Evolução da medição de LLMs para Android: a próxima era do Android Bench
Leitura de 3 minutos
Em março, apresentamos o Android Bench, nosso ranking de LLMs para tarefas reais de desenvolvimento em Android. Nosso objetivo era oferecer transparência sobre os recursos do modelo no desenvolvimento para Android e incentivar melhorias para oferecer opções de IA mais úteis no seu fluxo de trabalho diário. Desde então, aprimoramos o comparativo com base no seu feedback, incluindo a avaliação de modelos de peso aberto e a adição de dimensões de custo e eficiência ao ranking.
Mas os recursos de IA estão em constante evolução, e a medição precisa acompanhar esse ritmo. Como parte do nosso lançamento de julho, adotamos o framework Harbor, que inclui uma versão atualizada do agente de comparativo de mercado usado para avaliar modelos.
Além dessa mudança na nossa avaliação, nesta versão de julho, adicionamos oito novos modelos ao ranking: Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus e Qwen 3.7 Max. Também estamos compartilhando oportunidades para você, a comunidade de desenvolvedores Android, contribuir com a comparação.
Atualização da nossa metodologia com a estrutura do Harbor
Ao projetar o Android Bench, ancoramos nossa metodologia nos principais padrões do setor disponíveis na época. Usamos o mini-swe-agent v1, um agente de comparativo de mercado de uso geral, e o adaptamos às nuances do desenvolvimento do Android para fornecer uma medição de base dos recursos dos modelos para tarefas comuns de desenvolvimento do Android.
Para continuar oferecendo avaliações de última geração que medem com precisão os recursos mais recentes do modelo no desenvolvimento para Android, estamos padronizando nosso benchmark com a estrutura Harbor. O Harbor define padrões e integrações que facilitam a execução do comparativo por qualquer pessoa, a avaliação da configuração preferida ou o compartilhamento de resultados, oferecendo mais transparência e visibilidade.
Essa atualização nos permite avaliar modelos e recursos com mais rigor. Também executamos novamente o comparativo em todos os modelos para estabelecer um valor de referência atualizado. Isso significa que há uma pequena mudança na pontuação, mas você ainda poderá conferir as pontuações históricas no arquivo do nosso site.
Queremos garantir que o Android Bench seja útil para você. Por isso, vamos atualizá-lo continuamente à medida que nossas avaliações e o setor evoluem.
Expansão do ranking com oito novos modelos
Como parte do nosso compromisso de manter o ranking atualizado, adicionamos o Claude Fable 5, o Claude Sonnet 5, o Claude Opus 4.8, o GLM 5.2, o Kimi K2.7 Code, o MiniMax M3, o Qwen 3.7 Plus e o Qwen 3.7 Max ao ranking do Android Bench.
O Claude Fable 5 está no topo do ranking com uma pontuação de 84,5, seguido pelo GPT 5.5 com 80,2 e o Claude Sonnet 5 em terceiro lugar com uma pontuação de 76,2.
Ao comparar apenas modelos de peso aberto, o GLM 5.2 fica em primeiro lugar com 72,2, seguido pelo Kimi K2.7 Code com uma pontuação de 70,4.
Confira as métricas de desempenho e eficiência do modelo no ranking atualizado para saber como esses modelos novos e anteriores lidam com desafios específicos do Android, como migrações do Jetpack Compose, redes de wearables e atualizações da API da plataforma.
Abertura do Android Bench para contribuições da comunidade
Desde o início, valorizamos uma abordagem aberta e transparente. Por isso, disponibilizamos publicamente nossa metodologia original e o ambiente de teste no GitHub. Você pediu uma maneira de enviar feedback sobre nosso conjunto de dados. Agora, estamos dando um passo adiante na colaboração, oferecendo a você, a comunidade de desenvolvedores Android, a chance de moldar o Android Bench.
A partir de hoje, você pode contribuir com o Android Bench de duas maneiras:
- Crie e envie suas próprias tarefas de desenvolvimento do Android para avaliar como os modelos lidam com os cenários importantes para você.
- Execute e compartilhe avaliações de comparativo de mercado em primeira mão, testando seus modelos preferidos com nosso conjunto de dados ou suas próprias tarefas personalizadas.
Vamos analisar as tarefas enviadas e avaliar se elas serão adicionadas ao comparativo de mercado. Esperamos criar uma referência que reflita verdadeiramente as realidades diversas e cotidianas da comunidade global de desenvolvedores Android.
O que nos espera
Com cada vez mais opções de desenvolvimento agêntico, manter um comparativo de mercado de ponta garante que a assistência de IA em que você confia continue ficando mais inteligente, útil e eficaz. Acesse nosso repositório do GitHub para conferir as tarefas. Envie uma tarefa para nossa equipe analisar e confira o Harbor Hub para explorar o conjunto de dados ou enviar avaliações.
Como sempre, você pode conferir o ranking atualizado ou ler a metodologia no nosso site.
-
Novidades sobre produtosHoje, estamos lançando o primeiro conjunto de tarefas de longo prazo (LHT, na sigla em inglês), que são tarefas de grande complexidade que levam vários dias ou até uma semana para serem concluídas por um engenheiro. Também estamos lançando a avaliação com agentes, começando com agentes dos provedores de modelos correspondentes.
Matthew McCullough • Leitura de 3 minutos -
Novidades sobre produtosHoje, temos o prazer de anunciar o lançamento estável das bibliotecas AndroidX Security State versão 1.1.0 e Security State Provider versão 1.0.0.
Maunik Shah, Alec Garcia, Joseph Yong • Leitura de 4 minutos -
Novidades sobre produtosA depuração por Wi-Fi no Android agora é mais rápida, confiável e fácil de configurar do que nunca. Com o ADB Wi-Fi 2.0, apresentamos uma nova pilha de servidores e um tratamento de rede mais inteligente para resolver diretamente o feedback dos desenvolvedores sobre lacunas de usabilidade.
Steven Jenkins, Sherif Eid, Fabien Sanglard • Leitura de 1 minuto
Receba os insights mais recentes sobre desenvolvimento Android na sua caixa de entrada semanalmente.