Android Bench 2.0: ampliando os limites com tarefas desafiadoras de longo prazo
Leitura de 3 minutos
Quando lançamos o Android Bench, criamos uma base rigorosa para avaliar como os modelos de linguagem grandes (LLMs) ajudam os desenvolvedores com tarefas reais do Android. À medida que os modelos e agentes de IA evoluem rapidamente, atualizamos nossa metodologia, como o alinhamento do nosso framework de comparativo com o framework Harbor. Hoje, lançamos o primeiro conjunto de tarefas de longo prazo (LHTs, na sigla em inglês), que são tarefas de grande complexidade que levam vários dias ou até uma semana para serem concluídas por um engenheiro. Também estamos lançando a avaliação com agentes, começando com agentes dos provedores de modelos correspondentes. Essa adição nos leva ao Android Bench 2.0, uma grande atualização projetada para avaliar modelos e agentes de IA em relação à escala, ambiguidade e resolução de problemas complexos de várias etapas que você enfrenta todos os dias.
De correções incrementais a tarefas de longo prazo
A primeira iteração do Android Bench, junto com comparativos de programação de IA iniciais semelhantes, se concentrou em mudanças incrementais nos repositórios atuais, em muitos casos limitadas a correções de bugs ou solicitações de recursos menores. Isso refletia os recursos da assistência de IA na época, bem como a forma como você a usava.
Para continuar ajudando você a encontrar os modelos e agentes de programação mais adequados ao seu fluxo de trabalho de desenvolvimento, aumentamos o nível das nossas avaliações para corresponder ao trabalho que você delega à IA. O Android Bench 2.0 reflete esses desafios ambiciosos com LHTs que incluem upgrade de dependências, adição de novos recursos, criação de apps do zero ou conversão de um app multiplataforma para Android.
Tarefas complexas exigem uma avaliação e pontuação mais detalhadas
Em tarefas de engenharia de vários dias, a classificação binária de aprovação ou reprovação não captura o quadro completo.
Por exemplo, um agente pode refatorar 40 telas para o Jetpack Compose, configurar tabelas de banco de dados e passar em 90% dos requisitos, mas falhar em uma única declaração de caso extremo. A pontuação binária classifica essa execução como 0%, obscurecendo os recursos arquitetônicos do modelo. Estamos migrando para a pontuação contínua para oferecer um indicador mais significativo, tanto para o desenvolvimento de modelos quanto para sua compreensão de como a IA pode ajudar.
Calculamos essa taxa de conclusão com base em uma combinação de fatores, como funcionalidade, fidelidade visual e prevenção de regressões. Também aplicamos penalidades de pontuação objetivas por desvios das instruções de avaliação ou restrições estruturais. Confira o ranking atualizado e clique na visualização em card de cada modelo para ver outros elementos, como taxa de aprovação, taxa de conclusão e custos médios por modelo e por tarefa.
A maior taxa de aprovação para LHTs é de cerca de 28%, muito menor do que os 91% das tarefas originais no comparativo de mercado.
As tarefas de longo prazo revelam informações úteis para a assistência de IA
Além de medir a eficiência da IA em tarefas de longa duração, o conjunto de dados LHT nos ajuda a aprender mais sobre os pontos fortes e fracos dos modelos testados, e oferecemos orientações mais práticas.
Em todos os níveis de modelo, a IA é melhor para escrever código novo do que para refatorar código existente. Refatorações e migrações ficam mais complicadas porque o sucesso depende da complexidade arquitetônica, e não do volume de código.
Os modelos mostram recursos avançados em transformações determinísticas e bem estabelecidas, como converter Java em Kotlin, trocar o Retrofit pelo Ktor ou introduzir uma camada ViewModel. Eles aplicam esses padrões de forma consistente, mesmo em mais de 125 arquivos e 8.000 linhas de código.
No entanto, os modelos têm dificuldades quando as tarefas exigem validação em tempo de execução (como gráficos de injeção de dependência ausentes), envolvem mudanças de estrutura ou encontram lacunas de conhecimento com bibliotecas não lançadas. A portabilidade de apps multiplataforma para o Android ainda é um desafio em aberto. Nenhum modelo atinge uma taxa de aprovação de 100%, e os modelos de ponta alcançam, no máximo, uma taxa de conclusão de 80%.
Conheça as avaliações de agentes
Para ajudar você a entender melhor o desempenho dos modelos quando integrados aos seus fluxos de trabalho agênticos, estamos adicionando agentes usados com frequência à nossa avaliação. Vamos começar executando novos modelos em LHTs com agentes do provedor de modelo correspondente. Por exemplo, executamos o GPT 5.6 Sol no Codex e o Gemini 3.8 Flash no Google Antigravity. Essa combinação mostra como o design do harness impacta positivamente os resultados dos desenvolvedores, já que o cache de comandos e o dimensionamento compacto da janela de ferramentas podem resultar em reduções de token.
No futuro, vamos ampliar esse recurso, destacando também os resultados de várias combinações de modelos e agentes. Assim, você vai descobrir quais combinações funcionam melhor para você e sua equipe.
Investimos nessa medição porque é importante que você possa usar o agente e o modelo de sua escolha para o desenvolvimento do Android. Nas próximas semanas, vamos compartilhar mais informações com você.
Novos modelos adicionados
Além disso, estamos expandindo nosso ranking para garantir que você tenha os dados mais atualizados para suas decisões de desenvolvimento. Adicionamos o Gemini 3.8 Flash, o Gemini 3.7 Flash, o GPT-6 da OpenAI, o Fable 5.1 da Anthropic, o Kimi K3 e o Qwen 3.8 Max, com o GPT-6 Astra da OpenAI no topo com uma taxa de aprovação de 28%.
Planos para o futuro
O Android Bench 2.0 oferece um ambiente robusto para medir a IA no desenvolvimento para Android. Ao combinar tarefas de longo prazo, avaliação multimodal, agentes e pontuação contínua, esperamos capacitar as equipes de pesquisa de IA a criar parceiros de programação de IA mais capazes e confiáveis, além de oferecer mais transparência sobre suas opções de desenvolvimento de IA.
Confira o ranking atualizado e a metodologia atualizada. Seu feedback influencia diretamente a evolução do Android Bench. Por isso, continue compartilhando suas opiniões com a gente no GitHub e nos nossos canais sociais, como X e LinkedIn.
-
Novidades sobre produtosEm março, apresentamos o Android Bench, nosso ranking de LLMs para tarefas de desenvolvimento no Android no mundo real. Desde então, aprimoramos o comparativo com base no seu feedback, incluindo a avaliação de modelos de peso aberto e a adição de dimensões de custo e eficiência ao ranking.
Zoe Lopez-Latorre • Leitura de 3 minutos -
Novidades sobre produtosHoje, estamos lançando o Android 17, que já está disponível para a maioria dos dispositivos Pixel compatíveis. Aguarde novos dispositivos com o Android 17 nos próximos meses.
Matthew McCullough • Leitura de 13 minutos -
Novidades sobre produtosO Google I/O '26 apresenta 17 anúncios importantes para desenvolvedores Android com foco em produtividade liderada por agentes, Compose First como nosso padrão de interface e mídia de alta performance e desenvolvimento adaptável para o ecossistema em expansão.
Matthew McCullough • Leitura de 8 minutos
Receba os insights mais recentes sobre desenvolvimento Android na sua caixa de entrada semanalmente.