Actualités des produits

Android Bench 2.0 : repousser les limites avec des tâches difficiles à long terme

Temps de lecture : 3 min
Voir le profil de Matthew McCullough
Matthew McCullough Vice President, Product Management, Android Developer

Lorsque nous avons lancé Android Bench, nous avons établi une base rigoureuse pour évaluer la façon dont les grands modèles de langage (LLM) aident les développeurs à effectuer des tâches Android concrètes. Les modèles et agents d'IA évoluant rapidement, nous avons mis à jour notre méthodologie, par exemple en alignant notre framework de référence sur le framework Harbor. Aujourd'hui, nous lançons le premier ensemble de tâches à long terme. Il s'agit de tâches très complexes qui nécessitent plusieurs jours, voire une semaine, pour être accomplies par un ingénieur. Nous lançons également l'évaluation agentique, en commençant par les agents des fournisseurs de modèles correspondants. Cette nouveauté nous amène à Android Bench 2.0, une mise à niveau majeure conçue pour évaluer les modèles et agents d'IA en fonction de l'ampleur, de l'ambiguïté et de la résolution de problèmes complexes en plusieurs étapes auxquels vous êtes confrontés chaque jour.

LeaderboardFinal (1) (1).png
Classement Android Bench 2.0

Des corrections incrémentales aux tâches à long terme

La première itération d'Android Bench, ainsi que d'autres benchmarks de programmation d'IA précoces similaires, se sont concentrées sur les modifications incrémentielles apportées aux dépôts existants, dans de nombreux cas limitées aux corrections de bugs ou aux demandes de fonctionnalités plus petites. Cela reflétait les capacités de l'assistance IA à l'époque, ainsi que la façon dont vous l'utilisiez.

Pour continuer à vous aider à trouver les modèles et les agents de codage les mieux adaptés à votre workflow de développement, nous avons relevé le niveau de nos évaluations pour qu'il corresponde au travail que vous déléguez à l'IA. Android Bench 2.0 reflète ces défis ambitieux avec des LHT qui incluent la mise à niveau des dépendances, l'ajout de nouvelles fonctionnalités, la création d'applications à partir de zéro ou la conversion d'une application multiplate-forme en application Android.

Les tâches complexes nécessitent une évaluation et une notation plus nuancées

Pour les tâches d'ingénierie sur plusieurs jours, la notation binaire (réussite/échec) ne donne pas une image complète.

Par exemple, un agent peut refactoriser 40 écrans vers Jetpack Compose, configurer des tables de base de données et répondre à 90% des exigences, mais échouer à une seule assertion de cas limite. Le score binaire de cette exécution est de 0%, ce qui masque les capacités architecturales du modèle. Nous passons à une évaluation continue pour fournir un signal plus pertinent, à la fois pour le développement de modèles et pour vous aider à comprendre comment l'IA peut vous aider.

Nous calculons ce taux de réussite en combinant plusieurs facteurs, comme la fonctionnalité, la fidélité visuelle et l'évitement des régressions. Nous appliquons également des pénalités de score objectives en cas d'écart par rapport aux instructions d'évaluation ou aux contraintes structurelles. Consultez le classement mis à jour et cliquez sur la vue Fiche de chaque modèle pour afficher des éléments supplémentaires tels que le taux de réussite, le taux d'achèvement et les coûts moyens par modèle et par tâche.
 

Le taux de réussite le plus élevé pour les LHT est d'environ 28%, ce qui est beaucoup plus faible que les 91% environ pour les tâches d'origine dans le benchmark.

Screenshot 2026-09-16 at 3.18.23 PM.png
La vue "Fiche de modèle" vous permet d'explorer les points forts et les pièges de chaque modèle.

Les tâches à long terme permettent de découvrir des insights utiles pour l'assistance IA

Au-delà de la mesure de la capacité de l'IA à gérer les tâches de longue durée, l'ensemble de données LHT nous aide à en savoir plus sur les points forts et les points faibles des modèles testés, et nous vous proposons des conseils plus pratiques.

Tous niveaux de modèles confondus, l'IA est plus efficace pour écrire du nouveau code que pour refactoriser du code existant. Les refactorisations et les migrations deviennent plus délicates, car leur réussite dépend de la complexité de l'architecture plutôt que du volume de code.

Les modèles présentent de solides capacités en matière de transformations déterministes bien établies, comme la conversion de Java en Kotlin, le remplacement de Retrofit par Ktor ou l'introduction d'une couche ViewModel. Ils appliquent ces modèles de manière cohérente, même sur plus de 125 fichiers et 8 000 lignes de code.

Toutefois, les modèles ont du mal à gérer les tâches qui nécessitent une validation au moment de l'exécution (comme les graphiques d'injection de dépendances manquants), qui impliquent des modifications du framework ou qui présentent des lacunes en termes de connaissances avec les bibliothèques non publiées. Le portage d'applications multiplates-formes vers Android reste un défi ouvert : aucun modèle n'atteint un taux de réussite de 100% et les modèles de pointe atteignent au maximum un taux d'achèvement de 80 %.

Présentation des évaluations des agents

Pour vous aider à mieux comprendre les performances des modèles lorsqu'ils sont intégrés à vos workflows agentiques, nous ajoutons des agents couramment utilisés à notre évaluation. Nous commençons par exécuter de nouveaux modèles sur les LHT avec des agents du fournisseur de modèles correspondant. Par exemple, nous avons exécuté GPT 5.6 Sol sur Codex et Gemini 3.8 Flash sur Google Antigravity. Cette association montre comment la conception du harnais a un impact positif sur les résultats des développeurs. En effet, nous avons constaté que la mise en cache des requêtes et le fenêtrage compact des outils peuvent entraîner une réduction des jetons.

À l'avenir, nous allons étendre cette fonctionnalité en mettant également en avant les résultats obtenus avec différentes combinaisons de modèles et d'agents. Vous pourrez ainsi découvrir celles qui conviennent le mieux à vous et à votre équipe.

Nous investissons dans cette mesure, car il est important que vous puissiez utiliser l'agent et le modèle de votre choix pour le développement Android. Nous vous en dirons plus dans les prochaines semaines.

Nouveaux modèles ajoutés

De plus, nous continuons à développer notre classement pour vous assurer de disposer des données les plus récentes pour vos décisions de développement. Nous avons ajouté Gemini 3.8 Flash, Gemini 3.7 Flash, GPT-6 d'OpenAI, Fable 5.1 d'Anthropic, Kimi K3 et Qwen 3.8 Max. GPT-6 Astra d'OpenAI arrive en tête avec un taux de réussite de 28%.

Perspectives d'avenir

Android Bench 2.0 fournit un environnement robuste pour mesurer l'IA pour le développement Android. En combinant des tâches à long terme, une évaluation multimodale, des agents et une évaluation continue, nous espérons permettre aux équipes de recherche en IA de créer des partenaires de programmation d'IA plus performants et fiables, et vous offrir plus de transparence sur vos options de développement de l'IA.

Consultez le classement mis à jour et la méthodologie mise à jour. Vos commentaires nous aident à améliorer Android Bench. N'hésitez donc pas à continuer à nous les envoyer sur GitHub, ainsi que sur nos réseaux sociaux comme X et LinkedIn.

Écrit par :
Continuer à lire