Évolution de la mesure des LLM pour Android : une nouvelle ère pour Android Bench
3 minutes de lecture
En mars, nous avons lancé Android Bench , notre classement des LLM pour les tâches de développement Android réelles. Notre objectif était de fournir une transparence sur les capacités des modèles dans le développement Android et d'encourager leur amélioration, afin de vous offrir des options d'IA plus utiles pour votre workflow quotidien. Depuis, nous avons amélioré le benchmark en fonction de vos commentaires, notamment en évaluant les modèles à poids ouverts et en ajoutant des dimensions de coût et d'efficacité au classement.
Toutefois, les capacités de l'IA évoluent constamment, et les mesures doivent suivre le même chemin. Dans le cadre de notre version de juillet, nous avons adopté le framework Harbor, qui inclut une version mise à jour de l'agent de benchmarking utilisé pour évaluer les modèles.
En plus de cette modification de notre évaluation, nous ajoutons huit nouveaux modèles (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus et Qwen 3.7 Max) au classement dans cette version de juillet. Nous vous offrons également, à vous, la communauté des développeurs Android, la possibilité de contribuer au benchmark.
Amélioration de notre méthodologie avec le framework Harbor
Lorsque nous avons conçu Android Bench, nous avons basé notre méthodologie sur les principales normes du secteur disponibles à l'époque. Nous avons utilisé mini-swe-agent v1, un agent de benchmarking à usage général, et l'avons adapté aux nuances du développement Android pour fournir une mesure de référence des capacités des modèles pour les tâches de développement Android courantes.
Pour continuer à vous fournir des évaluations de pointe qui mesurent avec précision les dernières capacités des modèles sur le développement Android, nous standardisons notre benchmark sur le framework Harbor. Harbor définit des normes et des intégrations qui permettent à chacun d'exécuter facilement le benchmark, d'évaluer sa configuration préférée ou de partager des résultats, ce qui vous offre plus de transparence et de visibilité.
Cette mise à niveau nous permet d'évaluer plus rigoureusement les modèles et leurs capacités. Nous avons réexécuté le benchmark sur tous les modèles pour établir une référence mise à jour. Cela signifie que le système de notation a légèrement changé, mais vous pourrez toujours consulter les scores historiques dans l'archive de notre site Web.
Nous voulons nous assurer qu'Android Bench vous est utile. Nous le mettrons donc à jour en permanence à mesure que nos évaluations et le secteur évolueront.
Extension du classement avec huit nouveaux modèles
Dans le cadre de notre engagement à maintenir le classement à jour, nous avons ajouté Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus et Qwen 3.7 Max au classement Android Bench.
Vous verrez que Claude Fable 5 est en tête du classement avec un score de 84,5, suivi de GPT 5.5 avec 80,2, et de Claude Sonnet 5 en troisième position avec un score de 76,2.
Si l'on compare uniquement les modèles à poids ouverts, GLM 5.2 est en tête avec 72,2, suivi de Kimi K2.7 Code avec un score de 70,4.
Vous pouvez consulter les métriques de performances et d'efficacité des modèles dans le classement mis à jour pour voir comment ces nouveaux modèles et les précédents gèrent les défis spécifiques à Android, tels que les migrations Jetpack Compose, la mise en réseau des objets connectés et les mises à jour de l'API de la plate-forme.
Ouverture d'Android Bench aux contributions de la communauté
Depuis le début, nous avons adopté une approche ouverte et transparente. C'est pourquoi nous avons mis à disposition notre méthodologie et notre banc d'essai d'origine sur GitHub. Vous nous avez demandé un moyen de nous faire part de vos commentaires sur notre ensemble de données. Nous allons donc plus loin dans la collaboration en vous offrant, à vous, la communauté des développeurs Android, la possibilité de façonner Android Bench.
À partir d'aujourd'hui, vous pouvez contribuer à Android Bench de deux manières :
- Concevez et envoyez vos propres tâches de développement Android pour évaluer la façon dont les modèles gèrent les scénarios qui vous intéressent.
- _Exécutez et partagez des évaluations de benchmark_ directement, en testant vos modèles préférés par rapport à notre ensemble de données ou à vos propres tâches personnalisées.
Nous examinerons les tâches envoyées et déterminerons si elles seront ajoutées au benchmark. Nous espérons créer un benchmark qui reflète véritablement les réalités quotidiennes et diverses de la communauté mondiale des développeurs Android.
En prévision de ce qui nous attend
Avec de plus en plus d'options pour le développement agentique, le maintien d'un benchmark de pointe garantit que l'assistance IA sur laquelle vous comptez continue de s'améliorer, d'être plus utile et plus efficace. Accédez à notre dépôt GitHub pour consulter les tâches. Nous vous invitons à envoyer une tâche à notre équipe pour examen. Vous pouvez également consulter Harbor Hub pour explorer l'ensemble de données ou envoyer des évaluations.
Comme toujours, vous pouvez consulter le classement mis à jour ou lire la méthodologie sur notre site Web.
-
Actualités sur les produitsOffrir une expérience en ligne sûre et protéger les utilisateurs contre les préjudices sont des priorités absolues sur Google Play.
Paul Feng • 2 minutes de lecture -
Actualités sur les produitsAujourd'hui, nous célébrons officiellement les cinq ans de la sortie de Jetpack Compose 1.0. De la version 1.0, annoncée le 28 juillet 2021, à notre dernière version 1.11, les API ont considérablement évolué au fil des ans, et nous prenons le temps de célébrer cet événement.
Rebecca Franks, Nick Butcher, Loryn Hairston • 5 minutes de lecture -
Actualités sur les produitsAndroid Studio Quail 2 est désormais stable et prêt à être utilisé en production. Il apporte des modifications à votre IDE avec des workflows agentiques simultanés, un profilage des fuites de mémoire intégré en mode natif et une correction des plantages en fonction du contexte.
Amman Asfaw • 3 minutes de lecture
Recevez chaque semaine dans votre boîte de réception les dernières informations sur le développement Android.