Cómo evoluciona la medición de LLM para Android: la nueva era de Android Bench
Lectura de 3 min
En marzo, presentamos Android Bench , nuestra tabla de clasificación de LLM para tareas de desarrollo de Android en el mundo real. Nuestro objetivo era proporcionar transparencia en torno a las capacidades de los modelos en el desarrollo de Android y fomentar las mejoras de los modelos para ofrecerte opciones de IA más útiles para tu flujo de trabajo diario. Desde entonces, mejoramos el parámetro de comparación según tus comentarios, lo que incluye la evaluación de modelos de peso abierto y la adición de dimensiones de costo y eficiencia a la tabla de clasificación.
Sin embargo, las capacidades de IA están en constante evolución, y la medición debe seguir el mismo camino. Como parte de nuestro lanzamiento de julio, adoptamos el framework de Harbor, que incluye una versión actualizada del agente de parámetros de comparación que se usa para evaluar modelos.
Junto con este cambio en nuestra evaluación, en este lanzamiento de julio, agregamos 8 modelos nuevos (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus y Qwen 3.7 Max) a la tabla de clasificación. También compartimos oportunidades para que tú, la comunidad de desarrolladores de Android, contribuyas al parámetro de comparación.
Actualización de nuestra metodología con el framework de Harbor
Cuando diseñamos Android Bench, basamos nuestra metodología en los principales estándares de la industria disponibles en ese momento. Usamos mini-swe-agent v1, un agente de parámetros de comparación de uso general, y lo adaptamos a los matices del desarrollo de Android para proporcionar una medición de referencia de las capacidades de los modelos para tareas comunes de desarrollo de Android.
Para seguir proporcionándote evaluaciones de vanguardia que midan con precisión las capacidades más recientes de los modelos en el desarrollo de Android, estamos estandarizando nuestro parámetro de comparación en el framework de Harbor. Harbor define estándares e integraciones que facilitan que cualquier persona ejecute el parámetro de comparación, evalúe su configuración preferida o comparta resultados, lo que te proporciona transparencia y visibilidad adicionales.
Esta actualización nos permite evaluar los modelos y sus capacidades de manera más rigurosa, y volvimos a ejecutar el parámetro de comparación en todos los modelos para establecer una línea de base actualizada. Esto significa que hay un pequeño cambio en la puntuación, pero podrás ver las puntuaciones históricas en el archivo de nuestro sitio web.
Queremos asegurarnos de que Android Bench te sea útil, por lo que lo actualizaremos continuamente a medida que nuestras evaluaciones y la industria maduren.
Expansión de la tabla de clasificación con 8 modelos nuevos
Como parte de nuestro compromiso de mantener actualizada la tabla de clasificación, agregamos Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus y Qwen 3.7 Max a la tabla de clasificación de Android Bench.
Verás que Claude Fable 5 está en la parte superior de la tabla de clasificación con una puntuación de 84.5, seguido de GPT 5.5 con 80.2 y Claude Sonnet 5 en el tercer lugar con una puntuación de 76.2.
Cuando solo se comparan los modelos de peso abierto, GLM 5.2 está en la parte superior con 72.2, seguido de Kimi K2.7 Code con una puntuación de 70.4.
Puedes consultar las métricas de rendimiento y eficiencia de los modelos en la tabla de clasificación actualizada para ver cómo estos modelos nuevos y anteriores abordan los desafíos específicos de Android, como las migraciones de Jetpack Compose, las redes de dispositivos wearables y las actualizaciones de la API de la plataforma.
Apertura de Android Bench a las contribuciones de la comunidad
Desde el principio, valoramos un enfoque abierto y transparente, por lo que pusimos a disposición del público nuestra metodología original y el arnés de prueba en GitHub. Nos pediste una forma de enviar comentarios sobre nuestro conjunto de datos, por lo que ahora llevamos la colaboración un paso más allá y te brindamos a ti, la comunidad de desarrolladores de Android, la oportunidad de dar forma a Android Bench.
A partir de hoy, puedes contribuir a Android Bench de dos maneras:
- Diseña y envía tus propias tareas de desarrollo de Android para evaluar cómo los modelos manejan las situaciones que te interesan.
- _Ejecuta y comparte evaluaciones de parámetros de comparación_ de primera mano, prueba tus modelos preferidos con nuestro conjunto de datos o tus propias tareas personalizadas.
Revisaremos las tareas enviadas y evaluaremos si se agregan al parámetro de comparación. Esperamos crear un parámetro de comparación que refleje realmente las realidades diversas y cotidianas de la comunidad global de desarrolladores de Android.
Próximamente
Con cada vez más opciones para el desarrollo de agentes, mantener un parámetro de comparación de vanguardia garantiza que la asistencia de IA en la que confías siga siendo más inteligente, útil y eficaz. Dirígete a nuestro repositorio de GitHub para consultar las tareas. Te invitamos a enviar una tarea a nuestro equipo para su revisión, y puedes consultar Harbor Hub para explorar el conjunto de datos o enviar evaluaciones.
Como siempre, puedes encontrar la tabla de clasificación actualizada o leer la metodología en nuestro sitio web.
-
Novedades de productosProporcionar una experiencia en línea segura y proteger a los usuarios de daños es una prioridad en Google Play.
Paul Feng • Lectura de 2 min -
Novedades de productosHoy, celebramos oficialmente cinco años desde el lanzamiento de Jetpack Compose 1.0. Desde la versión 1.0, anunciada el 28 de julio de 2021, hasta nuestro lanzamiento más reciente de la versión 1.11, vimos que las APIs evolucionaron significativamente a lo largo de los años, y nos tomamos un momento para celebrarlo.
Rebecca Franks, Nick Butcher, Loryn Hairston • Lectura de 5 min -
Novedades de productosAndroid Studio Quail 2 ahora es estable y está listo para que lo uses en producción, lo que genera un cambio en tu IDE con flujos de trabajo de agentes simultáneos, generación de perfiles de fuga de memoria integrada de forma nativa y corrección de fallas contextual.
Amman Asfaw • Lectura de 3 min
Recibe la información más reciente sobre el desarrollo de Android en tu bandeja de entrada todas las semanas.