Evolución de la medición de LLM para Android: la nueva era de Android Bench
Lectura de 3 min
En marzo, presentamos Android Bench, nuestra tabla de clasificación de LLM para tareas de desarrollo de Android del mundo real. Nuestro objetivo era brindar transparencia sobre las capacidades del modelo en el desarrollo de Android y fomentar las mejoras del modelo para ofrecerte opciones de IA más útiles para tu flujo de trabajo diario. Desde entonces, mejoramos la comparativa según tus comentarios, lo que incluye la evaluación de modelos de código abierto y la incorporación de dimensiones de costo y eficiencia al ranking.
Sin embargo, las capacidades de la IA evolucionan constantemente, y las mediciones deben hacer lo mismo. Como parte de nuestro lanzamiento de julio, adoptamos el framework de Harbor, que incluye una versión actualizada del agente de comparativas que se usa para evaluar modelos.
Junto con este cambio en nuestra evaluación, en esta versión de julio agregamos 8 modelos nuevos (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus y Qwen 3.7 Max) al ranking. También compartiremos oportunidades para que tú, la comunidad de desarrolladores de Android, contribuyas a la comparativa.
Actualizamos nuestra metodología con el marco de trabajo Harbor
Cuando diseñamos Android Bench, basamos nuestra metodología en los principales estándares de la industria disponibles en ese momento. Usamos mini-swe-agent v1, un agente de comparativas de uso general, y lo adaptamos a los matices del desarrollo de Android para proporcionar una medición de referencia de las capacidades de los modelos para las tareas comunes de desarrollo de Android.
Para seguir proporcionándote evaluaciones de vanguardia que midan con precisión las capacidades más recientes del modelo en el desarrollo de Android, estandarizaremos nuestra comparativa con el marco de trabajo Harbor. Harbor define estándares e integraciones que facilitan que cualquier persona ejecute la comparativa, evalúe su configuración preferida o comparta resultados, lo que te brinda mayor transparencia y visibilidad.
Esta actualización nos permite evaluar los modelos y sus capacidades de manera más rigurosa, y volvimos a ejecutar la comparativa en todos los modelos para establecer una referencia actualizada. Esto significa que habrá un pequeño cambio en la puntuación, pero podrás seguir viendo las puntuaciones históricas en el archivo de nuestro sitio web.
Queremos asegurarnos de que Android Bench te sea útil, por lo que lo actualizaremos continuamente a medida que maduren nuestras evaluaciones y la industria.
Ampliamos el ranking con 8 modelos nuevos
Como parte de nuestro compromiso de mantener actualizado el ranking, agregamos Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus y Qwen 3.7 Max al ranking de Android Bench.
Verás que Claude Fable 5 está en la parte superior de la tabla de clasificación con una puntuación de 84.5, seguido de GPT 5.5 con 80.2 y Claude Sonnet 5 en el 3ᵉʳ lugar con una puntuación de 76.2.
Cuando solo se comparan los modelos de código abierto, GLM 5.2 ocupa el primer lugar con 72.2, seguido de Kimi K2.7 Code con una puntuación de 70.4.
Puedes consultar las métricas de rendimiento y eficiencia del modelo en el ranking actualizado para ver cómo estos modelos nuevos y anteriores abordan los desafíos específicos de Android, como las migraciones de Jetpack Compose, las redes de dispositivos wearables y las actualizaciones de la API de la plataforma.
Apertura de Android Bench a las contribuciones de la comunidad
Desde el principio, valoramos un enfoque abierto y transparente, por lo que pusimos a disposición del público nuestra metodología original y nuestro banco de pruebas en GitHub. Nos pediste una forma de proporcionar comentarios sobre nuestro conjunto de datos, por lo que ahora llevamos la colaboración un paso más allá y les brindamos a ustedes, la comunidad de desarrolladores de Android, la oportunidad de darle forma a Android Bench.
A partir de hoy, puedes colaborar con Android Bench de dos maneras:
- Diseña y envía tus propias tareas de desarrollo para Android para evaluar cómo los modelos manejan las situaciones que te interesan.
- Ejecuta y comparte evaluaciones comparativas de primera mano, y prueba tus modelos preferidos con nuestro conjunto de datos o tus propias tareas personalizadas.
Revisaremos las tareas enviadas y evaluaremos si se agregarán a la comparativa. Esperamos crear una referencia que refleje realmente las realidades diversas y cotidianas de la comunidad global de desarrolladores de Android.
Con la mirada puesta en el futuro
Con cada vez más opciones para el desarrollo de agentes, mantener una comparativa de vanguardia garantiza que la asistencia de IA en la que confías siga siendo más inteligente, útil y eficaz. Visita nuestro repositorio de GitHub para consultar las tareas. Te invitamos a enviar una tarea a nuestro equipo para que la revise. También puedes consultar Harbor Hub para explorar el conjunto de datos o enviar evaluaciones.
Como siempre, puedes consultar la tabla de clasificación actualizada o leer la metodología en nuestro sitio web.
-
Novedades sobre productosHoy lanzamos el primer conjunto de tareas de largo alcance (LHT), que son tareas de gran complejidad que a un ingeniero le llevan varios días o incluso una semana completar. También presentamos la evaluación agentiva, que comienza con los agentes de los proveedores de modelos correspondientes.
Matthew McCullough • Lectura de 3 minutos -
Novedades sobre productosHoy, nos complace anunciar el lanzamiento estable de las bibliotecas de AndroidX Security State versión 1.1.0 y Security State Provider versión 1.0.0.
Maunik Shah, Alec Garcia, Joseph Yong • Lectura de 4 min -
Novedades sobre productosLa depuración inalámbrica en Android ahora es más rápida, confiable y fácil de configurar que nunca. Con ADB Wi-Fi 2.0, presentamos una nueva pila de servidores y un manejo de red más inteligente para abordar directamente los comentarios de los desarrolladores sobre las brechas de usabilidad.
Steven Jenkins, Sherif Eid, Fabien Sanglard • Lectura de 1 min
Recibe la información más reciente sobre el desarrollo de Android en tu bandeja de entrada todas las semanas.