Развитие разработки Android-приложений с использованием ИИ и совершенствование учебных планов с помощью Android Bench
2 минуты чтения
We want to make it faster and easier for you to build high-quality Android apps, and one way we're helping you be more productive is by putting AI at your fingertips. We know you want AI that truly understands the nuances of the Android platform, which is why we've been measuring how LLMs perform Android development tasks. Today we released the first version of Android Bench , our official leaderboard of LLMs for Android development.
Our goal is to provide model creators with a benchmark to evaluate LLM capabilities for Android development. By establishing a clear, reliable baseline for what high quality Android development looks like, we're helping model creators identify gaps and accelerate improvements—which empowers developers to work more efficiently with a wider range of helpful models to choose for AI assistance—which ultimately will lead to higher quality apps across the Android ecosystem.
Разработано с учетом реальных задач разработки под Android.
We created the benchmark by curating a task set against a range of common Android development areas. It is composed of real challenges of varying difficulty, sourced from public GitHub Android repositories. Scenarios include resolving breaking changes across Android releases, domain-specific tasks like networking on wearables, and migrating to the latest version of Jetpack Compose, to name a few.
В ходе каждой оценки предпринимается попытка заставить модель LLM исправить проблему, указанную в задании, после чего мы проверяем результат с помощью модульных или инструментальных тестов. Такой подход, не зависящий от конкретной модели, позволяет нам оценить способность модели ориентироваться в сложных кодовых базах, понимать зависимости и решать проблемы, с которыми вы сталкиваетесь каждый день.
Мы подтвердили эффективность этой методологии на примере нескольких производителей программного обеспечения для обучения менеджменту, включая JetBrains.
« Оценка влияния ИИ на Android — это огромная проблема, поэтому здорово видеть такую надежную и реалистичную систему. Хотя мы сами активно проводим бенчмаркинг, Android Bench — это уникальное и полезное дополнение. Эта методология — именно тот вид строгой оценки, который сейчас необходим разработчикам Android».
- Кирилл Смелов, руководитель отдела интеграции ИИ в JetBrains.
Первые результаты Android Bench
For this initial release, we wanted to purely measure model performance and not focus on agentic or tool use. The models were able to successfully complete 16-72% of the tasks. This is a wide range that demonstrates some LLMs already have a strong baseline for Android knowledge, while others have more room for improvement. Regardless of where the models are at now, we're anticipating continued improvement as we encourage LLM makers to enhance their models for Android development.
Модель LLM с наивысшим средним баллом в этом первом релизе — Gemini 3.1 Pro, за ней следует Claude Opus 4.6. Вы можете попробовать все модели, которые мы оценивали для помощи в использовании ИИ в ваших проектах Android, используя ключи API в последней стабильной версии Android Studio .

Обеспечение прозрачности для разработчиков и лиц, получающих степень магистра права.
Мы ценим открытый и прозрачный подход, поэтому сделали нашу методологию , набор данных и тестовую среду общедоступными на GitHub .
Одна из проблем, с которой сталкиваются при использовании любых общедоступных бенчмарков, — это риск искажения данных, когда модели могли сталкиваться с оценочными задачами в процессе обучения. Мы приняли меры, чтобы гарантировать, что наши результаты отражают подлинное логическое мышление, а не запоминание или угадывание, включая тщательный ручной анализ траекторий агентов или использование «канареечной» строки для предотвращения обучения.
В дальнейшем мы продолжим совершенствовать нашу методологию для сохранения целостности набора данных, а также будем вносить улучшения в будущие версии эталонного теста — например, увеличивать количество и сложность задач.
Мы с нетерпением ждём, как Android Bench сможет улучшить работу ИИ-помощников в долгосрочной перспективе. Наша цель — сократить разрыв между концепцией и качественным кодом. Мы закладываем основу для будущего, где всё, что вы задумали, вы сможете реализовать на Android.
Новости о продуктахСегодня мы выпускаем первый набор задач с длительным горизонтом планирования (LHT), которые представляют собой задачи высокой сложности, выполнение которых занимает у инженера несколько дней или даже неделю. Мы также представляем агентную оценку, начиная с агентов от соответствующих поставщиков моделей.
Matthew McCullough • 3 мин чтения
Новости о продуктахСегодня мы выпускаем Android 17 и делаем его доступным для большинства поддерживаемых устройств Pixel. В ближайшие месяцы ожидайте появления новых устройств, работающих под управлением Android 17.
Matthew McCullough • 13 мин чтения
Новости о продуктахНа конференции Google I/O '26 было сделано 17 ключевых анонсов для разработчиков Android, посвященных повышению производительности за счет использования агентов, концепции Compose First как стандарта пользовательского интерфейса, а также высокопроизводительной разработке медиаконтента и адаптивной разработке для расширяющейся экосистемы.
Matthew McCullough • 8 мин чтения
Получайте еженедельно самые свежие новости о разработке Android прямо на свою электронную почту.

