Новости о продуктах

Развитие разработки Android-приложений с использованием ИИ и совершенствование учебных планов с помощью Android Bench

2 минуты чтения
Посмотреть профиль Мэтью Маккалоу
Matthew McCullough , вице-президент по управлению продуктами, разработчик Android.

We want to make it faster and easier for you to build high-quality Android apps, and one way we're helping you be more productive is by putting AI at your fingertips. We know you want AI that truly understands the nuances of the Android platform, which is why we've been measuring how LLMs perform Android development tasks. Today we released the first version of Android Bench , our official leaderboard of LLMs for Android development.

Our goal is to provide model creators with a benchmark to evaluate LLM capabilities for Android development. By establishing a clear, reliable baseline for what high quality Android development looks like, we're helping model creators identify gaps and accelerate improvements—which empowers developers to work more efficiently with a wider range of helpful models to choose for AI assistance—which ultimately will lead to higher quality apps across the Android ecosystem.

Разработано с учетом реальных задач разработки под Android.

We created the benchmark by curating a task set against a range of common Android development areas. It is composed of real challenges of varying difficulty, sourced from public GitHub Android repositories. Scenarios include resolving breaking changes across Android releases, domain-specific tasks like networking on wearables, and migrating to the latest version of Jetpack Compose, to name a few.

В ходе каждой оценки предпринимается попытка заставить модель LLM исправить проблему, указанную в задании, после чего мы проверяем результат с помощью модульных или инструментальных тестов. Такой подход, не зависящий от конкретной модели, позволяет нам оценить способность модели ориентироваться в сложных кодовых базах, понимать зависимости и решать проблемы, с которыми вы сталкиваетесь каждый день.

Мы подтвердили эффективность этой методологии на примере нескольких производителей программного обеспечения для обучения менеджменту, включая JetBrains.

« Оценка влияния ИИ на Android — это огромная проблема, поэтому здорово видеть такую ​​надежную и реалистичную систему. Хотя мы сами активно проводим бенчмаркинг, Android Bench — это уникальное и полезное дополнение. Эта методология — именно тот вид строгой оценки, который сейчас необходим разработчикам Android».
- Кирилл Смелов, руководитель отдела интеграции ИИ в JetBrains.

Первые результаты Android Bench

For this initial release, we wanted to purely measure model performance and not focus on agentic or tool use. The models were able to successfully complete 16-72% of the tasks. This is a wide range that demonstrates some LLMs already have a strong baseline for Android knowledge, while others have more room for improvement. Regardless of where the models are at now, we're anticipating continued improvement as we encourage LLM makers to enhance their models for Android development.

Модель LLM с наивысшим средним баллом в этом первом релизе — Gemini 3.1 Pro, за ней следует Claude Opus 4.6. Вы можете попробовать все модели, которые мы оценивали для помощи в использовании ИИ в ваших проектах Android, используя ключи API в последней стабильной версии Android Studio .

androidBench2.png

Обеспечение прозрачности для разработчиков и лиц, получающих степень магистра права.

Мы ценим открытый и прозрачный подход, поэтому сделали нашу методологию , набор данных и тестовую среду общедоступными на GitHub .

Одна из проблем, с которой сталкиваются при использовании любых общедоступных бенчмарков, — это риск искажения данных, когда модели могли сталкиваться с оценочными задачами в процессе обучения. Мы приняли меры, чтобы гарантировать, что наши результаты отражают подлинное логическое мышление, а не запоминание или угадывание, включая тщательный ручной анализ траекторий агентов или использование «канареечной» строки для предотвращения обучения.

В дальнейшем мы продолжим совершенствовать нашу методологию для сохранения целостности набора данных, а также будем вносить улучшения в будущие версии эталонного теста — например, увеличивать количество и сложность задач.

Мы с нетерпением ждём, как Android Bench сможет улучшить работу ИИ-помощников в долгосрочной перспективе. Наша цель — сократить разрыв между концепцией и качественным кодом. Мы закладываем основу для будущего, где всё, что вы задумали, вы сможете реализовать на Android.

    Автор:
    Продолжить чтение