Android Bench 2.0: Расширение границ возможного с помощью сложных задач с длительным горизонтом планирования.
3 мин чтения
Когда мы впервые запустили Android Bench, мы создали прочную основу для оценки того, как большие языковые модели (LLM) помогают разработчикам решать реальные задачи Android. Поскольку модели и агенты ИИ быстро развиваются, мы обновляем нашу методологию, например, приводя нашу систему бенчмаркинга в соответствие с фреймворком Harbor . Сегодня мы выпускаем первый набор задач с длительным горизонтом планирования (LHT) , которые представляют собой задачи высокой сложности, выполнение которых занимает у инженера несколько дней или даже неделю. Мы также вводим оценку с помощью агентов, начиная с агентов от соответствующих поставщиков моделей. Это дополнение выводит нас на Android Bench 2.0 — крупное обновление, предназначенное для оценки моделей и агентов ИИ с учетом масштаба, неоднозначности и сложных многоэтапных задач, с которыми вы сталкиваетесь каждый день.

От поэтапных исправлений до долгосрочных задач
Первая версия Android Bench, как и аналогичные ранние тесты производительности ИИ-программистов, фокусировалась на постепенных изменениях существующих репозиториев, во многих случаях ограничиваясь исправлением ошибок или небольшими запросами на добавление новых функций. Это отражало возможности ИИ-помощников на тот момент, а также то, как вы их использовали.
Чтобы и дальше помогать вам находить модели и агентов кодирования, наиболее подходящие для вашего рабочего процесса разработки, мы повысили планку наших оценок, чтобы она соответствовала объему работы, которую вы делегируете ИИ. Android Bench 2.0 отражает эти амбициозные задачи с помощью LHT, которые включают в себя обновление зависимостей, добавление новых функций, создание приложений с нуля или преобразование кроссплатформенного приложения для Android.
Для выполнения сложных задач требуется более тонкая оценка и подсчет баллов.
При выполнении инженерных задач, занимающих несколько дней, бинарная система оценок «прошел/не прошел» не отражает полной картины.
Например, агент может переписать 40 экранов с помощью Jetpack Compose, настроить таблицы базы данных и выполнить 90% требований, но при этом не пройти проверку по одному граничному случаю. Бинарная оценка засчитывает этот результат как 0%, скрывая архитектурные возможности модели. Мы переходим к непрерывной оценке, чтобы предоставить более значимый сигнал как для разработки модели, так и для вашего понимания того, как ИИ может вам помочь.
Мы рассчитываем этот показатель завершения, используя комбинацию таких факторов, как функциональность, визуальное качество и предотвращение регрессий. Мы также применяем объективные штрафные баллы за отклонения от инструкций по оценке или структурных ограничений. Ознакомьтесь с обновленной таблицей лидеров и перейдите в карточку каждой модели, чтобы увидеть дополнительные элементы, такие как процент успешного прохождения, процент завершения и средняя стоимость для каждой модели и для каждой задачи.
Максимальный процент успешного прохождения тестов LHT составляет около 28% , что значительно ниже, чем ~91% для исходных задач в бенчмарке.

Долгосрочные задачи позволяют получить полезные сведения для использования искусственного интеллекта в качестве помощника.
Помимо оценки того, насколько хорошо ИИ справляется с длительными задачами, набор данных LHT помогает нам узнать больше о сильных и слабых сторонах тестируемых моделей, и мы предлагаем вам более практические рекомендации.
На разных уровнях модели ИИ лучше справляется с написанием нового кода, чем с рефакторингом существующего. Рефакторинг и миграция становятся сложнее, поскольку успех зависит от архитектурной сложности, а не от объема кода.
Модели демонстрируют широкие возможности в отношении хорошо зарекомендовавших себя детерминированных преобразований, таких как перевод Java на Kotlin, замена Retrofit на Ktor или внедрение слоя ViewModel. Они последовательно применяют эти шаблоны даже в более чем 125 файлах и более чем 8000 строках кода.
Однако модели испытывают трудности, когда задачи требуют проверки во время выполнения (например, при отсутствии графов внедрения зависимостей), связаны с изменениями в фреймворке, нарушающими совместимость, или сталкиваются с пробелами в знаниях о невыпущенных библиотеках. Портирование кроссплатформенных приложений на Android остается сложной задачей — ни одна модель не достигает 100% успеха, а перспективные модели показывают максимум 80% успешного завершения.
Представляем оценку эффективности работы агентов.
Чтобы помочь вам лучше понять, как модели работают при интеграции в ваши агентские рабочие процессы, мы добавляем в нашу оценку часто используемые агенты. Мы начинаем с запуска новых моделей на LHT с агентами от соответствующего поставщика моделей. Например, мы запустили GPT 5.6 Sol на Codex и Gemini 3.8 Flash на Google Antigravity. Эта пара демонстрирует, как дизайн инструментария положительно влияет на результаты работы разработчиков, поскольку мы видели, что оперативное кэширование и компактное отображение окон инструментов могут привести к сокращению количества токенов.
В будущем мы расширим этот раздел, добавив результаты, полученные при различных комбинациях моделей и агентов, чтобы помочь вам определить, какие комбинации лучше всего подходят вам и вашей команде.
Мы инвестируем в это измерение, потому что для вас важно иметь возможность использовать выбранный вами агент и модель для разработки под Android, и в ближайшие недели мы поделимся с вами более подробной информацией.
Добавлены новые модели.
Кроме того, мы продолжаем расширять нашу таблицу лидеров, чтобы обеспечить вас самыми актуальными данными для принятия решений в области разработки. Мы добавили Gemini 3.8 Flash, Gemini 3.7 Flash, OpenAI GPT-6, Anthropic Fable 5.1, Kimi K3 и Qwen 3.8 Max, при этом OpenAI GPT-6 Astra заняла первое место с показателем успешного прохождения теста в 28% .
Взгляд в будущее
Android Bench 2.0 предоставляет надежную среду для измерения возможностей ИИ в разработке под Android. Сочетая задачи с длительным горизонтом планирования, многомодальную оценку, агентов и непрерывную оценку, мы надеемся дать возможность исследовательским группам в области ИИ создавать более компетентных и надежных партнеров по разработке программного обеспечения для ИИ, а также обеспечить вам большую прозрачность в отношении ваших возможностей в разработке ИИ.
Ознакомьтесь с обновленной таблицей лидеров и обновленной методологией . Ваши отзывы напрямую влияют на развитие Android Bench, поэтому, пожалуйста, продолжайте делиться с нами своими замечаниями на GitHub , а также в наших социальных сетях, таких как X и LinkedIn .
Новости о продуктахВ марте мы представили Android Bench — наш рейтинг LLM для решения реальных задач разработки под Android. С тех пор мы улучшили бенчмарк на основе ваших отзывов, в том числе оценили модели с открытым весом и добавили в рейтинг параметры стоимости и эффективности.
Zoe Lopez-Latorre • Чтение 3 минуты
Новости о продуктахСегодня мы выпускаем Android 17 и делаем его доступным для большинства поддерживаемых устройств Pixel. В ближайшие месяцы ожидайте появления новых устройств, работающих под управлением Android 17.
Matthew McCullough • 13 мин чтения
Новости о продуктахНа конференции Google I/O '26 было сделано 17 ключевых анонсов для разработчиков Android, посвященных повышению производительности за счет использования агентов, концепции Compose First как стандарта пользовательского интерфейса, а также высокопроизводительной разработке медиаконтента и адаптивной разработке для расширяющейся экосистемы.
Matthew McCullough • 8 мин чтения
Получайте еженедельно самые свежие новости о разработке Android прямо на свою электронную почту.


