Новости о продуктах

Android Bench 2.0: Расширение границ возможного с помощью сложных задач с длительным горизонтом планирования.

3 мин чтения
Посмотреть профиль Мэтью Маккалоу
Matthew McCullough , вице-президент по управлению продуктами, разработчик Android.

Когда мы впервые запустили Android Bench, мы создали прочную основу для оценки того, как большие языковые модели (LLM) помогают разработчикам решать реальные задачи Android. Поскольку модели и агенты ИИ быстро развиваются, мы обновляем нашу методологию, например, приводя нашу систему бенчмаркинга в соответствие с фреймворком Harbor . Сегодня мы выпускаем первый набор задач с длительным горизонтом планирования (LHT) , которые представляют собой задачи высокой сложности, выполнение которых занимает у инженера несколько дней или даже неделю. Мы также вводим оценку с помощью агентов, начиная с агентов от соответствующих поставщиков моделей. Это дополнение выводит нас на Android Bench 2.0 — крупное обновление, предназначенное для оценки моделей и агентов ИИ с учетом масштаба, неоднозначности и сложных многоэтапных задач, с которыми вы сталкиваетесь каждый день.

LeaderboardFinal (1) (1).png
Таблица лидеров Android Bench 2.0

От поэтапных исправлений до долгосрочных задач

Первая версия Android Bench, как и аналогичные ранние тесты производительности ИИ-программистов, фокусировалась на постепенных изменениях существующих репозиториев, во многих случаях ограничиваясь исправлением ошибок или небольшими запросами на добавление новых функций. Это отражало возможности ИИ-помощников на тот момент, а также то, как вы их использовали.

Чтобы и дальше помогать вам находить модели и агентов кодирования, наиболее подходящие для вашего рабочего процесса разработки, мы повысили планку наших оценок, чтобы она соответствовала объему работы, которую вы делегируете ИИ. Android Bench 2.0 отражает эти амбициозные задачи с помощью LHT, которые включают в себя обновление зависимостей, добавление новых функций, создание приложений с нуля или преобразование кроссплатформенного приложения для Android.

Для выполнения сложных задач требуется более тонкая оценка и подсчет баллов.

При выполнении инженерных задач, занимающих несколько дней, бинарная система оценок «прошел/не прошел» не отражает полной картины.

Например, агент может переписать 40 экранов с помощью Jetpack Compose, настроить таблицы базы данных и выполнить 90% требований, но при этом не пройти проверку по одному граничному случаю. Бинарная оценка засчитывает этот результат как 0%, скрывая архитектурные возможности модели. Мы переходим к непрерывной оценке, чтобы предоставить более значимый сигнал как для разработки модели, так и для вашего понимания того, как ИИ может вам помочь.

Мы рассчитываем этот показатель завершения, используя комбинацию таких факторов, как функциональность, визуальное качество и предотвращение регрессий. Мы также применяем объективные штрафные баллы за отклонения от инструкций по оценке или структурных ограничений. Ознакомьтесь с обновленной таблицей лидеров и перейдите в карточку каждой модели, чтобы увидеть дополнительные элементы, такие как процент успешного прохождения, процент завершения и средняя стоимость для каждой модели и для каждой задачи.

Максимальный процент успешного прохождения тестов LHT составляет около 28% , что значительно ниже, чем ~91% для исходных задач в бенчмарке.

Screenshot 2026-09-16 at 3.18.23PM.png
В режиме просмотра карточек моделей вы можете изучить сильные и слабые стороны каждой модели.

Долгосрочные задачи позволяют получить полезные сведения для использования искусственного интеллекта в качестве помощника.

Помимо оценки того, насколько хорошо ИИ справляется с длительными задачами, набор данных LHT помогает нам узнать больше о сильных и слабых сторонах тестируемых моделей, и мы предлагаем вам более практические рекомендации.

На разных уровнях модели ИИ лучше справляется с написанием нового кода, чем с рефакторингом существующего. Рефакторинг и миграция становятся сложнее, поскольку успех зависит от архитектурной сложности, а не от объема кода.

Модели демонстрируют широкие возможности в отношении хорошо зарекомендовавших себя детерминированных преобразований, таких как перевод Java на Kotlin, замена Retrofit на Ktor или внедрение слоя ViewModel. Они последовательно применяют эти шаблоны даже в более чем 125 файлах и более чем 8000 строках кода.

Однако модели испытывают трудности, когда задачи требуют проверки во время выполнения (например, при отсутствии графов внедрения зависимостей), связаны с изменениями в фреймворке, нарушающими совместимость, или сталкиваются с пробелами в знаниях о невыпущенных библиотеках. Портирование кроссплатформенных приложений на Android остается сложной задачей — ни одна модель не достигает 100% успеха, а перспективные модели показывают максимум 80% успешного завершения.

Представляем оценку эффективности работы агентов.

Чтобы помочь вам лучше понять, как модели работают при интеграции в ваши агентские рабочие процессы, мы добавляем в нашу оценку часто используемые агенты. Мы начинаем с запуска новых моделей на LHT с агентами от соответствующего поставщика моделей. Например, мы запустили GPT 5.6 Sol на Codex и Gemini 3.8 Flash на Google Antigravity. Эта пара демонстрирует, как дизайн инструментария положительно влияет на результаты работы разработчиков, поскольку мы видели, что оперативное кэширование и компактное отображение окон инструментов могут привести к сокращению количества токенов.

В будущем мы расширим этот раздел, добавив результаты, полученные при различных комбинациях моделей и агентов, чтобы помочь вам определить, какие комбинации лучше всего подходят вам и вашей команде.

Мы инвестируем в это измерение, потому что для вас важно иметь возможность использовать выбранный вами агент и модель для разработки под Android, и в ближайшие недели мы поделимся с вами более подробной информацией.

Добавлены новые модели.

Кроме того, мы продолжаем расширять нашу таблицу лидеров, чтобы обеспечить вас самыми актуальными данными для принятия решений в области разработки. Мы добавили Gemini 3.8 Flash, Gemini 3.7 Flash, OpenAI GPT-6, Anthropic Fable 5.1, Kimi K3 и Qwen 3.8 Max, при этом OpenAI GPT-6 Astra заняла первое место с показателем успешного прохождения теста в 28% .

Взгляд в будущее

Android Bench 2.0 предоставляет надежную среду для измерения возможностей ИИ в разработке под Android. Сочетая задачи с длительным горизонтом планирования, многомодальную оценку, агентов и непрерывную оценку, мы надеемся дать возможность исследовательским группам в области ИИ создавать более компетентных и надежных партнеров по разработке программного обеспечения для ИИ, а также обеспечить вам большую прозрачность в отношении ваших возможностей в разработке ИИ.

Ознакомьтесь с обновленной таблицей лидеров и обновленной методологией . Ваши отзывы напрямую влияют на развитие Android Bench, поэтому, пожалуйста, продолжайте делиться с нами своими замечаниями на GitHub , а также в наших социальных сетях, таких как X и LinkedIn .

Автор:
Продолжить чтение