Wiadomości o usługach

Android Bench 2.0: pokonywanie kolejnych granic dzięki wymagającym zadaniom długoterminowym

Czas czytania: 3 minuty
Wyświetl profil Matthew McCullougha
Matthew McCullough Wiceprezes ds. zarządzania produktami, Android Developer

Gdy po raz pierwszy wprowadziliśmy Android Bench, stworzyliśmy solidne podstawy do oceny, w jaki sposób duże modele językowe (LLM) pomagają programistom w wykonywaniu rzeczywistych zadań związanych z Androidem. W miarę szybkiego rozwoju modeli i agentów AI aktualizujemy naszą metodologię, np. dostosowujemy ramy porównawcze do ram Harbor. Dziś udostępniamy pierwszy zestaw zadań długoterminowych (LHT), czyli bardzo złożonych zadań, których wykonanie zajmuje inżynierowi kilka dni, a nawet tydzień. Wprowadzamy też ocenę agentów, zaczynając od agentów od odpowiednich dostawców modeli. Dzięki temu mamy Android Bench 2.0 – znaczące ulepszenie, które pozwala oceniać modele i agenty AI pod kątem skali, niejednoznaczności i złożonego rozwiązywania problemów wieloetapowych, z którymi stykasz się na co dzień.

LeaderboardFinal (1) (1).png
Tabela wyników The Android Bench 2.0

Od drobnych poprawek po zadania długoterminowe

Pierwsza wersja Android Bench, podobnie jak inne wczesne testy porównawcze dotyczące kodowania z użyciem AI, koncentrowała się na przyrostowych zmianach w istniejących repozytoriach, w wielu przypadkach ograniczonych do poprawek błędów lub mniejszych próśb o dodanie funkcji. Odzwierciedlało to możliwości Asystenta AI w tamtych czasach oraz sposób, w jaki z niego korzystałeś(-aś).

Aby nadal pomagać Ci w znajdowaniu modeli i agentów do kodowania, które najlepiej pasują do Twojego procesu programowania, podnieśliśmy poprzeczkę naszych ocen, aby odpowiadały one pracy, którą delegujesz na AI. Android Bench 2.0 odzwierciedla te ambitne wyzwania w ramach zadań LHT, które obejmują aktualizację zależności, dodawanie nowych funkcji, tworzenie aplikacji od podstaw lub konwertowanie aplikacji na wielu platformach na Androida.

Złożone zadania wymagają bardziej szczegółowej oceny i punktacji

W przypadku wielodniowych zadań inżynieryjnych ocena binarna (zdane/niezdane) nie oddaje pełnego obrazu.

Na przykład agent może przekształcić 40 ekranów na Jetpack Compose, skonfigurować tabele bazy danych i spełnić 90% wymagań, ale nie spełnić jednego warunku w przypadku skrajnego przypadku. Ocena binarna przypisuje temu uruchomieniu 0%, co zaciemnia możliwości architektury modelu. Przechodzimy na ciągłe ocenianie, aby dostarczać bardziej wartościowe sygnały zarówno na potrzeby rozwoju modelu, jak i Twojego zrozumienia, jak AI może Ci pomóc.

Obliczamy ten wskaźnik ukończenia na podstawie różnych czynników, takich jak funkcjonalność, wierność wizualna i unikanie regresji. Stosujemy też obiektywne kary punktowe za odchylenia od instrukcji oceny lub ograniczeń strukturalnych. Sprawdź zaktualizowaną tabelę wyników i kliknij kartę każdego modelu, aby zobaczyć dodatkowe elementy, takie jak odsetek pozytywnych wyników, odsetek ukończenia i średnie koszty poszczególnych modeli i zadań.

Najwyższy odsetek poprawnych odpowiedzi w przypadku zadań LHT wynosi około 28%, czyli znacznie mniej niż w przypadku pierwotnych zadań w teście porównawczym (około 91%).

Screenshot 2026-09-16 at 3.18.23 PM.png
Widok karty modelu umożliwia poznanie zalet i wad każdego modelu.

Zadania długoterminowe dostarczają pomocnych statystyk dla pomocy AI

Zbiór danych LHT pomaga nam nie tylko mierzyć, jak dobrze AI radzi sobie z długotrwałymi zadaniami, ale też lepiej poznawać mocne i słabe strony testowanych modeli, dzięki czemu możemy oferować bardziej praktyczne wskazówki.

Na wszystkich poziomach modeli AI lepiej radzi sobie z pisaniem nowego kodu niż z refaktoryzacją istniejącego. Refaktoryzacje i migracje stają się trudniejsze, ponieważ sukces zależy od złożoności architektury, a nie od ilości kodu.

Modele wykazują duże możliwości w przypadku dobrze znanych, deterministycznych przekształceń, takich jak konwersja z Javy na Kotlin, zamiana Retrofit na Ktor czy wprowadzenie warstwy ViewModel. Stosują te wzorce konsekwentnie, nawet w przypadku ponad 125 plików i ponad 8000 wierszy kodu.

Modele mają jednak problemy z zadaniami, które wymagają weryfikacji w czasie działania (np. brakujące wykresy wstrzykiwania zależności), obejmują zmiany w strukturze lub napotykają luki w wiedzy związane z niewydanymi bibliotekami. Portowanie aplikacji na wielu platformach na Androida nadal stanowi wyzwanie – żaden model nie osiąga 100% skuteczności, a modele graniczne osiągają maksymalnie 80% skuteczności.

Przedstawiamy oceny agentów

Aby pomóc Ci lepiej zrozumieć, jak modele działają po zintegrowaniu z procesami opartymi na agentach, dodajemy do naszej oceny najczęściej używanych agentów. Zaczynamy od uruchamiania nowych modeli na LHT z agentami od odpowiedniego dostawcy modelu. Na przykład model GPT 5.6 Sol został uruchomiony na platformie Codex, a Gemini 3.8 Flash – na platformie Google Antigravity. To połączenie pokazuje, jak konstrukcja interfejsu wpływa na wyniki deweloperów, ponieważ pamięć podręczna promptów i kompaktowe okna narzędzi mogą zmniejszyć liczbę tokenów.

W przyszłości rozszerzymy tę funkcję, aby wyróżniać wyniki w różnych kombinacjach modeli i agentów. Pomoże Ci to odkryć, które kombinacje najlepiej sprawdzają się w Twoim przypadku i w przypadku Twojego zespołu.

Inwestujemy w te pomiary, ponieważ ważne jest, abyś mógł używać wybranego agenta i modelu do tworzenia aplikacji na Androida. W najbliższych tygodniach przekażemy Ci więcej informacji na ten temat.

Dodano nowe modele

Stale rozwijamy też naszą tabelę wyników, aby zapewnić Ci dostęp do najbardziej aktualnych danych, które pomogą Ci podejmować decyzje dotyczące rozwoju. Dodaliśmy modele Gemini 3.8 Flash, Gemini 3.7 Flash, GPT-6 od OpenAI, Fable 5.1 od Anthropic, Kimi K3 i Qwen 3.8 Max. Najlepszy z nich to GPT-6 Astra od OpenAI, który uzyskał 28%.

Perspektywy

Android Bench 2.0 zapewnia solidne środowisko do pomiaru sztucznej inteligencji na potrzeby tworzenia aplikacji na Androida. Łącząc zadania długoterminowe, ocenę multimodalną, agentów i ciągłe ocenianie, chcemy umożliwić zespołom badawczym zajmującym się AI tworzenie bardziej wydajnych i niezawodnych partnerów do kodowania AI. Chcemy też zapewnić Ci większą przejrzystość w zakresie opcji rozwoju AI.

Zapoznaj się ze zaktualizowaną tabelą wynikówzaktualizowaną metodologią. Twoja opinia ma bezpośredni wpływ na to, jak rozwijamy Android Bench, więc nadal dziel się z nami swoimi uwagami na GitHubie oraz w naszych kanałach społecznościowych, takich jak XLinkedIn.

Autorzy:
Czytaj dalej