Ewolucja sposobu pomiaru modeli LLM na Androidzie: nowa era Android Bench
3 minuty czytania
W marcu wprowadziliśmy Android Bench – nasz ranking modeli LLM do zadań związanych z tworzeniem aplikacji na Androida. Naszym celem było zapewnienie przejrzystości w zakresie możliwości modeli w tworzeniu aplikacji na Androida oraz zachęcenie do ich ulepszania, aby zapewnić Ci bardziej przydatne opcje AI w codziennej pracy. Od tego czasu ulepszyliśmy testy porównawcze na podstawie Twoich opinii, w tym oceniliśmy modele open-weight i dodaliśmy do rankingu wymiary kosztów i wydajności.
Możliwości AI stale się rozwijają, a pomiary muszą za nimi nadążać. W ramach lipcowej wersji wprowadziliśmy platformę Harbor, która zawiera zaktualizowaną wersję agenta testów porównawczych używanego do oceny modeli.
Oprócz tej zmiany w ocenie w lipcowej wersji dodajemy do rankingu 8 nowych modeli (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus i Qwen 3.7 Max). Udostępniamy też możliwości, dzięki którym Ty, społeczność programistów na Androida, możesz przyczynić się do rozwoju testów porównawczych.
Ulepszanie metodologii za pomocą platformy Harbor
Projektując Android Bench, oparliśmy naszą metodologię na wiodących standardach branżowych dostępnych w tamtym czasie. Użyliśmy agenta testów porównawczych do zwykłych obciążeń mini-swe-agent w wersji 1 i dostosowaliśmy go do niuansów tworzenia aplikacji na Androida, aby zapewnić podstawowy pomiar możliwości modeli w przypadku typowych zadań związanych z tworzeniem aplikacji na Androida.
Aby nadal zapewniać Ci najnowocześniejsze oceny, które dokładnie mierzą najnowsze możliwości modeli w tworzeniu aplikacji na Androida, standaryzujemy nasze testy porównawcze do platformy Harbor. Harbor określa standardy i integracje, które ułatwiają każdemu przeprowadzanie testów porównawczych, ocenianie preferowanych konfiguracji i udostępnianie wyników, co zapewnia dodatkową przejrzystość i widoczność.
Ta aktualizacja umożliwia nam bardziej rygorystyczną ocenę modeli i ich możliwości. Aby ustalić zaktualizowaną linię bazową, ponownie przeprowadziliśmy testy porównawcze na wszystkich modelach. Oznacza to niewielką zmianę w punktacji, ale nadal będzie można wyświetlać wyniki historyczne w archiwum na naszej stronie.
Chcemy, aby Android Bench był dla Ciebie przydatny, dlatego będziemy go stale aktualizować w miarę rozwoju naszych ocen i branży.
Poszerzanie rankingu o 8 nowych modeli
W ramach naszego zobowiązania do utrzymywania aktualności rankingu Android Bench dodaliśmy do niego modele Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus i Qwen 3.7 Max.
Zobaczysz, że Claude Fable 5 znajduje się na szczycie rankingu z wynikiem 84,5, a za nim GPT 5.5 z wynikiem 80,2. Na 3. miejscu jest Claude Sonnet 5 z wynikiem 76,2.
Jeśli porównamy tylko modele open-weight, GLM 5.2 jest na szczycie z wynikiem 72,2, a za nim Kimi K2.7 Code z wynikiem 70,4.
W zaktualizowanym rankingu możesz sprawdzić dane o wydajności i skuteczności modeli, aby zobaczyć, jak te nowe i poprzednie modele radzą sobie z wyzwaniami związanymi z Androidem, takimi jak migracje do Jetpack Compose, sieci na urządzeniach do noszenia i aktualizacje interfejsu API platformy.
Otwieranie Android Bench na wkład społeczności
Od początku cenimy otwarte i przejrzyste podejście, dlatego udostępniliśmy naszą oryginalną metodologię i platformę testową w GitHubie. Poprosiliście o możliwość przekazywania opinii o naszym zbiorze danych, dlatego robimy kolejny krok w kierunku współpracy, dając Wam, społeczności programistów na Androida, możliwość kształtowania Android Bench.
Od dziś możesz przyczynić się do rozwoju Android Bench na 2 sposoby:
- Zaprojektuj i prześlij własne zadania związane z tworzeniem aplikacji na Androida, aby ocenić, jak modele radzą sobie w scenariuszach, które są dla Ciebie ważne.
- _Przeprowadzaj i udostępniaj oceny testów porównawczych_ z pierwszej ręki, testując preferowane modele na podstawie naszego zbioru danych lub własnych zadań niestandardowych.
Będziemy sprawdzać przesłane zadania i oceniać, czy zostaną dodane do testów porównawczych. Mamy nadzieję, że uda nam się stworzyć testy porównawcze, które będą odzwierciedlać różnorodne, codzienne realia globalnej społeczności programistów na Androida.
Co nas czeka
W miarę pojawiania się coraz większej liczby opcji tworzenia agentów utrzymywanie najnowocześniejszych testów porównawczych zapewnia, że pomoc AI, na której polegasz, będzie coraz inteligentniejsza, bardziej przydatna i skuteczniejsza. Aby sprawdzić zadania, przejdź do naszego repozytorium GitHub. Zachęcamy do przesłania zadania do naszego zespołu do sprawdzenia. Możesz też przejść do Harbor Hub, aby zapoznać się ze zbiorem danych lub przesłać oceny.
Jak zawsze, zaktualizowany ranking i metodologię znajdziesz na naszej stronie.
-
Nowości o produktachDziś oficjalnie obchodzimy 5. rocznicę wydania Jetpack Compose 1.0. Od wersji 1.0, ogłoszonej 28 lipca 2021 r., do najnowszej wersji 1.11 interfejsy API znacznie się rozwinęły, dlatego chcemy to uczcić.
Rebecca Franks, Nick Butcher, Loryn Hairston • 5 min czytania -
Nowości o produktachAndroid Studio Quail 2 jest już stabilny i gotowy do użycia w środowisku produkcyjnym. Wprowadza on zmiany w IDE dzięki równoczesnym przepływom pracy agenta, natywnie zintegrowanemu profilowaniu wycieków pamięci i naprawianiu awarii z uwzględnieniem kontekstu.
Amman Asfaw • 3 min czytania -
Nowości o produktachW Google Play dokładamy wszelkich starań, aby zapewnić użytkownikom jak najlepsze wrażenia, a jednocześnie dać deweloperom narzędzia i elastyczność, które pozwolą im odnieść sukces.
Paul Feng • 3 min czytania
Otrzymuj co tydzień najnowsze informacje o tworzeniu aplikacji na Androida na swoją skrzynkę odbiorczą.