Produktneuheiten

Weiterentwicklung der LLM-Messung für Android: die nächste Ära von Android Bench

Lesezeit: 3 Minuten
Profil von Zoe Lopez-Latorre ansehen
Zoe Lopez-Latorre Senior Developer Relations Engineer, Android

Im März haben wir Android Bench eingeführt, unsere LLM-Bestenliste für Android-Entwicklungsaufgaben in der Praxis. Unser Ziel war es, Transparenz in Bezug auf die Modellfunktionen in der Android-Entwicklung zu schaffen und Modellverbesserungen zu fördern, um Ihnen hilfreichere KI-Optionen für Ihren täglichen Workflow zu bieten. Seitdem haben wir den Benchmark anhand Ihres Feedbacks verbessert, einschließlich der Bewertung von Modellen mit offenen Gewichten und der Hinzufügung von Kosten- und Effizienzkriterien zur Bestenliste. 

Die KI-Funktionen entwickeln sich jedoch ständig weiter und die Messung muss entsprechend angepasst werden. Im Rahmen unserer Veröffentlichung im Juli haben wir das Harbor-Framework eingeführt, das eine aktualisierte Version des Benchmark-Agents enthält, der zur Bewertung von Modellen verwendet wird. 

Neben dieser Änderung an unserer Bewertung fügen wir der Bestenliste in dieser Veröffentlichung im Juli acht neue Modelle hinzu: Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus und Qwen 3.7 Max. Außerdem bieten wir Ihnen, der Android-Entwickler-Community, Möglichkeiten, zum Benchmark beizutragen. 

Aktualisierung unserer Methodik mit dem Harbor-Framework

Bei der Entwicklung von Android Bench haben wir unsere Methodik an den führenden Branchenstandards ausgerichtet, die zu diesem Zeitpunkt verfügbar waren. Wir haben mini-swe-agent v1 verwendet, einen Allzweck-Benchmark-Agenten, und ihn an die Besonderheiten der Android-Entwicklung angepasst, um eine Baseline-Messung für die Funktionen von Modellen für gängige Android-Entwicklungsaufgaben zu ermöglichen.

Um Ihnen weiterhin modernste Bewertungen zu bieten, mit denen die neuesten Modellfunktionen in der Android-Entwicklung genau gemessen werden können, standardisieren wir unseren Benchmark auf das Harbor-Framework. Harbor definiert Standards und Integrationen, die es jedem ermöglichen, den Benchmark auszuführen, die bevorzugte Einrichtung zu bewerten oder Ergebnisse zu teilen. So erhalten Sie zusätzliche Transparenz und Sichtbarkeit.

Durch dieses Upgrade können wir Modelle und ihre Funktionen genauer bewerten. Wir haben den Benchmark für alle Modelle noch einmal ausgeführt, um eine aktualisierte Baseline zu erstellen. Das bedeutet, dass es eine geringfügige Änderung bei der Bewertung gibt. Sie können aber weiterhin die bisherigen Bewertungen im Archiv auf unserer Website ansehen.

Wir möchten, dass Android Bench für Sie hilfreich ist. Daher werden wir es kontinuierlich aktualisieren, wenn sich unsere Bewertungen und die Branche weiterentwickeln.

Erweiterung der Bestenliste um acht neue Modelle

Im Rahmen unseres Engagements, die Bestenliste auf dem neuesten Stand zu halten, haben wir Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus und Qwen 3.7 Max zur Android Bench-Bestenliste hinzugefügt. 

Sie werden sehen, dass Claude Fable 5 mit einer Bewertung von 84,5 an der Spitze der Bestenliste liegt, gefolgt von GPT 5.5 mit 80,2 und Claude Sonnet 5 mit 76,2.

Wenn wir nur Modelle mit offenen Gewichten vergleichen, liegt GLM 5.2 mit 72,2 an der Spitze, gefolgt von Kimi K2.7 Code mit einer Bewertung von 70,4.

In der aktualisierten Bestenliste finden Sie Messwerte zur Leistung und Effizienz der Modelle. So können Sie sehen, wie diese neuen und bisherigen Modelle mit Android-spezifischen Herausforderungen wie Jetpack Compose-Migrationen, Wearable-Netzwerken und Plattform-API-Updates umgehen.  

image1.png

Android Bench für Beiträge aus der Community öffnen

Von Anfang an haben wir einen offenen und transparenten Ansatz verfolgt. Deshalb haben wir unsere ursprüngliche Methodik und Testumgebung auf GitHub öffentlich verfügbar gemacht. Sie haben uns um eine Möglichkeit gebeten, Feedback zu unserem Dataset zu geben. Deshalb gehen wir jetzt noch einen Schritt weiter und geben Ihnen, der Android-Entwickler-Community, die Möglichkeit, Android Bench mitzugestalten.

Ab heute können Sie auf zwei Arten zu Android Bench beitragen:

  1. Sie können eigene Android-Entwicklungsaufgaben entwerfen und einreichen , um zu bewerten, wie Modelle mit den für Sie wichtigen Szenarien umgehen.
  2. Sie können Benchmark-Bewertungen selbst ausführen und teilen und Ihre bevorzugten Modelle mit unserem Dataset oder Ihren eigenen benutzerdefinierten Aufgaben testen.

Wir werden die eingereichten Aufgaben prüfen und bewerten, ob sie zum Benchmark hinzugefügt werden. Wir möchten einen Benchmark entwickeln, der die vielfältigen Realitäten der globalen Android-Entwickler-Community widerspiegelt.

Ausblick

Da es immer mehr Optionen für die agentische Entwicklung gibt, sorgt ein hochmoderner Benchmark dafür, dass die KI-Unterstützung, auf die Sie sich verlassen, immer intelligenter, hilfreicher und effektiver wird. In unserem GitHub-Repository finden Sie die Aufgaben. Sie können eine Aufgabe zur Überprüfung durch unser Team einreichen und im Harbor Hub das Dataset erkunden oder Bewertungen einreichen.

Wie immer finden Sie die aktualisierte Bestenliste oder die Methodik auf unserer Website. 

Geschrieben von:
Weiterlesen