Berita Produk

Mengembangkan cara mengukur LLM untuk Android: era berikutnya dari Android Bench

Waktu baca: 3 menit
Lihat profil Zoe Lopez-Latorre
Zoe Lopez-Latorre Senior Developer Relations Engineer, Android

Pada bulan Maret lalu, kami memperkenalkan Android Bench—papan peringkat LLM kami untuk tugas pengembangan Android di dunia nyata. Tujuan kami adalah memberikan transparansi seputar kemampuan model dalam pengembangan Android dan mendorong peningkatan kualitas model, untuk memberi Anda opsi AI yang lebih bermanfaat bagi alur kerja sehari-hari Anda. Sejak saat itu, kami telah meningkatkan kualitas tolok ukur berdasarkan masukan Anda, termasuk mengevaluasi model berat terbuka dan menambahkan dimensi biaya dan efisiensi ke papan peringkat. 

Namun, kemampuan AI terus berkembang, dan pengukuran harus mengikutinya. Sebagai bagian dari rilis bulan Juli, kami telah mengadopsi framework Harbor, yang mencakup versi terbaru agen tolok ukur yang digunakan untuk mengevaluasi model. 

Seiring dengan perubahan pada evaluasi kami ini, dalam rilis bulan Juli ini, kami menambahkan 8 model baru (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, dan Qwen 3.7 Max) ke papan peringkat. Kami juga membagikan peluang bagi Anda, komunitas developer Android, untuk berkontribusi pada tolok ukur. 

Meningkatkan kualitas metodologi kami dengan framework Harbor

Saat mendesain Android Bench, kami mendasarkan metodologi kami pada standar industri terkemuka yang tersedia pada saat itu. Kami menggunakan mini-swe-agent v1, agen tolok ukur tujuan umum, dan menyesuaikannya dengan nuansa pengembangan Android untuk memberikan dasar pengukuran bagi kapabilitas model untuk tugas pengembangan Android umum.

Untuk terus memberikan evaluasi canggih yang secara akurat mengukur kemampuan model terbaru pada pengembangan Android, kami menstandardisasi tolok ukur kami ke framework Harbor. Harbor menentukan standar dan integrasi yang memudahkan siapa pun untuk menjalankan tolok ukur, mengevaluasi penyiapan yang diinginkan, atau membagikan hasil, sehingga memberikan transparansi dan visibilitas tambahan kepada Anda.

Upgrade ini memungkinkan kami mengevaluasi model dan kemampuannya secara lebih ketat, dan kami menjalankan kembali tolok ukur pada semua model untuk menetapkan dasar yang diperbarui. Artinya, ada sedikit perubahan dalam pemberian skor, tetapi Anda tetap dapat melihat skor historis dalam arsip di situs kami.

Kami ingin memastikan Android Bench bermanfaat bagi Anda, jadi kami akan terus memperbaruinya seiring dengan perkembangan evaluasi kami dan industri.

Memperluas papan peringkat dengan 8 model baru

Sebagai bagian dari komitmen kami untuk menjaga keaktualan papan peringkat, kami telah menambahkan Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, dan Qwen 3.7 Max ke papan peringkat Android Bench. 

Anda akan melihat bahwa Claude Fable 5 berada di puncak papan peringkat dengan skor 84,5, diikuti oleh GPT 5.5 dengan skor 80,2, dan Claude Sonnet 5 di posisi ke-3 dengan skor 76,2.

Jika hanya membandingkan model Open-weight, GLM 5.2 berada di posisi teratas dengan skor 72,2, diikuti oleh Kimi K2.7 Code dengan skor 70,4.

Anda dapat melihat metrik performa dan efisiensi model di papan peringkat yang telah diupdate untuk melihat cara model baru dan sebelumnya mengatasi tantangan khusus Android seperti migrasi Jetpack Compose, jaringan perangkat wearable, dan update API platform.  

image1.png

Membuka Android Bench untuk kontribusi komunitas

Sejak awal, kami menghargai pendekatan yang terbuka dan transparan, itulah sebabnya kami menyediakan metodologi dan test harness asli kami secara publik di GitHub. Anda telah meminta cara untuk memberikan masukan tentang set data kami, jadi sekarang kami meningkatkan kolaborasi dengan memberi Anda, komunitas developer Android, kesempatan untuk membentuk Android Bench.

Mulai hari ini, Anda dapat berkontribusi pada Android Bench dengan dua cara:

  1. Rancang dan kirimkan tugas pengembangan Android Anda sendiri untuk mengevaluasi cara model menangani skenario yang penting bagi Anda.
  2. Jalankan dan bagikan evaluasi tolok ukur secara langsung, dengan menguji model pilihan Anda terhadap set data kami atau tugas kustom Anda sendiri.

Kami akan meninjau tugas yang dikirimkan dan akan menilai apakah tugas tersebut akan ditambahkan ke tolok ukur. Kami berharap dapat membuat tolok ukur yang benar-benar mencerminkan realitas sehari-hari yang beragam dari komunitas developer Android global.

Visi ke depan

Dengan semakin banyaknya opsi untuk pengembangan agentik, mempertahankan tolok ukur mutakhir memastikan bahwa bantuan AI yang Anda andalkan akan terus menjadi lebih pintar, lebih bermanfaat, dan lebih efektif. Buka repositori GitHub kami untuk melihat tugas. Kami mengundang Anda untuk mengirimkan tugas kepada tim kami untuk ditinjau, dan Anda dapat membuka Harbor Hub untuk menjelajahi set data atau mengirimkan evaluasi.

Seperti biasa, Anda dapat menemukan papan peringkat yang diperbarui, atau membaca metodologi di situs kami. 

Ditulis oleh:
Lanjutkan membaca