Android Bench 2.0: Zorlu uzun vadeli görevlerle sınırları zorlama
Okuma süresi 3 dakika
Android Bench'i ilk kullanıma sunduğumuzda, büyük dil modellerinin (LLM'ler) geliştiricilere gerçek dünyadaki Android görevlerinde nasıl yardımcı olduğunu değerlendirmek için titiz bir temel oluşturduk. Yapay zeka modelleri ve aracıları hızla geliştiğinden metodolojimizi güncelledik. Örneğin, karşılaştırma çerçevemizi Harbor çerçevesiyle uyumlu hale getirdik. Bugün, uzun vadeli görevlerin (LHT) ilk grubunu kullanıma sunuyoruz. Bu görevler, mühendislerin tamamlaması birkaç gün hatta bir hafta süren, oldukça karmaşık görevlerdir. Ayrıca, ilgili model sağlayıcıların temsilcileriyle başlayarak temsilci tabanlı değerlendirmeyi de kullanıma sunuyoruz. Bu eklemeyle Android Bench 2.0'a geçiyoruz. Bu, yapay zeka modellerini ve aracılarını her gün karşılaştığınız ölçek, belirsizlik ve karmaşık çok adımlı problem çözme konularında değerlendirmek için tasarlanmış büyük bir yükseltmedir.
Küçük düzeltmelerden uzun vadeli görevlere kadar
Android Bench'in ilk sürümü ve benzer erken yapay zeka kodlama karşılaştırmaları, mevcut depolarda yapılan artımlı değişikliklere odaklanıyordu. Bu değişiklikler çoğu durumda hata düzeltmeleri veya daha küçük özellik istekleriyle sınırlıydı. Bu, o sırada yapay zeka yardımının özelliklerinin yanı sıra onu nasıl kullandığınızın bir yansımasıydı.
Geliştirme iş akışınıza en uygun modelleri ve kodlama aracılarını bulmanıza yardımcı olmaya devam etmek için değerlendirmelerimizin çıtasını, yapay zekaya devrettiğiniz işlerle eşleşecek şekilde yükselttik. Android Bench 2.0, bağımlılıkları yükseltme, yeni özellikler ekleme, uygulamaları sıfırdan oluşturma veya platformlar arası bir uygulamayı Android'e dönüştürme gibi LHT'lerle bu zorlu görevleri yansıtır.
Karmaşık görevler daha ayrıntılı bir değerlendirme ve puanlama gerektirir.
Çok günlük mühendislik görevlerinde, ikili (geçti/kaldı) notlandırma, resmin tamamını yansıtmaz.
Örneğin, bir aracı 40 ekranı Jetpack Compose'a yeniden düzenleyebilir, veritabanı tabloları oluşturabilir ve şartların% 90'ını karşılayabilir ancak tek bir uç nokta durumu onaylamasında başarısız olabilir. İkili puanlama, bu çalıştırmayı %0 olarak değerlendirerek modelin mimari yeteneklerini gizliyor. Hem model geliştirme hem de yapay zekanın size nasıl yardımcı olabileceğini anlamanız için daha anlamlı bir sinyal sağlamak amacıyla sürekli puanlamaya geçiyoruz.
Bu tamamlama oranı; işlevsellik, görsel doğruluk ve gerilemeleri önleme gibi faktörlerin bir kombinasyonuyla hesaplanır. Ayrıca, değerlendirme talimatlarından veya yapısal kısıtlamalardan sapmalar için de objektif puanlama cezaları uygularız. Güncellenen skor tablosuna göz atın ve her modelin kart görünümünü tıklayarak geçme oranı, tamamlama oranı, model başına ve görev başına ortalama maliyetler gibi ek öğeleri görün.
LHT'ler için en yüksek geçme oranı yaklaşık%28'dir. Bu oran, karşılaştırmadaki orijinal görevlerin geçme oranı olan% 91'den çok daha düşüktür.
Uzun vadeli görevler, yapay zeka yardımına yönelik faydalı analizler ortaya çıkarır.
LHT veri seti, yapay zekanın uzun süren görevleri ne kadar iyi yönettiğini ölçmenin yanı sıra test edilen modellerin güçlü ve zayıf yönleri hakkında daha fazla bilgi edinmemize yardımcı olur. Ayrıca, size daha pratik rehberlik sunar.
Yapay zeka, model katmanlarında mevcut kodu yeniden düzenlemek yerine yeni kod yazma konusunda daha iyi performans gösterir. Başarı, kod hacminden ziyade mimari karmaşıklığa bağlı olduğundan yeniden düzenlemeler ve taşımalar daha zor hale gelir.
Modeller, Java'yı Kotlin'e dönüştürme, Retrofit'i Ktor ile değiştirme veya ViewModel katmanı ekleme gibi iyi bilinen, deterministik dönüşümlerde güçlü özellikler gösterir. Bu kalıpları 125'ten fazla dosya ve 8.000'den fazla kod satırında bile tutarlı bir şekilde uygularlar.
Ancak görevler, çalışma zamanı doğrulaması (ör. eksik bağımlılık ekleme grafikleri) gerektirdiğinde, çerçeve değişikliklerini bozduğunda veya yayınlanmamış kitaplıklarla ilgili bilgi eksiklikleriyle karşılaştığında modeller zorlanır. Platformlar arası uygulamaları Android'e taşıma, açık bir zorluk olmaya devam ediyor. Hiçbir model% 100 başarı oranına ulaşmıyor ve en gelişmiş modeller en fazla% 80 tamamlanma oranına ulaşıyor.
Temsilci değerlendirmeleri kullanıma sunuluyor
Modellerin, ajan tabanlı iş akışlarınıza entegre edildiğinde nasıl performans gösterdiğini daha iyi anlamanıza yardımcı olmak için değerlendirmemize en çok tercih edilen aracıları ekliyoruz. İşe, yeni modelleri ilgili model sağlayıcının aracılarıyla LHT'lere karşı çalıştırarak başlıyoruz. Örneğin, Codex'te GPT 5.6 Sol'u, Google Antigravity'de ise Gemini 3.8 Flash'i çalıştırdık. Bu eşleştirme, istem önbelleğe alma ve kompakt araç penceresi oluşturma gibi özelliklerin jeton sayısında azalmaya yol açabildiğini gösterdiğinden koşum tasarımının geliştirici sonuçlarını nasıl olumlu etkilediğini gösteriyor.
Gelecekte, hangi kombinasyonların sizin ve ekibiniz için en iyi sonucu verdiğini keşfetmenize yardımcı olmak amacıyla çeşitli model ve aracı kombinasyonlarındaki sonuçları da vurgulayarak bu özelliği genişleteceğiz.
Android geliştirmede tercih ettiğiniz aracı ve modeli kullanabilmeniz önemli olduğundan bu ölçüme yatırım yapıyoruz. Önümüzdeki haftalarda sizinle paylaşacağımız daha fazla bilgi olacak.
Yeni modeller eklendi
Ayrıca, geliştirme kararlarınız için en güncel verilere sahip olmanızı sağlamak amacıyla liderlik tablomuzu genişletmeye devam ediyoruz. % 28 geçme oranıyla OpenAI'ın GPT-6 Astra'sının en üstte yer aldığı Gemini 3.8 Flash, Gemini 3.7 Flash, OpenAI'ın GPT-6'sı, Anthropic'in Fable 5.1'i, Kimi K3 ve Qwen 3.8 Max'i ekledik.
Geleceğe dönük planlar
Android Bench 2.0, Android geliştirmede yapay zekayı ölçmek için sağlam bir ortam sunar. Uzun vadeli görevleri, çok formatlı değerlendirmeyi, aracıları ve sürekli puanlamayı birleştirerek yapay zeka araştırma ekiplerinin daha yetenekli ve güvenilir yapay zeka kodlama ortakları oluşturmasına yardımcı olmayı ve yapay zeka geliştirme seçenekleriniz hakkında daha fazla şeffaflık sağlamayı amaçlıyoruz.
Güncellenen metodoloji ile birlikte güncellenen skor tablosuna göz atın. Geri bildirimleriniz, Android Bench'i geliştirme şeklimizi doğrudan etkiler. Bu nedenle, lütfen GitHub'da ve X ile LinkedIn gibi sosyal medya kanallarımızda geri bildirimlerinizi bizimle paylaşmaya devam edin.
-
Ürün HaberleriMart ayında, gerçek dünyadaki Android geliştirme görevleri için LLM skor tablomuz olan Android Bench'i tanıtmıştık. O zamandan beri, açık ağırlıklı modelleri değerlendirme ve maliyet ile verimlilik boyutlarını skor tablosuna ekleme gibi geri bildirimleriniz doğrultusunda karşılaştırma ölçütünü geliştirdik.
Zoe Lopez-Latorre • Okuma süresi 3 dakika -
Ürün HaberleriBugün Android 17'yi yayınlıyor ve desteklenen çoğu Pixel cihazda kullanıma sunuyoruz. Önümüzdeki aylarda Android 17'nin yüklü olduğu yeni cihazlar piyasaya sürülecek.
Matthew McCullough • Okuma süresi 13 dakika -
Ürün HaberleriGoogle I/O 2026 'da Android geliştiriciler için 17 önemli duyuru yapıldı. Bu duyurularda, ajan tabanlı üretkenlik, kullanıcı arayüzü standardımız olarak Compose First ve genişleyen ekosistem için yüksek performanslı medya ve uyarlanabilir geliştirme konularına odaklanıldı.
Matthew McCullough • Okuma süresi 8 dakika
Android geliştirmeyle ilgili en son analizleri her hafta gelen kutunuza alın.