प्रॉडक्ट से जुड़ी खबरें

Android के लिए एलएलएम को मेज़र करने के तरीके में बदलाव: Android Bench का नया वर्शन

पढ़ने में 3 मिनट लगेंगे
ज़ोए लोपेज़-लैटोर्रे की प्रोफ़ाइल देखें
Zoe Lopez-Latorre सीनियर डेवलपर रिलेशंस इंजीनियर, Android

मार्च में, हमने Android Bench लॉन्च किया था. यह एलएलएम लीडरबोर्ड है, जो Android डेवलपमेंट से जुड़े असल टास्क के लिए बनाया गया है. हमारा मकसद, Android डेवलपमेंट में मॉडल की क्षमताओं के बारे में पारदर्शिता बनाए रखना और मॉडल को बेहतर बनाने के लिए बढ़ावा देना था. इससे आपको अपने रोज़मर्रा के काम के लिए, एआई के ज़्यादा मददगार विकल्प मिल सकें. तब से, हमने आपके सुझाव के आधार पर बेंचमार्क को बेहतर बनाया है. इसमें ओपन-वेट मॉडल का आकलन करना और लीडरबोर्ड में लागत और क्षमता के डाइमेंशन जोड़ना शामिल है. 

हालांकि, एआई की क्षमताएं लगातार बेहतर हो रही हैं. इसलिए, मेज़रमेंट के तरीके में भी बदलाव ज़रूरी है. जुलाई में रिलीज़ हुए वर्शन में, हमने Harbor फ़्रेमवर्क को अपनाया है. इसमें मॉडल का आकलन करने के लिए इस्तेमाल किए जाने वाले बेंचमार्किंग एजेंट का अपडेटेड वर्शन शामिल है. 

मूल्यांकन में किए गए इस बदलाव के साथ-साथ, हम जुलाई में रिलीज़ हुए वर्शन में, लीडरबोर्ड में आठ नए मॉडल (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, और Qwen 3.7 Max) जोड़ रहे हैं. हम Android डेवलपर कम्यूनिटी के सदस्यों के लिए, बेंचमार्क में योगदान देने के अवसर भी शेयर कर रहे हैं. 

Harbor फ़्रेमवर्क की मदद से, अपने तरीके को अपग्रेड करना

Android Bench को डिज़ाइन करते समय, हमने अपने तरीके को उस समय उपलब्ध इंडस्ट्री के सबसे बड़े स्टैंडर्ड के हिसाब से बनाया था. हमने मिनी-एसडब्ल्यूई-एजेंट v1 का इस्तेमाल किया था. यह एक सामान्य मकसद वाला बेंचमार्किंग एजेंट है. हमने इसे Android डेवलपमेंट की बारीकियों के हिसाब से अडजस्ट किया, ताकि Android डेवलपमेंट से जुड़े सामान्य टास्क के लिए, मॉडल की क्षमताओं का शुरुआती मेज़रमेंट किया जा सके.

आपको Android डेवलपमेंट में, मॉडल की नई क्षमताओं का सटीक आकलन उपलब्ध कराने के लिए, हम अपने बेंचमार्क को Harbor फ़्रेमवर्क के हिसाब से स्टैंडर्ड बना रहे हैं. Harbor, स्टैंडर्ड और इंटिग्रेशन तय करता है. इससे कोई भी व्यक्ति बेंचमार्क चला सकता है, अपनी पसंद के सेटअप का आकलन कर सकता है या नतीजे शेयर कर सकता है. इससे आपको ज़्यादा पारदर्शिता और विज़िबिलिटी मिलती है.

इस अपग्रेड से, हम मॉडल और उनकी क्षमताओं का ज़्यादा सटीक तरीके से आकलन कर सकते हैं. साथ ही, हमने शुरुआती मेज़रमेंट को अपडेट करने के लिए, सभी मॉडल पर बेंचमार्क को फिर से चलाया है. इसका मतलब है कि स्कोरिंग में थोड़ा बदलाव हुआ है. हालांकि, हमारी वेबसाइट पर संग्रह में जाकर, पुराने स्कोर अब भी देखे जा सकेंगे.

हम यह पक्का करना चाहते हैं कि Android Bench आपके लिए मददगार हो. इसलिए, हम अपने आकलन और इंडस्ट्री के बेहतर होने के साथ-साथ, इसे लगातार अपडेट करते रहेंगे.

लीडरबोर्ड में आठ नए मॉडल जोड़ना

लीडरबोर्ड को अपडेट रखने की हमारी कोशिश के तहत, हमने Android Bench के लीडरबोर्ड में Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, और Qwen 3.7 Max को जोड़ा है. 

आपको दिखेगा कि Claude Fable 5 लीडरबोर्ड में सबसे ऊपर है. इसका स्कोर 84.5 है. इसके बाद, GPT 5.5 का स्कोर 80.2 है. वहीं, Claude Sonnet 5 तीसरे नंबर पर है. इसका स्कोर 76.2 है.

सिर्फ़ ओपन-वेट मॉडल की तुलना करने पर, GLM 5.2 सबसे ऊपर है. इसका स्कोर 72.2 है. इसके बाद, Kimi K2.7 Code का स्कोर 70.4 है.

अपडेट किए गए लीडरबोर्ड पर, मॉडल की परफ़ॉर्मेंस और क्षमता की मेट्रिक देखी जा सकती हैं. इससे यह पता चलता है कि ये नए और पुराने मॉडल, Android से जुड़ी चुनौतियों को कैसे हल करते हैं. इनमें Jetpack Compose माइग्रेशन, Wearable Networking, और प्लैटफ़ॉर्म एपीआई अपडेट जैसी चुनौतियां शामिल हैं.  

image1.png

Android Bench में कम्यूनिटी के सदस्यों का योगदान स्वीकार करना

शुरुआत से ही, हमने खुले और पारदर्शी तरीके को महत्व दिया है. इसलिए, हमने अपने ओरिजनल तरीके और टेस्ट हार्नेस को GitHub पर सार्वजनिक तौर पर उपलब्ध कराया है. आपने हमसे अपने डेटासेट पर सुझाव/राय देने या शिकायत करने का तरीका पूछा था. इसलिए, अब हम सहयोग को एक कदम आगे ले जा रहे हैं. हम Android डेवलपर कम्यूनिटी के सदस्यों को, Android Bench को बेहतर बनाने का मौका दे रहे हैं.

आज से, Android Bench में दो तरीकों से योगदान दिया जा सकता है:

  1. मॉडल का आकलन करने के लिए, Android डेवलपमेंट से जुड़े अपने टास्क डिज़ाइन करें और सबमिट करें. इससे यह पता चलेगा कि मॉडल, आपकी ज़रूरतों के हिसाब से काम कर पाते हैं या नहीं.
  2. अपनी पसंद के मॉडल की तुलना, हमारे डेटासेट या अपने कस्टम टास्क से करके, _बेंचमार्क के नतीजों को सीधे तौर पर शेयर करें_.

हम सबमिट किए गए टास्क की समीक्षा करेंगे और यह आकलन करेंगे कि उन्हें बेंचमार्क में जोड़ा जाए या नहीं. हमें उम्मीद है कि हम एक ऐसा बेंचमार्क तैयार कर पाएंगे जो दुनिया भर की Android डेवलपर कम्यूनिटी की अलग-अलग और रोज़मर्रा की ज़रूरतों को सही तरीके से दिखाता हो.

आगे की योजना

एजेंटिक डेवलपमेंट के लिए ज़्यादा से ज़्यादा विकल्प उपलब्ध होने से, बेहतर बेंचमार्क बनाए रखा जा सकता है. इससे यह पक्का होता है कि एआई असिस्टेंस, जिस पर आप भरोसा करते हैं वह ज़्यादा स्मार्ट, मददगार, और असरदार बना रहे. टास्क देखने के लिए, हमारे GitHub के डेटा स्टोर करने की जगह पर जाएं. हमारा आपसे अनुरोध है कि समीक्षा के लिए, हमारी टीम को कोई टास्क सबमिट करें. साथ ही, डेटासेट एक्सप्लोर करने या आकलन सबमिट करने के लिए, Harbor Hub पर जाएं.

हमेशा की तरह, हमारी वेबसाइट पर अपडेट किया गया लीडरबोर्ड देखा जा सकता है. इसके अलावा, तरीके के बारे में भी पढ़ा जा सकता है.

इसे लिखा है:
पढ़ना जारी रखें