Android के लिए एलएलएम को मापने के तरीके में बदलाव: Android Bench का नया वर्शन
3 मिनट में पढ़ें
मार्च में, हमने Android Bench लॉन्च किया था. यह Android डेवलपमेंट से जुड़े असल टास्क के लिए, एलएलएम का लीडरबोर्ड है. हमारा मकसद, Android डेवलपमेंट में मॉडल की क्षमताओं के बारे में पारदर्शिता बनाए रखना और मॉडल में सुधार करना था, ताकि आपको अपने रोज़मर्रा के काम के लिए, एआई के ज़्यादा मददगार विकल्प मिल सकें. तब से, हमने आपके सुझाव के आधार पर बेंचमार्क को बेहतर बनाया है. इसमें ओपन-वेट मॉडल का आकलन करना और लीडरबोर्ड में लागत और क्षमता के डाइमेंशन जोड़ना शामिल है.
हालांकि, एआई की क्षमताएं लगातार बेहतर हो रही हैं. इसलिए, मेज़रमेंट के तरीके में भी बदलाव करना ज़रूरी है. जुलाई में लॉन्च किए गए वर्शन में, हमने Harbor फ़्रेमवर्क को अपनाया है. इसमें मॉडल का आकलन करने के लिए इस्तेमाल किए जाने वाले बेंचमार्किंग एजेंट का अपडेटेड वर्शन शामिल है.
मूल्यांकन में किए गए इस बदलाव के साथ-साथ, हम जुलाई में लॉन्च किए गए वर्शन में, लीडरबोर्ड में आठ नए मॉडल (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, और Qwen 3.7 Max) जोड़ रहे हैं. हम Android डेवलपर कम्यूनिटी के सदस्यों के लिए, बेंचमार्क में योगदान करने के अवसर भी शेयर कर रहे हैं.
Harbor फ़्रेमवर्क की मदद से, अपने तरीके को अपग्रेड करना
Android Bench को डिज़ाइन करते समय, हमने अपने तरीके को उस समय उपलब्ध इंडस्ट्री के सबसे बड़े स्टैंडर्ड के हिसाब से बनाया था. हमने मिनी-स्वीप-एजेंट v1 का इस्तेमाल किया था. यह एक सामान्य-उद्देश्य वाला बेंचमार्किंग एजेंट है. हमने इसे Android डेवलपमेंट की बारीकियों के हिसाब से अडजस्ट किया था, ताकि Android डेवलपमेंट से जुड़े सामान्य टास्क के लिए, मॉडल की क्षमताओं का शुरुआती मेज़रमेंट किया जा सके.
आपको Android डेवलपमेंट में, मॉडल की नई क्षमताओं का सटीक आकलन उपलब्ध कराने के लिए, हम अपने बेंचमार्क को Harbor फ़्रेमवर्क के हिसाब से स्टैंडर्ड बना रहे हैं. Harbor, ऐसे स्टैंडर्ड और इंटिग्रेशन तय करता है जिनसे कोई भी व्यक्ति बेंचमार्क चला सकता है, अपनी पसंद के सेटअप का आकलन कर सकता है या नतीजे शेयर कर सकता है. इससे आपको ज़्यादा पारदर्शिता और विज़िबिलिटी मिलती है.
इस अपग्रेड की मदद से, हम मॉडल और उनकी क्षमताओं का ज़्यादा सटीक आकलन कर सकते हैं. साथ ही, हमने सभी मॉडल पर बेंचमार्क को फिर से चलाया है, ताकि अपडेटेड शुरुआती मेज़रमेंट किया जा सके. इसका मतलब है कि स्कोरिंग में थोड़ा बदलाव हुआ है. हालांकि, अब भी हमारी वेबसाइट पर संग्रह में जाकर, पुराने स्कोर देखे जा सकेंगे.
हम यह पक्का करना चाहते हैं कि Android Bench आपके लिए मददगार हो. इसलिए, हम अपने आकलन और उद्योग के हिसाब से इसे लगातार अपडेट करते रहेंगे.
लीडरबोर्ड में आठ नए मॉडल जोड़ना
लीडरबोर्ड को अपडेट रखने की हमारी कोशिश के तहत, हमने Android Bench के लीडरबोर्ड में Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, और Qwen 3.7 Max को जोड़ा है.
आपको दिखेगा कि Claude Fable 5 लीडरबोर्ड में सबसे ऊपर है. इसका स्कोर 84.5 है. इसके बाद, GPT 5.5 का स्कोर 80.2 है. तीसरे नंबर पर Claude Sonnet 5 है, जिसका स्कोर 76.2 है.
सिर्फ़ ओपन-वेट मॉडल की तुलना करने पर, GLM 5.2 सबसे ऊपर है. इसका स्कोर 72.2 है. इसके बाद, Kimi K2.7 Code का स्कोर 70.4 है.
अपडेट किए गए लीडरबोर्ड पर, मॉडल की परफ़ॉर्मेंस और क्षमता से जुड़ी मेट्रिक देखी जा सकती हैं. इससे यह पता चलता है कि ये नए और पुराने मॉडल, Android से जुड़ी चुनौतियों को कैसे हल करते हैं. जैसे, Jetpack Compose माइग्रेशन, Wearable Networking, और प्लैटफ़ॉर्म एपीआई अपडेट.
Android Bench में कम्यूनिटी के सदस्यों का योगदान स्वीकार करना
शुरुआत से ही, हमने ओपन और पारदर्शी तरीके को अहमियत दी है. इसलिए, हमने अपने ओरिजनल तरीके और टेस्ट हार्नेस को GitHub पर सार्वजनिक तौर पर उपलब्ध कराया है. आपने हमसे अपने डेटासेट पर सुझाव/राय देने या शिकायत करने का तरीका मांगा था. इसलिए, अब हम सहयोग को एक कदम आगे ले जा रहे हैं. हम Android डेवलपर कम्यूनिटी के सदस्यों को, Android Bench को बेहतर बनाने का मौका दे रहे हैं.
आज से, Android Bench में दो तरीकों से योगदान दिया जा सकता है:
- मॉडल का आकलन करने के लिए, Android डेवलपमेंट से जुड़े अपने टास्क डिज़ाइन करें और सबमिट करें. इससे यह पता चलेगा कि मॉडल, आपके लिए अहम स्थितियों को कैसे हैंडल करते हैं.
- अपनी पसंद के मॉडल की तुलना, हमारे डेटासेट या अपने कस्टम टास्क से करके, बेंचमार्क के आकलन को सीधे तौर पर चलाएं और शेयर करें.
हम सबमिट किए गए टास्क की समीक्षा करेंगे और यह आकलन करेंगे कि उन्हें बेंचमार्क में जोड़ा जाए या नहीं. हमें उम्मीद है कि हम एक ऐसा बेंचमार्क तैयार कर पाएंगे जो दुनिया भर में मौजूद Android डेवलपर कम्यूनिटी की अलग-अलग और रोज़मर्रा की ज़रूरतों को सही तरीके से दिखाता हो.
आगे की योजना
एजेंटिक डेवलपमेंट के लिए ज़्यादा से ज़्यादा विकल्प उपलब्ध होने से, एक बेहतर बेंचमार्क बनाए रखना ज़रूरी है. इससे यह पक्का होता है कि एआई असिस्टेंस, जिस पर आप भरोसा करते हैं वह ज़्यादा स्मार्ट, मददगार, और असरदार बना रहे. टास्क देखने के लिए, हमारे GitHub के डेटा स्टोर करने की जगह पर जाएं. हमारा आपसे अनुरोध है कि समीक्षा के लिए, हमारी टीम को कोई टास्क सबमिट करें. साथ ही, डेटासेट एक्सप्लोर करने या आकलन सबमिट करने के लिए, Harbor Hub पर जाएं.
हमेशा की तरह, हमारी वेबसाइट पर अपडेट किया गया लीडरबोर्ड देखा जा सकता है. इसके अलावा, तरीके के बारे में भी पढ़ा जा सकता है.
-
प्रॉडक्ट से जुड़ी खबरेंAndroid Studio Quail 2 का स्टेबल वर्शन अब उपलब्ध है. इसका इस्तेमाल प्रोडक्शन में किया जा सकता है. इसमें, एजेंटिक वर्कफ़्लो को एक साथ चलाने की सुविधा, मेमोरी लीक की प्रोफ़ाइलिंग को इंटिग्रेट करने की सुविधा, और कॉन्टेक्स्ट के हिसाब से क्रैश ठीक करने की सुविधा शामिल है. इससे आपके आईडीई में बदलाव आएगा.
Amman Asfaw • 3 मिनट में पढ़ें -
प्रॉडक्ट से जुड़ी खबरेंGoogle Play पर, हमारा मकसद उपयोगकर्ताओं को सबसे अच्छा अनुभव देना है. साथ ही, यह पक्का करना है कि डेवलपर के पास सफल होने के लिए ज़रूरी टूल और अडैप्टेबिलिटी हो.
Paul Feng • 3 मिनट में पढ़ें -
प्रॉडक्ट से जुड़ी खबरेंपिछले साल, हमने Android डेवलपर की पहचान की पुष्टि करने की सुविधा लॉन्च की थी. इसका मकसद, इकोसिस्टम की सुरक्षा को मज़बूत करना और नुकसान पहुंचाने वाले ऐप्लिकेशन रिलीज़ करने के लिए, बुरे मकसद से काम करने वाले लोगों या ग्रुप को अपनी पहचान छिपाने से रोकना था.
Matthew Forsythe • 2 मिनट में पढ़ें
Android डेवलपमेंट से जुड़ी नई अहम जानकारी, हर हफ़्ते अपने इनबॉक्स में पाएं.