Android के लिए एलएलएम को मेज़र करने के तरीके में बदलाव: Android Bench का नया वर्शन
पढ़ने में 3 मिनट लगेंगे
मार्च में, हमने Android Bench लॉन्च किया था. यह एलएलएम लीडरबोर्ड है, जो Android डेवलपमेंट से जुड़े असल टास्क के लिए बनाया गया है. हमारा मकसद, Android डेवलपमेंट में मॉडल की क्षमताओं के बारे में पारदर्शिता बनाए रखना और मॉडल को बेहतर बनाने के लिए बढ़ावा देना था. इससे आपको अपने रोज़मर्रा के काम के लिए, एआई के ज़्यादा मददगार विकल्प मिल सकें. तब से, हमने आपके सुझाव के आधार पर बेंचमार्क को बेहतर बनाया है. इसमें ओपन-वेट मॉडल का आकलन करना और लीडरबोर्ड में लागत और क्षमता के डाइमेंशन जोड़ना शामिल है.
हालांकि, एआई की क्षमताएं लगातार बेहतर हो रही हैं. इसलिए, मेज़रमेंट के तरीके में भी बदलाव ज़रूरी है. जुलाई में रिलीज़ हुए वर्शन में, हमने Harbor फ़्रेमवर्क को अपनाया है. इसमें मॉडल का आकलन करने के लिए इस्तेमाल किए जाने वाले बेंचमार्किंग एजेंट का अपडेटेड वर्शन शामिल है.
मूल्यांकन में किए गए इस बदलाव के साथ-साथ, हम जुलाई में रिलीज़ हुए वर्शन में, लीडरबोर्ड में आठ नए मॉडल (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, और Qwen 3.7 Max) जोड़ रहे हैं. हम Android डेवलपर कम्यूनिटी के सदस्यों के लिए, बेंचमार्क में योगदान देने के अवसर भी शेयर कर रहे हैं.
Harbor फ़्रेमवर्क की मदद से, अपने तरीके को अपग्रेड करना
Android Bench को डिज़ाइन करते समय, हमने अपने तरीके को उस समय उपलब्ध इंडस्ट्री के सबसे बड़े स्टैंडर्ड के हिसाब से बनाया था. हमने मिनी-एसडब्ल्यूई-एजेंट v1 का इस्तेमाल किया था. यह एक सामान्य मकसद वाला बेंचमार्किंग एजेंट है. हमने इसे Android डेवलपमेंट की बारीकियों के हिसाब से अडजस्ट किया, ताकि Android डेवलपमेंट से जुड़े सामान्य टास्क के लिए, मॉडल की क्षमताओं का शुरुआती मेज़रमेंट किया जा सके.
आपको Android डेवलपमेंट में, मॉडल की नई क्षमताओं का सटीक आकलन उपलब्ध कराने के लिए, हम अपने बेंचमार्क को Harbor फ़्रेमवर्क के हिसाब से स्टैंडर्ड बना रहे हैं. Harbor, स्टैंडर्ड और इंटिग्रेशन तय करता है. इससे कोई भी व्यक्ति बेंचमार्क चला सकता है, अपनी पसंद के सेटअप का आकलन कर सकता है या नतीजे शेयर कर सकता है. इससे आपको ज़्यादा पारदर्शिता और विज़िबिलिटी मिलती है.
इस अपग्रेड से, हम मॉडल और उनकी क्षमताओं का ज़्यादा सटीक तरीके से आकलन कर सकते हैं. साथ ही, हमने शुरुआती मेज़रमेंट को अपडेट करने के लिए, सभी मॉडल पर बेंचमार्क को फिर से चलाया है. इसका मतलब है कि स्कोरिंग में थोड़ा बदलाव हुआ है. हालांकि, हमारी वेबसाइट पर संग्रह में जाकर, पुराने स्कोर अब भी देखे जा सकेंगे.
हम यह पक्का करना चाहते हैं कि Android Bench आपके लिए मददगार हो. इसलिए, हम अपने आकलन और इंडस्ट्री के बेहतर होने के साथ-साथ, इसे लगातार अपडेट करते रहेंगे.
लीडरबोर्ड में आठ नए मॉडल जोड़ना
लीडरबोर्ड को अपडेट रखने की हमारी कोशिश के तहत, हमने Android Bench के लीडरबोर्ड में Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, और Qwen 3.7 Max को जोड़ा है.
आपको दिखेगा कि Claude Fable 5 लीडरबोर्ड में सबसे ऊपर है. इसका स्कोर 84.5 है. इसके बाद, GPT 5.5 का स्कोर 80.2 है. वहीं, Claude Sonnet 5 तीसरे नंबर पर है. इसका स्कोर 76.2 है.
सिर्फ़ ओपन-वेट मॉडल की तुलना करने पर, GLM 5.2 सबसे ऊपर है. इसका स्कोर 72.2 है. इसके बाद, Kimi K2.7 Code का स्कोर 70.4 है.
अपडेट किए गए लीडरबोर्ड पर, मॉडल की परफ़ॉर्मेंस और क्षमता की मेट्रिक देखी जा सकती हैं. इससे यह पता चलता है कि ये नए और पुराने मॉडल, Android से जुड़ी चुनौतियों को कैसे हल करते हैं. इनमें Jetpack Compose माइग्रेशन, Wearable Networking, और प्लैटफ़ॉर्म एपीआई अपडेट जैसी चुनौतियां शामिल हैं.
Android Bench में कम्यूनिटी के सदस्यों का योगदान स्वीकार करना
शुरुआत से ही, हमने खुले और पारदर्शी तरीके को महत्व दिया है. इसलिए, हमने अपने ओरिजनल तरीके और टेस्ट हार्नेस को GitHub पर सार्वजनिक तौर पर उपलब्ध कराया है. आपने हमसे अपने डेटासेट पर सुझाव/राय देने या शिकायत करने का तरीका पूछा था. इसलिए, अब हम सहयोग को एक कदम आगे ले जा रहे हैं. हम Android डेवलपर कम्यूनिटी के सदस्यों को, Android Bench को बेहतर बनाने का मौका दे रहे हैं.
आज से, Android Bench में दो तरीकों से योगदान दिया जा सकता है:
- मॉडल का आकलन करने के लिए, Android डेवलपमेंट से जुड़े अपने टास्क डिज़ाइन करें और सबमिट करें. इससे यह पता चलेगा कि मॉडल, आपकी ज़रूरतों के हिसाब से काम कर पाते हैं या नहीं.
- अपनी पसंद के मॉडल की तुलना, हमारे डेटासेट या अपने कस्टम टास्क से करके, _बेंचमार्क के नतीजों को सीधे तौर पर शेयर करें_.
हम सबमिट किए गए टास्क की समीक्षा करेंगे और यह आकलन करेंगे कि उन्हें बेंचमार्क में जोड़ा जाए या नहीं. हमें उम्मीद है कि हम एक ऐसा बेंचमार्क तैयार कर पाएंगे जो दुनिया भर की Android डेवलपर कम्यूनिटी की अलग-अलग और रोज़मर्रा की ज़रूरतों को सही तरीके से दिखाता हो.
आगे की योजना
एजेंटिक डेवलपमेंट के लिए ज़्यादा से ज़्यादा विकल्प उपलब्ध होने से, बेहतर बेंचमार्क बनाए रखा जा सकता है. इससे यह पक्का होता है कि एआई असिस्टेंस, जिस पर आप भरोसा करते हैं वह ज़्यादा स्मार्ट, मददगार, और असरदार बना रहे. टास्क देखने के लिए, हमारे GitHub के डेटा स्टोर करने की जगह पर जाएं. हमारा आपसे अनुरोध है कि समीक्षा के लिए, हमारी टीम को कोई टास्क सबमिट करें. साथ ही, डेटासेट एक्सप्लोर करने या आकलन सबमिट करने के लिए, Harbor Hub पर जाएं.
हमेशा की तरह, हमारी वेबसाइट पर अपडेट किया गया लीडरबोर्ड देखा जा सकता है. इसके अलावा, तरीके के बारे में भी पढ़ा जा सकता है.
-
प्रॉडक्ट से जुड़ी खबरेंआज हम आधिकारिक तौर पर, Jetpack Compose 1.0 के रिलीज़ होने के पांच साल पूरे होने की खुशी में आयोजित कार्यक्रम का एलान कर रहे हैं. 28 जुलाई, 2021 को लॉन्च हुए वर्शन 1.0 से लेकर, हमारे सबसे नए वर्शन 1.11 तक, हमने एपीआई में पिछले कुछ सालों में काफ़ी बदलाव देखे हैं. इसलिए, हम इस मौके को सेलिब्रेट कर रहे हैं.
Rebecca Franks, Nick Butcher, Loryn Hairston • पढ़ने में 5 मिनट लगेंगे -
प्रॉडक्ट से जुड़ी खबरेंAndroid Studio Quail 2 का स्टेबल वर्शन अब उपलब्ध है. इसका इस्तेमाल प्रोडक्शन में किया जा सकता है. इसमें एजेंटिक वर्कफ़्लो, मेमोरी लीक की प्रोफ़ाइलिंग, और कॉन्टेक्स्ट के हिसाब से क्रैश ठीक करने की सुविधा शामिल है. इससे आपके आईडीई में बदलाव आएगा.
Amman Asfaw • अमान असफ़ॉ • पढ़ने में 3 मिनट लगेंगे -
प्रॉडक्ट से जुड़ी खबरेंGoogle Play पर, हमारा मकसद उपयोगकर्ताओं को सबसे अच्छा अनुभव देना है. साथ ही, हम यह पक्का करते हैं कि डेवलपर के पास सफल होने के लिए ज़रूरी टूल और अडैप्टेबिलिटी हो.
Paul Feng • पढ़ने में 3 मिनट लगेंगे
Android डेवलपमेंट से जुड़ी नई अहम जानकारी, हर हफ़्ते अपने इनबॉक्स में पाएं.