تطوير طريقة قياس النماذج اللغوية الكبيرة على Android: الجيل التالي من Android Bench
قراءة لمدة 3 دقائق
في مارس الماضي، قدّمنا Android Bench، وهي لوحة صدارة للنماذج اللغوية الكبيرة تتضمّن مهام تطوير تطبيقات Android في العالم الحقيقي. كان هدفنا توفير الشفافية بشأن إمكانات النماذج في تطوير تطبيقات Android وتشجيع تحسين النماذج، وذلك لمنحك المزيد من خيارات الذكاء الاصطناعي المفيدة لسير عملك اليومي. منذ ذلك الحين، حسّنّا المقياس استنادًا إلى ملاحظاتك، بما في ذلك تقييم النماذج المفتوحة المصدر وإضافة بُعدَي التكلفة والكفاءة إلى لوحة الصدارة.
لكن إمكانات الذكاء الاصطناعي تتطوّر باستمرار، ويجب أن يواكبها القياس. في إطار إصدار يوليو، اعتمدنا إطار عمل Harbor، الذي يتضمّن إصدارًا معدَّلاً من وكيل القياس المستخدَم لتقييم النماذج.
بالإضافة إلى هذا التغيير في عملية التقييم، نضيف في إصدار يوليو هذا 8 نماذج جديدة (Claude Fable 5 وClaude Sonnet 5 وClaude Opus 4.8 وGLM 5.2 وKimi K2.7 Code وMiniMax M3 وQwen 3.7 Plus وQwen 3.7 Max) إلى لوحة الصدارة. نشارك أيضًا فرصًا تتيح لك، بصفتك أحد أفراد مجتمع مطوّري Android، المساهمة في المقياس.
تحسين منهجيتنا باستخدام إطار عمل Harbor
عند تصميم Android Bench، استندنا في منهجيتنا إلى المعايير الرائدة في المجال المتوفّرة في ذلك الوقت. استخدمنا mini-swe-agent v1، وهو وكيل قياس للأغراض العامة، وعدّلناه ليناسب الفروقات الدقيقة في تطوير تطبيقات Android من أجل توفير قياس أساسي لإمكانات النماذج في مهام تطوير تطبيقات Android الشائعة.
لمواصلة تزويدك بتقييمات حديثة تقيس بدقة أحدث إمكانات النماذج في تطوير تطبيقات Android، نعمل على مواءمة معايير المقياس مع إطار عمل Harbor. يحدّد Harbor المعايير وعمليات الدمج التي تسهّل على أي مستخدم إجراء مقياس أداء أو تقييم الإعدادات المفضَّلة أو مشاركة النتائج، ما يمنحك المزيد من الشفافية ونطاق ظهور العلامة التجارية.
يتيح لنا هذا التحسين تقييم النماذج وإمكاناتها بشكل أكثر دقة، وأعدنا إجراء المقياس على جميع النماذج لوضع خط أساس معدَّل. يعني ذلك حدوث تغيير طفيف في النتائج، ولكن سيظل بإمكانك الاطّلاع على النتائج السابقة ضمن الأرشيف على موقعنا الإلكتروني.
نريد التأكّد من أنّ Android Bench مفيد لك، لذا سنواصل تعديله مع تطوّر تقييماتنا وتطوّر المجال.
توسيع لوحة الصدارة باستخدام 8 نماذج جديدة
في إطار التزامنا بإبقاء لوحة الصدارة محدّثة، أضفنا Claude Fable 5 وClaude Sonnet 5 وClaude Opus 4.8 وGLM 5.2 وKimi K2.7 Code وMiniMax M3 وQwen 3.7 Plus وQwen 3.7 Max إلى لوحة صدارة Android Bench.
ستلاحظ أنّ Claude Fable 5 يتصدّر لوحة الصدارة بنتيجة 84.5، يليه GPT 5.5 بنتيجة 80.2، ثم Claude Sonnet 5 في المركز الثالث بنتيجة 76.2.
عند مقارنة النماذج المفتوحة المصدر فقط، يتصدّر GLM 5.2 بنتيجة 72.2، يليه Kimi K2.7 Code بنتيجة 70.4.
يمكنك الاطّلاع على مقاييس أداء النماذج وكفاءتها على لوحة الصدارة المعدَّلة لمعرفة كيفية تعامل هذه النماذج الجديدة والسابقة مع التحديات الخاصة بنظام Android، مثل عمليات نقل البيانات إلى Jetpack Compose، والربط الشبكي للأجهزة القابلة للارتداء، وتعديلات واجهة برمجة التطبيقات للمنصة.
إتاحة مساهمات المنتدى في Android Bench
من البداية، قدّرنا النهج المفتوح والشفاف، ولهذا السبب أتحنا منهجيتنا الأصلية ومجموعة أدوات الاختبار للجميع على GitHub. طلبتم طريقة لتقديم ملاحظات حول مجموعة البيانات، لذا ننتقل الآن بالتعاون إلى مستوى أعلى من خلال منحكم، بصفتكم أحد أفراد مجتمع مطوّري Android، فرصة تشكيل Android Bench.
اعتبارًا من اليوم، يمكنك المساهمة في Android Bench بطريقتَين:
- يمكنك تصميم مهام تطوير تطبيقات Android الخاصة بك وإرسالها لتقييم كيفية تعامل النماذج مع السيناريوهات التي تهمّك.
- يمكنك _إجراء تقييمات المقياس ومشاركتها_ بشكل مباشر، واختبار النماذج المفضّلة لديك مقابل مجموعة البيانات أو المهام المخصّصة.
سنراجع المهام المُرسَلة وسنقيّم ما إذا كان سيتم إضافتها إلى المقياس. نأمل في إنشاء مقياس يعكس بشكل حقيقي التحديات اليومية المتنوعة التي يواجهها مجتمع مطوّري Android العالمي.
نظرة مستقبلية
مع توفّر المزيد والمزيد من الخيارات لتطوير الوكلاء، يضمن الحفاظ على مقياس متطوّر أن يظل المساعد المستنِد إلى الذكاء الاصطناعي الذي تعتمد عليه أكثر ذكاءً وفائدة وفعالية. يمكنك الانتقال إلى مستودع GitHub للاطّلاع على المهام. ندعوك إلى إرسال مهمة إلى فريقنا لمراجعتها، ويمكنك الاطّلاع على Harbor Hub لاستكشاف مجموعة البيانات أو إرسال التقييمات.
يمكنك دائمًا العثور على لوحة الصدارة المعدَّلة أو قراءة المنهجية على موقعنا الإلكتروني.
-
أخبار المنتجاتإنّ توفير تجربة آمنة على الإنترنت وحماية المستخدمين من الأذى يمثلان أولوية قصوى في Google Play.
Paul Feng • قراءة لمدة دقيقتَين -
أخبار المنتجاتنحتفل اليوم رسميًا بمرور خمسة أعوام على إطلاق Jetpack Compose 1.0. من الإصدار 1.0، الذي تم الإعلان عنه في 28 يوليو 2021، إلى أحدث إصداراتنا 1.11، شهدنا تطوّر واجهات برمجة التطبيقات بشكل كبير على مرّ السنين، ونأخذ لحظة للاحتفال بذلك.
Rebecca Franks, Nick Butcher, Loryn Hairston • قراءة لمدة 5 دقائق -
أخبار المنتجاتأصبح استوديو Android Quail 2 ثابتًا ومتاحًا لك الآن لتستخدمه في الإصدار العلني، ما يغيّر بيئة التطوير المتكاملة (IDE) من خلال سير عمل الوكلاء المتزامن، وإمكانية إنشاء ملفات تعريف تسرب الذاكرة المدمجة، وإصلاح الأعطال المستند إلى السياق.
Amman Asfaw • قراءة لمدة 3 دقائق
يمكنك تلقّي أحدث الإحصاءات حول تطوير تطبيقات Android أسبوعيًا في بريدك الوارد.