การพัฒนาวิธีวัดผล LLM ที่พัฒนาขึ้นสำหรับ Android: ยุคใหม่ของ Android Bench
ใช้เวลาอ่าน 3 นาที
เมื่อเดือนมีนาคมที่ผ่านมา เราได้เปิดตัว Android Bench ซึ่งเป็นลีดเดอร์บอร์ด LLM สำหรับงานพัฒนา Android ในโลกจริง โดยมีเป้าหมายเพื่อแสดงความโปร่งใสเกี่ยวกับความสามารถของโมเดลในการพัฒนา Android และส่งเสริมการปรับปรุงโมเดล เพื่อให้คุณมีตัวเลือก AI ที่เป็นประโยชน์มากขึ้นสำหรับเวิร์กโฟลว์ในแต่ละวัน ตั้งแต่นั้นมา เราได้ปรับปรุงเกณฑ์มาตรฐานตามความคิดเห็นของคุณ ซึ่งรวมถึงการประเมินโมเดลแบบ Open-Weight และเพิ่มมิติข้อมูลด้านต้นทุนและประสิทธิภาพลงในลีดเดอร์บอร์ด
แต่ความสามารถของ AI มีการพัฒนาอยู่เสมอ และการวัดผลก็ต้องพัฒนาตามไปด้วย เราได้นำ เฟรมเวิร์ก Harbor มาใช้ในการเปิดตัวเดือนกรกฎาคม ซึ่งรวมถึงเอเจนต์การวัดประสิทธิภาพเวอร์ชันอัปเดตที่ใช้ในการประเมินโมเดล
นอกจากการเปลี่ยนแปลงการประเมินแล้ว ในการเปิดตัวเดือนกรกฎาคมนี้ เรายังเพิ่มโมเดลใหม่ 8 รายการ (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus และ Qwen 3.7 Max) ลงในลีดเดอร์บอร์ดด้วย นอกจากนี้ เรายังแชร์โอกาสให้คุณซึ่งเป็นชุมชนนักพัฒนาแอป Android ได้มีส่วนร่วมในการวัดประสิทธิภาพ
การอัปเกรดระเบียบวิธีด้วยเฟรมเวิร์ก Harbor
เมื่อออกแบบ Android Bench เราได้ยึดระเบียบวิธีตามมาตรฐานอุตสาหกรรมชั้นนำที่มีอยู่ในขณะนั้น เราใช้ mini-swe-agent v1 ซึ่งเป็นเอเจนต์การวัดประสิทธิภาพอเนกประสงค์ และปรับให้เข้ากับความแตกต่างของการพัฒนา Android เพื่อให้การวัดผลพื้นฐานสำหรับความสามารถของโมเดลสำหรับงานพัฒนา Android ทั่วไป
เรากำลังกำหนดมาตรฐานการวัดประสิทธิภาพให้เป็น เฟรมเวิร์ก Harbor เพื่อให้คุณได้รับการประเมินที่ทันสมัยซึ่งวัดความสามารถล่าสุดของโมเดลในการพัฒนา Android ได้อย่างแม่นยำ Harbor กำหนดมาตรฐานและการผสานรวมที่ช่วยให้ทุกคนเรียกใช้การวัดประสิทธิภาพ ประเมินการตั้งค่าที่ต้องการ หรือแชร์ผลลัพธ์ได้อย่างง่ายดาย ซึ่งจะช่วยเพิ่มความโปร่งใสและการมองเห็น
การอัปเกรดนี้ช่วยให้เราประเมินโมเดลและความสามารถของโมเดลได้อย่างเข้มงวดมากขึ้น และเราได้เรียกใช้การวัดประสิทธิภาพในโมเดลทั้งหมดอีกครั้งเพื่อกำหนดเกณฑ์พื้นฐานที่อัปเดต ซึ่งหมายความว่าคะแนนจะมีการเปลี่ยนแปลงเล็กน้อย แต่คุณจะยังดูคะแนนที่ผ่านมาได้ใน คลังเก็บในเว็บไซต์ของเรา
เราต้องการให้ Android Bench เป็นประโยชน์สำหรับคุณ ดังนั้นเราจะอัปเดตอย่างต่อเนื่องเมื่อการประเมินและอุตสาหกรรมมีการพัฒนามากขึ้น
การขยายลีดเดอร์บอร์ดด้วยโมเดลใหม่ 8 รายการ
เราได้เพิ่ม Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus และ Qwen 3.7 Max ลงในลีดเดอร์บอร์ด Android Bench เพื่อแสดงให้เห็นถึงความมุ่งมั่นของเราในการทำให้ลีดเดอร์บอร์ดมีความสดใหม่อยู่เสมอ
คุณจะเห็นว่า Claude Fable 5 อยู่ด้านบนสุดของลีดเดอร์บอร์ดด้วยคะแนน 84.5 ตามมาด้วย GPT 5.5 ที่มีคะแนน 80.2 และ Claude Sonnet 5 อยู่ในอันดับที่ 3 ด้วยคะแนน 76.2
เมื่อเปรียบเทียบเฉพาะโมเดลแบบ Open-Weight GLM 5.2 อยู่ด้านบนสุดด้วยคะแนน 72.2 ตามมาด้วย Kimi K2.7 Code ที่มีคะแนน 70.4
คุณสามารถดูเมตริกประสิทธิภาพและประสิทธิภาพของโมเดลได้ในลีดเดอร์บอร์ดที่อัปเดตเพื่อดูว่าโมเดลใหม่และโมเดลก่อนหน้านี้จัดการกับความท้าทายเฉพาะของ Android เช่น การย้ายข้อมูล Jetpack Compose, การเชื่อมต่อเครือข่ายของอุปกรณ์สวมใส่ และการอัปเดต API ของแพลตฟอร์มได้อย่างไร
การเปิดตัว Android Bench สำหรับการสนับสนุนของชุมชน
ตั้งแต่เริ่มต้น เราให้ความสำคัญกับแนวทางที่เปิดกว้างและโปร่งใส ซึ่งเป็นเหตุผลที่เราทำให้ระเบียบวิธีและชุดทดสอบเดิมพร้อมให้ทุกคนใช้งานได้ใน GitHub คุณได้ขอวิธีแสดงความคิดเห็นเกี่ยวกับชุดข้อมูลของเรา ตอนนี้เราจึงยกระดับการทำงานร่วมกันไปอีกขั้นด้วยการให้โอกาสคุณซึ่งเป็นชุมชนนักพัฒนาแอป Android ได้มีส่วนร่วมในการกำหนดทิศทางของ Android Bench
ตั้งแต่วันนี้เป็นต้นไป คุณสามารถมีส่วนร่วมใน Android Bench ได้ 2 วิธี ดังนี้
- ออกแบบและ ส่งงานพัฒนา Android ของคุณเองเพื่อประเมินวิธีที่โมเดลจัดการกับสถานการณ์ที่สำคัญสำหรับคุณ
- _เรียกใช้และแชร์การประเมินการวัดประสิทธิภาพ_ด้วยตนเอง โดยทดสอบโมเดลที่ต้องการกับชุดข้อมูลของเราหรืองานที่กำหนดเอง
เราจะตรวจสอบงานที่ส่งมาและประเมินว่าจะเพิ่มงานเหล่านั้นลงในการวัดประสิทธิภาพหรือไม่ เราหวังว่าจะสร้างการวัดประสิทธิภาพที่สะท้อนความเป็นจริงที่หลากหลายในแต่ละวันของชุมชนนักพัฒนาแอป Android ทั่วโลก
สิ่งที่จะเกิดขึ้นในอนาคต
เมื่อมีตัวเลือกการพัฒนาแบบเอเจนต์มากขึ้น การรักษาการวัดประสิทธิภาพที่ทันสมัยจะช่วยให้ความช่วยเหลือจาก AI ที่คุณใช้มีความชาญฉลาด เป็นประโยชน์ และมีประสิทธิภาพมากขึ้น ไปที่ ที่เก็บ GitHub ของเราเพื่อดูงาน เราขอเชิญคุณส่งงานให้ทีมของเราตรวจสอบ และคุณสามารถไปที่ Harbor Hub เพื่อสำรวจชุดข้อมูลหรือส่งการประเมิน
คุณสามารถดู ลีดเดอร์บอร์ดที่อัปเดตหรืออ่าน ระเบียบวิธีได้ในเว็บไซต์ของเรา
-
ข่าวสารเกี่ยวกับผลิตภัณฑ์การมอบประสบการณ์ออนไลน์ที่ปลอดภัยและการปกป้องผู้ใช้จากอันตรายเป็นสิ่งสำคัญที่สุดสำหรับ Google Play
Paul Feng • ใช้เวลาอ่าน 2 นาที -
ข่าวสารเกี่ยวกับผลิตภัณฑ์วันนี้เราขอฉลองครบรอบ 5 ปีนับตั้งแต่เปิดตัว Jetpack Compose 1.0 อย่างเป็นทางการ ตั้งแต่เวอร์ชัน 1.0 ที่ประกาศเมื่อวันที่ 28 กรกฎาคม 2021 ไปจนถึงเวอร์ชันล่าสุด 1.11 เราได้เห็นการพัฒนา API อย่างมากในช่วงหลายปีที่ผ่านมา และขอใช้โอกาสนี้ในการเฉลิมฉลอง
Rebecca Franks, Nick Butcher, Loryn Hairston • ใช้เวลาอ่าน 5 นาที -
ข่าวสารเกี่ยวกับผลิตภัณฑ์Android Studio Quail 2 พร้อมใช้งานแล้วและพร้อมให้คุณใช้ในเวอร์ชันที่ใช้งานจริง ซึ่งจะเปลี่ยน IDE ของคุณให้มีเวิร์กโฟลว์แบบ Agent ที่ทำงานพร้อมกัน การสร้างโปรไฟล์หน่วยความจำรั่วไหลที่ผสานรวม และการแก้ไขข้อขัดข้องที่คำนึงถึงบริบท
Amman Asfaw • ใช้เวลาอ่าน 3 นาที
รับข้อมูลเชิงลึกล่าสุดเกี่ยวกับการพัฒนา Android ส่งตรงถึงกล่องจดหมายของคุณ ทุกสัปดาห์