ข่าวสารเกี่ยวกับผลิตภัณฑ์

การพัฒนาวิธีวัดผล LLM ที่พัฒนาขึ้นสำหรับ Android: ยุคใหม่ของ Android Bench

ใช้เวลาอ่าน 3 นาที
ดูโปรไฟล์ของ Zoe Lopez-Latorre
Zoe Lopez-Latorre วิศวกรนักพัฒนาซอฟต์แวร์สัมพันธ์อาวุโสของ Android

เมื่อเดือนมีนาคมที่ผ่านมา เราได้เปิดตัว Android Bench ซึ่งเป็นลีดเดอร์บอร์ด LLM สำหรับงานพัฒนา Android ในโลกจริง โดยมีเป้าหมายเพื่อแสดงความโปร่งใสเกี่ยวกับความสามารถของโมเดลในการพัฒนา Android และส่งเสริมการปรับปรุงโมเดล เพื่อให้คุณมีตัวเลือก AI ที่เป็นประโยชน์มากขึ้นสำหรับเวิร์กโฟลว์ในแต่ละวัน ตั้งแต่นั้นมา เราได้ปรับปรุงเกณฑ์มาตรฐานตามความคิดเห็นของคุณ ซึ่งรวมถึงการประเมินโมเดลแบบ Open-Weight และเพิ่มมิติข้อมูลด้านต้นทุนและประสิทธิภาพลงในลีดเดอร์บอร์ด

แต่ความสามารถของ AI มีการพัฒนาอยู่เสมอ และการวัดผลก็ต้องพัฒนาตามไปด้วย เราได้นำ เฟรมเวิร์ก Harbor มาใช้ในการเปิดตัวเดือนกรกฎาคม ซึ่งรวมถึงเอเจนต์การวัดประสิทธิภาพเวอร์ชันอัปเดตที่ใช้ในการประเมินโมเดล 

นอกจากการเปลี่ยนแปลงการประเมินแล้ว ในการเปิดตัวเดือนกรกฎาคมนี้ เรายังเพิ่มโมเดลใหม่ 8 รายการ (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus และ Qwen 3.7 Max) ลงในลีดเดอร์บอร์ดด้วย นอกจากนี้ เรายังแชร์โอกาสให้คุณซึ่งเป็นชุมชนนักพัฒนาแอป Android ได้มีส่วนร่วมในการวัดประสิทธิภาพ

การอัปเกรดระเบียบวิธีด้วยเฟรมเวิร์ก Harbor

เมื่อออกแบบ Android Bench เราได้ยึดระเบียบวิธีตามมาตรฐานอุตสาหกรรมชั้นนำที่มีอยู่ในขณะนั้น เราใช้ mini-swe-agent v1 ซึ่งเป็นเอเจนต์การวัดประสิทธิภาพอเนกประสงค์ และปรับให้เข้ากับความแตกต่างของการพัฒนา Android เพื่อให้การวัดผลพื้นฐานสำหรับความสามารถของโมเดลสำหรับงานพัฒนา Android ทั่วไป

เรากำลังกำหนดมาตรฐานการวัดประสิทธิภาพให้เป็น เฟรมเวิร์ก Harbor เพื่อให้คุณได้รับการประเมินที่ทันสมัยซึ่งวัดความสามารถล่าสุดของโมเดลในการพัฒนา Android ได้อย่างแม่นยำ Harbor กำหนดมาตรฐานและการผสานรวมที่ช่วยให้ทุกคนเรียกใช้การวัดประสิทธิภาพ ประเมินการตั้งค่าที่ต้องการ หรือแชร์ผลลัพธ์ได้อย่างง่ายดาย ซึ่งจะช่วยเพิ่มความโปร่งใสและการมองเห็น

การอัปเกรดนี้ช่วยให้เราประเมินโมเดลและความสามารถของโมเดลได้อย่างเข้มงวดมากขึ้น และเราได้เรียกใช้การวัดประสิทธิภาพในโมเดลทั้งหมดอีกครั้งเพื่อกำหนดเกณฑ์พื้นฐานที่อัปเดต ซึ่งหมายความว่าคะแนนจะมีการเปลี่ยนแปลงเล็กน้อย แต่คุณจะยังดูคะแนนที่ผ่านมาได้ใน คลังเก็บในเว็บไซต์ของเรา

เราต้องการให้ Android Bench เป็นประโยชน์สำหรับคุณ ดังนั้นเราจะอัปเดตอย่างต่อเนื่องเมื่อการประเมินและอุตสาหกรรมมีการพัฒนามากขึ้น

การขยายลีดเดอร์บอร์ดด้วยโมเดลใหม่ 8 รายการ

เราได้เพิ่ม Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus และ Qwen 3.7 Max ลงในลีดเดอร์บอร์ด Android Bench เพื่อแสดงให้เห็นถึงความมุ่งมั่นของเราในการทำให้ลีดเดอร์บอร์ดมีความสดใหม่อยู่เสมอ

คุณจะเห็นว่า Claude Fable 5 อยู่ด้านบนสุดของลีดเดอร์บอร์ดด้วยคะแนน 84.5 ตามมาด้วย GPT 5.5 ที่มีคะแนน 80.2 และ Claude Sonnet 5 อยู่ในอันดับที่ 3 ด้วยคะแนน 76.2

เมื่อเปรียบเทียบเฉพาะโมเดลแบบ Open-Weight GLM 5.2 อยู่ด้านบนสุดด้วยคะแนน 72.2 ตามมาด้วย Kimi K2.7 Code ที่มีคะแนน 70.4

คุณสามารถดูเมตริกประสิทธิภาพและประสิทธิภาพของโมเดลได้ในลีดเดอร์บอร์ดที่อัปเดตเพื่อดูว่าโมเดลใหม่และโมเดลก่อนหน้านี้จัดการกับความท้าทายเฉพาะของ Android เช่น การย้ายข้อมูล Jetpack Compose, การเชื่อมต่อเครือข่ายของอุปกรณ์สวมใส่ และการอัปเดต API ของแพลตฟอร์มได้อย่างไร  

image1.png

การเปิดตัว Android Bench สำหรับการสนับสนุนของชุมชน

ตั้งแต่เริ่มต้น เราให้ความสำคัญกับแนวทางที่เปิดกว้างและโปร่งใส ซึ่งเป็นเหตุผลที่เราทำให้ระเบียบวิธีและชุดทดสอบเดิมพร้อมให้ทุกคนใช้งานได้ใน GitHub คุณได้ขอวิธีแสดงความคิดเห็นเกี่ยวกับชุดข้อมูลของเรา ตอนนี้เราจึงยกระดับการทำงานร่วมกันไปอีกขั้นด้วยการให้โอกาสคุณซึ่งเป็นชุมชนนักพัฒนาแอป Android ได้มีส่วนร่วมในการกำหนดทิศทางของ Android Bench

ตั้งแต่วันนี้เป็นต้นไป คุณสามารถมีส่วนร่วมใน Android Bench ได้ 2 วิธี ดังนี้

  1. ออกแบบและ ส่งงานพัฒนา Android ของคุณเองเพื่อประเมินวิธีที่โมเดลจัดการกับสถานการณ์ที่สำคัญสำหรับคุณ
  2. _เรียกใช้และแชร์การประเมินการวัดประสิทธิภาพ_ด้วยตนเอง โดยทดสอบโมเดลที่ต้องการกับชุดข้อมูลของเราหรืองานที่กำหนดเอง

เราจะตรวจสอบงานที่ส่งมาและประเมินว่าจะเพิ่มงานเหล่านั้นลงในการวัดประสิทธิภาพหรือไม่ เราหวังว่าจะสร้างการวัดประสิทธิภาพที่สะท้อนความเป็นจริงที่หลากหลายในแต่ละวันของชุมชนนักพัฒนาแอป Android ทั่วโลก

สิ่งที่จะเกิดขึ้นในอนาคต

เมื่อมีตัวเลือกการพัฒนาแบบเอเจนต์มากขึ้น การรักษาการวัดประสิทธิภาพที่ทันสมัยจะช่วยให้ความช่วยเหลือจาก AI ที่คุณใช้มีความชาญฉลาด เป็นประโยชน์ และมีประสิทธิภาพมากขึ้น ไปที่ ที่เก็บ GitHub ของเราเพื่อดูงาน เราขอเชิญคุณส่งงานให้ทีมของเราตรวจสอบ และคุณสามารถไปที่ Harbor Hub เพื่อสำรวจชุดข้อมูลหรือส่งการประเมิน

คุณสามารถดู ลีดเดอร์บอร์ดที่อัปเดตหรืออ่าน ระเบียบวิธีได้ในเว็บไซต์ของเรา

เขียนโดย:
อ่านต่อ