การพัฒนาการวัดผล LLM ที่พัฒนาขึ้นสำหรับ Android: ยุคใหม่ของ Android Bench
ใช้เวลาอ่าน 3 นาที
เมื่อเดือนมีนาคมที่ผ่านมา เราได้เปิดตัว Android Bench ซึ่งเป็นลีดเดอร์บอร์ด LLM สำหรับงานพัฒนา Android ในโลกแห่งความเป็นจริง โดยมีเป้าหมายเพื่อแสดงความโปร่งใสเกี่ยวกับความสามารถของโมเดลในการพัฒนา Android และส่งเสริมการปรับปรุงโมเดล เพื่อให้คุณมีตัวเลือก AI ที่เป็นประโยชน์มากขึ้นสำหรับเวิร์กโฟลว์ในแต่ละวัน ตั้งแต่นั้นมา เราได้ปรับปรุงเกณฑ์มาตรฐานตามความคิดเห็นของคุณ ซึ่งรวมถึงการประเมินโมเดลแบบเปิด และเพิ่มมิติข้อมูลด้านต้นทุนและประสิทธิภาพลงในลีดเดอร์บอร์ด
แต่ความสามารถของ AI มีการพัฒนาอยู่เสมอ และการวัดผลก็ต้องพัฒนาตามไปด้วย เราได้นำ เฟรมเวิร์ก Harbor มาใช้เป็นส่วนหนึ่งของการเปิดตัวในเดือนกรกฎาคม ซึ่งรวมถึงเอเจนต์การวัดประสิทธิภาพเวอร์ชันอัปเดตที่ใช้ในการประเมินโมเดล
นอกจากการเปลี่ยนแปลงการประเมินแล้ว ในการเปิดตัวเดือนกรกฎาคมนี้ เรายังเพิ่มโมเดลใหม่ 8 รายการ (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus และ Qwen 3.7 Max) ลงในลีดเดอร์บอร์ดด้วย นอกจากนี้ เรายังแชร์โอกาสให้คุณซึ่งเป็นชุมชนนักพัฒนาแอป Android ได้มีส่วนร่วมในการวัดประสิทธิภาพ
การอัปเกรดระเบียบวิธีด้วยเฟรมเวิร์ก Harbor
เมื่อออกแบบ Android Bench เราได้ยึดระเบียบวิธีตามมาตรฐานอุตสาหกรรมชั้นนำที่มีอยู่ในขณะนั้น เราใช้ mini-swe-agent v1 ซึ่งเป็นเอเจนต์การวัดประสิทธิภาพอเนกประสงค์ และปรับให้เข้ากับความแตกต่างของการพัฒนา Android เพื่อให้การวัดความสามารถของโมเดลเป็นไปตามเกณฑ์มาตรฐานสำหรับงานพัฒนา Android ทั่วไป
เรากำลังกำหนดมาตรฐานการวัดประสิทธิภาพให้เป็น เฟรมเวิร์ก Harbor เพื่อให้คุณได้รับการประเมินที่ทันสมัยและวัดความสามารถล่าสุดของโมเดลในการพัฒนา Android ได้อย่างแม่นยำ Harbor กำหนดมาตรฐานและการผสานรวมที่ช่วยให้ทุกคนเรียกใช้การวัดประสิทธิภาพ ประเมินการตั้งค่าที่ต้องการ หรือแชร์ผลลัพธ์ได้อย่างง่ายดาย ซึ่งจะช่วยเพิ่มความโปร่งใสและการมองเห็น
การอัปเกรดนี้ช่วยให้เราประเมินโมเดลและความสามารถของโมเดลได้อย่างเข้มงวดมากขึ้น และเราได้ทำการวัดประสิทธิภาพในโมเดลทั้งหมดอีกครั้งเพื่อกำหนดเกณฑ์มาตรฐานที่อัปเดต ซึ่งหมายความว่าคะแนนจะมีการเปลี่ยนแปลงเล็กน้อย แต่คุณจะยังดูคะแนนที่ผ่านมาได้ใน คลังเก็บในเว็บไซต์ของเรา
เราต้องการให้ Android Bench เป็นประโยชน์สำหรับคุณ ดังนั้นเราจะอัปเดตอย่างต่อเนื่องเมื่อการประเมินและอุตสาหกรรมมีการพัฒนามากขึ้น
การขยายลีดเดอร์บอร์ดด้วยโมเดลใหม่ 8 รายการ
เราได้เพิ่ม Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus และ Qwen 3.7 Max ลงในลีดเดอร์บอร์ด Android Bench เพื่อให้ลีดเดอร์บอร์ดมีความสดใหม่อยู่เสมอ
คุณจะเห็นว่า Claude Fable 5 อยู่ที่ด้านบนของลีดเดอร์บอร์ดด้วยคะแนน 84.5 ตามมาด้วย GPT 5.5 ที่มีคะแนน 80.2 และ Claude Sonnet 5 อยู่ในอันดับที่ 3 ด้วยคะแนน 76.2
เมื่อเปรียบเทียบเฉพาะโมเดลแบบเปิด GLM 5.2 อยู่ที่ด้านบนด้วยคะแนน 72.2 ตามมาด้วย Kimi K2.7 Code ที่มีคะแนน 70.4
คุณสามารถดูเมตริกประสิทธิภาพและประสิทธิภาพของโมเดลได้ในลีดเดอร์บอร์ดที่อัปเดตเพื่อดูว่าโมเดลใหม่และโมเดลก่อนหน้านี้จัดการกับความท้าทายเฉพาะของ Android เช่น การย้ายข้อมูล Jetpack Compose, การเชื่อมต่อเครือข่ายของอุปกรณ์สวมใส่ และการอัปเดต API ของแพลตฟอร์มได้อย่างไร
การเปิด Android Bench ให้ชุมชนมีส่วนร่วม
ตั้งแต่เริ่มต้น เราให้ความสำคัญกับแนวทางที่เปิดกว้างและโปร่งใส ซึ่งเป็นเหตุผลที่เราทำให้ระเบียบวิธีและชุดทดสอบเดิมพร้อมให้ทุกคนใช้งานได้ใน GitHub คุณได้ขอวิธีแสดงความคิดเห็นเกี่ยวกับชุดข้อมูลของเรา ตอนนี้เราจึงยกระดับการทำงานร่วมกันไปอีกขั้นด้วยการให้โอกาสคุณซึ่งเป็นชุมชนนักพัฒนาแอป Android ได้มีส่วนร่วมในการกำหนดทิศทางของ Android Bench
ตั้งแต่วันนี้เป็นต้นไป คุณสามารถมีส่วนร่วมใน Android Bench ได้ 2 วิธี ดังนี้
- ออกแบบและ ส่งงานพัฒนา Android ของคุณเอง เพื่อประเมินวิธีที่โมเดลจัดการกับสถานการณ์ที่สำคัญต่อคุณ
- _เรียกใช้และแชร์การประเมินการวัดประสิทธิภาพ_ด้วยตนเอง โดยทดสอบโมเดลที่ต้องการกับชุดข้อมูลของเราหรืองานที่กำหนดเอง
เราจะตรวจสอบงานที่ส่งมาและประเมินว่าจะเพิ่มงานเหล่านั้นลงในการวัดประสิทธิภาพหรือไม่ เราหวังว่าจะสร้างการวัดประสิทธิภาพที่สะท้อนความเป็นจริงที่หลากหลายในแต่ละวันของชุมชนนักพัฒนาแอป Android ทั่วโลก
สิ่งที่จะเกิดขึ้นในอนาคต
เมื่อมีตัวเลือกการพัฒนาแบบเอเจนต์มากขึ้น การรักษาการวัดประสิทธิภาพที่ทันสมัยจะช่วยให้ความช่วยเหลือจาก AI ที่คุณใช้มีความชาญฉลาด เป็นประโยชน์ และมีประสิทธิภาพมากขึ้น ไปที่ ที่เก็บ GitHub ของเราเพื่อดูงาน เราขอเชิญคุณส่งงานให้ทีมของเราตรวจสอบ และคุณสามารถไปที่ Harbor Hub เพื่อสำรวจชุดข้อมูลหรือส่งการประเมิน
คุณสามารถดู ลีดเดอร์บอร์ดที่อัปเดตหรืออ่าน ระเบียบวิธีได้ในเว็บไซต์ของเรา
-
ข่าวสารเกี่ยวกับผลิตภัณฑ์วันนี้เราขอฉลองครบรอบ 5 ปีนับตั้งแต่เปิดตัว Jetpack Compose 1.0 อย่างเป็นทางการ ตั้งแต่เวอร์ชัน 1.0 ที่ประกาศเมื่อวันที่ 28 กรกฎาคม 2021 ไปจนถึงเวอร์ชัน 1.11 ล่าสุด เราได้เห็น API มีการพัฒนาอย่างมากในช่วงหลายปีที่ผ่านมา และเราขอใช้โอกาสนี้ในการเฉลิมฉลอง
Rebecca Franks, Nick Butcher, Loryn Hairston • ใช้เวลาอ่าน 5 นาที -
ข่าวสารเกี่ยวกับผลิตภัณฑ์Android Studio Quail 2 เสถียรแล้วและพร้อมให้คุณใช้ในเวอร์ชันที่ใช้งานจริง ซึ่งจะเปลี่ยน IDE ของคุณให้มีเวิร์กโฟลว์แบบเอเจนต์ที่ทำงานพร้อมกัน การสร้างโปรไฟล์หน่วยความจำรั่วไหลที่ผสานรวมอย่างเป็นธรรมชาติ และการแก้ไขข้อขัดข้องที่คำนึงถึงบริบท
Amman Asfaw • ใช้เวลาอ่าน 3 นาที -
ข่าวสารเกี่ยวกับผลิตภัณฑ์ที่ Google Play เรามุ่งมั่นที่จะส่งมอบประสบการณ์การใช้งานที่ดีที่สุดเท่าที่จะเป็นไปได้ให้แก่ผู้ใช้ ควบคู่ไปกับการดูแลให้นักพัฒนามีเครื่องมือและความสามารถในการปรับตัวเพื่อประสบความสำเร็จ
Paul Feng • ใช้เวลาอ่าน 3 นาที
รับข้อมูลเชิงลึกเกี่ยวกับการพัฒนา Android ล่าสุดส่งตรงถึงกล่องจดหมายของคุณ ทุกสัปดาห์