เมื่อเดือนมีนาคมที่ผ่านมา เราได้เปิดตัว Android Bench ซึ่งเป็นลีดเดอร์บอร์ด LLM สำหรับงานพัฒนา Android ในโลกแห่งความเป็นจริง เป้าหมายของเราคือการให้ความโปร่งใสเกี่ยวกับความสามารถของโมเดลในการพัฒนา Android และส่งเสริมการปรับปรุงโมเดล เพื่อให้คุณมีตัวเลือก AI ที่เป็นประโยชน์มากขึ้นสำหรับเวิร์กโฟลว์ในชีวิตประจำวัน ตั้งแต่นั้นมา เราได้ปรับปรุงการเปรียบเทียบตามความคิดเห็นของคุณ ซึ่งรวมถึงการประเมินโมเดลแบบเปิด และการเพิ่มมิติข้อมูลต้นทุนและประสิทธิภาพลงในลีดเดอร์บอร์ด
แต่ความสามารถของ AI มีการพัฒนาอยู่เสมอ และการวัดผลก็ต้องเป็นไปในทิศทางเดียวกัน ในการเปิดตัวเดือนกรกฎาคม เราได้นำเฟรมเวิร์ก Harbor มาใช้ ซึ่งรวมถึงเอเจนต์การเปรียบเทียบเวอร์ชันที่อัปเดตแล้วซึ่งใช้ในการประเมินโมเดล
นอกจากการเปลี่ยนแปลงการประเมินแล้ว ในรุ่นเดือนกรกฎาคมนี้ เราจะเพิ่มโมเดลใหม่ 8 รายการ (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus และ Qwen 3.7 Max) ลงในลีดเดอร์บอร์ด นอกจากนี้ เรายังจะแชร์โอกาสให้คุณซึ่งเป็นชุมชนนักพัฒนาแอป Android ได้มีส่วนร่วมในการสร้างเกณฑ์มาตรฐานด้วย
การอัปเกรดระเบียบวิธีด้วยเฟรมเวิร์ก Harbor
เมื่อออกแบบ Android Bench เราได้ยึดวิธีการตามมาตรฐานชั้นนำของอุตสาหกรรมที่มีอยู่ในขณะนั้น เราใช้ mini-swe-agent v1 ซึ่งเป็นเอเจนต์การเปรียบเทียบอเนกประสงค์ และปรับให้เข้ากับความแตกต่างของการพัฒนา Android เพื่อให้การวัดพื้นฐานสำหรับความสามารถของโมเดลสำหรับงานพัฒนา Android ทั่วไป
เรากำลังปรับมาตรฐานการเปรียบเทียบเป็นเฟรมเวิร์ก Harbor เพื่อให้คุณได้รับการประเมินที่ทันสมัยซึ่งวัดความสามารถของโมเดลล่าสุดในการพัฒนา Android ได้อย่างแม่นยำต่อไป Harbor กำหนดมาตรฐานและการผสานรวมที่ช่วยให้ทุกคนเรียกใช้การเปรียบเทียบ ประเมินการตั้งค่าที่ต้องการ หรือแชร์ผลลัพธ์ได้อย่างง่ายดาย ซึ่งจะช่วยให้คุณมีความโปร่งใสและการมองเห็นเพิ่มเติม
การอัปเกรดนี้ช่วยให้เราประเมินโมเดลและความสามารถของโมเดลได้อย่างเข้มงวดมากขึ้น และเราได้ทำการทดสอบประสิทธิภาพอีกครั้งในโมเดลทั้งหมดเพื่อกำหนดเกณฑ์พื้นฐานที่อัปเดตแล้ว ซึ่งหมายความว่าการให้คะแนนจะมีการเปลี่ยนแปลงเล็กน้อย แต่คุณจะยังดูคะแนนที่ผ่านมาได้ในที่เก็บบนเว็บไซต์ของเรา
เราต้องการให้มั่นใจว่า Android Bench จะเป็นประโยชน์ต่อคุณ ดังนั้นเราจะอัปเดตแอปอย่างต่อเนื่องเมื่อการประเมินของเราและอุตสาหกรรมเติบโตขึ้น
ขยายลีดเดอร์บอร์ดด้วยโมเดลใหม่ 8 รายการ
เราได้เพิ่ม Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus และ Qwen 3.7 Max ลงในลีดเดอร์บอร์ด Android Bench เพื่อให้ลีดเดอร์บอร์ดมีความสดใหม่อยู่เสมอ
คุณจะเห็นว่า Claude Fable 5 อยู่ที่ด้านบนของลีดเดอร์บอร์ดด้วยคะแนน 84.5 ตามด้วย GPT 5.5 ที่มีคะแนน 80.2 และ Claude Sonnet 5 อยู่ในอันดับที่ 3 ด้วยคะแนน 76.2
เมื่อเปรียบเทียบเฉพาะโมเดลแบบ Open-weight GLM 5.2 อยู่ในอันดับต้นๆ ด้วยคะแนน 72.2 ตามมาด้วย Kimi K2.7 Code ที่มีคะแนน 70.4
คุณสามารถดูเมตริกประสิทธิภาพและประสิทธิภาพของโมเดลได้ในลีดเดอร์บอร์ดที่อัปเดตแล้ว เพื่อดูว่าโมเดลใหม่และโมเดลก่อนหน้าเหล่านี้จัดการกับความท้าทายเฉพาะของ Android เช่น การย้ายข้อมูล Jetpack Compose, การเชื่อมต่อเครือข่ายอุปกรณ์ที่สวมใส่ได้ และการอัปเดต API ของแพลตฟอร์มได้อย่างไร
เปิด Android Bench ให้ชุมชนมีส่วนร่วม
ตั้งแต่แรกเริ่ม เราให้ความสำคัญกับแนวทางที่เปิดกว้างและโปร่งใส จึงได้เผยแพร่ระเบียบวิธีและชุดทดสอบเดิมของเราต่อสาธารณะบน GitHub คุณขอให้เรามีวิธีแสดงความคิดเห็นเกี่ยวกับชุดข้อมูลของเรา ตอนนี้เราจึงก้าวไปอีกขั้นในการทำงานร่วมกันด้วยการให้โอกาสคุณ ซึ่งเป็นชุมชนนักพัฒนาแอป Android ได้กำหนดรูปแบบของ Android Bench
ตั้งแต่วันนี้เป็นต้นไป คุณสามารถร่วมสนับสนุน Android Bench ได้ 2 วิธี ดังนี้
- ออกแบบและส่งงานพัฒนา Android ของคุณเองเพื่อประเมินวิธีที่โมเดลจัดการกับสถานการณ์ที่สำคัญต่อคุณ
- เรียกใช้และแชร์การประเมินเกณฑ์มาตรฐานด้วยตนเอง โดยทดสอบโมเดลที่คุณต้องการกับชุดข้อมูลของเราหรืองานที่กำหนดเองของคุณ
เราจะตรวจสอบงานที่ส่งและประเมินว่าควรเพิ่มงานเหล่านั้นลงในเกณฑ์มาตรฐานหรือไม่ เราหวังว่าจะสร้างเกณฑ์มาตรฐานที่สะท้อนความเป็นจริงที่หลากหลายในแต่ละวันของชุมชนนักพัฒนาแอป Android ทั่วโลกได้อย่างแท้จริง
สิ่งที่จะเกิดขึ้นในอนาคต
เมื่อมีตัวเลือกในการพัฒนาเอเจนต์มากขึ้นเรื่อยๆ การรักษาเกณฑ์มาตรฐานที่ล้ำสมัยจะช่วยให้ความช่วยเหลือจาก AI ที่คุณใช้พึ่งพาฉลาดขึ้น มีประโยชน์มากขึ้น และมีประสิทธิภาพมากขึ้นอย่างต่อเนื่อง ไปที่ที่เก็บ GitHub เพื่อดูงาน เราขอเชิญคุณส่งงานให้ทีมของเราตรวจสอบ และคุณสามารถไปที่ Harbor Hub เพื่อสำรวจชุดข้อมูลหรือส่งการประเมิน
คุณสามารถดูลีดเดอร์บอร์ดที่อัปเดตแล้วหรืออ่านวิธีการได้ในเว็บไซต์ของเรา
-
ข่าวสารผลิตภัณฑ์ตอนนี้การแก้ไขข้อบกพร่องผ่าน Wi-Fi ใน Android ทำได้รวดเร็ว น่าเชื่อถือ และตั้งค่าได้ง่ายกว่าที่เคย ADB Wi-Fi 2.0 มาพร้อมสแต็กเซิร์ฟเวอร์ใหม่และการจัดการเครือข่ายที่ชาญฉลาดยิ่งขึ้นเพื่อตอบสนองความคิดเห็นของนักพัฒนาแอปโดยตรงเกี่ยวกับช่องว่างด้านการใช้งาน
-
ข่าวสารผลิตภัณฑ์นี่คือเวอร์ชันเสถียรสุดท้ายสำหรับ Android Studio Quail ฟีเจอร์ใหม่ใน Android Studio ช่วยให้คุณสร้างแอปพรีเมียมด้วย AI ได้อย่างมีประสิทธิภาพ
Amman Asfaw • อ่าน 5 นาที -
ข่าวสารผลิตภัณฑ์การรักษาระบบนิเวศ Android ให้ดีอยู่เสมอเป็นความมุ่งมั่นร่วมกันที่ทุกแอปและเกมมีบทบาทที่ต้องทำ
Raghavendra Hareesh Pottamsetty • อ่าน 4 นาที
รับข้อมูลเชิงลึกด้านการพัฒนาแอป Android ล่าสุดส่งตรงถึงกล่องจดหมายของคุณทุกสัปดาห์