Android Bench 2.0: Mở rộng giới hạn với các tác vụ khó khăn trong thời gian dài
3 phút đọc
Khi mới ra mắt Android Bench, chúng tôi đã xây dựng một nền tảng nghiêm ngặt để đánh giá cách các mô hình ngôn ngữ lớn (LLM) hỗ trợ nhà phát triển trong các tác vụ thực tế trên Android. Khi các mô hình và tác nhân AI phát triển nhanh chóng, chúng tôi đã cập nhật phương pháp của mình, chẳng hạn như điều chỉnh khung điểm chuẩn cho phù hợp với khung Harbor. Hôm nay, chúng tôi sẽ phát hành bộ nhiệm vụ dài hạn (LHT) đầu tiên. Đây là những nhiệm vụ có độ phức tạp cao mà một kỹ sư phải mất nhiều ngày hoặc thậm chí cả tuần mới hoàn thành. Chúng tôi cũng đang giới thiệu tính năng đánh giá dựa trên tác nhân, bắt đầu với các tác nhân của nhà cung cấp mô hình tương ứng. Việc bổ sung này giúp chúng tôi ra mắt Android Bench 2.0 – một bản nâng cấp lớn được thiết kế để đánh giá các mô hình và tác nhân AI dựa trên quy mô, mức độ mơ hồ và khả năng giải quyết vấn đề phức tạp gồm nhiều bước mà bạn phải đối mặt hằng ngày.
Từ các bản sửa lỗi gia tăng cho đến các nhiệm vụ dài hạn
Lần lặp lại đầu tiên của Android Bench, cùng với các điểm chuẩn tương tự về hoạt động lập trình AI ban đầu, tập trung vào các thay đổi gia tăng đối với các kho lưu trữ hiện có, trong nhiều trường hợp chỉ giới hạn ở việc sửa lỗi hoặc các yêu cầu nhỏ hơn về tính năng. Điều này phản ánh khả năng của trợ lý AI tại thời điểm đó, cũng như cách bạn sử dụng trợ lý này.
Để tiếp tục giúp bạn tìm thấy các mô hình và tác nhân lập trình phù hợp nhất với quy trình phát triển của mình, chúng tôi đã nâng cao tiêu chuẩn đánh giá để phù hợp với công việc mà bạn giao cho AI. Android Bench 2.0 phản ánh những thử thách đầy tham vọng này bằng các LHT, bao gồm việc nâng cấp các phần phụ thuộc, thêm tính năng mới, tạo ứng dụng từ đầu hoặc chuyển đổi một ứng dụng nhiều nền tảng sang Android.
Các nhiệm vụ phức tạp đòi hỏi phải đánh giá và tính điểm tinh tế hơn
Đối với các nhiệm vụ kỹ thuật kéo dài nhiều ngày, việc chấm điểm chỉ có 2 lựa chọn là đạt hoặc không đạt sẽ không phản ánh đầy đủ tình hình.
Ví dụ: một tác nhân có thể tái cấu trúc 40 màn hình thành Jetpack Compose, thiết lập các bảng cơ sở dữ liệu và đáp ứng 90% yêu cầu, nhưng không đáp ứng được một câu khẳng định trường hợp biên duy nhất. Tỷ lệ tính điểm nhị phân cho lần chạy này là 0%, che khuất các khả năng về cấu trúc của mô hình. Chúng tôi đang chuyển sang phương pháp tính điểm liên tục để cung cấp tín hiệu có ý nghĩa hơn, cả cho việc phát triển mô hình và để bạn hiểu rõ cách AI có thể giúp bạn.
Chúng tôi tính toán tỷ lệ hoàn thành này thông qua một số yếu tố như chức năng, độ trung thực về hình ảnh và tránh hồi quy. Chúng tôi cũng áp dụng các mức phạt dựa trên điểm số khách quan đối với những trường hợp sai lệch so với hướng dẫn đánh giá hoặc các ràng buộc về cấu trúc. Hãy xem bảng xếp hạng mới cập nhật và nhấp vào chế độ xem thẻ của từng mô hình để xem các yếu tố bổ sung như tỷ lệ đỗ, tỷ lệ hoàn thành và chi phí trung bình cho mỗi mô hình và mỗi nhiệm vụ.
Tỷ lệ vượt qua cao nhất cho LHT là khoảng 28%, thấp hơn nhiều so với khoảng 91% cho các nhiệm vụ ban đầu trong điểm chuẩn.
Các tác vụ dài hạn sẽ giúp AI tìm ra thông tin chi tiết hữu ích
Ngoài việc đo lường mức độ hiệu quả của AI trong việc xử lý các tác vụ kéo dài, tập dữ liệu LHT còn giúp chúng tôi tìm hiểu thêm về điểm mạnh và điểm yếu của các mô hình được kiểm thử, đồng thời cung cấp cho bạn hướng dẫn thiết thực hơn.
Trong các cấp mô hình, AI làm tốt hơn trong việc viết mã mới thay vì tái cấu trúc mã hiện có. Việc tái cấu trúc và di chuyển trở nên khó khăn hơn vì thành công phụ thuộc vào độ phức tạp của kiến trúc chứ không phải số lượng mã.
Các mô hình cho thấy khả năng mạnh mẽ đối với các phép biến đổi tất định và đã được thiết lập, chẳng hạn như chuyển đổi Java sang Kotlin, hoán đổi Retrofit cho Ktor hoặc giới thiệu một lớp ViewModel. Họ áp dụng các mẫu này một cách nhất quán, ngay cả trên hơn 125 tệp và hơn 8.000 dòng mã.
Tuy nhiên, các mô hình gặp khó khăn khi các tác vụ yêu cầu xác thực thời gian chạy (chẳng hạn như thiếu biểu đồ chèn phần phụ thuộc), liên quan đến việc thay đổi khung hình hoặc gặp phải những thiếu hụt về kiến thức với các thư viện chưa phát hành. Việc chuyển các ứng dụng nhiều nền tảng sang Android vẫn là một thách thức chưa có lời giải – không có mô hình nào đạt tỷ lệ thành công 100% và các mô hình tiên phong đạt tỷ lệ hoàn thành tối đa là 80%.
Giới thiệu về việc đánh giá tác nhân
Để giúp bạn hiểu rõ hơn về hiệu suất của các mô hình khi được tích hợp vào quy trình công việc dựa trên tác nhân, chúng tôi sẽ thêm các tác nhân thường dùng vào quy trình đánh giá. Chúng tôi sẽ bắt đầu bằng cách chạy các mô hình mới dựa trên LHT có các tác nhân của nhà cung cấp mô hình tương ứng. Ví dụ: chúng tôi đã chạy GPT 5.6 Sol trên Codex và Gemini 3.8 Flash trên Google Antigravity. Việc kết hợp này cho thấy thiết kế của harness ảnh hưởng tích cực đến kết quả của nhà phát triển, vì chúng ta đã thấy việc lưu vào bộ nhớ đệm lời nhắc và tạo cửa sổ công cụ nhỏ gọn có thể giúp giảm số lượng mã thông báo.
Trong tương lai, chúng tôi sẽ mở rộng tính năng này bằng cách làm nổi bật kết quả của nhiều tổ hợp mô hình và tác nhân, nhằm giúp bạn khám phá những tổ hợp phù hợp nhất với bạn và nhóm của bạn.
Chúng tôi đầu tư vào hoạt động đo lường này vì bạn cần có khả năng sử dụng tác nhân và mô hình mà bạn chọn để phát triển trên Android. Chúng tôi sẽ chia sẻ thêm thông tin với bạn trong những tuần tới.
Đã thêm mô hình mới
Ngoài ra, chúng tôi sẽ tiếp tục mở rộng bảng xếp hạng để đảm bảo bạn có dữ liệu mới nhất cho các quyết định phát triển của mình. Chúng tôi đã thêm Gemini 3.8 Flash, Gemini 3.7 Flash, GPT-6 của OpenAI, Fable 5.1 của Anthropic, Kimi K3 và Qwen 3.8 Max, trong đó GPT-6 Astra của OpenAI đứng đầu với tỷ lệ vượt qua là 28%.
Trong tương lai
Android Bench 2.0 mang đến một môi trường mạnh mẽ để đo lường AI cho quá trình phát triển Android. Bằng cách kết hợp các tác vụ dài hạn, đánh giá đa phương thức, các tác nhân và tính điểm liên tục, chúng tôi hy vọng sẽ giúp các nhóm nghiên cứu AI xây dựng được những đối tác lập trình AI có năng lực và đáng tin cậy hơn, đồng thời cung cấp cho bạn thông tin minh bạch hơn về các lựa chọn để phát triển AI.
Hãy xem bảng xếp hạng mới cập nhật cùng với phương pháp mới cập nhật. Ý kiến phản hồi của bạn ảnh hưởng trực tiếp đến cách chúng tôi phát triển Android Bench. Vì vậy, vui lòng tiếp tục chia sẻ ý kiến phản hồi của bạn với chúng tôi trên GitHub cũng như các kênh mạng xã hội của chúng tôi như X và LinkedIn.
-
Tin tức về sản phẩmVào tháng 3, chúng tôi đã giới thiệu Android Bench – bảng xếp hạng LLM cho các tác vụ phát triển Android trong thực tế. Kể từ đó, chúng tôi đã cải thiện điểm chuẩn dựa trên ý kiến phản hồi của bạn, bao gồm cả việc đánh giá các mô hình có trọng số mở và thêm các phương diện chi phí và hiệu quả vào bảng xếp hạng.
Zoe Lopez-Latorre • Đọc trong 3 phút -
Tin tức về sản phẩmHôm nay, chúng tôi phát hành Android 17 và cung cấp phiên bản này trên hầu hết các thiết bị Pixel được hỗ trợ. Hãy chờ đón những thiết bị mới chạy Android 17 trong những tháng tới.
Matthew McCullough • 13 phút đọc -
Tin tức về sản phẩmGoogle I/O 2026 có 17 thông báo quan trọng dành cho nhà phát triển Android, tập trung vào năng suất dựa trên tác nhân, Compose First làm tiêu chuẩn giao diện người dùng và nội dung nghe nhìn hiệu suất cao cũng như khả năng phát triển thích ứng cho hệ sinh thái đang mở rộng.
Matthew McCullough • 8 phút đọc
Nhận thông tin chi tiết mới nhất về hoạt động phát triển trên Android trong hộp thư đến của bạn mỗi tuần.