我們首次推出 Android Bench 時,就為評估大型語言模型 (LLM) 如何協助開發人員處理實際 Android 工作,奠定了嚴謹的基礎。隨著 AI 模型和代理程式快速發展,我們不斷更新方法,例如將基準架構與 Harbor 架構對齊。今天我們發布了第一組長期任務 (LHT),這些任務非常複雜,工程師需要多天甚至一週才能完成。我們也將推出代理評估功能,首先會評估相應模型供應商的代理。這項新增內容促成了 Android Bench 2.0 的誕生,這項重大升級旨在評估 AI 模型和代理程式,是否能解決您每天面臨的規模、模糊性和複雜多步驟問題。
從增量修正到長期工作
Android Bench 的第一個疊代版本,以及類似的早期 AI 程式碼編程基準,著重於現有存放區的增量變更,在許多情況下僅限於修正錯誤或較小的功能要求。這反映了當時的 AI 輔助功能,以及您的使用方式。
為持續協助您找到最適合開發工作流程的模型和程式設計代理程式,我們已提高評估標準,確保 AI 執行的工作符合您的要求。Android Bench 2.0 採用 LHT,反映出這些雄心勃勃的挑戰,包括升級依附元件、新增功能、從頭建構應用程式,或將跨平台應用程式轉換為 Android 應用程式。
複雜的任務需要更細緻的評估和評分
對於需要多天完成的工程工作,二元及格/不及格評分無法呈現全貌。
舉例來說,代理程式可能將 40 個畫面重構為 Jetpack Compose、設定資料庫表格,並通過 90% 的需求,但單一邊緣情況的斷言失敗。二元評分會將這次執行的評分設為 0%,導致模型架構功能遭到遮蔽。我們將改用持續評分機制,提供更有意義的信號,協助模型開發,並幫助您瞭解 AI 如何提供協助。
我們會綜合考量功能、視覺保真度和避免回歸等因素,計算這項完成率。如果違反評估指示或結構限制,我們也會套用客觀的評分處罰。查看更新後的排行榜,然後點選各模型的資訊卡檢視畫面,即可查看其他元素,例如通過率、完成率,以及每個模型和每項工作的平均費用。
LHT 的最高通過率約為 28%,遠低於基準中原始工作的 ~91%。
長期工作可發掘實用深入分析,供 AI 輔助功能使用
除了評估 AI 處理長時間執行工作的能力,LHT 資料集也有助於我們進一步瞭解受測模型的優缺點,並提供更實用的指引。
在各個模型層級中,AI 撰寫新程式碼的表現都比重構現有程式碼更好。重構和遷移會變得更加棘手,因為成功與否取決於架構複雜度,而非程式碼量。
模型在成熟的確定性轉換方面展現強大功能,例如將 Java 轉換為 Kotlin、將 Retrofit 換成 Ktor,或是導入 ViewModel 層。即使有超過 125 個檔案和 8,000 行程式碼,他們仍會持續套用這些模式。
不過,如果工作需要執行階段驗證 (例如缺少依附元件插入圖表)、涉及破壞性架構變更,或是遇到未發布程式庫的知識落差,模型就會難以處理。將跨平台應用程式移植到 Android 仍是一項公開挑戰,因為沒有任何模型能達到 100% 的通過率,而最先進的模型最多也只能達到 80% 的完成率。
隆重推出代理程式評估功能
為協助您進一步瞭解模型整合至代理式工作流程時的成效,我們在評估中加入了常用代理程式。我們首先會使用相應模型供應商的代理程式,對 LHT 執行新模型。舉例來說,我們在 Codex 上執行 GPT 5.6 Sol,在 Google Antigravity 上執行 Gemini 3.8 Flash。這項配對顯示安全帶設計如何對開發人員成果產生正面影響,因為我們發現提示快取和精簡工具視窗化可減少權杖。
我們日後會擴大這項功能,一併顯示各種模型和代理程式組合的結果,協助你找出最適合自己和團隊的組合。
我們投入資源進行這項評估,是因為您必須能夠使用所選的代理程式和模型進行 Android 開發。我們會在接下來幾週內分享更多資訊。
新增模型
此外,我們也會持續擴大排行榜,確保您能取得最新資料,做出最合適的開發決策。我們新增了 Gemini 3.8 Flash、Gemini 3.7 Flash、OpenAI 的 GPT-6、Anthropic 的 Fable 5.1、Kimi K3 和 Qwen 3.8 Max,其中 OpenAI 的 GPT-6 Astra 以 28% 的通過率位居榜首。
展望未來
Android Bench 2.0 提供穩固的環境,可評估 Android 開發作業的 AI。我們結合了長期任務、多模態評估、代理程式和持續評分機制,希望協助 AI 研究團隊打造更強大、可靠的 AI 程式碼編寫夥伴,並讓您更清楚瞭解 AI 開發選項。
請參閱更新版排行榜和更新版方法。您的意見直接影響 Android Bench 的發展,因此請繼續透過 GitHub 和 X、LinkedIn 等社群管道與我們分享意見。
-
產品最新消息我們在今年 3 月推出了 Android Bench,這是針對實際 Android 開發工作的大型語言模型排行榜。之後,我們根據您的意見回饋,進一步提升基準,包括評估開放權重模型,以及在排行榜中加入成本和效率維度。
Zoe Lopez-Latorre • 3 分鐘小故事 -
產品最新消息今天我們將發布 Android 17,並在大多數支援的 Pixel 裝置上推出。搭載 Android 17 的新裝置將於未來幾個月內推出。
Matthew McCullough • 13 分鐘小故事 -
產品最新消息2026 年 Google I/O 大會為 Android 開發人員帶來 17 項重大消息,重點包括以代理程式為主的生產力、以 Compose First 為 UI 標準,以及適用於擴展生態系統的高效能媒體和適應性開發。
Matthew McCullough • 8 分鐘小故事
每週透過電子郵件接收最新的 Android 開發洞察資訊。