Android Bench를 처음 출시했을 때 Google은 대규모 언어 모델 (LLM)이 개발자의 실제 Android 작업을 어떻게 지원하는지 평가하기 위한 엄격한 기반을 구축했습니다. AI 모델과 에이전트가 빠르게 발전함에 따라 Google은 Harbor 프레임워크에 벤치마크 프레임워크를 정렬하는 등 방법론을 업데이트하고 있습니다. 오늘 엔지니어가 며칠 또는 일주일이 걸려 완료하는 매우 복잡한 작업인 첫 번째 장기 작업 (LHT)을 출시합니다. 또한 해당 모델 제공업체의 에이전트부터 시작하여 에이전트 평가도 도입합니다. 이 추가로 Android Bench 2.0이 도입됩니다. 이는 매일 해결하는 규모, 모호성, 복잡한 다단계 문제 해결에 대해 AI 모델과 에이전트를 평가하도록 설계된 주요 업그레이드입니다.
증분 수정에서 장기 작업까지
Android Bench의 첫 번째 반복은 유사한 초기 AI 코딩 벤치마크와 함께 기존 저장소의 증분 변경에 중점을 두었으며, 대부분 버그 수정이나 소규모 기능 요청으로 제한되었습니다. 이는 당시 AI 지원 기능의 성능과 사용 방식을 반영한 것입니다.
개발 워크플로에 가장 적합한 모델과 코딩 에이전트를 계속해서 찾을 수 있도록 Google에서는 AI에 위임하는 작업에 맞춰 평가 기준을 높였습니다. Android Bench 2.0은 종속 항목 업그레이드, 새 기능 추가, 처음부터 앱 빌드, 크로스 플랫폼 앱을 Android로 변환하는 등의 LHT를 통해 이러한 야심찬 과제를 반영합니다.
복잡한 작업에는 더 미묘한 평가와 점수 부여가 필요합니다.
여러 날에 걸친 엔지니어링 작업에서는 이진 통과 또는 실패 평가가 전체 상황을 파악하지 못합니다.
예를 들어 에이전트가 40개의 화면을 Jetpack Compose로 리팩터링하고, 데이터베이스 테이블을 설정하고, 요구사항의 90% 를 통과했지만 하나의 특이 사례 어설션에 실패할 수 있습니다. 이 실행은 이진 점수 매기기에서 0%로 평가되어 모델의 아키텍처 기능이 가려집니다. 모델 개발과 AI의 활용 방법을 이해하는 데 도움이 되는 더 의미 있는 신호를 제공하기 위해 지속적인 점수 부여로 전환하고 있습니다.
Google에서는 기능, 시각적 충실도, 회귀 방지 등의 요소를 조합하여 이 완료율을 계산합니다. 또한 평가 지침이나 구조적 제약 조건에서 벗어나는 경우 객관적인 점수 페널티가 적용됩니다. 업데이트된 리더보드를 확인하고 각 모델의 카드 보기 뷰를 클릭하여 합격률, 완료율, 모델별 및 작업별 평균 비용과 같은 추가 요소를 확인하세요.
LHT의 최고 통과율은 약 28%로, 벤치마크의 원래 작업 통과율인 약 91% 보다 훨씬 낮습니다.
장기적 작업을 통해 AI 지원에 유용한 인사이트를 파악할 수 있습니다.
LHT 데이터 세트는 AI가 장기 실행 작업을 얼마나 잘 처리하는지 측정하는 것 외에도 테스트된 모델의 강점과 약점을 자세히 파악하는 데 도움이 되며, Google에서는 더 실용적인 가이드를 제공합니다.
모델 등급 전반에서 AI는 기존 코드를 리팩터링하는 것보다 새 코드를 작성하는 데 더 뛰어납니다. 성공 여부가 코드 양이 아닌 아키텍처 복잡성에 따라 달라지기 때문에 리팩터링과 마이그레이션이 더 까다로워집니다.
모델은 Java를 Kotlin으로 변환하거나, Retrofit을 Ktor로 바꾸거나, ViewModel 레이어를 도입하는 등 잘 정립된 결정론적 변환에서 강력한 기능을 보여줍니다. 이러한 패턴은 125개 이상의 파일과 8,000개 이상의 코드 줄에 걸쳐 일관되게 적용됩니다.
하지만 작업에 런타임 검증 (예: 종속 항목 삽입 그래프 누락)이 필요하거나, 프레임워크 변경사항이 포함되거나, 출시되지 않은 라이브러리로 인해 지식 격차가 발생하는 경우 모델이 어려움을 겪습니다. 크로스 플랫폼 앱을 Android로 포팅하는 것은 여전히 해결되지 않은 과제입니다. 100% 통과율을 달성하는 모델이 없으며, 최첨단 모델의 완료율은 최대 80% 에 불과합니다.
에이전트 평가 소개
에이전트형 워크플로에 통합되었을 때 모델이 어떻게 작동하는지 더 잘 파악할 수 있도록 평가에 흔히 사용되는 에이전트가 추가됩니다. 먼저 해당 모델 제공업체의 에이전트를 사용하여 LHT에 대해 새로운 모델을 실행합니다. 예를 들어 Codex에서 GPT 5.6 Sol을 실행하고 Google Antigravity에서 Gemini 3.8 Flash를 실행했습니다. 이 페어링은 하네스 설계가 개발자 결과에 긍정적인 영향을 미치는 방식을 보여줍니다. 프롬프트 캐싱과 컴팩트 도구 창이 토큰 감소로 이어질 수 있기 때문입니다.
향후 다양한 모델과 에이전트 조합의 결과를 강조 표시하여 사용자와 팀에 가장 적합한 조합을 찾을 수 있도록 지원할 예정입니다.
Android 개발에 원하는 에이전트와 모델을 사용할 수 있도록 하는 것이 중요하기 때문에 Google에서는 이 측정에 투자하고 있으며, 앞으로 몇 주 내에 더 많은 정보를 공유해 드릴 예정입니다.
새 모델 추가됨
또한 개발 결정을 내릴 때 최신 데이터를 확인할 수 있도록 리더보드를 계속 확장하고 있습니다. Gemini 3.8 Flash, Gemini 3.7 Flash, OpenAI의 GPT-6, Anthropic의 Fable 5.1, Kimi K3, Qwen 3.8 Max가 추가되었으며 OpenAI의 GPT-6 Astra가 28% 의 통과율로 1위를 차지했습니다.
향후 계획
Android Bench 2.0은 Android 개발을 위한 AI를 측정할 수 있는 강력한 환경을 제공합니다. Google은 장기적 작업, 멀티모달 평가, 에이전트, 지속적인 점수 부여를 결합하여 AI 연구팀이 더 유능하고 신뢰할 수 있는 AI 코딩 파트너를 구축할 수 있도록 지원하고 AI 개발 옵션에 관한 투명성을 높이고자 합니다.
업데이트된 방법론과 함께 업데이트된 리더보드를 확인하세요. 여러분의 의견은 Android Bench를 발전시키는 방식에 직접적인 영향을 미치므로 GitHub뿐만 아니라 X, LinkedIn과 같은 소셜 채널에서도 의견을 계속 공유해 주세요.
-
제품 소식지난 3월 Google은 실제 Android 개발 작업을 위한 LLM 리더보드인 Android Bench를 도입했습니다. 이후 Google은 광고주의 의견을 바탕으로 오픈 가중치 모델을 평가하고 리더보드에 비용 및 효율성 측정기준을 추가하는 등 벤치마크를 개선했습니다.
Zoe Lopez-Latorre • 3분 읽기 -
제품 소식오늘 Android 17이 출시되며 지원되는 대부분의 Pixel 기기에서 사용할 수 있습니다. 향후 몇 개월 내에 Android 17을 실행하는 새 기기가 출시될 예정입니다.
Matthew McCullough • 읽는 데 13분 소요 -
제품 소식Google I/O '26에서는 Android 개발자를 위한 17가지 주요 발표가 진행됩니다. 여기에는 에이전트 기반 생산성, UI 표준으로서의 Compose 우선, 확장되는 생태계를 위한 고성능 미디어 및 적응형 개발이 포함됩니다.
Matthew McCullough • 전문 길이: 8분
Android 개발 관련 최신 정보를 이메일로 받아 보세요.