제품 소식

Android용 LLM 측정 방식의 진화: Android Bench의 새로운 시대

읽는 데 3분 소요
조이 로페즈-라토레의 프로필 보기
Zoe Lopez-Latorre 선임 개발자 관계 엔지니어, Android

지난 3월, 실제 Android 개발 작업을 위한 LLM 리더보드인 Android Bench가 도입되었습니다. Google의 목표는 Android 개발에서 모델 기능에 관한 투명성을 제공하고 모델 개선을 장려하여 일상적인 워크플로에 더 유용한 AI 옵션을 제공하는 것입니다. 이후 Google은 오픈 웨이트 모델을 평가하고 리더보드에 비용 및 효율성 측정기준을 추가하는 등 광고주의 의견을 바탕으로 벤치마크를 개선했습니다. 

하지만 AI 기능은 계속 발전하고 있으므로 측정 방식도 이에 따라야 합니다. 7월 출시의 일환으로 모델을 평가하는 데 사용되는 벤치마킹 에이전트의 업데이트된 버전이 포함된 Harbor 프레임워크가 채택되었습니다. 

이번 7월 출시에서는 평가 변경과 함께 Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, Qwen 3.7 Max 등 8개의 새로운 모델이 리더보드에 추가됩니다. Android 개발자 커뮤니티가 벤치마크에 기여할 수 있는 기회도 공유합니다. 

Harbor 프레임워크를 사용한 방법론 업그레이드

Android Bench를 설계할 때 Google은 당시 제공되던 선도적인 업계 표준을 기반으로 방법론을 정했습니다. 범용 벤치마킹 에이전트인 mini-swe-agent v1을 사용하여 Android 개발의 미묘한 차이에 맞게 조정하여 일반적인 Android 개발 작업을 위한 모델 기능의 기준 측정값을 제공했습니다.

Android 개발의 최신 모델 기능을 정확하게 측정하는 최첨단 평가를 계속 제공하기 위해 벤치마크를 Harbor 프레임워크로 표준화하고 있습니다. Harbor는 누구나 벤치마크를 실행하고, 선호하는 설정을 평가하고, 결과를 공유할 수 있도록 지원하는 표준과 통합을 정의하여 투명성과 가시성을 높입니다.

이번 업그레이드를 통해 모델과 기능을 더 엄격하게 평가할 수 있으며, 업데이트된 기준을 설정하기 위해 모든 모델에서 벤치마크를 다시 실행했습니다. 따라서 점수에 약간의 변화가 있지만, 웹사이트의 보관 파일에서 이전 점수를 확인할 수 있습니다.

Google은 Android Bench가 유용하도록 평가 및 업계가 성숙해짐에 따라 지속적으로 업데이트할 예정입니다.

8개의 새로운 모델로 리더보드 확장

리더보드를 최신 상태로 유지하기 위해 Android Bench 리더보드에 Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus, Qwen 3.7 Max를 추가했습니다. 

Claude Fable 5가 84.5점으로 리더보드에서 1위를 차지하고 있으며, GPT 5.5가 80.2점으로 2위, Claude Sonnet 5가 76.2점으로 3위를 차지하고 있습니다.

오픈 웨이트 모델만 비교할 때는 GLM 5.2가 72.2로 가장 높고, Kimi K2.7 Code가 70.4로 그 뒤를 잇습니다.

업데이트된 리더보드에서 모델 성능 및 효율성 측정항목을 확인하여 이러한 신규 모델과 이전 모델이 Jetpack Compose 이전, 웨어러블 네트워킹, 플랫폼 API 업데이트와 같은 Android 관련 문제를 어떻게 해결하는지 확인할 수 있습니다.  

image1.png

Android Bench에 커뮤니티 참여 허용

Google은 처음부터 개방적이고 투명한 접근 방식을 중요하게 여겨 왔으며, 이러한 이유로 원래 방법론과 테스트 하네스를 GitHub에 공개적으로 제공했습니다. 데이터 세트에 관한 의견을 제공할 수 있는 방법을 요청해 주셨습니다. 이제 Android 개발자 커뮤니티가 Android Bench를 직접 만들어 볼 수 있도록 협업을 한 단계 더 발전시키고 있습니다.

오늘부터 다음 두 가지 방법으로 Android Bench에 참여할 수 있습니다.

  1. 자체 Android 개발 작업을 설계하고 제출하여 모델이 중요한 시나리오를 어떻게 처리하는지 평가합니다.
  2. 벤치마크 평가를 직접 실행하고 공유하여 Google 데이터 세트 또는 자체 맞춤 작업에 대해 선호하는 모델을 테스트합니다.

제출된 작업을 검토하여 벤치마크에 추가할지 평가할 예정입니다. Google은 전 세계 Android 개발자 커뮤니티의 다양한 일상적 현실을 진정으로 반영하는 기준을 구축하고자 합니다.

향후 계획

에이전트 개발을 위한 옵션이 점점 더 많아짐에 따라 최첨단 벤치마크를 유지하면 의존하는 AI 지원이 계속해서 더 스마트하고 유용하며 효과적으로 유지됩니다. GitHub 저장소에서 작업을 확인하세요. 검토를 위해 작업을 제출해 주시기 바랍니다. Harbor Hub에서 데이터 세트를 살펴보고 평가를 제출할 수 있습니다.

언제나처럼 웹사이트에서 업데이트된 리더보드를 확인하거나 방법론을 읽어보실 수 있습니다. 

작성자:
계속 읽기