ニュース
AIは新規開発より既存改修が苦手?より得意? Android開発の実力を測る「Android Bench 2.0」が公開
最新鋭モデルをより実務的な長期間タスクでテスト
2026年9月22日 11:45
米Googleは9月17日(現地時間)、「Android Bench 2.0」を発表した。Androidアプリ開発におけるAIモデルやAIエージェントの実力を測るベンチマーク「Android Bench」の後継となる。これまでの小規模な修正中心の評価では、フロンティアモデルの合格率が90%を超えるなど不十分となったことをうけ、より実務的な長期間タスク(Long-Horizon Tasks:LHT)を評価するように拡張されているという。
「Android Bench 2.0」で新たに追加されたLHT課題は、中級~上級の開発者でも数日から数週間を要する規模になっており、評価方法の説明によると、以下の4カテゴリーで全30タスクが用意されている。
- 新規アプリの開発(9タスク):デザインモックをもとに、多画面のフードデリバリーアプリ「Food Vibes」を新規開発。20~70ファイル・1,200~5,500行規模
- ライブラリ・アーキテクチャの移行(13タスク):実運用中のアプリを最新のライブラリへ移行する(「Retrofit」→「Ktor」、「RxJava」→「Coroutines」、「Hilt」→「Koin」、「Navigation 2」→「Navigation 3」)。5~294ファイル・200~8,200行規模
- 新機能の実装(6タスク):既存のコードベースへピクチャーインピクチャー、「Wear OS」連携の同期、ホーム画面ウィジェット、「CameraX」などを組み込む。4~60ファイル・400~2,200行規模
- アプリの移植(2タスク):「Flutter」や「React Native」で作られたクロスプラットフォームアプリを、「Jetpack Compose」によるネイティブAndroidアプリへ書き換える
課題の“暗記”を防ぐため、新規開発では一般公開されていない社内アプリを題材とし、移行課題にはお手本となる移行事例が上流に存在しないものを選んでいるという。
また、スコアリング(採点)も見直された。従来は合格・不合格の二択だったが、複雑な開発タスクでは「要件の90%を満たしていたのに、エッジケースの検証一つで落ちた」といったケースが0%扱いとなり、実力が見えなくなってしまう。
そこで、「Android Bench 2.0」では機能・リグレッション・要件順守・見た目の忠実さを重み付けして合成した0.0~1.0の連続値「completion rate」を併記。つまり、“合否”に加え、どこまで課題を達成できたかも比べられるようになった。
LHTの合格率はモデル単体ではなく、同じ会社のコーディングエージェントとの組み合わせ(たとえば「GPT-5.6 Sol」と「Codex」など)で評価されている。トップは、「Codex」と組み合わせた「GPT-6 Astra」で28.0%。以下、「Claude Code」+「Claude Fable 5.1」が22.7%、「Codex」+「GPT-5.6 Sol」が19.3%と続く。
ただし、合格率だけで評価を下すのは早計だ。全30タスクからなるベンチマーク1回あたりの平均コストは、合格率トップの組み合わせで375.7ドルに達しており、「Antigravity SDK」+「Gemini 3.8 Flash」の34.5ドル(合格率8.0%)とは10倍以上の開きがある。
傾向としては、どのクラスのモデルも既存コードの改修より新規コードの記述を得意としている。
一方で、実行時の検証を要するもの、フレームワークの破壊的変更を含むもの、未リリースのライブラリに関する知識が必要なものにはいまだ弱い。同社は発表時点で、クロスプラットフォームアプリのAndroid移植では合格率100%のモデルが一つもなく、達成率も最高80%にとどまったと説明している。























