ニュース

Googleが「Nano Banana 2.1」を公開 ~複雑な解説図や歴史的に正確なシーンも生成可能

「Nano Banana 2」「Nano Banana Pro」を凌ぐ性能を獲得

Googleが「Nano Banana 2.1」を公開

 Google DeepMindは10月6日、高度なマルチモーダル推論モデルの最新版「Nano Banana 2.1」を公開した。現在、以下のツールから利用できる。

  • 「Gemini」アプリ
  • 「Google AI Studio」
  • 「Gemini API」
  • 「Google Search AI Mode」
  • 「Google Ads」
  • 「Google Flow」
  • 「Google Stitch」

 本モデルはGemini 3シリーズに属し、基盤技術として「Gemini 3.6 Flash」を採用。テキストおよび画像からの入力情報をもとに、画像とテキストを生成できる。入力は最大100万トークンのコンテキストウィンドウに対応しており、プロンプトや文書、画像を処理可能。出力は最大4,000トークンの画像と、最大64,000トークンのテキスト生成に対応している。

 「Nano Banana 2.1」の主な強みは、高い精度と制御性を備えた画像の作成および編集能力だ。テキストからの画像生成や画像編集の性能評価では、全体の評価、インフォグラフィックの正確性、キャラクターの一貫性、スタイライズなどの項目で、「Gemini 3.1 Flash Image」(Nano Banana 2)や「Gemini 3 Pro Image」(Nano Banana Pro)より高いスコアを記録した。評価は[Thinking』モードと[No Thinking]モードの両方で行われ、いずれも良好な結果を示している。

テキストから画像生成の性能比較
画像編集の性能比較

 「Nano Banana 2.1」は、「Gemini 3.6 Flash」の持つ実世界の知識を活用し、複雑なインフォグラフィックから歴史的に正確なシーンまで生成可能。同社は、ポスターや複雑な図解における明確なテキストの生成や、多言語でのローカライズされたテキスト描画などの用途に最適だとしている。

 一方で一般的な基盤モデルと同様に、ハルシネーションが発生したり、処理の遅延やタイムアウトが生じる場合がある。また、小さな文字や長文のテキスト描画がぼやける問題、入力と出力画像間でキャラクターが完全に一致しない問題、左右などの空間認識に関する混同などが今後の改善点として挙げられている。また、本モデルが学習した知識は最新で2026年3月までであり、一部の分野では2025年1月までの情報に限定される。

 安全性に関しては、開発チームから独立した専門チームによる手動のレッドチーミング評価が実施された。オンラインでの児童保護に関する社内基準を満たしていることが確認されたほか、フロンティアセーフティ評価においても、重大なリスクをもたらす機能レベルには達していないと結論付けられている。