Googleが画像生成AI「Nano Banana 2.1」を公開、人物の一貫性や編集機能が向上
・テキストレンダリングとインフォグラフィックレイアウトの精度が向上
・最大14枚の参照画像をサポートするマルチ画像融合(最大4人のキャラクターの一貫性と最大10個のオブジェクトの忠実性)
・Googleウェブ検索と画像検索によるグラウンディング
・構成可能な思考レベル(minimal、medium、high)
また、Gemini Nano Banana 2.1は最新の高効率画像生成および編集モデルとして、「Gemini 3 Pro Image(Nano Banana Pro)」のより効率的な対応モデルとして機能するとのこと。
以下は、「テキストから画像への変換」におけるベンチマークをNano Banana 2.1(Thinking)、Nano Banana 2.1(No Thinking)、Gemini 3.1 Flash Image(Nano Banana 2 Thinking)、Gemini 3 Pro Image(Nano Banana Pro)で比較したもの。上から「総合的な好み」「インフォグラフィックデザイン」「インフォグラフィックの正確性」のスコアで、いずれもNano Banana 2.1(Thinking)が優れた性能を発揮しています。
以下は編集能力に関するベンチマークで、上から「一般編集」「単一キャラクターの一貫性」「複数キャラクターの一貫性」「マスク/インクベース編集」「製品の一貫性」「様式化」「複数参照編集」を示しています。こちらも、Nano Banana 2.1(Thinking)がすべてにおいて最も優れたスコアを記録しています。
一方で、既知の制限事項として「小さな文字、長い段落、ページの長さにおけるテキストのレンダリングが不十分」「入力画像と生成された出力画像の間で、キャラクターの一貫性が常に完璧とは限らない」「空間的な位置関係(左右など)に関して時折混乱が生じる」「世界に関する知識、3D推論、事実認識といった高度な能力は依然として限られている」などが品質改善の余地として挙げられています。また、Gemini 3.6 Flashの知識カットオフは2026年3月であり、一部のドメインではモデルの知識が2025年1月までしか利用できない場合もあるとのこと。制限事項などについては、Nano Banana 2.1のベースになっているGemini 3.6 Flashのモデルカードから確認できます。
Gemini 3.6 Flash - Model Card — Google DeepMind
https://deepmind.google/models/model-cards/gemini-3-6-flash/
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.


