Googleの画像生成AI「Nano Banana」は何が新しいのか 安野貴博がChatGPTと比べて見た4つの能力

YouTubeで開く ↗
概要

画像生成AIでできることは次々に増えているが、その中でもGoogleの「Nano Banana」は目立って話題になっている。この動画で安野貴博は、Nano Bananaとは何かを説明したうえで、自分で触って「すごい」と感じた点を4つ挙げる。空間把握能力、一貫性を保つ能力、テキストレンダリング能力、複数画像の入力である。いくつかの点は同じ指示をChatGPTにも出し、生成結果を並べて比べている。

8分で読めます

Nano Bananaとは何か

安野によれば、Nano BananaはGoogleが2025年8月26日に公開した画像生成モデルである。公開前には、LMArenaというサイトに「Nano Banana」というコードネームで高性能な画像生成モデルが現れ、話題になっていた。LMArenaは、開発企業が本来の名前を伏せたまま最先端モデルを先に出し、評判をひそかに確かめる場としてよく使われていると安野は説明する。

正式名称は「Gemini 2.5 Flash Image」で、Geminiシリーズの一つとして発表された。ただ、コードネームのほうが覚えやすかったため、Nano Bananaという呼び名が広く定着したという。Google自身も発表前にバナナの画像を「匂わせ」として投稿するなど、このコードネームを宣伝でも普通に使っていた。

1つ目:写っていない部分を想像する空間把握能力

安野は、「空間把握能力」は学術用語ではないと断ったうえで、この言葉の意味を説明する。画像を見て「ここに何があり、その裏側はこうなっているはずだ」と推測できる力のことだ。具体的には、画像をアップロードして撮影角度を変えるよう指示すると、別の角度から撮った画像を生成できる。たとえば正面から撮った自分の画像だけをもとに、側面や別の位置にカメラを置いたときの姿を作らせる、という使い方である。

最初の検証では、Nano Bananaで生成した渋谷風の交差点の画像を入力し、上から見た構図に変えるようNano BananaとChatGPTの両方に指示した。安野の評価では、ChatGPTの出力も上から撮った雰囲気は出ているが、左側のビルの形、看板のデザイン、街頭ビジョンの内容が微妙に変わり、細部を保てていなかった。これに対してNano Bananaは俯瞰の構図にきちんと変換でき、看板のデザインや街頭ビジョンの表示内容も元画像とほぼ同じだった。安野はこうした細部の再現に、両者の差が少しずつ表れていると見る。

次に、普段のYouTube撮影で使っている自分の画像を入れ、「後ろを向いた姿にして」と指示した。この例では、ChatGPTとNano Bananaの出力にそれほど差はなかったという。それでもNano Bananaは手の形を保っているように見えると安野は述べる。一方で、実際には後頭部にあるお団子髪までは想像できなかった。

こうした失敗はあるものの、安野は、画像に写っていない部分をうまく補う能力はかなり高いと評価する。3月に公開されたGemini 2.0の時点でも、それなりにできるようになったという印象はあった。ただ当時は、何度も生成して良い結果が出るのを待つ必要があった。画像生成の界隈ではこれを「ガチャを回す」と呼ぶ。Nano Bananaでは精度が上がり、ガチャを回す回数が減ったと安野は感じている。

2つ目:編集を重ねても元の画像を保つ一貫性

2つ目の強みは一貫性である。プロンプトで画像の変更を指示したとき、残すべき部分をきちんと残せるかどうか、という能力だ。安野は自分の画像を使い、服装と背景を段階的に変える検証を、同じ指示の順番でChatGPTとNano Bananaの両方に行った。

ChatGPTでは、まず黒いTシャツをサンタクロースの衣装に変えるよう指示した。結果は「まあまあいい」ものの、画像全体が黄色っぽくなり、顔も本人と言えば本人に見えるが、少し別人のような印象になった。次に白ひげと眼鏡を追加すると、追加自体はできたものの顔の雰囲気が変わった。安野は、顔の雰囲気を保つことが非常に難しいのだと強調する。続いて背景を遊園地に変えると、変更はできたが衣装や手の形が微妙に変わった。最後に、背景が寂しいのでクリスマスツリーを加えるよう指示した。この段階では顔が完全に変わり、最初の画像と比べると別人になっていた。

Nano Bananaに同じ指示を順番に出すと、サンタの衣装に変えた段階でも顔の印象はあまり変わらず、本人だと言える状態を保っていたと安野は評価する。白ひげと眼鏡を加えても手の形は同じままだった。背景を遊園地にした段階では、元の画像になかった青い椅子が勝手に描き込まれた。それでも背景の変更はうまくできていると安野は見る。クリスマスツリーを加えても、ほかの部分の雰囲気は変わらなかった。最終結果を並べると、Nano Bananaの画像は安野本人がサンタに変装しているように見える。両者の一番大きな違いは、顔の一貫性を保てるかどうかだと安野は言う。

安野はこの能力が画像編集の難易度を大きく変えると考えている。以前はPhotoshopのような編集ソフトで切り抜いたり、服だけを別の素材と差し替えたりしていた。これを「ここをもう少しこうして」と自然言語で指示し、結果を見ながら口頭で直していくことで、欲しい画像が手に入るようになる。安野は、この技術がさらに進めば、漫画制作や映像編集でも使える水準のものが作れるようになるのではないかと見通しを語る。

3つ目:画像の中に文字を書くテキストレンダリング

3つ目はテキストレンダリング、つまり画像の中に文字を書く能力である。以前の画像生成AIでは、日本語のように見えて日本語になっていない文字や、文字の並びがおかしい文字が生成される問題があった。安野によれば、昨年ごろからStable Diffusion 3、Imagen 3、Midjourney、Qwen-Imageなど、文字を正確に生成できるAIが増えている。Nano Bananaもこの能力が非常に高いと言われている。

検証では、「Merry Christmas」の文字を入れたクリスマス風の画像を生成した。Nano Bananaは書体まで含めて文字をきちんと描き、周囲のクリスマス風の装飾も含めてきれいな画像になった。一方で、日本語の文字を正確に生成する能力は「正直まだまだ低い」と安野は言う。カタカナで「メリークリスマス」と書くよう指示すると、「メレークリスクリス」のような文字になった。安野はこれを「幼稚園児が間違えたような間違い方」でかわいいと評し、「マ」と「ス」は確かに紛らわしいと改めて感じたという。なお、ChatGPTでも「メリークリスマス」の画像は正確に生成できていたと述べている。

文字入りの画像を正確に作れるようになれば、ポスターや広告のように、フォントを含めた「それらしさ」が重要な用途にも使えるようになる。安野は、英語に比べて日本語はまだ弱く、どちらの言語でも「あと一歩、二歩」の段階だと認めている。それでも、画像に文字を書き込む力は急速に強くなっていると見ている。

4つ目:複数の画像を入力して1枚にまとめる

4つ目は、複数の画像を入力して別の画像を生成できるようになった点である。これまではテキストから画像を作ることや、テキストと1枚の画像から別の画像を作ることはできた。Nano Bananaでは、複数の画像をもとに1枚の画像を作れるようになったと安野は説明する。

実演では、先ほど作った「Merry Christmas」の文字画像とサンタ姿の安野の画像を合成させ、「いい感じのポストカード風にして」と指示した。その結果、右上に「Merry Christmas」の文字があり、安野の姿が配置された、ポストカードらしい画像ができた。ほかの人の使い方として、時計や服といったコーディネート用のアイテムの画像と自分の写真を入れ、服だけを入れ替える例も紹介している。

安野によれば、複数の画像を参照して生成する機能は、動画生成AIのVeoやKlingなどで一部すでに実装されていた。それでも、これほど高い精度で複数画像を参照できる機能がGoogleでも使えるようになったことで、用途は大きく広がると安野は見る。これまでPhotoshopのようなアプリで行っていた画像の合成が、Photoshopを使ったことのない人でも簡単にできるようになりつつある。安野は、画像の扱い方そのものが本格的に変わってもおかしくないと考えている。

結論:指示で画像を作る未来は「まだ来ていないが近づいている」

振り返りで安野は、Nano BananaをGoogleのGeminiの新しい画像生成AIと位置づける。画像生成AI全体が良くなっている中でも、空間把握、一貫性の維持、文字の描画、複数画像の入力という4点が優れており、特に一貫性の高さは画像編集に使えると評価した。その結果、これまでPhotoshopを使わなければできなかった作業が、Photoshopを知らない人にもできるようになっていくという。

一方で、うまくいかないことは今も時々ある。後頭部のお団子髪を再現できなかった例や、日本語のカタカナを書き間違えた例がそれにあたる。それでも、ガチャを回す回数は明らかに減ってきている。Photoshopのような編集ソフトを操作するより、Nano Bananaのようなモデルに指示しながら欲しい画像を作っていく未来について、安野は「まだ来てはいないが、かなり近づいている」との見方を示して締めくくった。