Googleの画像生成AI「Nano Banana」は何が新しいのか 安野貴博がChatGPTと比べて見た4つの能力
安野貴博の自由研究画像生成AIでできることは次々に増えているが、その中でもGoogleの「Nano Banana」は目立って話題になっている。この動画で安野貴博は、Nano Bananaとは何かを説明したうえで、自分で触って「すごい」と感じた点を4つ挙げる。空間把握能力、一貫性を保つ能力、テキストレンダリング能力、複数画像の入力である。いくつかの点は同じ指示をChatGPTにも出し、生成結果を並べて比べている。
Nano Bananaとは何か
安野によれば、Nano BananaはGoogleが2025年8月26日に公開した画像生成モデルである。公開前には、LMArenaというサイトに「Nano Banana」というコードネームで高性能な画像生成モデルが現れ、話題になっていた。LMArenaは、開発企業が本来の名前を伏せたまま最先端モデルを先に出し、評判をひそかに確かめる場としてよく使われていると安野は説明する。
正式名称は「Gemini 2.5 Flash Image」で、Geminiシリーズの一つとして発表された。ただ、コードネームのほうが覚えやすかったため、Nano Bananaという呼び名が広く定着したという。Google自身も発表前にバナナの画像を「匂わせ」として投稿するなど、このコードネームを宣伝でも普通に使っていた。
1つ目:写っていない部分を想像する空間把握能力
安野は、「空間把握能力」は学術用語ではないと断ったうえで、この言葉の意味を説明する。画像を見て「ここに何があり、その裏側はこうなっているはずだ」と推測できる力のことだ。具体的には、画像をアップロードして撮影角度を変えるよう指示すると、別の角度から撮った画像を生成できる。たとえば正面から撮った自分の画像だけをもとに、側面や別の位置にカメラを置いたときの姿を作らせる、という使い方である。
最初の検証では、Nano Bananaで生成した渋谷風の交差点の画像を入力し、上から見た構図に変えるようNano BananaとChatGPTの両方に指示した。安野の評価では、ChatGPTの出力も上から撮った雰囲気は出ているが、左側のビルの形、看板のデザイン、街頭ビジョンの内容が微妙に変わり、細部を保てていなかった。これに対してNano Bananaは俯瞰の構図にきちんと変換でき、看板のデザインや街頭ビジョンの表示内容も元画像とほぼ同じだった。安野はこうした細部の再現に、両者の差が少しずつ表れていると見る。
次に、普段のYouTube撮影で使っている自分の画像を入れ、「後ろを向いた姿にして」と指示した。この例では、ChatGPTとNano Bananaの出力にそれほど差はなかったという。それでもNano Bananaは手の形を保っているように見えると安野は述べる。一方で、実際には後頭部にあるお団子髪までは想像できなかった。
こうした失敗はあるものの、安野は、画像に写っていない部分をうまく補う能力はかなり高いと評価する。3月に公開されたGemini 2.0の時点でも、それなりにできるようになったという印象はあった。ただ当時は、何度も生成して良い結果が出るのを待つ必要があった。画像生成の界隈ではこれを「ガチャを回す」と呼ぶ。Nano Bananaでは精度が上がり、ガチャを回す回数が減ったと安野は感じている。
2つ目:編集を重ねても元の画像を保つ一貫性
2つ目の強みは一貫性である。プロンプトで画像の変更を指示したとき、残すべき部分をきちんと残せるかどうか、という能力だ。安野は自分の画像を使い、服装と背景を段階的に変える検証を、同じ指示の順番でChatGPTとNano Bananaの両方に行った。
ChatGPTでは、まず黒いTシャツをサンタクロースの衣装に変えるよう指示した。結果は「まあまあいい」ものの、画像全体が黄色っぽくなり、顔も本人と言えば本人に見えるが、少し別人のような印象になった。次に白ひげと眼鏡を追加すると、追加自体はできたものの顔の雰囲気が変わった。安野は、顔の雰囲気を保つことが非常に難しいのだと強調する。続いて背景を遊園地に変えると、変更はできたが衣装や手の形が微妙に変わった。最後に、背景が寂しいのでクリスマスツリーを加えるよう指示した。この段階では顔が完全に変わり、最初の画像と比べると別人になっていた。
Nano Bananaに同じ指示を順番に出すと、サンタの衣装に変えた段階でも顔の印象はあまり変わらず、本人だと言える状態を保っていたと安野は評価する。白ひげと眼鏡を加えても手の形は同じままだった。背景を遊園地にした段階では、元の画像になかった青い椅子が勝手に描き込まれた。それでも背景の変更はうまくできていると安野は見る。クリスマスツリーを加えても、ほかの部分の雰囲気は変わらなかった。最終結果を並べると、Nano Bananaの画像は安野本人がサンタに変装しているように見える。両者の一番大きな違いは、顔の一貫性を保てるかどうかだと安野は言う。
安野はこの能力が画像編集の難易度を大きく変えると考えている。以前はPhotoshopのような編集ソフトで切り抜いたり、服だけを別の素材と差し替えたりしていた。これを「ここをもう少しこうして」と自然言語で指示し、結果を見ながら口頭で直していくことで、欲しい画像が手に入るようになる。安野は、この技術がさらに進めば、漫画制作や映像編集でも使える水準のものが作れるようになるのではないかと見通しを語る。
3つ目:画像の中に文字を書くテキストレンダリング
3つ目はテキストレンダリング、つまり画像の中に文字を書く能力である。以前の画像生成AIでは、日本語のように見えて日本語になっていない文字や、文字の並びがおかしい文字が生成される問題があった。安野によれば、昨年ごろからStable Diffusion 3、Imagen 3、Midjourney、Qwen-Imageなど、文字を正確に生成できるAIが増えている。Nano Bananaもこの能力が非常に高いと言われている。
検証では、「Merry Christmas」の文字を入れたクリスマス風の画像を生成した。Nano Bananaは書体まで含めて文字をきちんと描き、周囲のクリスマス風の装飾も含めてきれいな画像になった。一方で、日本語の文字を正確に生成する能力は「正直まだまだ低い」と安野は言う。カタカナで「メリークリスマス」と書くよう指示すると、「メレークリスクリス」のような文字になった。安野はこれを「幼稚園児が間違えたような間違い方」でかわいいと評し、「マ」と「ス」は確かに紛らわしいと改めて感じたという。なお、ChatGPTでも「メリークリスマス」の画像は正確に生成できていたと述べている。
文字入りの画像を正確に作れるようになれば、ポスターや広告のように、フォントを含めた「それらしさ」が重要な用途にも使えるようになる。安野は、英語に比べて日本語はまだ弱く、どちらの言語でも「あと一歩、二歩」の段階だと認めている。それでも、画像に文字を書き込む力は急速に強くなっていると見ている。
4つ目:複数の画像を入力して1枚にまとめる
4つ目は、複数の画像を入力して別の画像を生成できるようになった点である。これまではテキストから画像を作ることや、テキストと1枚の画像から別の画像を作ることはできた。Nano Bananaでは、複数の画像をもとに1枚の画像を作れるようになったと安野は説明する。
実演では、先ほど作った「Merry Christmas」の文字画像とサンタ姿の安野の画像を合成させ、「いい感じのポストカード風にして」と指示した。その結果、右上に「Merry Christmas」の文字があり、安野の姿が配置された、ポストカードらしい画像ができた。ほかの人の使い方として、時計や服といったコーディネート用のアイテムの画像と自分の写真を入れ、服だけを入れ替える例も紹介している。
安野によれば、複数の画像を参照して生成する機能は、動画生成AIのVeoやKlingなどで一部すでに実装されていた。それでも、これほど高い精度で複数画像を参照できる機能がGoogleでも使えるようになったことで、用途は大きく広がると安野は見る。これまでPhotoshopのようなアプリで行っていた画像の合成が、Photoshopを使ったことのない人でも簡単にできるようになりつつある。安野は、画像の扱い方そのものが本格的に変わってもおかしくないと考えている。
結論:指示で画像を作る未来は「まだ来ていないが近づいている」
振り返りで安野は、Nano BananaをGoogleのGeminiの新しい画像生成AIと位置づける。画像生成AI全体が良くなっている中でも、空間把握、一貫性の維持、文字の描画、複数画像の入力という4点が優れており、特に一貫性の高さは画像編集に使えると評価した。その結果、これまでPhotoshopを使わなければできなかった作業が、Photoshopを知らない人にもできるようになっていくという。
一方で、うまくいかないことは今も時々ある。後頭部のお団子髪を再現できなかった例や、日本語のカタカナを書き間違えた例がそれにあたる。それでも、ガチャを回す回数は明らかに減ってきている。Photoshopのような編集ソフトを操作するより、Nano Bananaのようなモデルに指示しながら欲しい画像を作っていく未来について、安野は「まだ来てはいないが、かなり近づいている」との見方を示して締めくくった。
どうもこんにちは。安野貴博です。今日は今話題の画像生成AI、ナノバナナについてご紹介したいと思います。画像生成AIもどんどんどんどんできることが増えていっておりますが、このナノバナナは最近の中では少しできることが増えたということで界隈では話題でございます。何ができるようになったのか、画像生成AIってどういう風にできることが増えていってるのか、そこら辺について実際の作例を元にご紹介したいと思います。是非ご覧ください。
はい、本日の動画ではまず最初にナノバナナって何なのという話をします。そして、ナノバナナのここがすごいんじゃないのかと思ったポイントを4つご紹介したいと思います。4つざっくり言っていくと、まず1つ目が空間把握能力、2つ目が一貫性を保つ能力。3つ目がテキストのレンダリング。テキストを書く能力。4つ目が複数の画像を入力する能力です。この4つが今までの画像生成AIと比べてナノバナナがすごいと思ったポイントです。
はい。まず最初のポイントはナノバナナって何なのという話です。このナノバナナなんですが、Googleが2025年の8月26日に公開した画像生成モデルです。元々LMArenaという場所で、ナノバナナっていうコードネームで高性能な画像生成AIモデルが登場してすごく話題になってました。このLMArenaという場所なんですけれども、開発してる企業が本来の名前を隠してコードネームで、先に最先端モデルを公開して評判をステルスで見ていくっていうのによく使われたりしてます。
じゃあ、そのナノバナナの正式名称っていうのは何なのという話なんですが、Gemini 2.5 Flash Imageという名前で発表がされました。いわゆるGeminiシリーズですね。Gemini 2.5 Flash Imageが本当の名前なんですけど、あまりにこのナノバナナっていう名前が良すぎてこっちの方の名前が広く定着してしまっています。Googleもモデル発表する前に匂わせ画像とかをアップロードしてるんですけど、その匂わせ画像としてバナナの画像を投稿したりですね。宣伝としてもこのナノバナナっていうコードネームは普通によく使われてました。
では次に、このナノバナナ、何が能力としてすごいのかということをいくつか紹介してまいりたいと思います。私が色々見た、触った上で感じたのは、4つポイントがありました。
まず1つ目が空間把握能力です。空間把握能力って言うとアカデミックな用語じゃないのでちょっと語弊があると思うんですけど、何が言いたいかと言うと、ナノバナナが画像を見た時にここに○○があって、ここに何々があって、この裏にはこんな感じになってるよねっていうことをちゃんと想像ができるんですよね。具体的に見ていくと、ナノバナナで画像をアップロードして、そこの撮影角度をちょっと変更するっていうプロンプトを入力すると撮影角度が変更できるんですね。これどういうことかと言うと、例えば私の正面像、このカメラで今撮ってますけれども、この画像だけから私の側面像とか、ここら辺にカメラを置いて撮った時の映像を想像させるっていうことをするんです。
例えばこちら。こちらはナノバナナで生成した交差点の画像です。ちょっとだけ渋谷っぽい画像ですが、この画像を入力して上から見た図に変更できるかどうかをナノバナナとChatGPTで比較してみます。ChatGPTを見てみると、確かにちょっと上から撮ってる感じはあるんですけれども、例えば左のビルの形であるとか、看板のデザインとか街頭ビジョン、微妙に変化してるんですよね。細部が維持できてなかったりするんですけれども、ナノバナナで生成した画像はちゃんと上から見てるっていう図に変更ができてます。正確性もかなり向上していて、例えば看板のデザインであるとか街頭ビジョンに表示されている内容っていうのが、元画像と同じようになっているんですよね。そういったところがやっぱりちょっとずつ違ってきているポイントだと思います。
はい。ちなみにもう1つ、いつもYouTube動画を撮影しているこの画像を入れてみました。この画像、着てるTシャツが違いますね。この画像をナノバナナに入れて自分が後ろを向いた画像にしてみてねっていうのを命令するとこんな感じになります。これはChatGPTでもナノバナナでもそんなに変わらなかったですが、ただ、手の形を保持してくれているのかなという感じはしますね。私は本当はお団子が後ろにあるんですけど、このお団子は想像できなかったみたいです。とはいえやっぱりナノバナナ、映ってないところをうまく想像するであるとか、その能力っていうのが非常に高いなと思っています。
3月に公開されたGeminiの2.0の方でもそれなりにすごいできるようになったねっていう感じだったんですけど、当時は何度か生成してガチャを回す。これ画像生成界隈ではガチャを回すっていう言い方するんですけど、たまにランダムでいいものが生成されたりするので、ガチャを回して何回かやった上でいいものを引くっていうことをやっているんですが、ナノバナナではかなり精度も高くなってきたので、そのガチャをする回数が少なくなってきたねという感じです。
はい。すごいと思ったポイント2つ目が一貫性を維持する力です。これは、プロンプトを与えて画像に指示を与えて変更させた時に、元の画像の残すべき部分をしっかり残せているっていうこと。これがすごいポイントだなと思ってます。早速検証してみましょう。この画像をもう1回使って、今度は服装とか背景を変えてみることで、元の画像をどれだけ維持したままそれを変更できるかっていうことの検証をしてみたいと思います。
まず、ChatGPTにやらせた時のを見てみますね。まずこれをサンタにしてみます。私が今黒いTシャツを着てるのをサンタクロースにしてくれと言ったらこんな形になります。まあまあいいんですけど、例えば全体の画像が黄色がかってしまっていたり、ちょっと顔も別人感が出ていると。安野だと言ったら安野な気もするんだけど、とはいえ、ちょっと違うんじゃないかという感じもするわけですね。ここに白ひげと眼鏡を追加してくださいというプロンプトを出すとこんな感じになります。追加できてるんですけれども、顔の雰囲気が変わってしまいました。この顔の雰囲気を維持するっていうのがもうめちゃめちゃ大変なわけですよ。さらにここから背景を遊園地に変えてみるとこちらになります。変更はできてるんですけど、細部を見ると、衣装や手の形ってのが微妙に変わってきてしまっています。さらにここに、後ろ側がちょっと寂しい道なのでクリスマスツリーを入れてみましょうと言って置きますね。ここまで来ると完全に顔も変わってしまっています。1番最初がこちら。本当に顔も全然別人であると。
じゃあ一方、ナノバナナはどんな感じなんですかというのを、全く同じ指示を出して順番に行ってみたいと思います。まず、元々の私がこれです。そこにサンタの服に変えてみるとこんな感じです。顔の印象はそんなに変わらずに一貫性を保つ、これ安野だよねと言えるんじゃないかなと思います。さらにそこに白ひげと眼鏡を追加してみるとこんな感じになってます。追加しても手の形は同じままです。次に、さっきやったように背景を遊園地にしてみようって言って遊園地を入力してみるとこんな感じになります。存在しなかった青い椅子なんかが勝手にイメージはされているんですけれども、とはいえうまく背景は変更できているかなと思います。さらにここにクリスマスツリーを追加してみると、はい、こんな感じになります。他の雰囲気は変わらないままですね。これ見比べてみた時に、私がサンタの変装してる雰囲気があるんじゃないかと思います。
ChatGPTにこの指示をさせたのがこちら。やっぱり1番大きな違いは顔ですよね。顔の一貫性がちゃんと維持できているというのがすごいとこだなと思います。
こうした画像編集っていうのは、昔はPhotoshopみたいな画像編集ソフトで切り抜いてみたりとか、服だけ変えて別のものを持ってきたりとか色々やられていたわけですけれども、ナノバナナみたいに自然言語でここもうちょっとこうしといてとか、ああしといてとかいうことができると、画像編集の難易度がめちゃくちゃ変わるわけですよ。物を見ながらどんどんどんどん口で指示していくことで自分が欲しい画像っていうのが手に入る。今後この技術っていうのはさらにどんどん進化していくことで、例えば漫画の制作とか映像編集とか、そういったところでも使えるレベルのものっていうのが作れるようになるんじゃないかなと思ってます。
はい。すごいと思ったポイント3つ目はテキストレンダリング能力です。これ何かと言うと、画像の中にテキストが入った画像っていうのを作ると、皆さんも見たことあるかもしれないですけど、日本語のように見えて日本語じゃないとか、日本語なんだけど全然文字の並び方が別だよとか、変な風に文字が書かれちゃうという問題があったんですが、昨年頃からStable Diffusion 3、Imagen 3、Midjourney、Qwen-Imageとか、文字を正確に生成できるよっていうAIが増えてきていて、今回のナノバナナもテキストをレンダリングする、テキストを画像として書く能力っていうのは非常に高いと言われています。
実際に試してみましょう。今回は、メリークリスマスっていう文字を入れたクリスマス風の画像を生成してみます。ナノバナナでやった時にはこんな感じです。メリークリスマスと、書体も含め、フォントも含めて書くことができてますね。周りもクリスマス風の装飾も含めて綺麗なテキスト画像が表示されました。こちら、日本語のテキストを正確に生成する能力は正直まだまだ低いです。日本語でメリークリスマスってカタカナで書いてねって言ったら、気持ちは分かるんだけどこんな感じのものになりました。メレークリスクリス。ちょっと可愛いですよね。幼稚園児が間違ったみたいな間違い方しますね。マとスって確かに紛らわしいっていうのを、これを見て改めて思いました。
メリークリスマスだと、ChatGPTで試してみても正確に生成ができているかなと思います。文字を含む画像が正確に生成できる。これは英語だと強くて日本語だとまだまだっていう話ではあるんですけど、こういうものができると、例えばポスターの制作であるとか広告の制作っていう、フォントまで含めたそれっぽさが重要になるような使い方であっても作れるようになると。まだ日本語・英語共にあと1歩2歩っていうところでは正直あると思いますが、すごい勢いでこのテキストを画像の中に書き込む力っていうのもどんどんどんどん強くなっていってるかなと思います。
はい。すごいと思ったポイント4つ目は、複数の画像を入力して他の画像を生成することができるようになったということです。例えば今まで、テキストを元に画像を作るであるとか、テキストと画像を元にまた別の画像を作るであるとか、そういうことはできたんですけど、複数の画像を入れてそれを元に1つの画像を作るっていうことが今回はできるようになったということです。早速やってみましょう。先ほど作ったメリークリスマスっていうテキストとサンタクロースの僕の画像を合成させて、いい感じのポストカードっぽくしてみてと言うと、出てくるのがドン、こんな感じになります。右上のところにメリークリスマスって書いてあって、僕の画像があってという感じで、ポストカードっぽいなというものですけれど、こういう風に複数の画像を入れることができるようになったってのは、1つ大きな、今までできなかったことができるようになったということですね。
他の人たちのやり方を見ると、例えばコーディネートの時に使う時計とか服とか、そういう画像と自分の写真を入れて服だけを入れ替えるであるとか、そういったことがやられたりしているみたいです。この複数の画像を参照しながら画像生成する機能っていうのは、動画生成AIのVeoとかKlingなどではすでにそういったものが一部実装はされていたんですが、これくらいの高い精度で複数の画像を参照できる機能がGoogleでも使えるようになったっていうのは、使用用途がすごい広がる話だなと思います。先ほども言ったように、Photoshopみたいな画像編集アプリでいろんな画像を合成していくっていうことができたんですけど、それと同じことがPhotoshopを全く使ったことない人でも簡単にできるようになってきているわけですよね。なので、こういった画像を取り扱うやり方っていうのが本格的に変わってきてもおかしくない。そういったことを考えさせる機能だなと思います。
はい。というわけで本日のポイントを振り返っていきましょう。まずナノバナナというのはGoogleが作った、Geminiの新しい画像生成AIでした。すごいポイントが4つくらいあると。他の画像生成AIと比べて、基本的にどんどん良くなってるわけですけど、その中でも、空間を把握する能力がすごい。そして一貫性を高く保つことができるので、画像編集の用途などに使える。テキストも書ける。さらに複数の画像も入力できるということで、Photoshopを使わないと今までできなかったような作業が、それを全く知らない人でもできるようになっていく。そんな未来が見れるようなモデルでした。まだうまくいかないよっていうことは時々発生するんですけれども、とはいえガチャを回す回数っていうのは明らかにどんどん少なくなってきていますし、Photoshop的な画像編集ソフトを触るというよりかは、ナノバナナ的なものにみんな指示しながら自分の欲しい画像を作っていく未来っていうのが、まだ来てないですが、かなり近づいてきているんじゃないかと僕は思いました。
はい、ということで本日の動画、少しでも役に立った、面白かったよっていう方は是非、チャンネル登録、高評価、そしてコメントをよろしくお願いいたします。
記事公開
