Gemini 3.0は「初めてOpenAIに勝った」のか:安野貴博氏によるリリース翌日の第一印象
安野貴博の自由研究GoogleがGemini 3.0を公開した翌日、安野貴博氏はその第一印象を語った。問いは、Gemini 3.0がOpenAIのGPT-5を超えたのかどうかである。安野氏の結論は「超えたんじゃないか」というものだ。ただし、根拠は公開されたベンチマークと、SNSの投稿、そして本人が数時間触ってみた感触に限られる。安野氏自身も、この評価はすぐに外れる可能性があると断っている。
久しぶりのメジャーバージョンアップ
今回のリリースで、GoogleのAI「Gemini」シリーズは2.5から3.0に上がった。安野氏によれば、バージョン番号のいちばん上の整数部分が上がることを「メジャーアップデート」と呼ぶ。メジャーアップデートを打ち出すのは、開発側がそのバージョンに自信を持っているということだと安野氏は説明する。
反対に、自信がないときは4から4.1や4.5へ、3.5から3.7へと小数点以下だけを上げる、と安野氏は言う。最近の例として、ChatGPTが5.0から5.1になったことも挙げている。これに対してGemini 3.0は久しぶりのメジャーバージョンアップであり、そのぶん多くの人が期待して使っている、というのが安野氏の見方である。
「ジェミニ」か「ジェミナイ」か
本題とは関係ないと断ったうえで、安野氏は名前の読み方にも触れている。結論は「どっちでもいい」だ。日本語ではおそらく「ジェミニ」が正解で、Googleの公式ドキュメントにもそう書かれていたという。一方、英語圏やGoogleの社員は「ジェミナイ」と呼んでいる。
さらに安野氏によれば、この語はもともと英語ではなく、たしかラテン語であり、ラテン語読みなら「ジェミニ」になる。英語圏に行ったときには「日本人はラテン語的に正しいジェミニで呼んでいる」と言えばよい、と冗談めかして話している。
ベンチマークでOpenAIが「ほぼ初めて」負けた
性能について、安野氏は「結構いい」と評価する。各種ベンチマークで、OpenAIのGPTやAnthropicのSonnetより良い結果が出ており、現時点でGPT-5を超えていると言ってほぼ間違いない、というのが安野氏の見解だ。
ベンチマークとは、AI向けのペーパーテストのようなものだと安野氏は説明する。AIにテストを解かせ、何点取れたかで評価する。人間のテストに国語・算数・理科・社会があるように、AIのテストにもさまざまな種類がある。世の中には非常に多くのベンチマークがあるが、動画では、よく使われていて現在のAIを測るうえで意味のあるものを並べた一覧表を紹介している。表のいちばん左がGeminiの数値で、太字がその項目の最高値である。安野氏によれば、掲載されたほぼすべてのベンチマークでGemini 3.0が最高の結果を出している。
安野氏はこの結果を、これまでの業界の構図と比べて意味づけている。ChatGPTの登場以来、AIの分野ではOpenAIがもっとも強く、他社がそれを追いかける構図が続いてきた。その中で、OpenAIが「マジで負けた」のはほぼ初めてだという。Geminiシリーズについても、2.0が出たときには半年かけてもGPT-4を上回る性能を出せず、当初は「微妙なんじゃないか」と言われていたと振り返る。そこから1年ほどたって、Gemini 3.0とGPT-5の比較ではGemini 3.0が上を行っている、というのが安野氏の整理である。
一覧表の中から、安野氏は特に注目したいベンチマークを3つ取り上げた。
ScreenSpot:パソコン画面の理解と、GUIエージェントへの予測
1つ目はScreenSpotである。パソコンの画面を画像として入力し、AIがどれだけ理解できるかを測るテストだ。安野氏によれば、この項目でGeminiは他のAIを大きく引き離している。Geminiが72.7%であるのに対し、GPT-5は3.5%だという。安野氏は「3点と72点」「桁が違う」と表現している。
安野氏はこの結果を面白いと感じた。こうした画面理解の能力は、Googleが意図して育てたものだろうと推測している。Googleは画像生成AIのNano Bananaなどもそうだが、データを持っていることや過去の積み上げもあって、画像や映像の理解が強い。その強みがうまく生きているように見える、と安野氏は言う。
そこから安野氏は、本人も「完全な邪推」と断ったうえで、Googleの狙いを推測している。AIにパソコン画面を理解させ、その画面を操作させて、仕事を代わりにやってもらう。そうした新しい使い方のAIをGoogleは出したいのではないか、そのために画面理解の能力を大きく引き上げてきたのではないか、という推測だ。
この推測は、2026年についての予測につながっている。安野氏は、2025年を「AIエージェント元年」だったと振り返る。ただし、その中心はClaude Codeに代表される、画面ではなく文字を読んでパソコンを操作するエージェントだったという。安野氏はこれをCUI、つまり黒い画面を見て操作するタイプと呼び、特にソフトウェアエンジニアリングの用途で目立ったとしている。これに対して2026年は、パソコンの画面を見ながら素早く操作するマルチモーダルなAIエージェント、つまりGUIで動くエージェントの元年になるかもしれない、と安野氏は予測する。この予測が当たっているかどうかは来年の今ごろに見てほしい、とも付け加えている。
ARC-AGI-2:まだ伸びしろのある難問
2つ目はARC-AGI-2である。安野氏によれば、このテストはAIにとって非常に難しく、他のAIもあまり良い点を取れていない。
安野氏はここで、ベンチマークが「飽和する」という言い方を説明している。多くのモデルがある程度の点数に達すると、点差がつかなくなってしまう状態のことだ。ARC-AGI-2はまだ飽和しておらず、伸びしろの大きいベンチマークなので、最近はこのスコアが注目されがちだという。
このARC-AGI-2で、Geminiは45%、GPT-5は18%だったと安野氏は紹介する。これまで上位にいたGPTをはるかに上回る数値をいきなり出してきた点について、安野氏は「率直にすごい」と評価している。
MRCR v2:長文を扱う能力と大きなコンテキスト
3つ目はMRCR v2である。安野氏の説明では、非常に長い文章を与えたときに、その中で指示に従ってタスクをこなせるかを測るベンチマークだ。ここでもGeminiは他のモデルより良い性能を出していたという。
安野氏は、そもそもGeminiは一度に処理できる文章の量、つまりコンテキストサイズ(コンテキストウィンドウ)が他のモデルより大きいと指摘する。安野氏が挙げた数字では、GPT-5が40万トークン、Claude Sonnet 4.5の通常版が20万トークンであるのに対し、Gemini 3.0は100万トークンを持つ。つまり、そもそも他より長い文章をまとめて入力でき、そのうえで入力した長文の理解力も他のモデルより高い、というのが安野氏の見立てである。
このため、大量のデータを扱う仕事では期待できる、と安野氏は言う。安野氏自身、いま仕事で大量のテキストを一度に処理する使い方をしており、その意味でGemini 3.0の能力に期待していると話している。
第一印象①②:フロントエンドとゲーム作成(SNSからの印象)
ベンチマークの話に続いて、安野氏は第一印象を4点挙げた。安野氏はこれらを「完全な主観」で、特に裏付けはないと前置きしている。
1つ目はフロントエンドの強さである。SNSには「このプロンプトでこういうウェブページを作ってみた」というスクリーンショットが多く投稿されている。それらを見ると、これまでの「AIが作った感」のあるサイトに比べて、デザイン的にも良いウェブページが出てくる割合が高い、と安野氏は感じている。ただし、これは安野氏自身が実際に触って確かめたものではなく、あまり評価はできていないと断っている。そのうえで、「いけてるフロントエンドが作れそう」という感触を持っているという。
2つ目はゲーム作成である。これもSNS上の報告にもとづくもので、Gemini 3.0でゲームを作ったという投稿が上がっており、ちゃんと面白そうなゲームができている例が多そうに見える、と安野氏は述べている。
第一印象③:日本語の文章力
3つ目は、安野氏がこの日、時間のあるときに自分で試した点である。Gemini 3.0の日本語の文章力は、他のモデルと比べて比較的高そうだという。
比較の前提として、安野氏は自分の好みを説明している。文章を書かせるとき、安野氏はChatGPTの文章があまり好きではない。勝手に大げさなタグラインやタイトルをつけたり、箇条書きを多用したりする癖があり、長いまとまった文章を書く能力はあまり信頼していないという。どちらかといえばSonnetの書く文章のほうが好みだ、と安野氏は言う。
そのうえでGemini 3.0に日本語の文章を書かせてみると、「まあまあ良かった」。安野氏の中での評価は、少なくともSonnetと同じくらいまで上がり、もしかするとSonnetよりいいかもしれない、というところまで来ているという。ただし、これは完全に主観で好き嫌いもあるので、各自で試してみるとよい、と安野氏は付け加えている。
第一印象④:エージェント的な振る舞いはまだ見えていない
4つ目は、安野氏がいま出てくるAIにもっとも期待している点、つまりエージェント的な振る舞いがどこまでできるかである。
安野氏の言うエージェント的な振る舞いとは、Claude Codeのように、自分がどんなツールを使えるかを把握し、そのツールで行動できる能力のことだ。たとえばファイルを見られるなら、そのファイルをどう探し、どう読み、それをもとに次の行動をどう考えるか。言葉を返すだけでなく、試行錯誤しながら問題を解決し、タスクをこなす能力である。
しかし、この点について安野氏は、公開から数時間しかたっていない段階ではまだ見られていないと述べる。正直まだ分からない、今後に期待、という評価だ。SNSでは、コーディングエージェントとしての能力はやはりSonnet 4.5のほうが高そうだ、という投稿も見かけたという。ただ、それも含めて、ここはまだ分からないと安野氏は考えている。
1日目の評価としての留保
安野氏は最後に、この評価の限界を改めて示している。撮影は公開から1日もたっていない時点で行われており、「実は違った」ということがあるかもしれない。また、OpenAI側が明日明後日にもGPT-5.3やGPT-5.5のような新モデルを出し、Gemini 3.0より圧倒的に良い、という状況になる可能性もある。今言っていることがすぐに的外れになるかもしれないが、あくまで「1日目の自分はこう思っている」という話だ、と安野氏は締めくくっている。
ベンチマークの上では、Gemini 3.0がGPT-5を上回った。一方で、安野氏がもっとも注目するエージェントとしての実力は、まだ答えが出ていない。
どうもこんにちは。安野貴博です。本日はGemini 3.0リリースということで、私の第1印象を話していきたいなと思っております。GPT-5超えかって書いてありますけれども、結論、超えたんじゃないかなと思います。ちょうど昨日の夜Gemini 3.0が突然リリースされまして、ちょうど今日動画を撮っているので、タイムリーにお話ししたいなと思っております。
まず何があったのという話なんですが、Google社が新しいAI、Geminiシリーズの1番新しいバージョンをリリースしました。Gemini 3.0ということで、今までGemini 2.5だったんですけど、これが0.5バージョンが上がりまして3.0になりました。この1番上の整数部分の数字が1個上がることをメジャーアップデートと呼んだりします。
メジャーアップデートの時っていうのは、なんか自信があるってことです。要するに、自信があるバージョンアップを今回Googleがしてきたということです。自信がない時は、4から4.1になったり、4.5になったり、3.5が3.7になったり、最近はChatGPTも5.0が5.1になったりしました。こんな感じで、Gemini 3.0は久しぶりのメジャーバージョンアップだということで、みんな期待して使っているわけです。
あと、これもう完全に関係ないんですけど、ジェミニって呼ぶのか、ジェミナイって呼ぶのか、どっちが正しいんだということなんですけれども、結論、どっちでもいいと思います。どっちでもいいんですけれども、多分日本語ではジェミニが正解です。Google社の公式のドキュメントにジェミニって書いてありました。でも英語でみんなが何て言ってるか、Googleの社員が何て言ってるかっていうと、ジェミナイって呼んでますので、英語風でちょっと分かってる感を出したい時にはジェミナイって言うと、なんかそれっぽくなるんじゃないでしょうか。
さらにもう1つ言うと、ジェミニ、あるいはジェミナイって元々英語じゃないんですよ。英語じゃなくて、確かラテン語だったと思います。で、ラテン語読みすると、これジェミナイじゃなくてジェミニです。なので皆さん、アメリカに行った時には、あるいは英語圏に行った時には、ジェミナイじゃなくてジェミニがラテン語的には正しいんだと、日本人たちはみんなラテン語的に正しいジェミニで呼んでるんだという風にマウンティングをしていくといいと思います。
はい。というわけで話を戻して、性能はどうなんだという話をしていきたいと思います。これ結構いいです。各種ベンチマークでOpenAI社のGPT、あるいはAnthropic社のSonnetより良い結果を出しております。これはもうGPT-5を今の時点で超えていると言っても間違いないと思いますね。
このベンチマークって何なのと言うと、私の動画を他にも見たことある方ならよく出てくる単語でございまして、これはAI向けに作ったペーパーテストみたいなものです。このテストを解かせた上で、あなた何点です、何点ですっていうのをAIに対して評価をしているんですね。
ほぼ初めてだと思いますね。ずっと、ChatGPTが出てからこのAIの世界ってOpenAIが1番強くて、それを他の会社がどんどん追いかけているという構図だったわけですけれども、ほぼ初めてOpenAIがマジで負けたということになると思います。しかも、ジェミニシリーズ、ジェミナイシリーズって、2.0が出た時って半年かけてもOpenAIのGPT-4よりも高い性能を出せなかったんですよね。ということで、Gemini微妙なんじゃないかと最初の頃は言われてましたが、その2.0対GPT-4の戦いから1年くらいかな、経った上で、Gemini 3.0とGPT-5の戦いになった今、実はGemini 3.0の方が上を行っているという、そういう状況になっております。
これ、ベンチマークスコア一覧、こんな風に勝ってるよっていう画像があります。ドン。こんな感じでございます。1番左にあるのがGeminiの数字でございまして、太字で書いてあるのが1番高い数字だよってことですが、ここに載ってるほとんど全てのベンチマークでGemini 3.0が1番いい結果を出していると思います。
1番いい結果を出している中でも、これいろんなテストがあるわけですよ。人間のテストでも国語・算数・理科・社会ってありますけれども、AIのテストもこんなにたくさん種類があって、ぶっちゃけこれだけじゃないです。世の中にはありとあらゆるテストが、今もうたくさんのベンチマークがあるんですけど、でもよく使われる、そして今のAIを測る時によく意味があるベンチマークっていうと、こんな感じになると思います。
いろんなベンチマークありますけれども、特に私がちょっと注目したいなと思ったのを3つほど挙げさせていただきます。まず1つはScreenSpotというもので、これはパソコンの画面を理解する、そういうタスクでございます。画像としてパソコンの画面を入れた上で、これをどれだけ理解できるのかっていうテストなんですけれども、これまずぶっちぎってます。他のAIと比べてぶっちぎっておりまして、Geminiが72.7%で、GPT-5が3.5%ですよ。3点と72点ってもう全然違うわけです。もう桁が違う。
これはですね、面白いなと思いました。というのは、多分ScreenSpotみたいなパソコン画面を理解させる能力って、それなりにGoogle社がこの能力を育てようと思って育てたんだと思うんですよね。Googleは画像生成AIのNano Bananaとかもそうですけど、データを持っていることもあり、過去の積み上げがあることもあり、画像とか映像の理解ってすごい強いところがあるんですけれども、なんかそれがうまく生きてるような気がします。
これもう僕の完全な邪推ですけれども、今後パソコン画面を理解させた上でパソコン画面をAIにいじらせる、パソコンの画面を自動操縦させて、AIに何か仕事を代わりにやってもらおうと、そういうような新しい使い方のAIをGoogle社は結構出したいのかなと思いました。そのためにこのパソコンの画面を理解させる能力ってのをグッと上げてきているのかなと思いますので、私は来年2026年くらい、マルチモーダル、パソコンの画面を見ながらシュシュっと操作を素早くやってくれるような、マルチモーダルに自律的に動くAIのエージェントっていうのが、来年くらいには扱われててもおかしくないなと思います。
今年、2025年って、いわゆるClaude Codeに代表されるような、GUIじゃなくて、パソコンの画面を見るんじゃなくて、パソコンの、何でしょう、文字を読んでパソコンを操作するCUIと呼ばれるような黒い画面を見てパソコンを操作するような自律的なエージェントは、特にソフトウェアエンジニアリングの用途においてはすごい、この2025年なんてAIエージェント元年だったなと思いますけれども、2026年はもしかするとGUI、パソコンの画面を見て動くようなマルチモーダルなAIエージェント元年になるかもしれないなと思います。ちょっと、これが合ってるか間違ってるかは来年の今頃見ていただけるといいなと思います。
2つ目がARC-AGI-2と呼ばれているものでございまして、このテスト、めっちゃAIにとってむずくてですね、あんまり他のAIもいい点取れてないです。伸び代が結構あります。あんまり飽和してないやつって書いてあるんですけど、ベンチマークテストが飽和するっていう言い方があるんですけれども、なんかみんな、いいところまで行くとあんまり点差がつかなくなっちゃうんですよね。っていうのがあるんですけど、まだまだ伸び代があるベンチマークでございまして、最近はよくこのARC-AGI-2がどれくらい強いのかっていうのが注目されがちなんですけど、これも結構すごい成果を出してます。Geminiは45%、GPT-5は18%だったので、いきなり今まで1番上の方を取っていたGPTよりもはるかに高い数値を出してきました。すごい。これは率直にすごいなと思います。
3つ目がですね、これMRCR v2って呼ばれてるものなんですけれども、これは長文を扱う能力を見てます。すごい長い文章を見て、その長い文章の中でも指示に従ってタスクがこなせるかどうかっていう、そういう能力を扱っています。このMRCR v2も他のモデルよりもいい性能を出しておりました。
そもそも他のモデルと違って、1度にAIが処理できる文章の量がめっちゃ多いです。コンテキストサイズとかコンテキストウィンドウとか言われたりしますけれども、このコンテキストウィンドウなんですけど、そもそもGeminiは他のSonnetとか、あるいはGPT-5よりも大きなコンテキストサイズを持っています。GPT-5が40万トークンで、Claude Sonnet 4.5の普通のやつは20万トークンしかないという状況なんですけれども、Gemini 3.0は100万トークン持ってるというところで、他よりもそもそも長い量の長文をガッと入れることができるんですね。ガッと入れた時の長文の理解力っていうのが他のモデルよりもいいということで、大量のデータを扱うような仕事においては結構期待できるんじゃないかなと思います。ちょうど私が今仕事でやっている作業が、大量のテキストを1度に処理する能力っていうのが求められる使い方をしてるので、そういう意味ではGemini 3.0の能力に期待しているところでございます。
今までベンチマークテストの話をしてきましたけれども、次に第1印象。第1印象というか、ここから先は私の完全な主観です。特に裏付けはない話なんですけれども、この第1印象というところで申し上げると、4つくらい思ったことがありました。
1つ目は、いろんな人がこういう風に使ってみたよっていうスクリーンショットをSNSなどに投稿しているんですが、これを見ると結構フロントエンド強そうだなという印象を持ちました。これ、例えばこういうウェブページをこのプロンプトで作ってみたよって言った時の結果が出てるんですけど、今までのAIが作った感のあるウェブサイトと比べて、デザイン的にもすごいウェブページが出てくる率ってのがすごい高いなと思ってます。これ私が実際に触ったわけじゃないんで、あんまり評価できてないんですけど、結構いけてるフロントエンド作れそうやなっていう感触を持ってます。
2つ目が、これもそうなんですけど、結構ゲーム作ったよっていう報告がSNSでも上がってます。これを見ても、ちゃんと面白そうなゲームができていることが多そうに見えます。
3つ目。3つ目が、これは私ちょっと今日時間がある時に触ったんですが、日本語の文章を書く能力っていうのは比較的他のモデルよりも高そうだなと思いました。私、文章を書かせる時に、ChatGPTの文章そんなに好きじゃないんですよね。癖があるというか、なんか結構ギュっと勝手に大げさなタグラインをつけたり、大げさなタイトルをつけたり、箇条書きをわーっと多用したりするので、長いまとまった文章を書く能力ってそんなにChatGPTに関して信頼してなくて、どちらかというとSonnetの方が好きなんですけど、これも完全主観ですよ。なんですが、Sonnetの書く文章の方がなんかそれっぽいなと思って割と好きなんですが、今回Gemini 3.0に日本語の文章を書かせてみたら、まあまあ良かったなと思ってます。少なくともSonnetと同じくらいまで僕の中の印象がグッと上がりました。もしかするとSonnetよりもいいかもしんないくらいまで僕の中では来てます。僕の中では。皆さんもこれは好き嫌いあると思うんで、色々試されてみるといいと思います。
4つ目。4つ目は、これ結構僕が最近出てくるAIに期待してるのは、エージェント的な振る舞いをどれくらいできるのかっていう話なんですよね。エージェント的な振る舞いっていうのは、Claude Codeみたいに自分がどういうツールを使えるのか、そのツールを使った上で、例えば自分がこのファイルを見れるってなった時に、このファイルをどういう風に探して、このファイルをどういう風に見て、それをもとに次の行動をどう考えるのかっていう、アクションをできる能力ですね。実際にAIが言葉を返すだけじゃなくて、色々試行錯誤しながら問題を解決する、アクションをする、タスクをこなす、こういった能力がどれくらいあるのかっていうのを結構期待して見てるんですけど、正直まだこれ出てから数時間くらいしか経っていない中での話で言うと、あんまりまだこれは見れてないです。これはちょっと今後期待ですね。まだ正直分かってない。いろんな人の話を聞いてると、Sonnet 4.5の方がやっぱりそのコーディングエージェントとしての能力っていうのは高そうだねっていうようなSNSの投稿なんかは見ましたが、ここは正直まだ分からないなと思って見ています。
はい。ということで、正直まだ出てから日が浅いというか、1日も経っていない中での撮影なんで、いや、実は違ったよっていうことがあるかもしれないですし、実はもう明日明後日にでも、ChatGPT側、OpenAI側が、いやいやいや、GPT-5.3が出ますよみたいな、5.5が出てGemini 3.0より圧倒的にいいみたいなことを出してくる可能性もあるんで、今言ってることがすぐに的外れになるかもしれませんが、とりあえず1日目の私としてはこう思っているよということでございました。
皆さんもこれ聞いて興味を持ったら、Gemini 3.0使ってみて、どういう感じだったかっていうのを是非コメント欄などで書いていただけると嬉しいなと思います。チャンネル登録、高評価も是非よろしくお願いいたします。では。
[音楽]
[音楽]
記事公開
