Gemini 3.0は「初めてOpenAIに勝った」のか:安野貴博氏によるリリース翌日の第一印象

YouTubeで開く ↗
概要

GoogleがGemini 3.0を公開した翌日、安野貴博氏はその第一印象を語った。問いは、Gemini 3.0がOpenAIのGPT-5を超えたのかどうかである。安野氏の結論は「超えたんじゃないか」というものだ。ただし、根拠は公開されたベンチマークと、SNSの投稿、そして本人が数時間触ってみた感触に限られる。安野氏自身も、この評価はすぐに外れる可能性があると断っている。

9分で読めます

久しぶりのメジャーバージョンアップ

今回のリリースで、GoogleのAI「Gemini」シリーズは2.5から3.0に上がった。安野氏によれば、バージョン番号のいちばん上の整数部分が上がることを「メジャーアップデート」と呼ぶ。メジャーアップデートを打ち出すのは、開発側がそのバージョンに自信を持っているということだと安野氏は説明する。

反対に、自信がないときは4から4.1や4.5へ、3.5から3.7へと小数点以下だけを上げる、と安野氏は言う。最近の例として、ChatGPTが5.0から5.1になったことも挙げている。これに対してGemini 3.0は久しぶりのメジャーバージョンアップであり、そのぶん多くの人が期待して使っている、というのが安野氏の見方である。

「ジェミニ」か「ジェミナイ」か

本題とは関係ないと断ったうえで、安野氏は名前の読み方にも触れている。結論は「どっちでもいい」だ。日本語ではおそらく「ジェミニ」が正解で、Googleの公式ドキュメントにもそう書かれていたという。一方、英語圏やGoogleの社員は「ジェミナイ」と呼んでいる。

さらに安野氏によれば、この語はもともと英語ではなく、たしかラテン語であり、ラテン語読みなら「ジェミニ」になる。英語圏に行ったときには「日本人はラテン語的に正しいジェミニで呼んでいる」と言えばよい、と冗談めかして話している。

ベンチマークでOpenAIが「ほぼ初めて」負けた

性能について、安野氏は「結構いい」と評価する。各種ベンチマークで、OpenAIのGPTやAnthropicのSonnetより良い結果が出ており、現時点でGPT-5を超えていると言ってほぼ間違いない、というのが安野氏の見解だ。

ベンチマークとは、AI向けのペーパーテストのようなものだと安野氏は説明する。AIにテストを解かせ、何点取れたかで評価する。人間のテストに国語・算数・理科・社会があるように、AIのテストにもさまざまな種類がある。世の中には非常に多くのベンチマークがあるが、動画では、よく使われていて現在のAIを測るうえで意味のあるものを並べた一覧表を紹介している。表のいちばん左がGeminiの数値で、太字がその項目の最高値である。安野氏によれば、掲載されたほぼすべてのベンチマークでGemini 3.0が最高の結果を出している。

安野氏はこの結果を、これまでの業界の構図と比べて意味づけている。ChatGPTの登場以来、AIの分野ではOpenAIがもっとも強く、他社がそれを追いかける構図が続いてきた。その中で、OpenAIが「マジで負けた」のはほぼ初めてだという。Geminiシリーズについても、2.0が出たときには半年かけてもGPT-4を上回る性能を出せず、当初は「微妙なんじゃないか」と言われていたと振り返る。そこから1年ほどたって、Gemini 3.0とGPT-5の比較ではGemini 3.0が上を行っている、というのが安野氏の整理である。

一覧表の中から、安野氏は特に注目したいベンチマークを3つ取り上げた。

ScreenSpot:パソコン画面の理解と、GUIエージェントへの予測

1つ目はScreenSpotである。パソコンの画面を画像として入力し、AIがどれだけ理解できるかを測るテストだ。安野氏によれば、この項目でGeminiは他のAIを大きく引き離している。Geminiが72.7%であるのに対し、GPT-5は3.5%だという。安野氏は「3点と72点」「桁が違う」と表現している。

安野氏はこの結果を面白いと感じた。こうした画面理解の能力は、Googleが意図して育てたものだろうと推測している。Googleは画像生成AIのNano Bananaなどもそうだが、データを持っていることや過去の積み上げもあって、画像や映像の理解が強い。その強みがうまく生きているように見える、と安野氏は言う。

そこから安野氏は、本人も「完全な邪推」と断ったうえで、Googleの狙いを推測している。AIにパソコン画面を理解させ、その画面を操作させて、仕事を代わりにやってもらう。そうした新しい使い方のAIをGoogleは出したいのではないか、そのために画面理解の能力を大きく引き上げてきたのではないか、という推測だ。

この推測は、2026年についての予測につながっている。安野氏は、2025年を「AIエージェント元年」だったと振り返る。ただし、その中心はClaude Codeに代表される、画面ではなく文字を読んでパソコンを操作するエージェントだったという。安野氏はこれをCUI、つまり黒い画面を見て操作するタイプと呼び、特にソフトウェアエンジニアリングの用途で目立ったとしている。これに対して2026年は、パソコンの画面を見ながら素早く操作するマルチモーダルなAIエージェント、つまりGUIで動くエージェントの元年になるかもしれない、と安野氏は予測する。この予測が当たっているかどうかは来年の今ごろに見てほしい、とも付け加えている。

ARC-AGI-2:まだ伸びしろのある難問

2つ目はARC-AGI-2である。安野氏によれば、このテストはAIにとって非常に難しく、他のAIもあまり良い点を取れていない。

安野氏はここで、ベンチマークが「飽和する」という言い方を説明している。多くのモデルがある程度の点数に達すると、点差がつかなくなってしまう状態のことだ。ARC-AGI-2はまだ飽和しておらず、伸びしろの大きいベンチマークなので、最近はこのスコアが注目されがちだという。

このARC-AGI-2で、Geminiは45%、GPT-5は18%だったと安野氏は紹介する。これまで上位にいたGPTをはるかに上回る数値をいきなり出してきた点について、安野氏は「率直にすごい」と評価している。

MRCR v2:長文を扱う能力と大きなコンテキスト

3つ目はMRCR v2である。安野氏の説明では、非常に長い文章を与えたときに、その中で指示に従ってタスクをこなせるかを測るベンチマークだ。ここでもGeminiは他のモデルより良い性能を出していたという。

安野氏は、そもそもGeminiは一度に処理できる文章の量、つまりコンテキストサイズ(コンテキストウィンドウ)が他のモデルより大きいと指摘する。安野氏が挙げた数字では、GPT-5が40万トークン、Claude Sonnet 4.5の通常版が20万トークンであるのに対し、Gemini 3.0は100万トークンを持つ。つまり、そもそも他より長い文章をまとめて入力でき、そのうえで入力した長文の理解力も他のモデルより高い、というのが安野氏の見立てである。

このため、大量のデータを扱う仕事では期待できる、と安野氏は言う。安野氏自身、いま仕事で大量のテキストを一度に処理する使い方をしており、その意味でGemini 3.0の能力に期待していると話している。

第一印象①②:フロントエンドとゲーム作成(SNSからの印象)

ベンチマークの話に続いて、安野氏は第一印象を4点挙げた。安野氏はこれらを「完全な主観」で、特に裏付けはないと前置きしている。

1つ目はフロントエンドの強さである。SNSには「このプロンプトでこういうウェブページを作ってみた」というスクリーンショットが多く投稿されている。それらを見ると、これまでの「AIが作った感」のあるサイトに比べて、デザイン的にも良いウェブページが出てくる割合が高い、と安野氏は感じている。ただし、これは安野氏自身が実際に触って確かめたものではなく、あまり評価はできていないと断っている。そのうえで、「いけてるフロントエンドが作れそう」という感触を持っているという。

2つ目はゲーム作成である。これもSNS上の報告にもとづくもので、Gemini 3.0でゲームを作ったという投稿が上がっており、ちゃんと面白そうなゲームができている例が多そうに見える、と安野氏は述べている。

第一印象③:日本語の文章力

3つ目は、安野氏がこの日、時間のあるときに自分で試した点である。Gemini 3.0の日本語の文章力は、他のモデルと比べて比較的高そうだという。

比較の前提として、安野氏は自分の好みを説明している。文章を書かせるとき、安野氏はChatGPTの文章があまり好きではない。勝手に大げさなタグラインやタイトルをつけたり、箇条書きを多用したりする癖があり、長いまとまった文章を書く能力はあまり信頼していないという。どちらかといえばSonnetの書く文章のほうが好みだ、と安野氏は言う。

そのうえでGemini 3.0に日本語の文章を書かせてみると、「まあまあ良かった」。安野氏の中での評価は、少なくともSonnetと同じくらいまで上がり、もしかするとSonnetよりいいかもしれない、というところまで来ているという。ただし、これは完全に主観で好き嫌いもあるので、各自で試してみるとよい、と安野氏は付け加えている。

第一印象④:エージェント的な振る舞いはまだ見えていない

4つ目は、安野氏がいま出てくるAIにもっとも期待している点、つまりエージェント的な振る舞いがどこまでできるかである。

安野氏の言うエージェント的な振る舞いとは、Claude Codeのように、自分がどんなツールを使えるかを把握し、そのツールで行動できる能力のことだ。たとえばファイルを見られるなら、そのファイルをどう探し、どう読み、それをもとに次の行動をどう考えるか。言葉を返すだけでなく、試行錯誤しながら問題を解決し、タスクをこなす能力である。

しかし、この点について安野氏は、公開から数時間しかたっていない段階ではまだ見られていないと述べる。正直まだ分からない、今後に期待、という評価だ。SNSでは、コーディングエージェントとしての能力はやはりSonnet 4.5のほうが高そうだ、という投稿も見かけたという。ただ、それも含めて、ここはまだ分からないと安野氏は考えている。

1日目の評価としての留保

安野氏は最後に、この評価の限界を改めて示している。撮影は公開から1日もたっていない時点で行われており、「実は違った」ということがあるかもしれない。また、OpenAI側が明日明後日にもGPT-5.3やGPT-5.5のような新モデルを出し、Gemini 3.0より圧倒的に良い、という状況になる可能性もある。今言っていることがすぐに的外れになるかもしれないが、あくまで「1日目の自分はこう思っている」という話だ、と安野氏は締めくくっている。

ベンチマークの上では、Gemini 3.0がGPT-5を上回った。一方で、安野氏がもっとも注目するエージェントとしての実力は、まだ答えが出ていない。