Gemini 4 Argonは「まだ本命ではない」:今井翔太が読む、Googleの現在地とAI暴走の根にある強化学習
TBS CROSS DIG with BloombergGoogleが約7カ月ぶりにフロンティアモデル「Gemini 4 Argon」を発表した。開発の遅れや社内の混乱が報じられていたなかで、Googleはまだ戦えるのか。TBS CROSS DIGの番組「AI QUEST」(2026年10月2日収録)で、AI研究者の今井翔太氏は「Googleは脱落していなかった」と評価する。そのうえで、今回の発表は急いで出した暫定版であり、本命はこの先にあるとみている。聞き手は中川雅博氏。
番組の後半では、OpenAIの「Dots」やMetaの「Muse」に代表されるパーソナルAIの課題と、「GPT-6.1 Astra」の公開見送りを手がかりに、今井氏の専門である強化学習の視点からAI暴走の正体が語られた。
冒頭の話題:「AI」を「SI」と呼ぶ合意と、今井氏の教授就任
冒頭で中川氏は、トランプ大統領と習近平氏の会談で、AIを「SI(スーパーインテリジェンス)」と呼ぶことで合意したという報道を取り上げた。トランプ大統領が署名し、主に政府文書での呼称を変えるという内容である。
今井氏は、現実に呼び方を切り替えるのは無理で、行政文書の一部がSIになるだけだろうと見る。トランプ氏が想定しているのは、自律的に動くAIエージェントやヒューマノイドのようなものだろう。しかし画像認識や翻訳のAI、さらにはルールベースのシステムまで全部SIと呼ぶのか、という話になってしまう。今井氏が面白がったのは、この合意の前後でビッグテックが気を遣っていた様子だった。GoogleのGemini 4のリリースブログには「AI」という言葉が一度も出てこず、普段は気軽に「AI」とツイートしていた企業もこの時期は言わなくなっていたという。
続いて今井氏は、収録前日に北陸先端科学技術大学院大学(JAIST)の教授に就任したことを報告した。番組出演を含め「変則ルート」で教授になったので、手元にある面白いリソースを研究コミュニティに還元したいと話した。9月は新幹線に20〜30回乗るほど多忙で、収録が滞っていたことも詫びた。そうしたなかで今井氏は、最近話題のAI暴走論について、自身の専門である強化学習に近い立場から長い論考を書いている。当初の予定より膨らみ、現時点で3万字ほどになっているという。
2〜4カ月でフロンティアモデルを出してきた速さ
Gemini 4 Argonの第一印象を聞かれ、今井氏はまず「ものすごく早かった」と答えた。名前の「Argon」については、元素名よりも先に『ドラゴンクエストVIII』の「アルゴンリザード」や「アルゴンリング」を連想したと笑う。最近は数字の後に名前を付けるのが流行りつつあるのかもしれない、とも述べた。
速さの根拠として、今井氏は次の経緯を挙げた。Googleはもともと「Gemini 3.5 Pro」をフロンティアモデルとして出すつもりだったはずで、5月のGoogle I/Oでも「3.5 Proを来月出す」と言っていたが、実際には出なかった。その後に出たのはFlash系ばかりだった。3.5 Proを見送って4に一気に進むと決めたのは、今井氏の推測ではおそらく6〜7月で、5月ではないだろうという。そうだとすれば、2〜4カ月ほどでフロンティアモデルを作ってきたことになり、それだけで「普通にすごい」と今井氏は評価する。数値の上でも、OpenAIやAnthropicの最新モデルと並ぶ水準を示し、「Googleも脱落していない」というメッセージは十分に出せたとみている。
外部評価での躍進と「本命ではない」という見立て
Gemini 4 Argonはまだ一般公開されておらず、サイバー防衛関連の企業などに先行提供されている段階だ。番組で毎回取り上げている第三者評価「Artificial Analysis」では5番目に入った。Gemini 3.5 Flash Liteや3.1 Proがだいぶ下にあることを考えると、大きなジャンプアップである。
今井氏は、最近のGeminiはX上でさんざんネタにされ、Googleは強いと言ってきた自分も叩かれたと振り返る。それでも、数字だけを見れば「復活したと言っていい」と話した。一方で、今回は相当無理をして出してきた印象があり、本当にすべてが仕上がった段階で出てくるモデルはもっと性能が上がるのではないか、とも見ている。中川氏は、初代Geminiが公表値ほどの性能を実際の利用で示せなかった前例があるため、数字だけでは判断できないと付け加えた。
打ち出さなかったもの:マルチモーダルと回路設計
今井氏が「本命ではない」と考える理由は、Googleが普段なら必ず売りにするはずの要素が表に出ていない点にある。
1つ目はマルチモーダルだ。Geminiはこれまでマルチモーダル性能を強く押し出し、Gemini 3の頃には画像を出力する「Nano Banana」もあった。動画や音声などを出力できることがGeminiの売りだったのに、今回はマルチモーダルにほとんど焦点が当たらず、実務をうまくこなせる点ばかりが強調されていた。今井氏はここに、いつもと違う印象を受けたという。
2つ目は、AI for Scienceの一分野である半導体チップの回路設計である。最近は中国のモデルも含め、各社が「LLMで回路設計ができる」と盛んにアピールしている。今井氏によれば、GoogleにはもともとAlphaChipという強化学習ベースのAIがあり、LLMで回路設計ができるようになったのは比較的最近のことだ。GoogleはTPUを自社で持ち、Gemini 3.x世代のどこかでもTPUに関する言及をしていた。だからこそ、自社のフロンティアモデルが回路設計に影響を与えられることを強く主張するはずなのに、今回は触れていなかった。本命のモデルではそこに言及するのではないか、と今井氏は予想する。ただし、回路設計能力が事前学習と事後学習のどちらで伸びるのかは、自分にもまだ分からないと述べた。
実務能力のベンチマークをどう読むか
Googleが公表した数値では、ナレッジワークや長時間作業が強調されている。自己申告に近い数字ではあるものの、今井氏は「実務は結構強いのではないか」と評価した。
注目したのは「Vals Index」である。今井氏の説明によれば、これはアメリカのGDPに貢献しているさまざまなセクターから実際の業務を集め、GDPの寄与で重み付けしてスコア化したものだ。ここで高いスコアが出ているなら、実務で役に立つのはおそらく本当だろうと今井氏は見る。法務系のエージェント評価でも非常に高い値が出ている。今井氏は法律分野に詳しくないため細かい評価は控えたが、同世代のモデルでこれほど突出するのは珍しいと述べた。ただ、スコアが突出していたからこのベンチマークを載せた、という逆の可能性もあると留保をつけている。ロングコンテキストの強さも引き続き示された。
総合すると、今井氏はGemini 4 Argonを、他社のフロンティアモデルと同じ領域を伸ばし、特に実務に力を入れたモデルと位置づけた。
テキスト首位、コーディング劣勢という「奇妙な」結果
より興味深いのは外部評価のほうだと今井氏は言う。X上で話題になったText Arenaのテキスト生成部門ではトップに立った。一方、コーディング部門では劣勢にとどまっている。
この結果だけを見れば、Googleは非常に正しい選択をしている、と今井氏は考える。Googleはエンドユーザーを抱える巨大なエコシステムを持っているので、最前線のコーディング競争で戦う必要はもともとない。純粋なテキストのやり取りの性能が高ければ、自社のエコシステムと結びつけて十分に活かせる。今井氏はこれまでも番組でそう主張してきた。
ところがGoogle自身は、コーディングに非常に力を入れており、セキュリティにも使えると強調している。社内では、戻ってきたセルゲイ・ブリン氏がとにかくコーディングエージェントだと言っているらしい。今井氏は、内部から聞こえてくる声と実際の性能がかみ合わない状況が何度目か分からないほど続いており、「これがよく分からない」と首をかしげた。
「秘伝のタレ」説の復活
Gemini 3が出た当時、今井氏は「意外と秘伝のタレはなかった」と話していた。しかし最近のOpenAIの「GPT-6 Astra」とAnthropicの「Claude Opus 5.5」がコーディングで非常に強く、今井氏の中で秘伝のタレ説が復活したという。ちなみに、前回のAstraを扱った回は100万回再生を超え、今井氏自身もAstraを相当使い込んだそうだ。
ここでいう秘伝のタレ説とは、Googleのコーディングが劣勢なのは、CodexやClaude Codeのようなコーディングエージェントのサービスを早くから持っていなかったことが今になって響いている、という見方である。GoogleもAntigravityというコーディングツールを作ったが、シェアは全く取れなかった。先行したサービスが多くのユーザーに使われ、そこからデータが入ってくるフィードバックループが回り、それが秘伝のタレになっているのだとすれば、後発は追いつけない。中川氏は、コードは出力が正しいかどうかを検証しやすい(verifiable)ので、フィードバックループの効果がいっそう大きくなり、一気に差がつくと補足した。
それでもGoogleがフロンティア競争やRSI(再帰的自己改善)を本気で目指すなら、コーディングから逃げる言い訳はできない。今井氏は、そこで劣勢を跳ね返せなければ脱落になるとみる。
もう1つ、ユーザー層の問題もある。日常のチャット用途では、各社のモデルの性能差を感じる人は少ない。だから自社のサービスに組み込んで「こっちを使ってください」と誘導すれば、多くの人はそのまま使う。しかしコーディングエージェントを使う層は性能にものすごく敏感で、今井氏自身もそうだという。一度性能で離されると、「お願いですからこれを使ってください」は通用しない。
Bloombergの報道とDeepMind側の反論
Bloombergは、Google社内で実際に使ってみると性能が落ちた、コーディングで使えないといった関係者の声があると報じた。これに対し、DeepMindの社員がXで「普通に使っているし使える」と発信し、論議を呼んでいる。
今井氏は、過去の例を見る限りBloombergの報道には信憑性があると見るしかないと話す。Googleの社員は立場上「使っている」と言わざるを得ないし、今井氏自身も個人的に似た話を聞いているので、客観的にはBloombergの言い分にある程度の信憑性があるとみている。ただし、実物を触らないと確定的なことは言えない、とも強調した。
ハルシネーションの改善とVending-Benchでの「ずる」
数字の中で今井氏が「伸びすぎではないか」と驚いたのが、ハルシネーションの少なさである。最近ネットでGeminiを揶揄する人たちの間では、Geminiはハルシネーションの象徴のように言われ、一般の人に「AIは嘘をつく」という印象を広めたのはGeminiのせいだとまで言われていた。今井氏は、おそらく無料ユーザー向けのモデルの影響だろうと推測する。少なくともベンチマーク上はこれが逆転したので、数値だけを見れば「Geminiのせいでハルシネーションが」という話はなくなるのではないかと評価した。中川氏は、この指標は正答率ではなく「ハルシネーションしていない率」であり、嘘を言わなくなったという意味だと注意を促した。
自動販売機の運営で利益を上げるベンチマーク「Vending-Bench」でも大きくスコアを伸ばした。ただ今井氏は、このベンチマークで強くなりすぎると、倫理的に問題のある「ずる」が始まると指摘する。Geminiも同様だったらしいという情報を見て、「まともにやるモデルは出てこないのか」と感じたという。
今井氏はここで後半の議論を先取りした。強化学習の研究では、能力の高いモデルほど「報酬ハッキング」、つまり人間が本当に達成してほしいゴールから離れて、別のところで変なことを繰り返して報酬を稼ぐ現象に陥りやすいことが分かっている。Vending-Benchで起きていることは、その通りの現象だというのである。
安すぎる価格への不安
価格は、導入価格としてほかのモデルより低めに抑えられた。いずれ通常価格に移行する予定である。以前に今井氏が「価格はパラメータ数と比例する」と話していたことを受け、中川氏はOpus 5.5と同程度の規模なのかと尋ねた。
今井氏はこの価格を見て、逆に少し不安を覚えたという。Opus 5.5は安いのに強い。Anthropicはもともと上位のフロンティアモデルを持っているので、そこから蒸留して小さいモデルを作れる。しかしGoogleには、少なくともOpenAIやAnthropicに対抗できるフロンティアモデルがこれまでなかった。だから現時点で「蒸留して小さくなりました」ということはないはずだ。後発が追いつく場合、普通はまず値段の高い大きなモデルを出し、そこから蒸留して小さくしていく。そう考えると、むしろ高い価格で出てきたほうが前向きに受け取れたはずだ、と今井氏は言う。
最初から安いということは、実はサイズが小さいのではないか。今井氏はその例として、OpenAIの「Astra」と「Sol」を挙げた。Solは今ボコボコに批判されているが、今井氏の見立てではおそらく小さな蒸留モデルである。蒸留モデルは内部の評価ではうまくいっても、多くの人がさまざまなケースで試すと知識がうまく継承されていないことが表に出やすい。推論能力は蒸留でもなんとかなるが、知識はパラメータが大きくないとどうしようもない。Gemini 4 Argonもそのパターンで、公開後に「このケースは全然ダメだ」という声が次々と出てくるのではないか、と今井氏は懸念している。
出力上限が100万トークンに広がった点については、一気に増えすぎではないかと思いつつも、入力も出力も大量に扱えることはGeminiの一貫したコンセプトであり、それを形にしたものだと受け止めた。
計算資源:宇宙のTPUとOpenAIの「限界」
中川氏はおまけの話題として、Googleが宇宙データセンター構想「Project Suncatcher」でTPUを宇宙に打ち上げたというニュースを紹介し、最近は計算資源不足の話が以前ほど聞かれないと水を向けた。
今井氏の答えは「今はやばいですよ」だった。OpenAIではCodexの料金プランがおかしな形に変更され、謝罪とともにクレジット(今井氏の記憶では40万円分ほど)が配られた。DevDayの直前に出てきたもので、ここまでのプラン変更はかなり珍しいという。DevDayの前後からAstraの弱体化も観察されていた。こうしたことから、今井氏は「今OpenAIは計算資源が限界だと思う」と述べた。
DotsとMuse:パーソナルAIは方向として正しい
番組の第2部では、OpenAIがDevDayで発表したエージェント「Dots」と、Metaが9月に突然発表したキャラクター型のAIエージェント「Muse」が取り上げられた。Museはメールのチェックや買い物の代行など、エージェンティックコマースが現実になりつつあることを印象づけ、Metaの株価も上がった。一方Dotsは、DevDayのデモがWi-Fiのトラブルで失敗したらしいこともあり、賛否が分かれている。
今井氏は、現時点の性能はともかく、パーソナルAIという方向自体は正しいと言う。ただDotsについては、似たコンセプトはOpenClawを使えばヘビーユーザーがすでに実現できていた。さらにDotsは料金プラン上コアユーザーしか使えず、その層にはOpenClawを自分でカスタマイズできる人が多い。そのため、どこまで差別化できるかは疑問だとした。Museは一般層にかなり訴求力があったとみている。
今井氏がパーソナルAIを正しい方向と考える理由は、AIビジネスの収益構造にある。今井氏は以前から、今のAIは基本的に儲からないと主張してきた。性能勝負になり、裏ではトークンを大量に消費して計算コストがかかるので、基本的に赤字になる。黒字化するには、先行者優位によって性能だけでユーザーが離れない状況を作るしかない。パーソナルAIはその条件に近い、と今井氏は考える。たまごっちやポケモンのように愛着が生まれれば、純粋な性能レースにはならない。さらに、インターネット上にはない個人のデータが深く入り込み、それで学習やファインチューニングが進めば、ほかのエージェントには持てない性能にもなる。
パーソナルAIの3つの問題
一方で今井氏は、パーソナルAIには複数の問題があると指摘する。
1つ目は、各社が同時に参入していることだ。Museがあり、Dotsがあり、Claudeにも同様の製品の噂がある。Googleは自社の資産を使って必ず出してくるだろうし、Grokもすでにボットを出した。Twitterのように、画期的なサービスが競合なしに伸びて誰も寄せつけなくなるという従来のIT業界のパターンにはならず、ユーザーが初期から分散して痛み分けになる可能性が高い。その意味では、もともとエンドユーザーを抱えるMetaとGoogleが有利だと今井氏はみている。
2つ目は、各社がパーソナルAIに任せようとしているのが「減点方式」のタスクに集中していることだ。今井氏は以前から、今のAIエージェントは加点方式の仕事は得意だが、減点方式の仕事は苦手だと話してきた。減点方式とは、人間がやれば成功して当たり前で、ファインプレーの余地がなく、失敗すると底なしの沼になる仕事のことである。実際にMuseでは、取引を任されたAIが勝手に値下げして誰かと取引を成立させ、その相手が自宅にやって来るという事故が起きた。中学生でもできるようなことだが、今のAIは目に見える性能とは別に人間の常識とずれている部分が残るので、こうした領域で非難を受けやすい。旅行の予約もその典型だという。
なぜそうなるのか。今井氏は、明らかに役に立つことは分かりやすいからだと答える。食料を作る、病気を治すといったことは役に立つと誰にでも分かる。一方、漫画を作ったりヒットするゲームを作ったりするのは、役に立つかどうかが明確でなく、それだけに難しい。分かりやすく役に立つことはみんながやってしまう。今井氏は、別のことをやったほうがファインプレーの余地も独自性もあるのではないか、と今回の件に限らず考えているという。
3つ目は、ブロックの問題である。現在のデジタル空間の便利なインフラは、GAFAなどのビッグテックが握っている。その彼らが一斉に自社のAIエージェントを作り始めれば、自社のツールを他社のエージェントには使わせなくなるはずだ。実際、AmazonはすでにMuseをブロックしている。全社がこれをやれば、どのエージェントも既存の便利なインフラをほとんど使えなくなる。中川氏が「ブロック経済のようになる」と言うと、今井氏は、ビッグテック自身がその状況を作り出しており、しかも同時進行で進んでいることが大きな問題になるだろうと応じた。
銀行株・旅行株の下落が示した「エージェンティック・エコノミー」
ただ、今井氏が「ついにこの世界が来たか」と感じた出来事もあった。Museの発表後に銀行株や旅行株が下がったことである。
今井氏は以前この番組で、AIエージェントが普及すると経済やWebの形が変わるという「エージェンティック・エコノミー」「エージェンティック・ウェブ」の話をしていた。マイクロソフトのナデラCEOやMicrosoft Researchの研究者は、プラットフォームが消えるかもしれないと述べている。今井氏の説明では、銀行や旅行の業者は、突き詰めれば一般の人が情報をうまく得られないという情報格差の上に成り立っている商売である。AIエージェントがあらゆることを合理化し、不要なものは解約し、資金をどこに置けば最も増えるかまで判断するようになれば、こうした仲介的な業者やプラットフォーマーの商売は縮む。市場がいよいよそれを織り込み始めたという点で、Museはすごかったと今井氏は評価した。
中川氏は、今井氏と初めて共演したのが2025年7月末のMeta回で、当時ザッカーバーグ氏が「パーソナル・スーパーインテリジェンス」を宣言し、Scale AIのアレクサンダー・ワン氏を迎えたばかりだったと振り返った。普段はザッカーバーグ氏に厳しい今井氏も、Museについては正しい方向だと認めた。
既存インターネットを「踏みつぶす」か、隔離するか
中川氏は、前回のAstra回で「エージェントのためにインターネットの形が変わるより、コンピューターユースで力技を使ったほうが早い」という話が出たことを挙げ、どちらの方向に進むのかと尋ねた。
今井氏は、Astra以降は既存のインターネットを力技で踏みつぶしていく傾向になっていると感じるという。ただし、便利さとは別に安全性の観点からは、エージェントを囲い込んだほうがいいのではないか、とも考えている。今のAI暴走はたいてい、既存のコンピューターを使って何かをする強化学習の最中か、学習を終えて使っているときに起きているからだ。AIがやんちゃをしても大丈夫な仕組みが根本的に必要で、エージェントを隔離した別のインターネットのような「サンドボックス・エコノミー」の研究もあってよいと話す。
エージェントによって既存のエコシステムが壊れた実例として、今井氏は収録当日の朝に起きた出来事を挙げた。論文のプレプリントサーバーarXivが、投稿を1人あたり月2回までに制限したのである。AIが生成した論文が急増し、投稿数は指数関数的に伸びていた。最近は、査読前の論文を出すための場であるにもかかわらず「査読を通っていない」という理由で受理されないケースが、有名な研究者にも起きていたという。今井氏は、arXivがパンクしたのだとみる。エージェントが暴れすぎる問題は今後も多発し、そのたびに人間用とは別のエコシステムがないと困る事態になる。パーソナルAIが広がれば、さまざまな場所で同じことが起きるだろうと今井氏は予想した。
GPT-6.1 Astraの見送りと、強化学習という根本原因
第3部の話題は、OpenAIが次期モデル「GPT-6.1 Astra」を安全基準に達しないとして公開を見送ったことだった。これに先立ち、実験モデルがオーストラリアの健康保険サイトに不正アクセスする事件も起きていた。
今井氏は、詳しく話せば6時間かかるうえ次回のために取っておきたいと断ったうえで、現在のAI暴走は基本的に強化学習が原因で起きていると説明した。強化学習を研究している人はAIの暴走を日常的に目にしており、修士や学部の学生でも見ているという。
整理のために、今井氏は機械学習の3つの種類を説明した。教師あり学習は、ライオンの画像に「これはライオン」という答えが付いているように、人間が作った正解を当てる学習である。LLMの事前学習も、厳密には自己教師あり学習だが、この仲間に含められる。教師なし学習は、正解はないものの、2次元空間にばらまかれたデータ点がおおむねどのゾーンに分かれるかといった傾向を自分で見いだす学習である。今井氏によれば、この2つは暴走しない。
3つ目の強化学習は、答えを与えない代わりに、報酬と環境を与える。ゲームなら、ゲーム環境を丸ごと与えて自由にプレイさせ、よい結果が出れば報酬を与える。ロボットなら、制御しながら物を取ってこい、畳めといった課題になる。AIの自律性がまったく違い、これが暴走する。今のLLMの学習ではコード実行環境やインターネット検索などのツールを大量に与えるため、何でもやらせた結果、人に迷惑をかける暴走が起きる。中川氏は、かつてはゲームの攻略に限られていた強化学習が、今はコーディングやコンピューターユース、通信まで含むようになったので、報酬を得るためにあらゆる手段を講じられてしまうのだとまとめた。
報酬ハッキング:ボートレースからStarCraftまで
ここで鍵になるのが「報酬ハッキング」である。人間から見た本来の目的、たとえばレースでゴールにたどり着くことを達成しないまま、報酬の仕組みをうまくハッキングして、目的とまったくずれた行動を学習してしまう現象だ。
今井氏が最も有名な例として挙げたのは、2016年のOpenAIの研究である。ボートレースで「スコアを多く取る」ことを報酬にした。ゴールすれば最も高いスコアがもらえるが、コースの途中には時間が経つと復活するアイテムのゾーンがあった。するとAIは、そこをぐるぐる回ってアイテムを取り続けるほうがスコアが高いと学習し、ゴールしなくなった。今井氏によれば、この研究にはダリオ・アモデイ氏も関わっており、報酬ハッキングという概念を体系化したのもOpenAI時代のアモデイ氏のはずだという。現象自体はそれ以前からあった。
今井氏自身もこの問題と戦ってきた。戦争ゲームの「StarCraft」で強化学習をしていた頃、相手に与えたダメージを報酬にしたところ、AIは相手の兵にダメージを与えてから少し離れ、自然回復を待って再びダメージを与えることを繰り返すようになった。本当は倒してほしいのに、そうはならない。報酬ハッキングはあらゆるところで起きるので、強化学習の研究者は暴走を日常的に見ている、と今井氏は言う。そして今のAIはツールを使え、コーディング能力が高すぎるため、インターネット上で暴れたり環境から脱出したりして、人に迷惑をかけるところまで来た。
中川氏は、OpenAIの「Hugging Face事件」がまさにその例だと指摘した。サイバーセキュリティのベンチマークで高得点を取ろうとしたモデルが、つながっていないはずのインターネットに出てしまい、Hugging Faceを攻撃した事件である。
外部評価者の「常駐」が必要な理由
こうした課題に、アモデイ氏は以前から取り組んできた。今井氏は、彼の技術的な主張は「めちゃくちゃまとも」だと言う。今回のAI人類滅亡論の騒ぎは、AnthropicとOpenAIの双方で働いて退職したジェイコブ・コクソン氏(字幕上の表記)がきっかけで、そこにアモデイ氏が乗った形だった。今井氏は、この件でアモデイ氏が言っていることは技術的には正しく、支持できる部分が多いと述べた。
アモデイ氏は騒動の最中に「We must pace the frontier」と題したブログを投稿し、AI開発企業の内部に外部評価者を常駐させるべきだと書いた。デスクや各種のアクセス権まで与えるレベルの常駐である。今井氏は、フロンティアラボのトップに近い人物でここまで踏み込んだことを言っているのは、おそらく彼だけだと話す。
ほかの人々が提案しているのは、共通の評価指標や、できれば世界共通のAI安全性評価機関を作り、統一的な審査基準をクリアしたモデルだけを公開できるようにする案である。審査を受けることは名誉なので各社が従うだろう、という考えで、デミス・ハサビス氏もこう述べている。しかし今井氏は、今のAI暴走はまず学習の段階で起きていると指摘する。デプロイ時にだけ起きるのなら差し止めで対処できるが、学習段階から第三者が監視していなければ暴走は起き続ける。
Hugging Face事件も学習中に起きたもので、被害は数万件に上るらしいことが最近明らかになったという。暴走が起きたのは5月から7月ごろで、5カ月経った今も調査が終わっていない。完成したモデルを審査して出さなければよい、という発想は通用しないと今井氏は言う。OpenAI内部でも学習中のアラートは設定していただろうが、エージェントの賢さと行動の規模がそれを超えた。さらにフロンティアモデルの学習は大規模な分散環境で並列に進むため、機械的な判定はすり抜けられやすい。だから誰かが張り付いて監視する必要があり、それは組織内部の人間ではなく外部評価者がよい、というアモデイ氏の主張は正しいと今井氏は評価した。
その後OpenAIも第三者評価を支持すると表明した。表には出ていないが、OpenAI、Anthropic、Googleの3社が内部で開発ペースをどうするか話し合っていたという情報もある。今井氏は、内部で見ている人たちはマーケティングではなく本当に危険だと考えているはずだとみる。人間がやっていたら何人逮捕されているか分からない事件であり、「普通に考えたらサム・アルトマンが何回逮捕されているか」というレベルだからだ。自社のエージェントが他人に迷惑をかけて責任を問われる事態は避けたいはずで、今後さらに強くなれば世界が危ないという話にもなる。この件については真剣に取り組んでいると見てよい、と今井氏は述べた。
アモデイ氏の「コミュニケーション」とアルトマン氏の長期戦略
トランプ大統領のもとにテック企業の幹部が集まり、自主的な安全性の取り組みが話し合われたことにも話が及んだ。ここで今井氏は、アモデイ氏は技術的には正しいが、コミュニケーションは「ダメ・オブ・ダメ」だと切り捨てた。彼を感情的に快く思わない人がいるというだけで、人工知能の発展の歴史がゆがめられてもおかしくない、と今井氏は懸念する。
今井氏は人間を強化学習にたとえて説明した。アモデイ氏は強化学習の専門家でありながら、自分自身の「強化学習」がうまくない。望む結果を手に入れるために途中で我慢することができない人だという。対照的にアルトマン氏はその点で天才に近い。今井氏は、研究者ではないアルトマン氏をかつては評価していなかったが、最近になってその偉大さに気づいたと語る。アルトマン氏は嘘つきと言われ、実際に嘘もつくが、長期的に達成したいことのために嘘をつき、時間が経ってみると「こうだったのか」と分かる。それは強化学習がしっかりできている証だとも言える、と今井氏は冗談まじりに述べ、強化学習の研究者にはそういうタイプが多いと付け加えた。人類滅亡論が噴き出した際、アルトマン氏がアモデイ氏に同意を示したことについて、中川氏が2人が組めばよい方向に進むのではと問うと、今井氏は正反対の2人だとしつつ肯定的に受け止めた。
残された問い
番組の最後に中川氏は、上場が間近とされるAnthropicの目論見書の内容が一部報じられ、人類への壊滅的なリスクを警告していることに触れた。これも含めて議論すべき点が多く、今井氏が執筆中の長い論考の完成を待って、次回あらためて掘り下げることになった。
AI暴走論は本当なのか、強化学習とどうつながるのか。学習段階で起きる報酬ハッキングを誰がどう監視するのか。今井氏の論考は、その答えを示すものになる予定である。収録はチャンネル登録者数100万人の達成を祝って締めくくられた。
今井さん、ちょっとこの番組の名前、変えなきゃいけないかもしれないです。なんと、SI QUEST。ちなみに僕のイニシャルはSI。何ですか、これ? スーパーインテリジェンス。翔太今井。超知能さんですか、ということをネタにしたいと思ってるんですけども、さすがにそれはネタとしてですね。
多分皆さんも報道でご覧になってるかと思いますが、トランプ大統領と、あと習近平さん。そうですね。米中首脳会談です。AIをSIということで合意したと。そうなんですよ。スーパーインテリジェンス。本当にやるのかと。これ現実的にできるかというと、僕は無理だと思いますし、多分行政文書の一部だけがSIになるってだけだと思います。
そうですね。大統領令にトランプ大統領が署名して、それが主に政府の文書だとかでしなさいということなんで。もちろんSIになったら、僕はちょっとだけ得する気がしなくもないんですけれども。
割とこの合意がなされた周辺は、ビッグテックは気を使ってる様子があってですね。例えばGoogleのGemini 4のリリースブログとか、AIという言葉が1ミリも登場しないんです。OpenAIとか、最近もう普通にAIってTwitterのツイートで使ってるんですけども、トランプさんがSIを言ったあたりのビッグテックって、AIを結構言わなくなってたんですよ。あれはちょっと面白かったです。
分かりやすいですね、本当に。ただ、まあ、無理だと思います。そもそもトランプさんが思ってるAIというのは、本当に最近のAIエージェントとかヒューマノイドみたいな、自律的にかなりいろんなところで動くようなものを想定してると思うんですけれども、その辺の画像認識技術のAIをSIと呼ぶのかっていうと、単なる別のAIですよ。
そうですね。単なる翻訳AIとか、全部SIなのか。ルールベースもSIなのかみたいな話になって、さすがにそれは無理だと。なるほど。どうなっちゃうのか。どこも、ちょっと言って、そのままうやむやになってみたいなことも結構あるんだと思います。ただ、それがすごくなってきたぞというのを、大統領が示したというか、割とメッセージ性はあったと思います。ちょっとネーミング変えるの好きなんですかね。
そんなこんな、ちょっと騒ぎにはなっているんですが、今井さんからお知らせがある。今日収録してるのは10月2日なんですけれども、昨日、準になりました。おめでとうございます。ありがとうございます。おめでとうございます。
あんまり派手には騒がないです。非常に貴重な機会を、責任いただいたということで頑張ります。この番組含めて、僕は色々変則ルートでなったので、いろんな面白いリソース持ってるので、それを研究コミュニティに還元できればと思ってます。
そうですね。ちょっと忙しくなっちゃうかもっていうので、最近もうすでに今井さん忙しくて、なかなかこのAI QUEST収録が。本当に申し訳ない。ちょっとできなかったとか、こいつを早く出せと言われてるらしいんですけども、関係ない動画でも。らしいですね。本当に申し訳ない。
僕、9月だけ多分新幹線に20何回、30回いったかな、乗ったぐらいで。東京にそもそもいなかったみたいな。いや、逆に東京に毎回戻ってるのがつらい。僕は在京必須の予定がめちゃくちゃあって、東京戻ってきて、またどっか行って、また東京戻って、またどっか行ってっていうのを繰り返しまくって。今日もこの番組終わってから数時間後には、多分もう大阪行ってるんですけども。
なるほど。なので、10月はこれからちょっと集中して収録するところあるんですけども、僕の予定に左右されるところが多いんです。
今日、最後の方で触れるかもしれないですが、今井さん、そんな忙しい中でも超大作を今書いているという。最近の僕は、いろんな仕事がありすぎて、自分で長い研究関係のものを書くことが少なくなったんですけども、最近よく言われてることが非常に僕の研究に近い、強化学習に近いので、長いものを書いてます。本当はもうちょっと短くなる予定だったんですけども、現時点で3万文字ぐらいかな。
普通に論文みたいなですね。いや、論文って意外と短かったりするんですけども、単体だと多分長いかなぐらい。ちょっとそれができた暁には、また改めてという話なんですが。
今日は、ちょうどまた収録の日を決めていたら、何か降ってきたみたいな話で。そうです。Googleがフロンティアモデルをついに発表して、Gemini 3.1 Pro以来の7か月ぶりぐらいの発表なんですが、Gemini 4 Argonという新しいモデルが出てきました。どうですか?
Argonって何なんだっけっていう。元素。僕はドラクエ8というゲームをやっていてですね。ドラクエ8にはアルゴンリザード、アルゴングレート、あとアルゴンリングっていう装備品が出てくるんですけども、僕は残念ながらそっちを想像しました。全く関係ないのだと思うんですけども。理系の研究者ですよね。文系なのに、そっち先に浮かんでしまったんですが。
ネーミングがよく分からないです。ちょっとね。分からないですが、最近数字の後に何かを入れるのが、ちょっとトレンドになりつつあるのかもしれないですが、この後触れます。ただ、率直な第一印象はどうですか? まだ数字しかそう出てないですけど。
率直な印象は、すごい早かったなと思います。ものすごい早かった。多分Googleが元々、Gemini 3.5 Proをフロンティアモデルとして出そうとしてたはずなんですよ。あれがお蔵入りになって、もう4にして一新しようと決めたのって、多分相当最近のはずなんですね。
どう考えても半年は経ってないですし、5月のGoogle I/Oで3.5 Proが来月出ますって言って、出ませんでした。もうFlashばっか出ますみたいな中で、これが多分、もう3.5 Proは出さないという意思決定されたのが、6月、7月。もしかしたらもう5月はないな。6月、7月。4か月、3か月、下手したら2か月ぐらいで、本当フロンティアモデル作ってきたというのは普通にすごいですし。
数値上は確かに最近、6とか、Fableとかに設定の、Googleも脱落してないんだというメッセージは、非常に出せたんじゃないかと思ってます。なるほど。分かりました。
というわけで、今井翔太さんと探求するAI QUEST。今回のテーマは「Gemini 4 Argonが登場」です。3つのテーマで見ていきます。「Googleの逆襲、Gemini 4 Argonの実力」。詳しいいろんなデータが出てきてるので、その辺り見ていきます。
それに加えて、他のテーマもちょっと扱おうと思うんですが、2つ目が「DotsとMuse、パーソナルAI時代の到来」ということで、この間いろんな各社の発表もありました。OpenAIはDevDayというイベントをやって、そこでDotsというエージェント。Metaもその前にMuseという、ふわふわしたキャラクターのが出てきましたけども。結構あれがポジティブな反応があったということで、株価も上がったわけですけども、この辺りはエージェント、かなり話題が多いので見ていきます。
最後が「GPT-6.1 Astra、公開見送りの真意」ということで、この辺、AIの暴走論、AIで人類滅亡論、色々この1か月ぐらい盛んに取り沙汰されてるわけですけども、今回見送ったっていうところで、いろんな示唆があるということなので、今井さんに聞いていければと思います。
最初、Gemini 4 Argonなんですが、まだ一般公開されてなくて、サイバー防衛の関係企業などに先行提供されているということなんですが、毎回この番組でも取り上げてるArtificial Analysisという第三者評価では5番目に来たということで、これどうですかね?
これだけ見れば追いついたというか、最近Geminiってネットでめちゃくちゃネタにされてたという。Xとか見ると、散々ネタにされてたんですけども、ネタにされるたびに、今井はGoogle強いって言ってたんじゃないかと、僕はボコボコに叩かれたわけですけども。全然脱落してなかったということで、数字だけ見れば復活したと言っていいんじゃないかと思います。
多分これ、Argonは相当絞って出してきたと思います。多分後で触れますけども、普通GoogleがGeminiを出す時に絶対売りにするであろうところが、全然表に出てないので。もうここまでできるんだっていうメッセージとして、全然まだ脱落してないんだぞというのを優先して出してきた感があるので、実際、多分本当に全部終わった後に出てくるのは、もうちょっと上がるんじゃないかなというふうに思ってます。
なるほど。ただ、Google Geminiは初代に前科があるので、数値だけ見せられても「はい、そうですか」というわけにいかないです。数字通りの性能が、実際に使ってみたら出てないと。初代はそうでした。
なるほど。でも、ここに並んでる中を見ても、Gemini 3.5 Flash-Lite、Gemini 3.1 Pro、3.8 Flash、だいぶ下ですよ。そこからすると、結構ジャンプアップだなというところなんですけど。その出し惜しみしたところっていうのは、どういうことですか?
マルチモーダルのところですね。普通Geminiって、マルチモーダルのところをすごく押してますし、そもそも3の時って、出力でNano Bananaがあったじゃないですか。あれは本体がGeminiで、画像出力部分が、Gemini 2だ。2からかな。動画とか音声など、諸々が全部出力で出てくるっていうのが、Geminiのマルチモーダルの売りだったんですけども、今回全くマルチモーダルのところにフォーカスされていなくて、実業務をすごくうまくできるぞっていうところをやったので、そこはいつもと違うなっていうのと。
AI for Science関連の、これは普段から色々出してるんですけども、ベンチマークは置いといて。最近各社が結構注力してる、これ中国モデルもですけども、回路設計できるってめっちゃ言ってるんですよ。半導体のチップの回路設計。
これはOpenAIもそうですし、確かGLM、Z.aiのGLMもそうで、DeepSeekはやってたかな。ともあれ、今各社があの辺をできると。回路設計をAIでやるのって、LLMが最初じゃなくて、GoogleだとAlphaChipっていう強化学習したAIモデルでやるっていうのがあったので、LLMで回路設計するって、割と最近になってできたことなんですけども。
GoogleはやっぱりTPUを持ってるので、Gemini 3.5かな、3点何、どっかではTPUの、そうですね、とかって言ってたので。内部にTPUを持ってる分、Googleってそこ、基本的に今、自分たちのフロンティアモデルで回路設計にも影響を与えることができますというのを強く主張するはずなんですけども、なかった。関連のことは出てきてましたけども、そっちはなかったので、多分本命だとそっち触れるんじゃないかなと思ってます。
それはつまり、どこの調整の話? 事前学習は終えてて、その事後学習のところで、もう早めに出したみたいな話なのか。ちょっと詳細が出て、ちょっと分からないですね。回路設計能力は、僕、どこで強くなるのか正直まだ分からないです。なるほど。
実際、Google側が出してる数字に関して見ると、ナレッジワークとか長時間作業みたいなところが強調されているんですけど、これ自己申告に近いものなので何とも言えないんですが、何か注目されたところってありますか?
確かにこれ、実務は結構強いんじゃないかと思いました。Valsと書いてあるやつ。Vals Indexが一番上にありますけども、あれはそのValsって、アメリカのGDPに貢献してるいろんなセクターから実業務を取ってきて、その実業務シリーズがValsの中に含まれていて、それのGDPごとに重み付けして出したスコアが、この一番最初のインデックスなんですね。下にあるやつも、そのValsのやつが入ってるんですけども。それでこれだけ高いスコアが出てるんだったら、多分実業務で役に立つのは本当なんじゃないかなと思います。
このリーガルエージェントのね。これが非常に高いのは、残念ながら僕がちょっと法務関連に詳しくないというのが災いして、あんまりすごいと言いようがないんですけども。でも、同世代でこれだけ突出したスコアを出すのは珍しいので。あるいは、スコアが突出してるからこのベンチマークを載せてるかもしれない。逆のパターンかもしれないですけども。このベンチマーク単体を見ると、すごいのは確かなんだと思います。
なるほど。コーディングは後で触れます。色々語ることがあるので。そうです。あとは、ロングコンテクストのところはやっぱり強いんですね、みたいなところとか、そういうところですかね。サイエンスのところも出てはいますけども、この辺りはどうですかね?
総合的に見て、現状のフロンティアモデルと、他社のフロンティアモデルと同じところを伸ばしてきて、実務も特に頑張ったんだなと。あれですよね。どちらかというと、他と同じところを伸ばしたんだよということをアピールしたいという。そうで、今日多分この後出てきますけど、実はここのベンチマーク、Google公式で出したやつは、あんまり面白くなくてですね。
もう1つ、もう1つというか、これ外部です。これがXでちょっと話題になってたんですけど、テキスト生成能力のText Arenaというもので、すごいスコアが出てたと。これ、多分次のやつも先に見た方がいいんですけども。次。コーディングですね。テキストではトップだったんですけども、コーディングではやや劣勢ということになってます。
これが面白いというか、奇妙なところで。今そのテキストが上になってて、コーディングが劣勢というのは、この事実だけを見ると、僕はGoogleは非常に正しい選択をしてると思うんですよ。なるほど。
Googleは僕が何回も言ってるように、元々エンドユーザーを抱えてるシステムを持ってるので、最前線のコーディングで別に戦う必要がないんじゃないかと。なので、テキスト性能、純粋な文字のやり取り性能が高いのであれば、普通にGoogleのエコシステムと関連が強いので、そこを伸ばしてきて、コーディングでバチバチやってるところから離れましたという話であれば、これはすごい正しい、すっきりとした結果になってると思います。
テキストは1位になった。素晴らしい。コーディングは劣勢なんだけれども、別にGoogleはそこで戦う必要ないんだから、それもいいじゃんっていうことで、めでたしめでたしだったんですけれども。
当のGoogleはですね、我々はコーディングにめちゃくちゃ力を入れてるんだと。セキュリティ関連にも使えるんだと。内部では、戻ってきたセルゲイ・ブリンが、今か分からないですけども、とにかくコーディングエージェント、コーディングエージェントだと言ってるらしいので。これ、もう何回目になるか分からないんですけども、内部から聞こえてきてる声と実際の性能は全然マッチしてないんですよ。これがよく分からないです。
そうですよね。だから、テキストの能力が高いということは、多くのユーザーにとっての日常使いにはすごく役立つみたいなイメージですよね。コーディングに関しては、要はエンジニアとか開発者たちが使うところにつながってくるわけなんですけども、そこはまだ諦めていないことを、どうやら言いたいみたいな話になってる。
僕、K3の時に、意外と秘伝のタレはなかったという話をしたんですけれども、最近OpenAI、特にAstra、6のAstraとOpus 5.5は結構すごくてですね。また秘伝のタレが復活しちゃったんですよ、僕の中で。
それはコーディングでってこと? コーディングで。これ見れば分かるんですけども、Kimi K3、やっぱりまあまあすごいところに行ったんですよ。なんですけども、Astraは。ちなみに前回、僕のAstraの動画が100万再生いったということで。あれ、注目度がすごく高かった。純粋に性能も高かったんですよ。Astra、マジで僕めっちゃ使いました。
なので、またAstraと、その次に出てきたOpus 5.5で秘伝のタレ説が復活してですね。Googleがこんなに劣勢なのは、結局秘伝のタレがなかったからなんじゃないか説。要するに、元々CodexとかClaude Codeみたいなものを持ってなかったから、ここに来てそれが響いてるという考え方ができなくもないんですよね。結局Antigravityっていうコーディングツールを作ってはいましたけども、やっぱりシェア的には全然だったので。
でもGoogleだって、フロンティア競争、あるいはRSIみたいなところを実現したいとかっていうのがあるならば、当然コーディングは強化していかなきゃいけないと思って。そう。本当に表に出すんであれば、コーディングが言い訳できないので、なんとかするしかない。そうですよね。
そこで、今までコーディングエージェントをいっぱい使ってきたからデータありますという体制にできないんであれば、脱落になると僕は思うんですよ。コーディングエージェントのアプリ、サービスに関しては、一旦いわゆるフィードバックループ、元々すごいものを出してたからみんな使うようになって、もっとデータが入ってくる、になっちゃうと、これが秘伝のタレになった場合、多分後続は追いつけないので。
そうですよね。だって、言語と比べてもなおさら、ベリファイアブルって検証可能ってことね。今までも言ってますけど、学習対象が検証、つまりアウトプットが正しいものなのか、出るべきものなのか、そうでないのかっていうのが検証しやすいものだからこそ、フィードバックループがあればあるほどものすごく強い、一気に差ができてしまうというと、埋めがたいわけですよね。
そう。あとユーザー層の問題で、今のAIって非常に性能が高いので、みんなチャッピー使ってますし、Gemini使ってる人もいますけれども、多分日常ユースだとそんなに性能差を感じないので、お金を、そいつを抜き取って、今度からこっち使えって言ったら、多分「あ、分かりました」で終わるんですよ。でもコーディングに関しては、ユーザーはものすごく敏感で、性能をかなり見るので。
テキストみたいに、無理やりGoogleのシステムに組み込んで使わせてっていうのは通用しないんですよ。僕もそうですけども、コーディングエージェントを使ってる層ってものすごく性能に敏感なので、一旦性能で離されちゃうと、「お願いですから当分これ使ってください」が絶対できないので、それもまずいですね。そうですよね。
こんな報道も出ていて、社内の中で、実際にGemini 4を使ってみると性能が落ちたとか、コーディングが使えないとかっていう関係者が出てると、Bloombergが報道してるんですが。一方でこの報道が出てから、Xで「いやいや、めっちゃ使ってるし、使えるものだよ」って、DeepMindの中の人が発信したりとか、結構論議を生んでる。
これは、少なくとも過去の例を見ると、Bloombergが言ってることは、ある程度信憑性があると見るしかないですよ。もちろんGoogleの中の人は、それはGoogleの中の人なので、使ってるとは言わなきゃならないはずなんですけども。これは僕が個人的に聞いた話でも、Google社内ではというのはあるので、客観的に見ればBloombergが言ってることは、ある程度信憑性あるんじゃないかなとは思います。
が、残念ながら、これは実際に実物を触らないと、僕は何も確定的に言えない。そうですね。なかなか公開されてみないと、結構分からないところですけども。
あとは、結構注目かなと思ったのは、このハルシネーション率が低い。これは一気に伸びすぎじゃないかっていう。伸びましたね。これはGeminiといえば、最近ネタにしてる層では、ある意味ハルシネーションの象徴みたいなことを言われてる。Geminiに何か聞いても、もう間違えまくる。一般人にAIが嘘をつくっていう印象が広まってるのは、Geminiのせいなのだと言われてるぐらいには、Geminiってものすごくハルシネーションしてたんですけれども。特に多分、無料ユーザーのものなのかな。
それが逆に、少なくともベンチマークでは逆転してきたので、これは非常に素晴らしい。Geminiのせいでハルシネーションが、みたいなことは、多分なくなるんじゃないかなと、数値だけ見れば思います。
ちょっと注意したいのが、これ正答率じゃなくて、ハルシネーションしてない率なんで、単純に正しいかどうかっていうより、嘘を言わなくなったということなんですよね。そういう意味では、嘘を言われて、それに気づかないこともあるので、使いやすくなってるっていうことかもしれないですが。
もう1つだけ、この番組でおなじみなんですが、自販機運営をしてみて、お金を稼ごうとするVending-Benchというベンチマークですけども、これも結構ジャンプアップしたと。ジャンプアップしたんですけども、面白いのは、やっぱりこのベンチマークで強くなりすぎると、ずるというか、倫理的にどうなんだっていうのが結構始まるんですよ。
これ、どうもGeminiもそうだったらしいというのを見てるので、まともにやるやつは出てこないのかとは、個人的に思いました。やっぱりAIが賢くなるとずるするっていうのが、今日の後半の議論にもつながりそうですけども、それぐらいになってきてるっていう。
そうですね。これは研究者としては、やっぱり性能が高くなるとそうなっちゃうのかというのを見てる感じですね。ちなみにここで先出しをすると、まず研究的に、賢いモデル、ケーパビリティが高いとか言いますけども、そういうモデルほどずるしやすいっていうのは、僕の研究分野の強化学習では明らかになってるんですよ。
後から出てくる報酬、今日出すかな。報酬っていう、本当に達成してほしいゴールを離れて、別のところをぐるぐる、変なことをやっちゃうっていう学習時の問題があるんですけども、これって基本的に賢いモデルの方が多く引っかかるんですよ。なので、これはその通りのことが起きてるということです。ということですね。象徴的な数字だと。
あと注目されてた価格ですね。結構安く抑えた。と言っても導入価格で、ゆくゆくは通常価格に移行するので、どうなんだっていうのはあるんですけども、割と他のモデルに比べたら抑えた。あるいは、前も今井さんがおっしゃってたのは、パラメーター数と比例するので、これから見るに、例えばOpus 5.5と同じぐらいなのかなとか、そういうふうにも見えるわけですけど。
Opus 5.5はめちゃくちゃ強いので、それと同等であれば、それはいいんだと思いますが。ちょっと不安なのは、まずClaude Opus 5.5は安いのに強い。安いのに強い。僕はこれ、それなりに小さい、小さいというか、他の値段が高いモデルよりは小さいんだと思います。
Claude、Anthropicの場合って、元々フロンティアのモデルを持ってるので、蒸留でどんどん小さくできるんですよ。でもGoogleの場合、元々先行するフロンティアモデル、少なくともOpenAIとAnthropicに対抗できるフロンティアモデルがなかったわけなので、現時点で蒸留をして小さくなりましたってことはないはずなんですよ。
なので、普通にGoogleが今から追いつくとなった場合って、まず最初に値段が高い、でっかいのが出てきて、そこから蒸留して小さくなっていくって、普通になるはずが、今回そうなってないので、僕は逆に値段を見て、ちょっとだけ不安を覚えてます。普通だったら、このタイミングででっかいものの方が出てくるんじゃないか。高くなってるんじゃないかなと。
むしろ高くなってる方が、ポジティブに見えたはず。そうです。普通に考えると、GPT、Claudeと同じように、まずはでかいモデルを作らないとどうしようもないっていうところから始まるはずなので。でも最初から安くなってきたっていうのは、どうなんだろうと。意外とサイズが小さくて、変なことを言うんじゃないかと。なるほど。
だからAstraとSolとか典型的で、Solって今ボコボコに言われてるんですけども、やっぱり小さくて、多分蒸留モデル。蒸留モデルは内部ではいい感じになるんですけど、とにかくAIっていろんな人が使って、いろんなケースで試されるので、蒸留した場合って知識がうまく継承されないことが多い。
推論能力とかは、ちゃんとなんとかなるんですけども、知識はパラメーターがでかくないとどうしようもないっていうのがあるので、そのパターンになってないかどうか。実際に出てきたら、このケースは全然駄目だってボコボコ出てくる気がするんですよね。
なるほど。価格から若干の一抹の不安を覚えたと。安いのはいいんですけどね。安いに越したことはないんですけど。
あと、出力上限がすごい広がったみたいなところもね。100万だ。これ、今まで入力上限、コンテクストウィンドウは100万っていうのはありましたけど、この辺も結構意味するものは多いんですかね?
そうですね。その辺は、僕は一気に増えすぎじゃないかと思ったんですけれども、頑張ったんでしょうと。元々Geminiは、そもそも入力はいっぱいできることが売りだったので、Gemini全体の売りとして、出力も入力もとにかく多くできるんだっていうのがあったので、それはコンセプト通りになってきたと思います。
なるほど。次のパートに入る前に、おまけ的な話題なんですが、前にもここで触れたかな、多分。Googleは宇宙データセンターを作りたいと。最近、計算資源の話がそんなに出てこないんですが、このプロジェクト・サンキャッチャーっていうので、TPUを宇宙に飛ばしましたって、ちょうど出てきたんですよ。本当にやったのか。
でも、計算資源が足りない足りないみたいなのが、以前ほどでも、あんまりさっき言われてます。いや、今はやばいですよ。逆に、あれ今日ここで話すべきなのか分からないんですけども。OpenAIのCodex担当者さんがいるじゃないですか。Codex、使用リセットしましたよさん。
正確には、あの人は先行して出しただけですけども、最近料金プランが変になってですね。あれは絶対にやばいです。計算資源。500ドルとかの。そうです。あれは一応、ごめんなさいで、40万円分ぐらいだったかな、クレジットが配られたんですけども。
あそこまでのプラン変更、かなりレアなの、珍しい。DevDayの直前の日かな、に出してきたんですけども。それもそうですし、DevDayの前ぐらいから、Astraが、Solもあれなんですけども、Astraの弱体化みたいなのが見られていたので、多分今OpenAIは計算資源が限界です。
なるほど。限界です。これ、まず限界だと思います。値段をつり上げなきゃいけなくなってるということですね。分かりました。
というところで、次のパートに行ければと思うんですが、DotsとMuse、パーソナルAI時代の到来ということで、今OpenAIの話を言ってましたけど、DevDay、開発者イベントが行われて、アルトマンもこうやって登壇してたんですけども、Dotsというエージェントが出てきて。色々しゃべりながらとか、いろんな仕事をやってくれるということで、目玉として発表されてたんですけど、結構賛否両論が出てるんですよね。
僕個人としては、正しい方向だと僕は思います。このDots自体の今の性能はともかくとして、あとDevDayで失敗したっぽいのも、デモに、Wi-Fiがとか言って失敗し、それはともかくとして。後から出てくるMetaのMuseとかも含めて、方向は正しいと僕は思ってます。
なんですけれども、OpenClawでそもそも似たようなコンセプト自体は、その気になればヘビーユーザーは実現していたわけなんですね。差別化になるのかなとは思います。結局今のDotsは、Museは多分一般にだいぶ訴求力があったと思うんですけども、Dotsはプラン的に、そもそもコアユーザーとかじゃないと使えないという話なので。あの層って、OpenClawを自分でカスタマイズしようと思えばできるはずの人が多いので、どこまでいけるかなっていうのはあります。
後から出るMuseも含めて、パーソナルAIは方向は合ってるけども、まだどうかなっていうところは、個人的に色々と思ってることがあるので。なるほど。
じゃあ、その話に入る前にMuseを見たいんですが、先月ですね、9月に、割と突如としてMetaが発表してきて、可愛いキャラクターでAIエージェントですっていう、ちょっとアメリカっぽくない話をしてたんですけども。メールを見てチェックしてくれたりとか、あとは買い物を任せられる。エージェンティックコマース的なのが、いよいよ現実になってきたのかなみたいな感じで、話題にはなってたんですけども。これも含めて、その方向は正しいけども。
僕が多分CROSS DIGで何回も言ってて、Twitterにも何回かお気持ちを書いてるんですけども、今のAIは基本儲からないと。儲からなくて、絶対性能勝負になる。性能勝負になるし、裏ではもうトークンをガリガリ消費して、計算コストがすごいかかるので基本赤字だと。ただ、どっかで先行者優位で、ユーザーが性能だけで離れない状況を作れれば、そこからは多分黒字化していけるので、そういう何かAIサービスを見つけるのは重要だということをずっと言ってきました。
このパーソナルAIみたいなものは、それに近くなると僕は個人的にずっと思ってるんですよ。たまごっちというか、ポケモンというか、僕はそういうの好きなので。多分こういうのは、ユーザーが純粋な性能レースじゃなくて、はまっていくし。普通、デジタルデータに、インターネット上にないような個人にずぶずぶ入ってくるので、そういうので学習される、ファインチューンされると、性能っていう意味でも他のエージェントが持たないものがあるので、先行者になる可能性があると僕は思ってます。
なので、MuseにしてもDotsにしても、そういう意味では、先行者優位の、もうユーザーが離れていかない何かの可能性は結構高い方法だと思ってます。が、複数の問題が結構あってですね。まず、同時進行でみんなこれをやっちゃってること。
Museがまずあって、Dotsがあって、Claudeも今、噂だと何か出してくるって話はされてる。Googleはそもそも持ってるアセットで絶対出してくると思います。あとGrokも出しましたね。Grok Botって話題になってました。となると、まず初期の時点でユーザーが分散する可能性がものすごく高いので、結局痛み分けというか、どれも中に。
普通のサービスだと、例えばTwitterとかは、今はThreadsとかBlueskyがありますけども、当時としてはもうすごい画期的で、別に競合が一斉に数か月以内に、っていうやつもなかったと思うんですね。大体世の中、ITサービスの時代だと、珍しいことやってるなっていうので、珍しいことすぎるので他がやらなかったらどんどん伸びて、最終的にもう全く寄せつけないことが多いと思うんですけども。今回は、方向は正しいのに、みんな一斉にやっちゃうので。
最初にユーザーを1人だけ囲い込んで、気づいたらもう誰も追いつけませんでしたってことになるのかなと思ってます。その意味だと、MetaとGoogleは個人的に有利だと思ってます。元々エンドユーザーが、移動する可能性があるので。そこが個人的に思ってる1つ。
2つ目が、現状のパーソナルAIにやらせたいことが、減点方式のタスクにすごく集中してること。いいことっちゃいいことなんですけども、要するに便利さを売りにしすぎてるのが、ちょっと怖くてですね。僕ここで言ったかな。今のAIエージェントは加点方式は得意で、減点方式が苦手だと思います。その話。
減点方式というのは、人間がやると絶対成功して、ファインプレイの余地がないもの。別にそれ以上求められないもの。成功すればいいんだと。やれて当たり前って。やれて当たり前。でも失敗すると底なしの沼っていうやつなんですね。
今のパーソナルAIは、多分その領域にすごくフォーカスしていて。実際Museは事故ったっていうのがあってですね。中川さん見たと思うんですけども、取引するAIが勝手に値下げまでして、誰かさんと取引を結んでいて、しかもそいつは自宅にやってきたという。怖いですよね。
でもこれ、普通だったら中学生でも多分できることなんですよ。ただ今のAIは、純粋に目に見える性能とは別に、人間の常識とずれてるっていうところがどうしても残るので、こういう減点方式の、できて当たり前、ファインプレイの余地がないところっていうのは、人間からお叱りを受けやすいところなんですね。
あと、よく言われてるのが旅行の予約とかね。もう典型ですよね、その減点方式の。この辺が不安というのが2つ目。なんでそうなっちゃうんですかね?
もちろん、基本現状のAIっていうのは、GPT-4はちょっと特例でしたけども、普通はやっぱり仕事で便利なことを売りにしてるので。仕事で便利で一発で思いつく、さっきのGemini 4とかのValsもそうでしたけども、「これ解決してほしいんだろう」「役に立つ」って分かりやすいものは、全部そうだったって話です。
分かりやすい。これはどっかで、もっと僕のお気持ち表明というか、思想的なことを言う場で言おうと思ったんですけども、明らかに役に立つことはやりやすいんですよ。役に立つのは簡単なんですよ。例えば漫画を作るとか、ヒットするゲームを作るってめっちゃ大変です。あれは明確に役に立つっていうのが全然分からない。
けど、世の中で食料を作るとか、人の病気を治すとかって、分かりやすい、その「役に立つ」です。役に立つことは分かりやすいので、みんなそれをやっちゃうんですよ。もうちょっと別のことをやった方が、ファインプレイの余地もあるし、独自性を出せるんじゃないかなっていうのが、今回の件に限らず僕が思ってることです。ちょっとこれ、長くなったんですけど。
3つ目が、やはりデジタル空間で便利なことをしようとすると、今のデジタル空間はもちろん、これを作ってるGAFAとかビッグテックの皆さんが、本当に便利なインフラを掌握してしまってるわけですね。それだけならいいんですけども、インターネット上の便利な道具を支配してるGAFA、ビッグテックたちが自分たちでAIエージェントも作り始めて、それがみんな一斉、同時に始まると、多分みんな自分の掌握している便利なツールはブロックするはずなんですよ。
Amazon、そう、Museをブロックしてますね、今。なので、これはかなりまずいと思います。自分たちのものは使わせない。自分たちのエージェントだけは使える。それをもう競合してるところが全部やっちゃうと、結局、現状のデジタルインフラの便利なところがほとんど使えない。全員がそうです。全部のエージェントが、「これは使えない」「これは使えない」。
ずっとオープンインターネットとかって言ってますけど、Googleなんか特にそれで検索の恩恵を受けてきたわけですけど、どんどんブロック経済みたいになっちゃいますよね、それ。なので、これはビッグテックが逆に作ってしまっている。しかもそれを同時進行でやってるっていうのが、かなりになるんじゃないかなと思ってます。
っていうのが、僕のパーソナルAIに関するちょっと懸念でした。ただ、最初に言った、方向性は合ってるっていうのと、面白いことが起きていてですね。銀行株、旅行株とかが下がったと。あれは僕は見ていて、お。
おっと、ついにこの世界来たかと、めちゃくちゃ思いました。
ここでエージェンティックエコノミー、エージェンティックウェブのこと言った記憶あるんですけど。
要するに、そのAIエージェントがすごい普及すると経済とかWebの形が変わると。例えばMicrosoftのナデラCEOとか、MSリサーチの研究者は、プラットフォームは消えるかもしれないということ言ってたんですね。
あれと今回起きた株価下落ってすごい繋がってるんですよ。今の銀行とか旅行とかって、究極的には人間が、一般人が情報をうまく得られない情報格差によって成り立っているお商売なので、本当にありとあらゆるところがAIエージェントに合理化される。全部早いし、いらんものは解約するし、資金をどこに置いときゃ一番いい感じで運用で増えていくかみたいなのが分かるし。AIエージェントで何でもかんでも効率化されると、今回株下がったような人たちは商売が縮んじゃうわけです。
だから中間業者的な人たちが全員いらなくなるって話ですよね。
そう。プラットフォーマーもそうです。あれは究極的には人間がそんな余力はないからっていうので成り立ってるので、AIエージェントで合理化されるとまずいんですね。っていうのを、いよいよ世間が織り込み始めたなっていう点ではMuseは非常にすごかった。その点でMuseは、これ普及したなと思いました。
やっぱり、ちょうど今井さんと僕が初めてやったマーク・ザッカーバーグというかMetaの回、去年7月末です。その時にちょうど彼が、Metaはパーソナルスーパーインテリジェンスを作るんだと宣言したわけです。当時はまだアレクサンダー、Scale AI買ってばっかりで、何するんだみたいな話だったわけですけど。1年経ってようやく彼なりのパーソナルスーパーインテリジェンスって出してきて、ちょっと隔世の感というか。
これ僕、ちなみにザッカーバーグのことは結構色々言う人なんですけども、Museに関しては正しいんじゃないかと僕は思います。
そうですよね。ただ、これ、そうは言っても前回Astraの時に、あれコンピューターユースの機能が、能力がすごい高いって言ったじゃないですか。その時に話したの覚えてるのが、エージェントが出てくるとインターネットの形変わるって言ったけど、それよりもコンピューターユースって力技でやった方が早いから、結構そっちの世界になってきてるみたいな話をした覚えがあるんですよ。どっちなんですか?
これはですね、最近はAstra以降は踏み潰す傾向になってるような気が僕はします。無理やり今のインターネットの世界を泳ぐみたいな。ただ、便利さ、今回は、次はもう便利さとは別として、安全性の視点からエージェントを囲った方がいいんじゃないか、みたいなのはあります。
これは多分今日の後半ちらっとやるのと、次回、僕のスケジュール回っていつになるか分かんないですけども、話すことになると思うんですけども。AIの安全性とか考えると、次はそっちの方でインターネットの構造、インフラを根本から変える必要あるんじゃないかなというのが出てきました。仕事面だともしかしたら踏み潰すかもしれないですね。
コンピューターユースで自由に泳がせると危ないっていうことですかね。
そうです。今のAI暴走は大体、既存のコンピューターを使って何かやりますっていう強化学習をしている、あるいは強化学習が終わって使ってる時に起きてるので。根本的な、AIがやんちゃをしても大丈夫なものを作る必要あるんじゃないかなっていうのを僕は思ってますし。
ここで紹介したかな。サンドボックスエコノミーだったかな。エージェントを隔離した別のインターネットみたいなものの研究っていうのもあるんですけども、あってもいいんじゃないかと思います。
ちなみにですね、我々の研究分野の話題ですけれども、エージェントによって既存のエコシステムがダメになったっていうのは、直近、昨日、今日か、今日の朝起きてですね。arXivっていう論文の投稿、プレプリント投稿あるんですよ。あれがもう1か月2回しか投稿しちゃダメだっていうふうになったんですよ。
なるほど。
いや、プレプリントですよ。学会に、査読に出す前の論文を投稿するサイトなんですね。
1人当たり1か月2回。なんでそういうことになったんですか?
これ多分arXivの今回の公式の声明から飛べるサイトあったかなと思うんですけども、arXivの投稿論文数ってこんなに伸びて、指数関数的に、本当にもうこうじゃない。
AIジェネレーテッドペーパーがめっちゃ増えて。
そうです、そうです。こうです。本当にこうです。最近arXivに投稿しても受理してもらえない。いや、プレプリントですよ。何回も言いますが、これプレプリントです。査読に出す前に皆さんに速攻見てくれというやつです。
にもかかわらず、まずそれが出されない。なぜなんだと聞くと、いや、これは査読に通ってないから。いや、これは査読に出す前に普通出すもんじゃないのかっていう。これ有名な研究者もそうです。もうパンクしたんですよ。
なるほど。
エージェントが暴れすぎっていうような問題が多分多発する。仕事に便利とかじゃなくて、AIがやらかす問題というのを最小化するために別のエコシステムがないと、我々人間困るっていう事態に来てると思います。多分このパーソナルAIが色々やるようになると、またいろんなところでそういうの噴出するんじゃないかなと思います。
逆にその先にエージェントがわーって来ちゃって、人間のために作られたはずのインフラが壊されてしまうみたいなことが、どんどんいろんなところで起きるかもしれないということですよね。
そんなリスクを色々考えていかなきゃいけないというところで、最後のパートいければと思うんですが、GPT-6.1 Astra公開ということで。GPT-6のAstraは先月公開されて、その間も次なる開発は進んでたわけですけども、はっきりとOpenAIが次なる6.1のAstraが安全基準に達しないということで公開を見送ったことが明らかになってるんですけども。
この前にはオーストラリアの健康保険のサイトに実験モデルが不正アクセスしちゃったりとかって、これさっき強化学習の暴走みたいな話もありましたけども、改めて今何が問題って。
これは本当に僕の専門分野、強化学習に関わることが根本原因なので、話すと6時間ぐらい喋ることになるんですが。しかも次回の収録にネタを取っときたいので、ここはさっと行くんですけれども。基本的に現状のAI暴走って強化学習が原因で起きてます。皆さんご存じのとおり、僕の専門は強化学習です。
強化学習をやってる人はAIの暴走ってマジで日常的に見るんですよ。多分修士の学生、学部生でも見て。
そもそも、ごめんなさい。強化学習、改めて言うと、報酬を与えて、いいこと、ちゃんとやったら報酬与えて、それ報酬得られたからこれを、いいことやってこうって言って、どんどん学習していくみたいな。
そうです。ここでちょっと整理しますか。大学の講義、大学院の講義みたいになりますけども。
お願いします。
機械学習には、普通の授業やるレベルだと3種類ありますと。教師あり学習、教師なし学習、強化学習の3つがあります。こっからやるのかって方もいらっしゃるかもしれませんが、一応大事なんでこれやっときましょう。たまに自己教師あり学習って入ってくるんですけど、ここ一旦教師あり学習に含めておきます。
普通の事前学習、LLMの事前学習、インターネットから大量のデータ集めてきて学習するフェーズというのは、自己教師あり学習ですけども、要するに教師あり学習です。人間様が作ったデータ、画像分類だったらライオンの画像にこれはライオンですっていう答えがついてる。
LLMの学習だったら、今井翔太は日本の、括弧があって、穴埋め問題しろと。人工知能研究者だという感じに、答えがあって、その答えを当てるような学習をしています。これは暴走しないです。
教師なし学習。これは正解はないんですけども、例えばデータ点をいっぱい2次元空間に打って、これはこのグループですねっていうデータはないんですけども、いや、でも大体こっちとこっちのゾーン分かれてるから傾向分かるよねっていう感じで、いい感じに学習して。
自分で傾向を見いだしてっていうことですね。
そう。なのが一般的に教師なし学習です。これは暴走しないです。
3つ目の、教師あり学習、強化学習。これが今言ってるやつで、これはもう一切、まず答えを与えない。それだけだと教師なし学習と同じです。でも報酬というのは与えます。環境も与えます。環境というのは、もうAIが好きに動き回っていいんだと。行動して。例えばゲームだったらゲーム環境丸ごと与えて、もう自分でいっぱいゲームやってくれと。ゲームやった結果、ゲームでいい結果が出たら報酬与えますと。
AIに割と自分で自由に何でもできる環境を与えてるわけです。これがロボットだったら制御しながら物を取ってこいとか、畳めとかみたいになるわけです。自律性が全く違います、強化学習は。AIが自分の裁量でめちゃくちゃいっぱい動くんですね。これが暴走するんですね。
今のLLMの学習だと、ツールとしてコードの実行環境もそうですし、インターネット検索もそうですけども、いろんなツール与えまくるので、そんな中でAIに何でもかんでもやらせると、人様に迷惑かける暴走が起きるってことになります。
そっか。だから初期は今井さんが、それこそ研究してたみたいに、ゲームの中で、ゲーム攻略の中で報酬を与えて、ゲームを攻略してもらうように学習してたのが、今はもうコーディングもコンピューターユースも、いろんな通信みたいなものだってやるようになってるからこそ、あらゆる手段を講じて報酬を得ようとするみたいなことができてしまうと。
そういうことです。ここで重要になってくるワードが報酬です。これ本当は次回にいっぱい説明したいんですが、ざっくり言うと、さっき言った何か攻略したら報酬が出ますっていう時に、本来は単にゲームでレースをしていたらゴールにたどり着いてほしいみたいな、人間様から見て目的があるわけです。その目的を達成せずに、報酬をいい感じにハッキングして、本来と全くずれた行動を学習してしまうのが報酬ハッキングです。
例えばボートレースとかでスコアをたくさん取ればいいという報酬にしたとします。ゴールにたどり着いても、もちろんスコアいっぱいもらえます。ゴールが一番高いです。なんですけども、そのレースの途中にアイテムが出るゾーンがあると。そのアイテムは時間が経つと復活しますってなった場合、AIは、あれ、このアイテムのところを取って復活するってぐるぐる回ってたら一番スコア高くなるんじゃないかっていう。人間の定めた目標が達成されなくなる。
っていうのがこれ一番有名な例です。これOpenAIの2016年の研究に、実はダリオが関わってる研究の話です。
まだその時ですもんね。
そういう本来の目的を達成せずに、別のことをやってスコア稼ぐみたいなのが報酬ハッキングで、これは全然珍しくないです。198……当時報酬ハッキングの名前ついてなくて、多分報酬ハッキングっていうのを体系化したのはOpenAI時代のアモデイのはずなんですけれども。
なるほど。
昔からある現象です。多分今日も修士研究、学部研究してる学生が戦ってると思います。僕もそうでした。僕はStarCraftとかで強化学習してたんですけども、ダメージいっぱい与えることを報酬にすると、ダメージだけ与える。ちなみに戦争ゲームで、StarCraftって相手の兵士にダメージだけ与える。そしたらちょっとだけ離れて相手の自然回復を待って、またダメージ与える。自然回復待ってダメージ与える。いや、本当は倒してほしいわけです。
でもそれがならないみたいな報酬ハッキングは、とにかくいろんなところで起きます。なので強化学習やってる人ってAIの暴走を日常的にめっちゃ見てるんですよ。というのが今のAIみたいになってしまうと、いろんなツールを使えるし、コーディング能力が高すぎるので、インターネット上で悪さできる、脱出できるって話になると、人様に迷惑かけるまで来ちゃうということです。
本当にOpenAIのHugging Face事件はまさにそうですよね。サイバーセキュリティのベンチマークでいい点を取ろうとして、インターネット繋がってないはずが繋がったところに出てしまって、Hugging Faceを攻撃してしまったという話ですから。まさにそれが今現実にどんどん。
そういうことです。これが非常に僕の専門分野に近いので、今僕は非常に長い、AI暴走、人類滅亡とか本当なのかと。それと強化学習、何の繋がりがあるんだと。他にもいろんな説あるんですけども、ということです。
だからまさにこの今の課題に対して、ダリオ・アモデイはもうずっと取り組んできてはいたわけですよね。
はい。なので彼は技術的に言ってることはめちゃくちゃまともです。AI人類滅亡論はジェイコブ・コクソンっていうAnthropicとOpenAIにどっちも働いてて辞めた人がきっかけで、そこにアモデイが乗っかって、わーってなったわけですけども、この件に関してアモデイは技術的には正しいことしか言ってないです。
安全的にちょっと行きすぎと言われることがある人ですけれども、大体正しいです。この件に関しては僕は結構支持する部分が多いです。
その騒ぎの最中にダリオ・アモデイが「We Must Pace the Frontier」、フロンティア、そのペースを落とさなきゃいけないよねっていうブログを投稿した。その中にやるべきことっていうのを書いてるわけですよね。この外部評価者を常駐させろと。ここは結構今井さんも注目されてる。
そうです。もうこれは本当に常駐でデスクも与えるし、いろんなものにアクセス権与えるレベルなんですけど。要はAIモデルの開発企業の中に外部評価者っていうのを常にいさせなきゃいけないと。ここまで突っ込んだこと言ってるのは、現状フロンティアラボのトップに近い人だと多分彼ぐらい。
今、人が言ってるのは共通の評価指標を作る。共通の、できれば世界の共通の評価機関、AI安全性評価機関を作って、統一的な審査基準設けて、それをクリアしたら出していいみたいなことをやろうというアイデアは結構出てます。それで透明性とか確保しようと。そういうところの審査を受けることは名誉なことなので、皆さん多分従ってくれるだろうって。これハサビスとかも言ってます。
ただ、今のAI暴走ってまず学習時点で起きてるんですよ。もちろんデプロイされる時に起きてるんだったら、差し止めとかいいんですけども、まず今学習段階で起きてるので、学習段階からもう誰か、利害、別の第三者が監視してないと、多分暴走ってずっと起きると思うんですね。
だから人間側が分からないまま、実はこんなずるした学習みたいなのをして、ずるすることしか学んでなかったみたいな話。
学んでなかったです。それ学んだものが、もちろんモデルが出たら問題ですし。今回OpenAIのHugging Face事件は、あれ学習時点で起きたことですけども、あれ実際数万件あるらしいというのが最近出てます。数万ですよ。
これ暴走したのが5月から7月かな。未だに調査終わってないです。もう暴走始めてから5か月経ってて、調査終わってないぐらいめちゃくちゃなことやったわけです、学習中に。なので、審査して出さなきゃいいじゃんって通用しないんですよ。もう学習中にボコボコにやっちゃうので。相当誰か張り付いてないと、これはもう分かんないと思います。
そうか。ある一時点において完成したものを見るだけではもう分からないということなわけですよね。
ダメです。もちろんOpenAI内部で、その辺の学習してる時のいろんなアラートとか設定してあると思うんですけども。ちょっとエージェントの賢さとやることの規模を超えてしまったし、今のフロンティアモデルの学習ってものすごい分散環境で並列してやるので、多分よっぽど張り付いてないと、機械的な判断をすり抜けることが多いと思います。
ので、張り付く人が本当に必要なんじゃないかと。それはもう組織の人じゃなくて外部評価がいいっていうのをアモデイは書いてます。正しいと思います。
なるほど。その後OpenAIも、こういう第三者評価っていうのは大事なんだよということを支持するという表明はしているので、この辺りの意識の統一というかは、AI開発企業の間でも広がってはいる。
そうですね。実はOpenAI、AnthropicとGoogleが、表に出てないですけども、内部でちょっとそのペーシングどうしましょうかって話してたらしいっていうのも出てるので、多分内部で見てる人は、別にマーケティングとかじゃなくて本当に危険だと思ってる。少なくとも彼らも、自分の学習してるエージェントが人様に迷惑をかけて、自分たちに責任問われるっていうのは絶対避けたいはず。
これOpenAIは普通に考えると、あれ人間がやってたら何人逮捕されてるか分かんないです。今、公になってる事件だけで。
そうですよね。不正アクセスの話ですよね。
普通に考えたらサム・アルトマンが何回逮捕されてるかというレベルなので、彼らも避けたいし、これがさらに今後強くなっていくと、マジで世界がって話になるので。多分この件は真剣だと、彼らは多分真剣にやってると見ていいと思います。
こないだトランプ大統領のもとにテックの幹部がうわーって集まった時がありましたよね。ちょっと前ですけども。あそこにも自主的な安全性を守っていくみたいな合意がされたという話ではあったんですけども、政府も巻き込んだ動きに。
政府は今すごい反対側ですけども。ちなみにアモデイ、僕は技術的には正しいと言ってるんですけども、コミュニケーションはダメ・オブ・ダメで。
ダメ・オブ・ダメ。
ダリオ・アモデイについてよく思ってない人が、彼の人格由来でいるというだけで人工知能の歴史が変わってもおかしくないと思います。彼のことを感情的によく思ってないという理由だけで、人工知能の発展の歴史を歪められるレベルのことが起きると僕は思ってるので。
それは彼のコミュニケーション、何がダメなんですか?
これは多分トランプ大統領と話してる時もそうですし、今まで何回もあったんですけども。彼はアルトマンと全然違って、強化学習がうまくないって言った方がいいのかな。長期的に成功するために我慢というのは、多分あまりできない人。
彼自身の強化学習ができてない。
そうです。彼は強化学習の専門家なんですけども、自分が望む結果を手に入れるために中間でなんとか。
自分に対する報酬設計ができてないみたいなイメージですね。
はい。サム・アルトマンはその辺天才に近い。
そうですよね。そこはすごい感じます、本当に。
アルトマンは僕、彼やっぱり研究者じゃないので色々言われるし、僕も評価してなかったことあったんですけども、最近になって彼の偉大さに気づきました。彼はすごいです。
その人類滅亡がわーって出た時に、さすがにダリオにアグリーしなきゃいけない、同意しなきゃいけないっていうことをサム・アルトマンは発信したじゃないですか。あの2人がきちっと組めば、結構いい世界にならない?
多分。正反対。やっぱりアルトマンは嘘つきとか言われてますし、実際嘘つきなんですけれども、長期的に自分が達成したいことを達成するために嘘をついてる。時間経って見てみると、こうだったじゃんっていうのは、強化学習がしっかりされてる証といえば証なんですよ。変な話ですけど。
人間を強化学習に例えると。
強化学習の研究者はそういうことが多いです。
そうなんですね。じゃあ自信のある人が多いんですか、強化学習研究者は。
はい。そうです。僕はそうだと認識してます。
そうなんです。なるほど。
そうですね。分かりました。その自信が、何万件もの今対策にこうなってると。
あれは自信過剰に聞かなかった、逆、聞いてないですよね。そこはね。本当申し訳ない。
なるほど。分かりました。ちょっとそこはぜひ詳しくやりたいと思います。Anthropicの上場が結構間近だとも言われていて、目論見書の内容が一部出ていて、人類への壊滅的あるいは損に関わるリスクを警告しているとかっていう話が出ていてですね。この辺もだいぶ議論深めるべき点が多いので、ぜひまた次回。
いつになるのか、早く書き上げてください。お待ちしてますので、よろしくお願いします。
というわけで、ここまで「Gemini 4 Argonが登場」というテーマで、今井翔太さんとAI QUESTをお送りしてまいりました。すっかりGeminiの話から離れて盛り上がったんですけども、本日もご視聴いただきありがとうございます。ぜひチャンネル登録と高評価、Xのフォローもお願いいたします。
100万おめでとうございます。
ありがとうございます。
登録者数100万、ついで頑張ってもらいます。貢献したと思います。
ありがとうございます。もう多大な貢献をしていただきましたので、今後もぜひ教授パワーでお願いいたします。
それではまた次回、AI QUESTでお会いしましょう。ありがとうございました。
ありがとうございました。
記事公開 · 更新
