何をスケールしているのか:継続学習なしにAGIは来ないというドワルケシュの見立て

YouTubeで開く ↗
概要

この動画は、ドワルケシュが自身のブログ(dwarkesh.com)で公開したエッセイの朗読である。中心の問いは、AI研究所が今スケールさせているものが本当にAGI(汎用人工知能)につながるのか、という点にある。話者は、AGIの実現は非常に近いと予想する人々が、同時に「検証可能な報酬に基づく強化学習(RL)」にも強気であることを矛盾だと考える。話者自身は、人間のように仕事の中で学び続ける「継続学習」が決定的に欠けていると見ており、実際の脳のような知能は今後10年か20年のうちに現れると予想している。

12分で読めます

強化学習でスキルを事前に組み込むことの矛盾

話者はまず、各研究所がモデルの訓練段階でさまざまなスキルを組み込もうとしている現状を取り上げる。ウェブブラウザの操作や、Excelでの財務モデル構築を教える強化学習環境を作る企業が集まり、一種のサプライチェーンができているという。

話者の考えでは、結論は二つのどちらかになる。モデルがまもなく現場で自律的に学習できるようになり、こうした事前準備がすべて無意味になるか。そうならず、AGIはまだ近くないか。人間は、仕事で使う可能性のあるソフトウェアを一つずつ予行演習する特別な訓練段階を必要としない。本当に人間のような学習者に近づいているのなら、検証可能な結果に基づいて訓練するアプローチ全体が見当違いになる、というのが話者の主張である。

話者は、ベレン・ミリッジ(Beren Millidge)のブログ記事の一節を引用している。フロンティアモデルが各種ベンチマークで改善しているのを見るときには、規模の拡大や巧妙なML研究だけでなく、まさにその能力を狙った問題を作り、模範解答や推論を書く博士号保持者や医師などの専門家に支払われる何十億ドルもの費用についても考えるべきだ、という内容である。

ロボット工学に最も鮮明に表れる緊張

話者によれば、この緊張がいちばんはっきり見えるのはロボット工学である。話者は、ロボット工学の本質はハードウェアやデータではなくアルゴリズムの問題だと考える。人間は少し訓練すれば、今あるハードウェアを操作して役に立つ作業ができるようになる。人間のような学習者があれば、ロボット工学はほぼ解決済みの問題になるはずだという。ところが実際にはそういう学習者がないため、何千もの家庭に出向き、皿の片付けや洗濯物たたみを何百万回も練習させる必要が生じている、と話者は指摘する。

「自動化されたイリヤ」という反論への応答

今後5年以内に急激な進歩(テイクオフ)が起きると考える人々からは、次の反論があるという。超人的なAI研究者を作るためには面倒なRLをすべてやる必要があった。そして、自動化されたイリヤ(イリヤ・サツケバーを指すと思われる)の100万のコピーが、経験から頑健かつ効率的に学ぶ方法を見つけ出す、というものである。

話者はこれを「売るたびに赤字だが、数をこなせば取り戻せる」という古いジョークになぞらえる。子どもが持っているような基本的な学習能力もないシステムが、人類が半世紀以上悩んできたAGIのアルゴリズムを解き明かすという話であり、話者は極めて非現実的だと評価する。

さらに話者は、仮にこの見方を信じるとしても、研究所が検証可能な報酬による強化学習に取り組む理由の説明にはならないと述べる。イリヤを自動化するために、コンサルタントのパワーポイント作成スキルを組み込む必要はないからだ。話者の読みでは、研究所の行動は別の世界観を示している。モデルは今後も汎化や実地学習が苦手なままなので、経済的に役立ちそうなスキルを前もって組み込む必要がある、という世界観である。

「一度組み込む方が効率的」という反論と、企業固有のスキル

もう一つの反論は効率性に関するものだ。モデルが仕事の中でスキルを身につけられるとしても、ユーザーごと・企業ごとに何度も学ばせるより、訓練中に一度組み込む方がはるかに効率的だという。話者はこの点を一部認める。ブラウザやターミナルのような汎用ツールを流暢に扱えるようにすることは理にかなっているし、コピー間で知識を共有できることはAGIの大きな利点の一つでもある。

それでも話者は、多くの仕事に必要な、企業や状況に固有のスキルが過小評価されていると述べる。そして現状では、AIがそうしたスキルを頑健かつ効率的に身につける方法がない。

マクロファージの逸話:人間の労働者はなぜ価値があるのか

話者は、AI研究者と生物学者が同席した食事会でのやり取りを紹介する。長いタイムラインを予想するその生物学者に理由を尋ねると、最近の研究室での仕事の一部として、スライド上の点が本当にマクロファージなのか、マクロファージに似ているだけなのかを見分ける作業を挙げた。するとAI研究者は、画像分類は教科書どおりのディープラーニングの問題で、まさにモデルを訓練できる得意分野だと答えたという。

話者は、このやり取りに自分と「数年以内に変革的な経済的影響が起きる」と予想する人々との違いの核心があると考える。人間の労働者に価値があるのは、仕事の細かな一つひとつに面倒な訓練ループを組み込む必要がないからだ。ある研究室特有のスライドの作り方に合わせてマクロファージを識別する専用の学習パイプラインを作り、次の研究室特有の細かい作業のためにまた別の学習ループを作る。話者はこれを、正味で生産的ではないと評価する。

必要なのは、意味のあるフィードバックや自分で得た経験から学び、人間のように汎化できるAIだと話者は主張する。人は毎日、判断力や状況認識、実務で培ったスキルと文脈を必要とする多くの作業をこなしている。しかもその作業は人によって異なり、同じ人でも日によって変わる。あらかじめ決めたスキルを組み込むだけでは一つの仕事さえ自動化できず、すべての仕事の自動化は不可能だというのが話者の見方である。

本物のAGIは過小評価されている

一方で話者は、本物のAGIがどれほど強力になるかは、多くの人がむしろ過小評価していると考える。今の延長線上でしか考えていないため、サーバー上の何十億もの人間のような知能が、互いの学習をすべてコピーし統合できる状況を想像していないという。話者はこれを実際に期待しており、今後10年か20年のうちに実際の脳のような知能が現れると予想している。話者自身、これは「かなりぶっ飛んだ話」だと述べている。

「技術の普及には時間がかかる」は言い訳

AIが企業全体に広く導入されず、コーディング以外であまり価値を生んでいない理由として、「技術の普及には時間がかかる」という説明がよく持ち出される。話者はこれを言い訳だと考える。モデルには広い経済的価値を生むのに必要な能力がまだ足りない、という事実をごまかしているというのである。

話者の論拠はこうだ。モデルが本当にサーバー上の人間のような存在なら、驚くほど速く普及するはずだ。むしろ普通の人間の従業員よりずっと簡単に導入できる。数分でSlackやDriveの中身をすべて読み込み、ほかのAI従業員が持つスキルも即座に取り込める。また話者は、人間の採用市場は「レモン市場」に近いと指摘する。良い人材を事前に見分けるのは難しく、悪い人を雇ってしまうと大きなコストがかかる。検証済みのAGIモデルのインスタンスをもう一つ立ち上げるだけなら、この問題はない。そして企業は常に人を雇っている。これらの理由から、話者はAIの労働力を企業に広げる方が人を雇うよりはるかに簡単になると予想する。

話者はさらに、能力が本当にAGIの水準にあれば、人々はモデルが生み出すトークンに年間何兆ドルでも喜んで払うだろうと述べる。世界の知識労働者の賃金は合計で年間何十兆ドルにのぼる。研究所の収益がこの数字から遠く離れているのは、モデルが人間の知識労働者ほど有能ではないからだ、と話者は説明する。

ゴールポストの移動はある程度正当化される

これに対し、ついこの前まで「推論できるか」「常識はあるか」「単なるパターン認識ではないか」が問われていたのに、なぜ基準が「年間何十兆ドルの収益」に上がるのか、という疑問がありうる。話者は、AI推進派が懐疑派の「ゴールポストの移動」を批判するのは多くの場合もっともだと認める。過去10年のAIの進歩は過小評価されがちだからだ。

それでも話者は、ある程度のゴールポスト移動は正当だと主張する。2020年の時点でGemini 3を見せられたら、知識労働の半分は自動化できると確信しただろうと話者は言う。AGIへのボトルネックだと思われていたものは次々と解決され、一般的な理解力、少数例からの学習(few-shot学習)、推論能力を持つモデルがすでにある。それでもAGIはまだない。これを見て「知能や労働には以前考えていたよりずっと多くのものが含まれている」と考えるのは妥当だ、というのが話者の立場である。話者は、自分が以前AGIと定義していたものは多くの点ですでに超えられたが、モデル企業がAGIにふさわしい何兆ドルもの収益を上げていないことから、以前の定義が狭すぎたことがはっきりしたと述べる。

話者はこの状況が今後も続くと予想する。2030年には研究所が継続学習で大きく前進し、モデルは年間数千億ドルの収益を上げているだろう。しかしすべての知的労働が自動化されているわけではなく、そのとき自分は「多くの進歩はあったが、まだAGIではない。X、Y、Zの能力も必要だ」と言っているはずだという。話者のまとめでは、モデルは短いタイムラインを予想する人々のペースで印象的になっているが、実際に役立つようになるペースは長いタイムラインを予想する人々の見立てに近い。

RLのスケーリングには確立された傾向がない

ここで話者はタイトルの問いに戻る。事前学習では、何桁にもわたる計算規模で損失が改善するという、明確で一般的な傾向があった。ただしそれはべき乗則であり、指数関数的な成長に比べれば弱いものだと話者は付け加える。

話者が問題視するのは、宇宙の物理法則のように予測可能だった事前学習スケーリングの権威が、検証可能な報酬による強化学習についての楽観的な予測を正当化するために使われていることだ。RLには確立され公開された傾向がない。限られた公開データから読み取ろうとすると、結果はかなり悲観的になるという。例として話者はトビー・オード(Toby Ord)の投稿を挙げる。オードはOシリーズ(OpenAIのoシリーズモデル)のさまざまなベンチマークの結果をつなぎ合わせ、GPTの1世代分に相当する性能向上を得るには、RLの総計算量を100万倍程度に増やす必要があるという示唆を得たという。

次の改善の推進力は「継続学習」

AIが自分より賢い後継システムのコードを書く「ソフトウェアのみのシンギュラリティ」や、後継機の計算ハードウェアまで改善する「ソフトウェアとハードウェアを組み合わせたシンギュラリティ」については、多くの議論がされてきた。話者は、こうしたシナリオはどれも、AGIがさらに改善していく主な推進力になると自分が考える「継続学習」を見落としていると述べる。

話者の根拠は、人間が能力を高める方法である。それはほとんどが関連分野での経験から来ている。話者はベレン・ミリッジとの会話で出た案を紹介する。未来は、継続的に学習するエージェントたちがそれぞれ外に出て仕事をこなして価値を生み、学んだことをすべて一つの「ハイブマインド」モデルに持ち帰り、そのモデルが全エージェント分をまとめて蒸留(バッチ蒸留)する形になるかもしれない、というものだ。エージェント自体はかなり専門化しており、カーパシーが「認知コア」と呼んだものに加えて、配属先の仕事に関わる知識とスキルを持つ、と話者は描写する。

継続学習はインコンテキスト学習と同じく段階的に進む

話者は、継続学習の解決は一度きりの成果ではなく、インコンテキスト学習の進み方に近いと予想する。GPT-3は2020年の時点でインコンテキスト学習が非常に強力なことを示し、論文のタイトルも「言語モデルは少数ショット学習器である(Language Models are Few-Shot Learners)」だった。しかしGPT-3の登場でインコンテキスト学習が解決したわけではなく、理解度からコンテキスト長まで、今も多くの進歩が必要だと話者は言う。

継続学習にも同じような進み方を話者は予想している。来年には研究所が「継続学習」と呼ぶものを発表し、それは実際に継続学習への前進になるだろう。しかし人間並みの実地学習の解決には、さらに5年から10年かかるかもしれない。そのため話者は、最初に継続学習を実現したモデルが広く展開され高性能になっていく過程から、爆発的な進歩が一気に起きるとは予想していない。サティアがポッドキャストでこの可能性を問われて答えたように、継続学習が突然完全に解決されれば確かに「ゲームセット」だろう。だが話者はおそらくそうならないと見ている。

モデル企業間の競争は激しいままだろう

話者が予想する展開はこうだ。どこかの研究所が最初の手がかりをつかみ、その機能を使っているうちに実装の仕組みが明らかになり、他の研究所がすぐにそのブレークスルーを再現して少し改善する。話者は以前から、モデル企業間の競争はかなり激しいままだろうと考えてきた。

その根拠として話者は、チャットのユーザーエンゲージメントや合成データといった、いわゆる「フライホイール」が、これまで企業間の競争をほとんど和らげてこなかったことを挙げる。大手3社が毎月のように首位を入れ替え、他の競合も大きくは遅れていない。人材の引き抜きか、サンフランシスコでの噂話か、通常のリバースエンジニアリングか、何らかの力が働いて、単一の研究所が独走的な優位を得ることを妨げてきた、と話者は述べる。継続学習の進展もこの力学の中で起きるだろう、というのがエッセイの締めくくりである。