LLMは世界の知識を内部にどう刻んでいるのか:乾健太郎氏が語る内部機序研究の現在地

YouTubeで開く ↗
概要

MBZUAI(アブダビのムハンマド・ビン・ザイード人工知能大学)教授の乾健太郎氏は、国立情報学研究所のサイバーシンポジウムで「LLMは何をどのように記憶しているか」と題して講演した。乾氏は3年前に東北大学からMBZUAIへ移り、東北大学などにも籍を残しながら3拠点で自然言語処理の研究を進めている。講演では、LLMの内部で知識がどのような構造として表現されているかについて研究がどこまで進んでいるかを紹介した。乾氏の立場は、内部に規則的な知識表現が見つかりつつある一方で、それを読み取れることと、制御や信頼性の担保につなげられることの間にはまだ大きな隔たりがある、というものである。

9分で読めます

ベンチマークの数字だけでは「理解」は分からない

乾氏は出発点として、LLMが多くのベンチマークで人間並み、あるいは人間を超える性能を示しているという、広く報告されている状況を挙げた。そのうえで、テストに正解できることと実際に理解していることは必ずしも同じではないと指摘する。評価に使ったデータがどこかから漏れていたり、問題と答えの組そのものをモデルが丸覚えしていたりすることが起こり得るからである。乾氏によれば、モデルやデータが大きくなるほど、こうした問題は避けにくくなる。したがって性能評価の数字を見るだけでは、LLMが何をどう理解しているのかは十分に分からない。これが講演の出発点だった。

言葉が分かるとはどういうことか:洗濯物の例

では、言葉が分かるとはどういうことなのか。乾氏は20年来使い続けているという例文「庭に洗濯物を干した途端に雨が降ってきた」を示した。

この文を聞いたとき、人の頭の中では少なくとも3つのことが起きていると乾氏は説明する。1つ目は常識的な知識の想起である。洗濯物を干すのは乾かすためであり、洗濯物が乾くには晴れていなければならない、といった知識が呼び出される。2つ目は、その知識を使った話の再構成である。洗濯物を干したが雨が降ってきたので乾かなかった、だからやり直さなければならない、という道筋を組み立てる。3つ目は行間を読むことである。文には書かれていない「がっかりした」という気持ちまで受け取る。

言語理解にはいろいろな側面があるが、最終的にはこの3つが本質だと多くの人が考えており、自分もそう考えている、と乾氏は述べた。そのうえで、LLMの中に、世界についての知識を持ち、それを使って話を再構成し、シミュレーションや予測を行う仕組みがあるのか、あるとすればどこにどのようにできていて、ボトルネックはどこにあるのかを問う。これを明らかにすることが、言語モデルが言語を、あるいは言語を通じて世界を理解しているのかという問いに答えを与えていく道だ、というのが乾氏の考えである。

生まれ年は内部に「数直線」として並んでいる

最初の問いは、LLMが世界の知識をどこにどのように記憶しているか、である。例として取り上げられたのは有名人の生まれ年だった。LLMはバラク・オバマやアインシュタインが何年に生まれたかを正しく答えることができる。

LLMは入力を内部でベクトルに変換し、その上に計算を重ねていく。研究では、この内部表現のベクトルから生まれ年の情報を読み出すことを試みた。その結果、生まれ年の情報がLLM内部のある構造の中に、いわば数直線のような形できちんと並んで刻まれていることが分かったという。有名人一人ひとりの表現を点として2次元に落とし込むと、生まれ年の古い人から新しい人へ向かって、点が滑らかな1本の線の上に並ぶ様子が見られた。

乾氏によれば、こうした構造は生まれ年に限らない。人口や緯度・経度といった数値属性についても、同様の構造が見つかっている。

構造を書き換えると答えが変わる:介入実験

数値の構造が内部に数直線のような形で存在することは見えた。しかし、その構造がLLMが実際に答えを出すときに使われているかどうかは別の問題である。これを確かめるため、見つかった数直線に沿って内部表現のベクトルを実際に書き換える介入実験を行った。

例として挙げられたのはカール・ポパーである。ポパーの生まれ年は1902年だが、内部の記憶部分を数直線上で生まれ年の方向にずらしていくと、同じ質問に対してモデルが後ろにずれた年を答えるようになった。逆方向にずらすと、1681年のように前の年を答えた。

乾氏はここから、少なくともこの例では、見つかった構造をいじると実際の出力もそれに応じて変わるので、その構造は単なる副産物ではなく、LLMが答えを出す際に使われている、少なくとも関わっていると言える、と述べた。数値属性の知識の少なくとも一部については、内部にきれいな構造があり、それが出力にも関わっていることまで確認できた、というのがここまでの到達点である。

知識の種類ごとに異なる「形」がある

数値以外の知識はどうか。乾氏は、知識の種類によって内部表現の形が異なることが分かってきていると紹介した。点のようにまとまっているもの、先ほどの数直線、曜日のように輪になっているもの、さまざまな関係の対になっているもの、階層になっているものなどである。乾氏は細部には立ち入らず、そのうち2つの例を紹介した。

名前の曖昧さと表記揺れ

1つ目は、名前にまつわる曖昧さと表記の揺れである。「オバマ」と言われたとき、それが誰を指すかは文脈によって変わる。バラク・オバマかもしれないし、別の人物かもしれない。逆に、同じ人物でも「バラク・オバマ」と呼ばれることもあれば、別の呼び方をされることもある。

LLMの内部表現を取り出して調べたところ、人物や組織といったエンティティに関する知識は、比較的少ない次元、つまり簡単な空間の中にうまく埋め込まれていることが分かってきたという。同じ名前の別人はその空間の中で離れた位置にあり、同じ人物の別の呼び方は近くに来るように整理されていた。乾氏はこれを、名前の曖昧さと表記揺れという世界の側にある構造と、LLMの内部表現の構造が、ある程度対応していることを示すものだと説明した。

概念の上位・下位関係

2つ目は概念の階層である。「動物」という上位概念の下に「鳥」や「哺乳類」といった下位概念がある。こうした階層概念を調べると、内部ではやはり規則的な構造を持っていることが分かってきた。具体的には、低次元の線形な部分空間、つまりシンプルな形の空間の中に階層関係がまとまって現れる。さらに乾氏が興味深い点として挙げたのは、場所の階層や人物の階層など、意味の領域が異なる階層が、似たような構造のパターンで表現されていることである。

分かってきたこと、まだほとんど分かっていないこと

乾氏はここまでを整理し、人物や組織のようなエンティティ、単純な事実関係、生まれ年のような数値情報、上位・下位関係のような階層的な分類については、内部の規則的な構造が徐々に見つかってきていると述べた。

一方で、ほとんど分かっていないこともまだたくさんある。乾氏が挙げたのは次のような知識である。

  • 「インフルエンザにかかると熱が出る」のような条件・因果関係
  • 「〜はドイツの人ではない」のような否定や反事実的な情報
  • 「鳥は飛ぶがペンギンは飛べない」のような例外を伴う一般則
  • コーヒーの入れ方のような手順や行為についての知識

冒頭の洗濯物の例が示すように、こうした複雑な知識こそが言語の理解や世界の理解に必要だと考えられる。しかし、それらが内部でどう表現され、どう使われているのかはまだほとんど分かっていない、というのが乾氏の示した現状である。

読み取ること(プロービング)と制御すること(ステアリング)の隔たり

乾氏がもう1つの重要な点として強調したのは、内部表現を読むこと(専門的にはプロービングと呼ぶ)は比較的やりやすいが、その表現を使ってモデル全体の振る舞い、例えば答えを制御すること(ステアリング)は、読むこととは別次元で、はるかに難しいということだった。

生まれ年の例のように一部の限られたケースでは制御できるが、乾氏によれば、この単純な例でさえ本当はあまりきれいには制御できていない。逆方向に動かしても、時代がそれほどきれいに遡っていかないという。内部表現を操作してモデルの振る舞いを変えられるところまで内部表現をきちんと理解できている、という段階にはまだ全然達していない、と乾氏は述べた。

「おばあちゃんニューロン」の教訓

ここで乾氏は神経科学の教訓を引いた。初期の神経科学では、1つのニューロンが1つの概念に対応していることを示すような、いわゆる「おばあちゃんニューロン」の結果が数多く報告され、熱狂的に受け止められた。単純で分かりやすく魅力的な考え方だったが、後になって、それは過剰な単純化だったというのが現在のコンセンサスになっている。

乾氏は、LLMの内部機序の研究も同じ罠にはまっているかもしれないと警告する。見つけやすく説明しやすい構造だけを見ている可能性がある、ということである。読み取れることと制御できることは別だ、という点を乾氏は改めて強調した。

内部が少し見えても信頼性は保証できない

これが具体的に何を意味するのか。乾氏の要点は、内部が少し見えてきた程度では信頼性を十分に保証できない、ということである。例えば、内部表現を見て誤った答えを確実に見分けることは、まだ本当に難しいことが分かってきている。内部表現を通じて知識を修正することも難しく、内部表現を操作して安全対策を施すといったこともまだなかなかできていない。

さらに根本的な問題として、内部機序をどこまで理解できれば十分と言えるのかについて、しっかりした理論がまだない。乾氏は、この点について理論的な研究と経験的・記述的な研究の両面を進めていく必要がまだまだあると考えている。

教育の現場への示唆と講演の結論

では、例えば教育の現場でAIについて何をすべきか。乾氏がポイントとして挙げたのは、もっともらしい説明ができることと、モデルが本当に理解しているかどうかは同じではない、ということを改めて確認しておく必要があるという点である。内部機序の研究は、どこでAIを信頼してよく、どこでは出典の確認や人間による検証が必要なのかを明らかにするための基盤を作る研究だと位置づけてほしい、と乾氏は述べた。

乾氏は講演を次のようにまとめた。LLMの内部には規則的に整理された知識表現があり、少なくともその一部は実際に答えを出すために使われている。ただし解明できたのはまだごく一部であり、さらに研究を進める必要がある。そして、内部表現を読み取れることと、それを安定して制御したり信頼性の担保につなげたりすることの間には、まだ大きな隔たりがある。これが講演のメッセージとして示された。