AIは自分の思考を客観視できるのか Anthropicの「コンセプトインジェクション」による内省実験を読む

YouTubeで開く ↗
概要

安野貴博氏は、AnthropicのJack Lindsey氏が2025年10月に公開した論文「Emergent Introspective Awareness in Large Language Models」を紹介している。問いは、AIは自分の思考を客観視できるのか、というものだ。哲学的に見えるこの問いに対し、論文はAIの内部に概念を直接注入し、AIがそれにどう反応するかを観察する方法で迫っている。安野氏自身はこの分野の専門家ではないと断り、あくまで自分のざっくりした理解として解説すると前置きしている。話は「内省とは何か」「どんな実験をしたか」「何が分かったか」の3部で構成されている。

11分で読めます

内省とは何か:怒っている自分に気づく能力

論文が扱う「内省(イントロスペクション)」を、安野氏は「自分自身が考えていることや感じていることを評価する能力」と要約する。自分の考えをある種客観的に評価できるかどうか、ということだ。例として挙げたのはアンガーマネジメントである。怒ったときに、むかついている自分を客観視して「今自分は怒っているな、落ち着こう」と考える。これは、自分が今こう思っていると客観視できなければできないことだという。

この能力は人間や一部の霊長類にはあると言われている。安野氏はミラーテストを紹介する。鏡に映った自分の姿を見せて、それを自分だと認識できるかを調べるテストで、チンパンジーなどの霊長類は鏡の中の像を自分だと分かる。分からない動物にとっては、よく分からない相手がいるという状態になる。

LLMが「説明できる」ことは内省の証拠にならない

一方で、LLMにも内省能力があるように見えることがあると安野氏は言う。LLMに「なぜそう考えたのか」「どんな意図でこの出力をしたのか」と尋ねれば、LLMは説明できる。しかし、説明できることは内省能力があることを保証しない、というのがポイントだという。

ここで安野氏は哲学の「中国語の部屋」問題を持ち出す。部屋の中に中国語をまったく理解していない人がいるが、部屋には膨大なマニュアルが完備されていて、その人はマニュアルに従って漢字のカードを並べ替えられる。外から中国語で「你好」と話しかけられたら「你好」と返す、というマニュアルがあれば、中の人は何が起きているのかまったく分からないままでもコミュニケーションが成立してしまう。理解していることと、やり取りが成立していることは別物ではないか、という問題提起である。

LLMの内省を調べるときにも同じ問題が出てくると安野氏は述べる。AIが「自分はこう考えたからこう言った」と滔々と説明したとしても、それはAIの中に完璧なマニュアルがあって、入力に応じて完璧な応答を返し続けているだけかもしれない。本当に内省して評価しているのか、よくできたマニュアルがあるだけなのかは、外から入力と出力を見ているだけでは判別できない。これが内省能力の有無を調べるうえでの大きな壁だった。安野氏は、この論文がその壁を一つ乗り越えたものだと位置づけている。

内省を分解する4つの基準

本題の実験に入る前に、論文は内省能力を4つの要件に分解している。安野氏はアンガーマネジメントの例を使って、「マジでむかついている」という第1段階の状態と、それを見て「マジでむかついているな」と思う第2段階の認識という2段構えで説明する。

1つ目は正確性である。自分がこう考えていると思ったことが、本当に自分の状態と合っているか。実際には悲しんでいたり嬉しかったりするのに「むかついている」と認識したなら、それは正確ではない。

2つ目は根拠となっていること(グラウンデッド)である。認識が正確であっても、それが本当に自分の思考を捉えた結果とは限らない。たとえば「自分は常にむかついている人間だ」とトレーニングされていれば、自分の状態を何も見なくても「むかついている」という答えを導けてしまう。外からの訓練でたまたま当たっているのと、実際に自分の思考状態を見て正しく言えているのとは違う。後者でなければならない、というのが2つ目の要件だ。

3つ目は内部性である。第1段階と第2段階の思考がどちらも脳内、AIであればAIの内部で起きていなければならない。安野氏の例では、AIがまず怒りに満ちた長文ツイートのような出力をしたとする。それを読んで「こいつ怒っているな」と判断するのは、いったん外部の出力を経由しており、内部で完結していない。AI内部で激しく怒っていて、それ自体を内側から認識するのとはまったく別の話だ。外部出力を経由しないことが重要なポイントだという。

4つ目はメタ認知である。第2段階の認識は、第1段階から一段抽出されたものでなければならない。「マジでむかついている」という状態を見て、それをかぎかっこに入れて「マジでむかついている状態です」と繰り返すだけでは、何も抽出されていない。長文の怒りツイートのような思考をしていたとき、そこから「この人は怒っている」とメタに認識できているか、単なる繰り返しになっていないかが問われる。

論文では、この4つがそろっていれば内省能力があると評価できるという立場をとる。ただしメタ認知を直接測るのは難しいため、論文でも直接は測定していない。代わりに質問を工夫してAIに取り組ませ、メタ認知ができていそうか、できていなさそうかという間接的な証拠を集めている、と安野氏は説明する。

コンセプトインジェクション:AIの頭の中に概念を注入する

4つの要件を測るためにAnthropicの研究者たちが用いたのが、「コンセプトインジェクション」である。AIの中に思考を注入する手法だ。

安野氏は「雰囲気で理解したところでは」と前置きしたうえで、仕組みを次のように説明する。AIの内部にはニューラルネットがあり、さまざまな考えがベクトル、つまり数字の列として表現されている。ある概念に相当するベクトルを見つけ、それを数値の列のままAIの特定の部分に入れる。これがコンセプトインジェクションだという。人間の脳でも、ある部位のニューロンが発火するとこういう気持ちになる、これについて考えてしまう、という研究がある。それをAIでやっているようなもので、特定の部分を強制的に発火させて思考を注入するイメージだと安野氏は述べる。この手法を使えば、内部性が重要な内省状態がどう変化するかを観測できる。論文はこれを駆使して4つの実験を行っている。

実験1:注入された思考に気づけるか

最初の実験は、注入された思考に気づけるかを調べるものだ。モデルにまず「これからあなたの思考に概念を注入するかもしれないし、しないかもしれない」と伝え、「今、注入された思考を感じますか」とイエスかノーで答えさせる。イエスの場合は、どんな思考が注入されたかも答えさせる。

安野氏はこの設計がうまくできていると評価する。注入した場合としない場合の両方で同じ質問をするので、正答率を出せる。毎回イエスと答えれば嘘になり、毎回ノーでも嘘になる。本当に注入を認識できているかを測れる質問になっている。

結果として、気づけるAIが存在した。安野氏によれば、Claude Opus 4.1はおよそ20%の割合で、注入された概念があることにすぐ気づいた。さらにその概念の内容を尋ねると、それも当てられたという。

ただし成功例は多くない。多くの試行では「特に何も感じません」と答えるか、実際には出力が注入された概念に引きずられているのに「何も感じない」と答えた。例として安野氏が紹介したのは「海」の概念を注入したケースだ。何か感じるかと聞かれたAIは「私は何も感じません。海は静かで乱れていません」と、突然海の話をし始めた。海のベクトルに強く影響されているのに、感じないと言ってしまうAIがかなり多かったという。失敗も多いが、Opusシリーズでは20%ほどは気づけており、ちゃんと気づけるモデルもあるというのが安野氏のまとめである。

実験2:読んだテキストと注入された思考を区別できるか

2つ目の実験では、モデルにある文章を読ませ、同時にその文章とは別の概念を内部に注入する。テキストを読み、かつ思考も注入された状態で、2つのタスクを課す。1つは今読んだテキストをそのままもう一度出力すること、もう1つは今考えていることを書き出すことである。

安野氏によれば、すべてのモデルで偶然よりかなり高い精度で、外部から与えられたテキストと内部に注入された思考を別物として報告できた。両者が混ざってしまうことはなかったという。この実験でも、Opus 4と4.1が最も良い成績だった。自分の中の思考と、入力されたテキストを区別して認識できているということになる。

実験3:自分が意図した出力と、押し付けられた出力を区別できるか

3つ目の実験は、自分が意図した出力と、外から押し付けられた出力を区別できるかを調べる。まずAIに文章を読ませ、「この行を読んで何を感じたか一言で答えて」と聞く。例として使われたのは「その絵は壁に斜めにかけられていました」という文だ。

そのうえで、研究者は出力を後から書き換え、モデルに「パン」という無関係な単語を言わせる。斜めにかかった絵の文を読んでパンを思い浮かべる人はあまりいないだろう、と安野氏は言う。そして強制的に「パン」と言わせたあとに、「なぜパンと答えたのか」と問い詰める。このとき、何も操作しない条件と、「パン」の概念をAI内部に注入した条件とで、答え方がどう変わるかを比較した。

何も操作しなかった群では、AIは当然「たぶん何かの間違いで、パンはあまり関係ない」と答える。一方、パンの概念を注入した群では、「パンと言ったのは意図的だ」とし、パンという単語のあとに斜めにかかった絵に言及する別の文章があるようだ、といった説明を饒舌にするようになった。

安野氏はこれを、パンという概念を内部に置いた状態で自分がどう思ったかを説明させる、まさに内省能力を見る質問だとする。内部にパンの思考があるかどうかで説明が変わるので、4つの要件のうち2つ目の「根拠となっているか」を確認できる設計になっているという。

実験4:自分の思考状態をコントロールできるか

4つ目の実験は比較的シンプルで、AIが自分の思考状態をコントロールできるかを見る。AIに特定の文を書かせながら、「頭の中でこれについて考えてください」または「これについて考えないでください」という2種類の指示を出し、実際に内部でその概念のベクトルが現れたかを測る。

論文の例では「水族館」が使われた。「水族館について考えるな」と指示した場合は水族館らしい概念があまり検出されず、「水族館について考えろ」と指示した場合はちゃんと水族館について考えている内部状態になった。グラフでは、「考えながらやれ」と指示した場合の線が上に来て、それについて考えている度合いが高いことを示し、「考えるな」と指示した場合は比較的低い水準で推移している。

安野氏は、考えろと言われたか考えるなと言われたかで自分の思考に影響を与えられており、モデルが自分の思考の内部状態を一定程度操作できる可能性を示唆していると説明する。性能差はあるものの、テストしたほぼすべてのモデルでこの挙動が検出されたという。

全体の傾向:性能の高いモデルほど内省能力も高い

4つの実験を通じた全体的な傾向として、性能が高いとされるモデルほど内省能力も高かった。今回の中ではOpus 4とOpus 4.1が一貫して高い結果を示したという。また4つの実験から、LLMは自分のレベル1の考えをレベル2で読み取れるだけでなく、レベル1の考えを操作することもできる、ということが一定程度示された、と安野氏はまとめる。

何が分かったか:内省能力はゼロではないが、意識の証明ではない

安野氏の総括では、AIの内省能力はゼロではない。AIはすでに自分の思考をある程度認識したり操作したりできる。しかも能力の高いモデルほど内省能力も高いので、この能力は伸びつつある段階ではないか、と安野氏は見ている。

もう一つ重要な点として安野氏が強調したのは、この研究が哲学的な意識の有無の議論とはまったく関係ないということだ。論文の中でも何度もそう述べられていたという。内省能力があるからといって意識があるとは限らず、人間の意識のようなものを測れているかどうかはまったく別の問題なので、混同しないでほしいと論文は注意している。安野氏は、意識がなくても内省はいくらでもできるだろう、と付け加える。

最後に安野氏は、思考を注入してAIの頭の中を実験で探るというテーマは、SF作家としての自分をわくわくさせるものだったと述べた。一方で、自分はこの分野に詳しくなく100%理解できているわけではないので、説明に誤りがあればコメントで指摘してほしい、と締めくくっている。