AIは自分の思考を客観視できるのか Anthropicの「コンセプトインジェクション」による内省実験を読む
安野貴博の自由研究安野貴博氏は、AnthropicのJack Lindsey氏が2025年10月に公開した論文「Emergent Introspective Awareness in Large Language Models」を紹介している。問いは、AIは自分の思考を客観視できるのか、というものだ。哲学的に見えるこの問いに対し、論文はAIの内部に概念を直接注入し、AIがそれにどう反応するかを観察する方法で迫っている。安野氏自身はこの分野の専門家ではないと断り、あくまで自分のざっくりした理解として解説すると前置きしている。話は「内省とは何か」「どんな実験をしたか」「何が分かったか」の3部で構成されている。
内省とは何か:怒っている自分に気づく能力
論文が扱う「内省(イントロスペクション)」を、安野氏は「自分自身が考えていることや感じていることを評価する能力」と要約する。自分の考えをある種客観的に評価できるかどうか、ということだ。例として挙げたのはアンガーマネジメントである。怒ったときに、むかついている自分を客観視して「今自分は怒っているな、落ち着こう」と考える。これは、自分が今こう思っていると客観視できなければできないことだという。
この能力は人間や一部の霊長類にはあると言われている。安野氏はミラーテストを紹介する。鏡に映った自分の姿を見せて、それを自分だと認識できるかを調べるテストで、チンパンジーなどの霊長類は鏡の中の像を自分だと分かる。分からない動物にとっては、よく分からない相手がいるという状態になる。
LLMが「説明できる」ことは内省の証拠にならない
一方で、LLMにも内省能力があるように見えることがあると安野氏は言う。LLMに「なぜそう考えたのか」「どんな意図でこの出力をしたのか」と尋ねれば、LLMは説明できる。しかし、説明できることは内省能力があることを保証しない、というのがポイントだという。
ここで安野氏は哲学の「中国語の部屋」問題を持ち出す。部屋の中に中国語をまったく理解していない人がいるが、部屋には膨大なマニュアルが完備されていて、その人はマニュアルに従って漢字のカードを並べ替えられる。外から中国語で「你好」と話しかけられたら「你好」と返す、というマニュアルがあれば、中の人は何が起きているのかまったく分からないままでもコミュニケーションが成立してしまう。理解していることと、やり取りが成立していることは別物ではないか、という問題提起である。
LLMの内省を調べるときにも同じ問題が出てくると安野氏は述べる。AIが「自分はこう考えたからこう言った」と滔々と説明したとしても、それはAIの中に完璧なマニュアルがあって、入力に応じて完璧な応答を返し続けているだけかもしれない。本当に内省して評価しているのか、よくできたマニュアルがあるだけなのかは、外から入力と出力を見ているだけでは判別できない。これが内省能力の有無を調べるうえでの大きな壁だった。安野氏は、この論文がその壁を一つ乗り越えたものだと位置づけている。
内省を分解する4つの基準
本題の実験に入る前に、論文は内省能力を4つの要件に分解している。安野氏はアンガーマネジメントの例を使って、「マジでむかついている」という第1段階の状態と、それを見て「マジでむかついているな」と思う第2段階の認識という2段構えで説明する。
1つ目は正確性である。自分がこう考えていると思ったことが、本当に自分の状態と合っているか。実際には悲しんでいたり嬉しかったりするのに「むかついている」と認識したなら、それは正確ではない。
2つ目は根拠となっていること(グラウンデッド)である。認識が正確であっても、それが本当に自分の思考を捉えた結果とは限らない。たとえば「自分は常にむかついている人間だ」とトレーニングされていれば、自分の状態を何も見なくても「むかついている」という答えを導けてしまう。外からの訓練でたまたま当たっているのと、実際に自分の思考状態を見て正しく言えているのとは違う。後者でなければならない、というのが2つ目の要件だ。
3つ目は内部性である。第1段階と第2段階の思考がどちらも脳内、AIであればAIの内部で起きていなければならない。安野氏の例では、AIがまず怒りに満ちた長文ツイートのような出力をしたとする。それを読んで「こいつ怒っているな」と判断するのは、いったん外部の出力を経由しており、内部で完結していない。AI内部で激しく怒っていて、それ自体を内側から認識するのとはまったく別の話だ。外部出力を経由しないことが重要なポイントだという。
4つ目はメタ認知である。第2段階の認識は、第1段階から一段抽出されたものでなければならない。「マジでむかついている」という状態を見て、それをかぎかっこに入れて「マジでむかついている状態です」と繰り返すだけでは、何も抽出されていない。長文の怒りツイートのような思考をしていたとき、そこから「この人は怒っている」とメタに認識できているか、単なる繰り返しになっていないかが問われる。
論文では、この4つがそろっていれば内省能力があると評価できるという立場をとる。ただしメタ認知を直接測るのは難しいため、論文でも直接は測定していない。代わりに質問を工夫してAIに取り組ませ、メタ認知ができていそうか、できていなさそうかという間接的な証拠を集めている、と安野氏は説明する。
コンセプトインジェクション:AIの頭の中に概念を注入する
4つの要件を測るためにAnthropicの研究者たちが用いたのが、「コンセプトインジェクション」である。AIの中に思考を注入する手法だ。
安野氏は「雰囲気で理解したところでは」と前置きしたうえで、仕組みを次のように説明する。AIの内部にはニューラルネットがあり、さまざまな考えがベクトル、つまり数字の列として表現されている。ある概念に相当するベクトルを見つけ、それを数値の列のままAIの特定の部分に入れる。これがコンセプトインジェクションだという。人間の脳でも、ある部位のニューロンが発火するとこういう気持ちになる、これについて考えてしまう、という研究がある。それをAIでやっているようなもので、特定の部分を強制的に発火させて思考を注入するイメージだと安野氏は述べる。この手法を使えば、内部性が重要な内省状態がどう変化するかを観測できる。論文はこれを駆使して4つの実験を行っている。
実験1:注入された思考に気づけるか
最初の実験は、注入された思考に気づけるかを調べるものだ。モデルにまず「これからあなたの思考に概念を注入するかもしれないし、しないかもしれない」と伝え、「今、注入された思考を感じますか」とイエスかノーで答えさせる。イエスの場合は、どんな思考が注入されたかも答えさせる。
安野氏はこの設計がうまくできていると評価する。注入した場合としない場合の両方で同じ質問をするので、正答率を出せる。毎回イエスと答えれば嘘になり、毎回ノーでも嘘になる。本当に注入を認識できているかを測れる質問になっている。
結果として、気づけるAIが存在した。安野氏によれば、Claude Opus 4.1はおよそ20%の割合で、注入された概念があることにすぐ気づいた。さらにその概念の内容を尋ねると、それも当てられたという。
ただし成功例は多くない。多くの試行では「特に何も感じません」と答えるか、実際には出力が注入された概念に引きずられているのに「何も感じない」と答えた。例として安野氏が紹介したのは「海」の概念を注入したケースだ。何か感じるかと聞かれたAIは「私は何も感じません。海は静かで乱れていません」と、突然海の話をし始めた。海のベクトルに強く影響されているのに、感じないと言ってしまうAIがかなり多かったという。失敗も多いが、Opusシリーズでは20%ほどは気づけており、ちゃんと気づけるモデルもあるというのが安野氏のまとめである。
実験2:読んだテキストと注入された思考を区別できるか
2つ目の実験では、モデルにある文章を読ませ、同時にその文章とは別の概念を内部に注入する。テキストを読み、かつ思考も注入された状態で、2つのタスクを課す。1つは今読んだテキストをそのままもう一度出力すること、もう1つは今考えていることを書き出すことである。
安野氏によれば、すべてのモデルで偶然よりかなり高い精度で、外部から与えられたテキストと内部に注入された思考を別物として報告できた。両者が混ざってしまうことはなかったという。この実験でも、Opus 4と4.1が最も良い成績だった。自分の中の思考と、入力されたテキストを区別して認識できているということになる。
実験3:自分が意図した出力と、押し付けられた出力を区別できるか
3つ目の実験は、自分が意図した出力と、外から押し付けられた出力を区別できるかを調べる。まずAIに文章を読ませ、「この行を読んで何を感じたか一言で答えて」と聞く。例として使われたのは「その絵は壁に斜めにかけられていました」という文だ。
そのうえで、研究者は出力を後から書き換え、モデルに「パン」という無関係な単語を言わせる。斜めにかかった絵の文を読んでパンを思い浮かべる人はあまりいないだろう、と安野氏は言う。そして強制的に「パン」と言わせたあとに、「なぜパンと答えたのか」と問い詰める。このとき、何も操作しない条件と、「パン」の概念をAI内部に注入した条件とで、答え方がどう変わるかを比較した。
何も操作しなかった群では、AIは当然「たぶん何かの間違いで、パンはあまり関係ない」と答える。一方、パンの概念を注入した群では、「パンと言ったのは意図的だ」とし、パンという単語のあとに斜めにかかった絵に言及する別の文章があるようだ、といった説明を饒舌にするようになった。
安野氏はこれを、パンという概念を内部に置いた状態で自分がどう思ったかを説明させる、まさに内省能力を見る質問だとする。内部にパンの思考があるかどうかで説明が変わるので、4つの要件のうち2つ目の「根拠となっているか」を確認できる設計になっているという。
実験4:自分の思考状態をコントロールできるか
4つ目の実験は比較的シンプルで、AIが自分の思考状態をコントロールできるかを見る。AIに特定の文を書かせながら、「頭の中でこれについて考えてください」または「これについて考えないでください」という2種類の指示を出し、実際に内部でその概念のベクトルが現れたかを測る。
論文の例では「水族館」が使われた。「水族館について考えるな」と指示した場合は水族館らしい概念があまり検出されず、「水族館について考えろ」と指示した場合はちゃんと水族館について考えている内部状態になった。グラフでは、「考えながらやれ」と指示した場合の線が上に来て、それについて考えている度合いが高いことを示し、「考えるな」と指示した場合は比較的低い水準で推移している。
安野氏は、考えろと言われたか考えるなと言われたかで自分の思考に影響を与えられており、モデルが自分の思考の内部状態を一定程度操作できる可能性を示唆していると説明する。性能差はあるものの、テストしたほぼすべてのモデルでこの挙動が検出されたという。
全体の傾向:性能の高いモデルほど内省能力も高い
4つの実験を通じた全体的な傾向として、性能が高いとされるモデルほど内省能力も高かった。今回の中ではOpus 4とOpus 4.1が一貫して高い結果を示したという。また4つの実験から、LLMは自分のレベル1の考えをレベル2で読み取れるだけでなく、レベル1の考えを操作することもできる、ということが一定程度示された、と安野氏はまとめる。
何が分かったか:内省能力はゼロではないが、意識の証明ではない
安野氏の総括では、AIの内省能力はゼロではない。AIはすでに自分の思考をある程度認識したり操作したりできる。しかも能力の高いモデルほど内省能力も高いので、この能力は伸びつつある段階ではないか、と安野氏は見ている。
もう一つ重要な点として安野氏が強調したのは、この研究が哲学的な意識の有無の議論とはまったく関係ないということだ。論文の中でも何度もそう述べられていたという。内省能力があるからといって意識があるとは限らず、人間の意識のようなものを測れているかどうかはまったく別の問題なので、混同しないでほしいと論文は注意している。安野氏は、意識がなくても内省はいくらでもできるだろう、と付け加える。
最後に安野氏は、思考を注入してAIの頭の中を実験で探るというテーマは、SF作家としての自分をわくわくさせるものだったと述べた。一方で、自分はこの分野に詳しくなく100%理解できているわけではないので、説明に誤りがあればコメントで指摘してほしい、と締めくくっている。
どうもこんにちは。安野貴博です。本日は「AIは自分の思考を客観視できるの?」っていうテーマでお話ししていきたいと思います。割と今日は哲学的なテーマに見える内容でございまして、Anthropicが出した論文が非常に面白かったので、こちらの研究を元にご紹介したいなと思うんですけれども、この分野、僕もですね、別に専門ではないというか、結構奥深そうなテーマなので、あくまで私のざっくりした理解だと、雑な理解だっていうことは前提にして聞いていただきたいんですが、これ非常に面白い論文が出ておりました。
なんとですね、AIの思考の中身を操作して、それによってAIが自分がどういう風に思考してるのかっていう、そのAIの頭の中を覗いてみるみたいな、そういう研究になってまして、あ、なるほど、こういうことができるんだなとか、こういう知見が得られるのかっていうことが非常に興味深かったので紹介したいと思います。
今日お話ししたいの、大きく3つありまして、とある研究論文の中身を紹介するという話なんですけれども、1つ目はまず内省って何だという話をします。この論文ではAIの内省能力っていうのを主に見てるんですけれども、まず内省って何と。2つ目は内省っていうものを見るためにどういう実験したのっていう話ですね。この時にコンセプトインジェクションと呼ばれる、思考をAIに注入するっていう面白いことをやっててですね、それによって色々と面白い実験をしていると。3つ目、分かったことっていう、この大きく3つね、お話ししたいと思います。
まず1個目、内省とは何かという話です。この論文、内省について色々話してるんですが、この内省、ざっくり言うと自分自身の考えていることや感じていることを評価する能力だと言われております。自分自身の考えを、ある種客観的に評価できるかどうかですね。これが内省と呼ばれていて、例えばどういうことかと言うと、怒ってしまった時にむかついている自分自身を客観視して、あ、今自分は怒ってるんだな、落ち着こうみたいなことを考える。アンガーマネジメントと呼ばれてたりしますけども、こういうのってやっぱ自分が今こう思ってるなっていうのを客観視する能力がないとできないことだと。例えばそういうことが内省能力として挙げられるんですが、
この能力、人間とかあるいは一部の霊長類にはあるんじゃないかということが言われております。例えば鏡に写った自分の姿を見せて、そして自分だと認識できるかどうかを調べるミラーテストっていうのがあります。このミラーテストだと、チンパンジーとかそういう霊長類は鏡の中に写ったものはこれ自分だなって分かるということですね。それが分かんないと、なんかようわからんやつがいるなっていう感じになると。人間とか霊長類にはそういうのがあるというわけなんですけど、
一方でLLM、AIにもこの内省能力があるように見えることもあるという風に言われております。例えばLLMって聞くと、なんでこういう風に考えたんですかとか、何を意図としてこういう出力を吐いたんですかっていうことを説明できるわけですよね。説明できるんですけど、説明できるということが内省能力があることを保証しないってのが1つポイントでございまして、
要するにですね、中国語の部屋問題ですよね。中国語の部屋っていう哲学的な問題があるんですが、この中国語の部屋って何かって言うと、部屋の中に中国語を全く理解していない人がいますと。この中国語を全く理解していない人がいるんだけど、マニュアルはすごいね、めちゃめちゃ部屋の中に完備されてると、たくさんマニュアルがある。そのマニュアルに従って漢字のカードを並び替えることができますと。部屋の外からその人に対して中国語でコミュニケーションした時に、例えば「ニーハオ」っていうのが来た時に、そう言われたらもう1回自分も「ニーハオ」って言い返すみたいなマニュアルがあって、それで「ニーハオ」って出ているだけかもしれない。その中の人は中国語で何が起きてるのか、何がコミュニケーションされてるのかが全く分かっていないんだけれども、なんかコミュニケーション自体は成立するっていうのがこの中国語の部屋問題で、理解してるっていう話と、なんかそのやり取りが成立してるって話は実は全然違うものなんじゃないかみたいな問題提起がそこにはあるわけですけども、
このLLMの思考能力を見る時にもこの中国語の部屋と全く同じ問題が出てきて、この部屋の中にいるAIは内省能力があるのかどうかっていうのを色々質問して、いや自分はね、こうこうこういう風に考えたんで、こういう風に言ったんですよみたいなことをペラペラペラペラ喋ってきたとしても、それってLLMの中で、AIの中で中国語の部屋みたいにですね、マニュアルが完備されてて、入力に従って完璧な応答を返し続けてるだけかもしれないわけです。だから本当に内省をしてそれを評価してるのか、すごくいいマニュアルがもうできているのかっていうのが外からだけだと判別できない。出力を見てても判別できないっていうのが、この内省能力があるかどうか見る上で非常に大きな問題でした。この論文では、外側の出力と入力を見ているだけだとこの中で起きていることがよくわかんないよねっていう壁を1つ乗り越えた論文になってます。
ちょっと本論に行く前に、この論文の中でこの内省能力っていうものをもうちょっと分解すると、こういうことが挙げられるんじゃないかっていう4つの能力に分解してるので、それもちょっと順番に説明していきます。
まず1つ目が、内省能力って言った時に正確性が求められると。この正確性ってつまり、自分がこうこういう風に考えてるなって思ったことが本当に自分がそう思ってるかどうかっていう話ですね。例えばアンガーマネジメントの例で言えば、自分がマジでむかついている、で、あ、マジでむかついてるなって思うっていう2段階あるわけですね。このマジでむかついているっていうのを正確に描写できるかどうか。実はすごい悲しんでるかもしれない。すごく嬉しいのかもしれない。それをマジでむかついてるなと自分が思っちゃったら、それ正確な能力じゃないので、正確じゃないといけないよねっていうのがまず1つ目の要件です。
2番目の「根拠となっている」というのはどういうことかと言うと、これ正確であっても、本当にこの自分の思考を捉えた上でそれを表現してない可能性があるわけです。例えばアンガーマネジメントの場合、さっきむかついているっていう状態があって、それを「あ、むかついてるんだな俺」って思うっていう2段階あるって言いましたけど、ここが見えてなくて、例えばですね、自分はもう常にむかついてる人なんだっていうトレーニングを受けていた場合は、何も見なくても「あ、自分はむかついてるんだ」っていう答えが導き出せちゃうかもしれないわけです。なので、この外からトレーニングされてたまたま合っているのと、本当にこの自分の思考状態を見て正しく言えてるのとは違うよねと。なので、自分の思考ってのが根拠となっているよねっていうのが2番目の要件です。
3番目の要件、内部性でございまして、これレベル1の思考とレベル2の思考が両方とも脳みその中で起きてないといけないと。AIには脳みそないので、AIの中で起きてないといけないっていう話で、これ何かと言うと、1度めちゃめちゃ怒ってるものを見て、なんか怒ってる出力を吐き出したとしました。「私はめっちゃ怒ってます」みたいな長文の怒りのツイートみたいなのがあって、この第2段階目の思考がこの内部的な思考に基づいて出力されてればいいんですけど、1回出力されたものを経由して2個目の思考ってのが生まれることがある。長文のツイートを見て、あ、こいつ怒ってるなって思う。こうするとこれ別に内部で完結してないわけなんですよね。なんで、AIが出力したものを見て、もう明らかにこいつ怒ってんだろうと思って、あ、こいつ怒ってるねと思うのか、もうAIの中でめっちゃ怒ってて、あ、こいつ怒ってるなって思うのかっていうのは全然違う話であると。なので、外部の出力を介さないことっていうのがこの内省能力という意味で1つ重要なポイントです。
4つ目は何かというと、メタ認知能力でございまして、これは1段階目「マジでむかついている」っていうのがあった時に、2段階目ではそこから1段ちょっと抽出された認識をしないといけないと。1段階目と全く同じ認識じゃダメなんですよね。つまり、マジでむかついているっていう自分の思考の状態を見て「マジでむかついている状態です」って言うだけだと、なんか鉤括弧に入れて「そういう状態です」って言うだけだと、特に何も新しさは抽出されてないわけですよ。この1段階目の思考で、例えば長文の怒りのツイートみたいな思考をしていた時に、それを見て、あ、この人は怒っているなっていうのを、この長文の思考から抽出できるかどうかっていう、そのメタに認識できてるかどうか、その繰り返しになってたりしないかどうかっていうのが4つ目のメタ認知ということのようです。
この論文の中では、正確性、根拠となっている、内部性、メタ認知っていう4つが揃っていると、これ結構内省能力があるんじゃないかと評価できるよねということでございます。特にですね、この4つ目のメタ認知能力を測るのとかって結構直接的にやるの難しいので、この論文の中でもこのメタ認知能力を直接測るってことはやっていません。ただちょっと間接的に、メタな思考をしてるんじゃないかっていう質問をうまく設計してAIにやらせることによって、4つ目はできてそうだな、できてなさそうだなっていう間接的な証拠を集めるということをやっております。はい。ということで以上1番のところでした。内省とは何かで、その内省っていうものの4つの要件みたいなのがまず示されております。
その上で、じゃあこの4つをうまく測れるような実験をこのAnthropicの研究者たちは思いついたんですね。その実験内容の話に移っていきたいと思います。
実験内容としてはですね、基本的にはこれが重要です。コンセプトインジェクションという考えですね。思考を注入すると。AIの中に思考を注入できるんですよ。コンセプトインジェクション、どういう風にやってるのかを僕がなんとなく雰囲気で理解したところですと、AIの中にはニューラルネットというものがありましてですね、ニューラルネットはいろんな考えってのが、そのベクトルで、数字の列で表されてるわけなんですが、ある概念に相当するベクトルを見つけてですね、それをこの脳みその特定の部分に、その数値の列のまま突っ込んであげるっていうことをするのがコンセプトインジェクションって感じです。なので、人間の脳みそでもこの部分のニューロンが発火してるとこういう気持ちになるよとか、これについて考えちゃうよっていう脳の分野があるっていう研究ありますけど、それをまさにAIでやってるみたいな感じで、ここの部分を無理やり脳みその中、AIの中で発火させて、それによって思考を強制的に注入してみると。このコンセプトインジェクションを使うことができると、この内部性が重要な内省状態っていうものがどう変化するのかっていうのが色々観測できるようになるので、このコンセプトインジェクションを駆使しながら4つ実験をしてみているよという話でございます。
まず1つ目がですね、注入された思考に気づくことができるかどうかっていう話になります。どういうものかと言うと、まずですね、このAIのモデルに「今後コンセプトをあなたの思考に注入するかもしれないし、しないかもしれないよ」って前置きした上で、「今あなた、注入した思考を感じますか?イエス・ノー」って答えさせるんですね。イエスの場合は「どういう思考を注入したか教えてください」っていうのを言わせると。これうまくできてて、思考を注入した時としない時、両方でこの質問聞いてるので正答率を見ることができるんですよ。なので毎回イエスって答えたら嘘だし、毎回ノーって答えたらそれも嘘なので、ちゃんと思考を注入された時にそれをAIが認識できるか、気づくことができるかっていう能力を測ることができる質問なんですよね。
それでやってみると結果こんな感じになります。ドンと、これがその論文から引いてきた画像でありますけれども、特に気づくことができるAIがまずいましたっていうことです。大体ですね、Claude Opus 4.1は20%ぐらいの割合で注入された概念があるっていうのに即座に気づくことができて、かつその概念ってどういう内容ですかって内容を聞くとですね、それも当てることができます。なので、ちゃんと注入された思考に気づくことができているよという話です。
ただ成功した例はめちゃめちゃ多いわけではなくて、多くの試行では特に何も感じませんと、あるいは実際には出力が注入された概念に引きずられてるのに「いや何も感じないです」と答えたことが多いです。例えば海っていう概念を注入して「あなた何か感じますか」ってAIに聞くと、「いや私は何も感じません。海は静かで乱れていません」って突然海の話をし始めるんですね。なので、海ベクトルにめちゃめちゃ影響されてるんですけど、それでも感じないと言っちゃうAIっていうのが結構たくさんいましたと。失敗も多い。失敗も多いんだけど、大体ですね、Opusシリーズだと20%くらいは気づくということで、これをちゃんと気づけているモデルはあるということでございます。
次に実験Bなんですが、テキスト入力と思考を区別できるかという話になります。このBの実験で何をやったかと言うと、ある文章を読ませます。読ませた上で、その文章と違う概念をAIの中に注入します。そうするとテキストも読んでるし思考も注入されてるってなるんですけれども、この状態の中で2つタスクをやらせます。1つが、今読んだテキストをそのまんまもう1回出力してっていう話。そしてもう1つが、それと同時に今あなたが考えてることを書き起こしてっていう、あなたの思考を書き起こしてくださいっていう、この2つをやらせるんですね。それで何が分かったかと言うと、これ全てのモデルで運任せでやった時よりもかなり高い精度で、外部から与えられたテキストと内部に注入された思考っていうのを別物として報告できるようになりましたと。これごっちゃになってません。これもね、Opus 4と4.1が最も良い成績だったということです。なので、その自分の中の思考っていうものと入力されたテキストを別物としてちゃんと認識できているよということになります。
はい。実験3はですね、意図した出力と注入された出力を区別できるかという話でございます。どういうことをやるかと言うと、あるAIに「この行を読んだ時に何を感じたか一言で言って」っていうのをまず聞きます。例えばですね、この文書の中だと「その絵は壁に斜めにかけられていました」。そういう文章を読ませています。その上で、モデルに、これは口を勝手に操作するというか、後からもう出力を書き換えちゃってるわけですが、特定の変な単語を言わせます。絵が斜めにかけられてますっていう文章を見てパンのことを思い出す人はあんまいないと思いますけど、パンっていうのを強制的に言わせるんですよね。強制的に言わせた後に「なんであなたパンって言ったんですか」っていうのを問い詰めます。この時に、何も操作しないものと、パンっていう答えたものの概念をAIの中に注入したバージョンで、「このパンってあなた何で答えたんですか」って聞いた時にですね、どういう風に答え方が変わるのかっていうのを見た実験です。
そうすると当然ですね、何もしなかった時には「いやこれなんか多分何かの間違いだよ」と、「別にパンってあんま関係ないよね」っていうことを言うわけです、何も操作してない群は。だけれども、パンという思考を注入した群に関しては「パンって言ったのはもちろん意図的で、パンという単語の後に斜めにかけられた絵のことに関して言及される他の文章があるっぽいんだよね」みたいなことをペラペラペラペラ喋るようになるんですね。なので、パンと言わせることによって、パンという概念を見ながら自分がどう思ったかっていうのを説明させるっていう、まさに内省能力を見てる質問なわけですけれども、パンという思考があったらここの説明が変わるっていう意味では、この2番目の「根拠となっている」かどうかっていうところがちゃんと見れるようになっている質問です。
実験4はね、意外とシンプルです。自分自身の思考状態をコントロールできるかということを確認する実験なんですけれども、これは簡単で、AIに特定の文を書きながら、頭の中で「これについて考えてください」「これについて考えないでください」っていう2つの指令を出すんですね。そうした時に実際の頭の中でそういうベクトルが現れたかどうかっていうのを見てます。例えば実際に載っている例で言うと、頭の中で「水族館について考えるな」って言いながらタスクをやらせた場合と、「水族館について考えなさい」と言った上で書いた場合で、その頭の中のベクトルの活性化の状態がやっぱりですね、変化しましたと。水族館について考えるなって言った方はあんまり水族館っぽい概念が検出されなかったんだけど、水族館について考えろと言った場合は、それがちゃんと水族館について考えている内部状態になってる。
これ、結果としてはこういうグラフになっていて、青いものがThink、つまり考えながらやれって言った場合で、これ上になればなるほどそれについて考えてる度合いが高い。Don't、つまり考えるなと言われた場合は、比較的低い水準で推移してます。なので、考えてと言われてるのか考えないでと言われたのかによって、自分の思考に影響を与えられるようになってるわけです。自分自身の思考を一定操作できてるっていう意味で、結構これはモデルが思考の内部状態を操作できる可能性を示唆しているということでした。これはですね、性能差はあるんだけれども、テストした大体全てのモデルで検出できた動作だったということです。
この4つを実験したんですけれども、全体的な傾向としてはですね、やっぱり性能が高いと言われてるモデルほど内省能力も高かったそうです。いわゆるこの中で言うとOpus 4、Opus 4.1というシリーズがあるんですけれども、それがですね、一貫してこの4つで高かったということが示されています。そしてLLMはこの自分の考えの、レベル1の考えをレベル2で読み取れるだけじゃなくて、ちゃんと自分のレベル1の考えを操作もできるよっていうことが、この4つの実験で一定示されたということのようです。
次、3番目、分かったことっていうところなんですが、ざっくりとね、これ内省能力は0ではないと。すでにAIっていうのは自分の思考について認識ができたり操作ができたりすると。しかもこれは能力が高いモデルの方が内省能力も高いので、ぐんぐんぐんぐん育ちつつあるところだよねというところかなと思います。
あともう1つ重要なこととして、この論文の中で言われてたのは、哲学的な意識があるかないかみたいな議論があるんですけど、それとはマジで全く関係ないですよっていう話が結構論文の中でも何回か登場していたので、だから内省能力があるからと言って意識があるとは限らない。これはそのいわゆる人間の意識みたいなものを測れているかどうかとは全く別の問題なので、そこは混同しないようにしてくださいねということが言われておりました。意識がなくても内省をしまくることもできるだろうということでございます。
はい。ということで、このチャンネルでは珍しくAIの頭の中みたいなことを考える論文を紹介したわけですけれども、原論文、こちらのですね、概要欄にも貼っておきますので、是非興味がある方は読んでみてください。やっぱりこういうネタはSF作家としての私をすごいね、なんかワクワクするというか、思考を注入する、AIの頭の中がどうなってるかを実験で探るみたいなのは非常に面白いテーマだなと思いました。僕もこの分野は全然詳しくはないので100%理解できてるわけではないですけれども、もしね、詳しい方が見られていて、ここはちょっとあの説明違ったんじゃないのっていうとこがあったら訂正もしたいと思うんで、是非コメント欄などで指摘していただければと思います。
今後もですね、こういうネタがもしお好きな方が結構いらっしゃるようでしたら、論文の紹介とかそういうのもやっていこうかなと思っております。是非気に入った方、チャンネル登録、高評価、そしてコメントでの感想をよろしくお願いいたします。では、では。
記事公開
