なぜAIは「もっともらしい嘘」をつくのか:OpenAIのハルシネーション論文を安野貴博が読む

YouTubeで開く ↗
概要

AIが事実と異なる内容を、事実であるかのように自信を持って語る現象は「ハルシネーション」と呼ばれる。安野貴博は、OpenAIが9月5日に公開したハルシネーションの発生原因に関する論文を取り上げ、その内容を解説した。話の柱は5つある。ハルシネーションとは何か、事前学習に由来する原因、評価方法に由来する原因、論文が示す解決策、そしてハルシネーションをむしろ必要とする場面である。

9分で読めます

自分の著作を尋ねて見えたハルシネーション

安野はまず、言語モデルに自分の著作をすべて挙げさせた例を示した。ChatGPTの回答は一見正しそうだが、『はじめる力』が抜けていた。安野は、ChatGPTが参照しているWikipediaに『はじめる力』が載っていないことも原因の一つかもしれないと述べている。

Geminiに同じ質問をすると、『はじめる力』は挙がっていた。しかしアンソロジー収録作品として、「コンテクスト・オブ・ザ・デッド」という存在しない作品を挙げ、『2084年のSF』に収録された短編だと説明していた。安野が『2084年のSF』に寄せたのは「フリーフォール」という作品である。

安野は、このタイトルがそれらしすぎる点を面白がった。「〜・オブ・ザ・デッド」はゾンビ作品によく使われる言い回しで、「コンテクスト」はAIに与える文脈情報を指す。AIとゾンビを組み合わせた短編として成立しそうだし、AIがハルシネーションで出したタイトルを後から作家が書くのも面白い試みかもしれない、とゾンビ好きとして語っている。本人がそう思うほどもっともらしい嘘が出てくることが、ハルシネーションの典型例だという。

Web検索で減ったが、なくなってはいない

安野によれば、2024年にはハルシネーションが大きな問題として盛んに語られていた。その後、ChatGPTの4.5のようにモデル自体の性能が上がり、さらにAIがWeb検索をするようになったことで、精度はかなり改善したという。

それでも2025年9月時点で、ChatGPTもGeminiもそれらしい嘘をつくと安野は述べる。検索先に誤った情報があっても、LLMはそれが正しいかどうかをいちいち精査しない。そのため、まだ嘘をつく可能性は残っているという見方である。

原因1:データが正しくても学べないパターンがある

論文が挙げる根本原因の一つは、事前学習という最初の訓練段階にある。事前学習では、インターネットから集めた膨大なテキストを読み込み、言語の統計的なパターンを学ぶ。安野は、LLMが「次に来る単語を予測し続けている」という説明について、半分は正しく半分は間違っていると補足しつつ、この統計的に学ぶ段階が存在することを説明した。

学習データに誤情報が含まれていれば、誤った回答が出るのは当然である。安野が強調した論文の主張はその先にある。学習データが完全に正確だったとしても、ハルシネーションは発生するという主張だ。

論文はこれを、言語生成を二値分類の問題にたとえて説明している。二値分類とは、与えられたデータが2つのカテゴリーのどちらに属するかを判定する課題で、たとえば画像を犬と猫に分ける課題がこれにあたる。実際の画像データはもっと高次元だが、仮に2次元に集約すれば、犬らしいデータと猫らしいデータの間に線を引ける。画像認識モデルはざっくり言えば、このように分けられる切り方を探していると安野は説明した。

LLMにも似た面がある。スペルミスを含む文と含まない文を分ける場合、そこには明確なパターンがある。「おはようございます」と書かれていれば正しく、「おはようごじゃいます」なら誤りだと判断できる。正しい綴りの例は学習データに大量にあるため、正しく線を引ける。

問題は「〇〇さんの誕生日は〇月〇日です」のような文である。この種の文自体は大量にあっても、人物と日付の間にはほとんど関連性がない。安野は、誕生日は厳密にはランダムではなく、丙午のような影響や生まれやすい月もあるだろうと留保したうえで、特定の人物と特定の日付を結びつけるパターンはほぼ存在しないと述べた。イエス・キリストのように非常に有名な人物であればデータが大量にあるので問題ない。しかし安野本人の誕生日はほとんど誰も話題にしない。いくらデータを集めても、正しい生年月日の文と間違った生年月日の文をテキストだけから分ける線は、原理的に引きにくい。

LLMが学ぶ対象には、パターンを学びやすいものも多い。一方で、データから原理的にパターンを学べないものもそれなりにある。これが事前学習に由来する問題である。

原因2:「分からない」が報われない評価方法

2つ目の原因は、事前学習の後に行う事後学習の段階にある。事前学習で得たモデルはベースモデルと呼ばれる。これを目的に合わせて調整するのが事後学習で、人間のフィードバックを用いた強化学習(RLHF、Reinforcement Learning from Human Feedback)などが使われる。ハルシネーションを減らす調整もこの段階で行われる。しかし論文は、ここでモデルを誤った方法で評価しているために、ハルシネーションが大量に起きているのではないかと指摘している。

安野は論文中の表を例に挙げた。新しいモデルのGPT-5 Thinking Miniと、一つ前のOpenAI o4-miniに、SimpleQAというベンチマークを解かせた結果である。正解率では古いo4-miniのほうが高い。しかし安野によれば、これはo4-miniのほうが良いモデルだという意味ではない。誤答率、つまりハルシネーションの割合を比べると、GPT-5 Thinking Miniのほうが低いからである。

この差が生まれる理由は評価方法にある。現在の多くのベンチマークは正解か不正解かだけで判定し、正解なら1点を与える。一見妥当だが、「分からない」と言えるかどうかが考慮されていない。人間なら、安野の誕生日を知らなければ「分かりません」と答える。しかし正誤だけで採点される場合、「分かりません」の期待値は0点である。適当に「3月3日です」と答えれば、およそ365分の1の確率で当たる。正解数だけで評価されるなら、適当な日付を答えたほうが必ず得になる。

安野は、四択のペーパーテストで空欄にするより、どれかを適当に選んだほうが点が上がるのと同じだと説明した。AIはこうした方法で評価されてきたため、事後学習の中で「分かりません」と言う動機を失い、とりあえず何か答えたほうが評価される環境で育った。その結果、著作を聞かれて存在しない「コンテクスト・オブ・ザ・デッド」を自信満々に挙げるようなことが起きる、というのが安野の読み方である。

安野はこれを人間の受験にも重ねた。評価方法が歪めば、出来上がるモデルも歪む。自分が知らないことを認められず、「たぶんこうです」と言ってしまう。人間が受験やペーパーテストを通じて身につける傾向と似た現象が起きていて面白い、と述べている。

解決策:誤答に強いペナルティを与える

では、どうすればハルシネーションを減らせるのか。論文では、評価方法が鍵の一つになるとされている。適当に答えるモデルが「分からない」と答えるモデルより高く評価される今の方式をやめ、「分からない」と答えたことを適切に評価する方式に変えるというのが、挙げられている例の一つである。

具体的には、信頼度の目標をプロンプトに明記する方法が提案されている。正解なら+1点、不正解なら−3点、「分からない」なら0点とする。正解が最善であることは変わらないが、間違えると大きく減点されるので、自信がなければ「分からない」と答えたほうがよくなる。

安野は先ほどの表にある棄権率、つまり「分からない」と答えた割合に注目した。o4-miniの棄権率は1%ほどで、ほとんど「分からない」と言わない。一方のGPT-5 Thinking Miniは52%ほどで、「分からない」と答えている。安野はここから、2つのモデルの間で評価方法を変えたことがよく分かると述べた。知らないことを知らないと言えるようになり、ハルシネーション率は75%から26%へ下がった。安野は、26%もハルシネーション率としてはまだ高いとしつつ、信頼度は上がったと言えると評価した。

この解決策を「そうだよね」と納得できるものだとしたうえで、安野は論文から逆に着想を得たと話す。小中学校のペーパーテストも、不正解を−3点にするような戦略性を導入したほうがよいのではないか。運よく当たって良い点が取れることがなくなり、ハルシネーションを起こしまくる大人を減らせるのではないか、という感想である。

ハルシネーションは悪いことだけなのか

最後に安野は視点を変え、ハルシネーションは本当に悪いのかという論点を示した。もっともらしい嘘をつく能力が必要な場面もあるからだ。アイデアのブレインストーミング、小説の執筆、現実にはあり得ないが面白い設定づくりといった創作では、むしろハルシネーションが必要になる。答えのない未知の問題を推論する場合も、限られた情報から「これがそれらしい」と考えられなければならない。

安野によれば、OpenAIのサム・アルトマンは以前どこかの講演で、創造性を発揮させたいときはハルシネーションを歓迎し、事実を述べさせたいときはハルシネーションをなるべく起こさないモデルを作ることが大事だ、という趣旨を語っていたらしい。LLMからハルシネーションを完全に撲滅すると面白みがなくなるのではないか、という意見もあると安野は補足している。

論文から見えたこと

安野は、ハルシネーションには2つの原因があると整理した。学習データが完全に正しくてもパターンを読み取れない種類の情報があること。そして、適当でも何か答えたほうが高く評価される評価体制をとってきたことである。対策としては、適当なことを言えばきちんと減点される評価体制に見直すことが挙げられ、実際にハルシネーション率が下がった。

ただし、ハルシネーションは完全に悪いものではなく、使いどころもある。「こうかもしれない」とそれらしいことを言う能力が必要な場面もある、というのが安野の結論である。AIの負の側面とされがちなハルシネーションも、掘り下げてみると面白いと安野は述べている。