なぜAIは「もっともらしい嘘」をつくのか:OpenAIのハルシネーション論文を安野貴博が読む
安野貴博の自由研究AIが事実と異なる内容を、事実であるかのように自信を持って語る現象は「ハルシネーション」と呼ばれる。安野貴博は、OpenAIが9月5日に公開したハルシネーションの発生原因に関する論文を取り上げ、その内容を解説した。話の柱は5つある。ハルシネーションとは何か、事前学習に由来する原因、評価方法に由来する原因、論文が示す解決策、そしてハルシネーションをむしろ必要とする場面である。
自分の著作を尋ねて見えたハルシネーション
安野はまず、言語モデルに自分の著作をすべて挙げさせた例を示した。ChatGPTの回答は一見正しそうだが、『はじめる力』が抜けていた。安野は、ChatGPTが参照しているWikipediaに『はじめる力』が載っていないことも原因の一つかもしれないと述べている。
Geminiに同じ質問をすると、『はじめる力』は挙がっていた。しかしアンソロジー収録作品として、「コンテクスト・オブ・ザ・デッド」という存在しない作品を挙げ、『2084年のSF』に収録された短編だと説明していた。安野が『2084年のSF』に寄せたのは「フリーフォール」という作品である。
安野は、このタイトルがそれらしすぎる点を面白がった。「〜・オブ・ザ・デッド」はゾンビ作品によく使われる言い回しで、「コンテクスト」はAIに与える文脈情報を指す。AIとゾンビを組み合わせた短編として成立しそうだし、AIがハルシネーションで出したタイトルを後から作家が書くのも面白い試みかもしれない、とゾンビ好きとして語っている。本人がそう思うほどもっともらしい嘘が出てくることが、ハルシネーションの典型例だという。
Web検索で減ったが、なくなってはいない
安野によれば、2024年にはハルシネーションが大きな問題として盛んに語られていた。その後、ChatGPTの4.5のようにモデル自体の性能が上がり、さらにAIがWeb検索をするようになったことで、精度はかなり改善したという。
それでも2025年9月時点で、ChatGPTもGeminiもそれらしい嘘をつくと安野は述べる。検索先に誤った情報があっても、LLMはそれが正しいかどうかをいちいち精査しない。そのため、まだ嘘をつく可能性は残っているという見方である。
原因1:データが正しくても学べないパターンがある
論文が挙げる根本原因の一つは、事前学習という最初の訓練段階にある。事前学習では、インターネットから集めた膨大なテキストを読み込み、言語の統計的なパターンを学ぶ。安野は、LLMが「次に来る単語を予測し続けている」という説明について、半分は正しく半分は間違っていると補足しつつ、この統計的に学ぶ段階が存在することを説明した。
学習データに誤情報が含まれていれば、誤った回答が出るのは当然である。安野が強調した論文の主張はその先にある。学習データが完全に正確だったとしても、ハルシネーションは発生するという主張だ。
論文はこれを、言語生成を二値分類の問題にたとえて説明している。二値分類とは、与えられたデータが2つのカテゴリーのどちらに属するかを判定する課題で、たとえば画像を犬と猫に分ける課題がこれにあたる。実際の画像データはもっと高次元だが、仮に2次元に集約すれば、犬らしいデータと猫らしいデータの間に線を引ける。画像認識モデルはざっくり言えば、このように分けられる切り方を探していると安野は説明した。
LLMにも似た面がある。スペルミスを含む文と含まない文を分ける場合、そこには明確なパターンがある。「おはようございます」と書かれていれば正しく、「おはようごじゃいます」なら誤りだと判断できる。正しい綴りの例は学習データに大量にあるため、正しく線を引ける。
問題は「〇〇さんの誕生日は〇月〇日です」のような文である。この種の文自体は大量にあっても、人物と日付の間にはほとんど関連性がない。安野は、誕生日は厳密にはランダムではなく、丙午のような影響や生まれやすい月もあるだろうと留保したうえで、特定の人物と特定の日付を結びつけるパターンはほぼ存在しないと述べた。イエス・キリストのように非常に有名な人物であればデータが大量にあるので問題ない。しかし安野本人の誕生日はほとんど誰も話題にしない。いくらデータを集めても、正しい生年月日の文と間違った生年月日の文をテキストだけから分ける線は、原理的に引きにくい。
LLMが学ぶ対象には、パターンを学びやすいものも多い。一方で、データから原理的にパターンを学べないものもそれなりにある。これが事前学習に由来する問題である。
原因2:「分からない」が報われない評価方法
2つ目の原因は、事前学習の後に行う事後学習の段階にある。事前学習で得たモデルはベースモデルと呼ばれる。これを目的に合わせて調整するのが事後学習で、人間のフィードバックを用いた強化学習(RLHF、Reinforcement Learning from Human Feedback)などが使われる。ハルシネーションを減らす調整もこの段階で行われる。しかし論文は、ここでモデルを誤った方法で評価しているために、ハルシネーションが大量に起きているのではないかと指摘している。
安野は論文中の表を例に挙げた。新しいモデルのGPT-5 Thinking Miniと、一つ前のOpenAI o4-miniに、SimpleQAというベンチマークを解かせた結果である。正解率では古いo4-miniのほうが高い。しかし安野によれば、これはo4-miniのほうが良いモデルだという意味ではない。誤答率、つまりハルシネーションの割合を比べると、GPT-5 Thinking Miniのほうが低いからである。
この差が生まれる理由は評価方法にある。現在の多くのベンチマークは正解か不正解かだけで判定し、正解なら1点を与える。一見妥当だが、「分からない」と言えるかどうかが考慮されていない。人間なら、安野の誕生日を知らなければ「分かりません」と答える。しかし正誤だけで採点される場合、「分かりません」の期待値は0点である。適当に「3月3日です」と答えれば、およそ365分の1の確率で当たる。正解数だけで評価されるなら、適当な日付を答えたほうが必ず得になる。
安野は、四択のペーパーテストで空欄にするより、どれかを適当に選んだほうが点が上がるのと同じだと説明した。AIはこうした方法で評価されてきたため、事後学習の中で「分かりません」と言う動機を失い、とりあえず何か答えたほうが評価される環境で育った。その結果、著作を聞かれて存在しない「コンテクスト・オブ・ザ・デッド」を自信満々に挙げるようなことが起きる、というのが安野の読み方である。
安野はこれを人間の受験にも重ねた。評価方法が歪めば、出来上がるモデルも歪む。自分が知らないことを認められず、「たぶんこうです」と言ってしまう。人間が受験やペーパーテストを通じて身につける傾向と似た現象が起きていて面白い、と述べている。
解決策:誤答に強いペナルティを与える
では、どうすればハルシネーションを減らせるのか。論文では、評価方法が鍵の一つになるとされている。適当に答えるモデルが「分からない」と答えるモデルより高く評価される今の方式をやめ、「分からない」と答えたことを適切に評価する方式に変えるというのが、挙げられている例の一つである。
具体的には、信頼度の目標をプロンプトに明記する方法が提案されている。正解なら+1点、不正解なら−3点、「分からない」なら0点とする。正解が最善であることは変わらないが、間違えると大きく減点されるので、自信がなければ「分からない」と答えたほうがよくなる。
安野は先ほどの表にある棄権率、つまり「分からない」と答えた割合に注目した。o4-miniの棄権率は1%ほどで、ほとんど「分からない」と言わない。一方のGPT-5 Thinking Miniは52%ほどで、「分からない」と答えている。安野はここから、2つのモデルの間で評価方法を変えたことがよく分かると述べた。知らないことを知らないと言えるようになり、ハルシネーション率は75%から26%へ下がった。安野は、26%もハルシネーション率としてはまだ高いとしつつ、信頼度は上がったと言えると評価した。
この解決策を「そうだよね」と納得できるものだとしたうえで、安野は論文から逆に着想を得たと話す。小中学校のペーパーテストも、不正解を−3点にするような戦略性を導入したほうがよいのではないか。運よく当たって良い点が取れることがなくなり、ハルシネーションを起こしまくる大人を減らせるのではないか、という感想である。
ハルシネーションは悪いことだけなのか
最後に安野は視点を変え、ハルシネーションは本当に悪いのかという論点を示した。もっともらしい嘘をつく能力が必要な場面もあるからだ。アイデアのブレインストーミング、小説の執筆、現実にはあり得ないが面白い設定づくりといった創作では、むしろハルシネーションが必要になる。答えのない未知の問題を推論する場合も、限られた情報から「これがそれらしい」と考えられなければならない。
安野によれば、OpenAIのサム・アルトマンは以前どこかの講演で、創造性を発揮させたいときはハルシネーションを歓迎し、事実を述べさせたいときはハルシネーションをなるべく起こさないモデルを作ることが大事だ、という趣旨を語っていたらしい。LLMからハルシネーションを完全に撲滅すると面白みがなくなるのではないか、という意見もあると安野は補足している。
論文から見えたこと
安野は、ハルシネーションには2つの原因があると整理した。学習データが完全に正しくてもパターンを読み取れない種類の情報があること。そして、適当でも何か答えたほうが高く評価される評価体制をとってきたことである。対策としては、適当なことを言えばきちんと減点される評価体制に見直すことが挙げられ、実際にハルシネーション率が下がった。
ただし、ハルシネーションは完全に悪いものではなく、使いどころもある。「こうかもしれない」とそれらしいことを言う能力が必要な場面もある、というのが安野の結論である。AIの負の側面とされがちなハルシネーションも、掘り下げてみると面白いと安野は述べている。
どうもこんにちは。安野貴博です。本日はOpenAI社が9月5日に公開した、ハルシネーションは何で起きるのかという論文について簡単に解説したいと思います。
皆さんもAIと聞いた時に、ハルシネーションが問題だっていう言葉を聞いたことあると思います。ハルシネーションとはAIが意図せずについてしまう嘘、もっともらしい嘘のことを言います。で、これなんで起きるのかっていうのは結構面白いテーマだなと思ったので、私のYouTubeでも取り上げたいなと思ってます。
大きくですね、ポイントを5つ紹介していきます。まずハルシネーションとは何か。その上で、なぜ起きるのかの問題が2つあります。事前学習の時の問題と、その後の評価方法の問題があります。で、じゃあこのハルシネーションをどういう風に解決するのか。で、5つ目がハルシネーションを解決しなくてもいい場面ってどういうところか。この5つについてお話ししていきたいと思います。
まず最初にハルシネーションというのは何なのか改めて説明したいと思います。ハルシネーションとは、言語モデルが事実とは異なる情報をあたかも事実のように生成することのことを言います。例えば私、安野貴博の著作についてLLMに質問してみるとこんな感じになります。「安野貴博の著作を全て挙げてください」と質問してみました。そうするとChatGPTの回答はこんな感じになってまして、いくつか出してくれてるんですけれども、実はですね、『はじめる力』という著作が抜けております。一見正しそうに見えるじゃないですか。見えるんですけども、実はよくよく見てみると1つ抜けている。で、これはですね、ChatGPTが参照しているWikipediaに『はじめる力』が書いてないことも原因の1つかもしれませんが、こういう風になってしまっておると。
一方ですね、Geminiに質問してみると以下の回答が得られます。こんな感じです。これはですね、『はじめる力』を挙げてくれていますけれども、ただですね、アンソロジー収録作品をいくつか挙げてもらってますが、「コンテクスト・オブ・ザ・デッド」っていう、マジでそれっぽいタイトルを勝手に作って書かれています。で、『2084年のSF』に収録されてる短編小説ですって書いてありますけど、私が『2084年のSF』に書いたのは「フリーフォール」っていう話なので、「コンテクスト・オブ・ザ・デッド」ではないです。
全然関係ないけど、「コンテクスト・オブ・ザ・デッド」って結構面白いかもしんないですよね。「なんとかオブ・ザ・デッド」ってゾンビとかによく使われたりしますけども、コンテクストってAIに突っ込む情報の文脈みたいな感じで、AIとゾンビみたいなものをうまくモチーフとして組み合わせた短編として「コンテクスト・オブ・ザ・デッド」っていう作品もあるかもしれないな。あるかもしれないし、逆にAIがハルシネーションとして出してきたタイトルを後で作家が書くっていうのは結構面白い試みな気もするので、それはそれで「コンテクスト・オブ・ザ・デッド」っていう短編を書きたくなってきた気がしますが、それは置いときましょう。ちなみに僕もゾンビが好きなんで、ゾンビ好きとしても「コンテクスト・オブ・ザ・デッド」はいいかもしれない。で、いいかもしれないと僕が思うくらい、もっともらしい、正しそうに見える嘘が出ています。こういったものがハルシネーションの典型例ですね。
で、ハルシネーションは2024年は結構問題だ問題だってものすごい言われてたんですが、最近ですね、AIがWeb検索をすることによってだいぶこの精度って改善されてきました。あとはそもそもChatGPTの4.5とかもそうですけれども、そもそものモデルの性能も上がってきたし、Webの検索によってさらに減ってきました。減ってきたんだけれども、でもですね、まだ2025年9月ではChatGPTもGeminiもそれらしい嘘をついてしまうという感じでございます。で、Web検索した先に間違った情報があったら、LLMもそれが正しい情報なのかどうかっていうのをいちいち精査しないんで、そういう意味でまだまだ嘘がつかれる可能性があります。こういったAIが不確かな情報に対して分かってるような感じを出してくるのをハルシネーションと呼びます。
ではなんでこのようなハルシネーションの問題が起きてしまっているのかということです。そもそもですね、この論文を見ると、まずハルシネーションが起きる根本的な原因の1つとして、AIの事前学習という最初のトレーニング段階の問題が挙げられています。この事前学習ってまず何なのかと言うと、AIのモデルがインターネット上から集められた膨大なテキストデータを読み込んで、言語の統計的なパターンを学ぶっていう段階ですね。よくLLMって次に出てくる単語を予測し続けてるんだよって言いますけれども、これちょっと半分くらい間違ってるんですけど、半分くらい正しくて、この統計的に学ぶ段階の学習があります。
で、この収集されてる学習データっていうのは、もちろんネット上の間違った情報を学習してしまったりもするんですけど、間違った内容を学習したら間違った回答をしてしまうのも当たり前であると。これは分かると思うんですけど、この論文で言われてるのが、もし学習データが完全に正しかったとしても、正確だったとしても、ハルシネーションは発生するっていう、こういう主張を今回の論文はしています。
どういうことかと言うと、この論文の中では言語の生成のタスクっていうものを二値分類、2つの値を分類するという問題に例えて説明しているんですが、この二値分類っていうのはですね、あるデータが与えられた時に、それがどっちのカテゴリーに属するのかっていうのを分類するっていうタスクです。例えば画像データを与えられて犬か猫に分類していくっていうのが1つ二値分類のタスクになります。グラフで見るとこんな感じですね。あるデータっていうのが例えば2次元であれば分かりやすいんですけど、本当はもうちょっと画像のデータって次元数多いですが、仮に2次元だったとした時に、ここら辺にあるデータとここら辺にあるデータとここら辺にあるデータ、その中で犬っぽいものと猫っぽいものの間に線を引いて、ここから先が犬で、ここから先が猫だねっていう風に仕分けられるというものですね。で、画像認識モデルっていうのは大体ざっくり言うとこういうことやってます。本当はもっと次元数多いんですけれども、これをぎゅっと2次元に集約してきた時に、こういう風に切ると犬と猫を分類できるよねっていう切り方を探しているような感じです。
では次、LLMはどういう風にやってるかと言うと、例えばスペルミスが含まれてる文章はこっちで、スペルミスが含まれてない文章はこっちっていう形で、ざっくり似たような形で二値分類をしていたりするわけですよね。で、これは明確にパターンがあって、例えば「おはようございます」ね。「ごじゃ」って言ってたら、これはスペルミス含んでるよねとか、「おはようございます」って言ってたら、それはもうスペルミスを含んでないよねとかですね。そこからパターンを学習して線を引くことができます。「おはようございます」みたいな正しいスペルがあるようなものに関しては学習データもたくさんありますし、正しい線を引くことができます。
ただですね、ここからが問題なんですけど、例えば「〇〇さんの誕生日は何月何日です」っていう文章、これもたくさん文章あるんですけれども、これって結構明確なパターンがないわけですよ。〇月〇日の中が1月2日の時もあれば、3月4日の時もあれば、12月3日くらいの時もあると。これは基本的に生まれる日って大体ランダムなので、ランダムって言うと言いすぎなんですけど、丙午とかあるし、何月は生まれやすいとかあると思うんで、完璧にランダムじゃないんですけど、ある〇〇さんは〇月〇日っていうことの、ここの間の関連性ってほとんどないわけですよね。で、例えばめちゃめちゃ有名な人、「イエス・キリストの誕生日は12月24日です」とかは、結構大量にデータがあるのでいいんですけど、安野貴博の生まれた日っていうのはほとんどの人は話題にしないわけですよね。なので、ここっていくらデータ集めたとしても、そこのデータから明確なパターンが引けないんですよ。
つまり犬と猫の画像のデータから犬と猫の境界線を引くとか、スペルミスを含むデータと含まないデータから線を引くとかですね。これはできるんですけど、いくらデータ集めたとしても、生年月日が合ってるデータと間違ってるデータをテキストデータだけから線を引くっていうのは、原理的になかなか難しいよねということを言っています。なので、このLLMが色々パターンを学んでいく中で、パターンを学びやすいものが結構多くあるんだけれども、パターンを学べないもの、原理的にデータからパターンを学べないものもまあまああるよねっていうことが、1つの事前学習の時の問題です。
次にですね、評価システムの問題です。先ほどの事前学習の後に事後学習っていう段階があります。OpenAIの論文で指摘されているものの2つ目として、この事後学習の評価の方法にハルシネーションを生む原因があったんじゃないかということが言われています。で、まず事後学習って何なのかっていう話なんですけれども、これはですね、事前学習で統計的なパターンを学習しましたと。これをベースモデルって呼んだりしますが、このベースモデルを目的に合わせてチューニングするっていうのが事後学習の段階です。で、この時に人間のフィードバックを用いて強化学習と呼ばれることを行ったりします。RLHFって呼ばれたりしますね。Reinforcement Learning from Human Feedbackと呼ばれたりもしますが、このような手法でこのベースモデルをより使えるモデルにチューニングしていくんですよね。で、この事後学習の段階でハルシネーションを減らすための調整が行われるんですけれども、実はここで間違った方法でモデルを評価しているがためにハルシネーションがバコバコ起きるんじゃないかということが指摘されています。
何を言ってるかと言うと、モデルの性能を評価するって結構難しい話なんですよね。ちょっと例として1つ挙げてみますが、こちらの図を見てください。ドン。えっとですね、新しいモデルのGPT-5 Thinking miniっていうやつと、ちょっと1個古いモデルのOpenAI o4-miniの2つを、SimpleQAっていうベンチマークテストでテストをさせた、ペーパーテストを解かせた結果の得点表がこちらになります。これを見てみるとですね、正確性は実はOpenAIのo4-miniの方が高くなってます。古いモデルの方が高いんですよ、正解率で見ると。だけれども、実はこれはo4-miniの方がいいモデルだということを意味しません。何かと言うと、エラー率、ハルシネーションの割合を比較すると、新しいGPT-5 Thinking miniの方が低くなっているんですよね。より間違いが減っていると。
この違いは何で生まれるのかと言うと、モデルの評価方法にあると。つまり現在のベンチマークの多くっていうのは正解か不正解かだけで判定をしていて、正解ならプラス1点とされるわけですけれども、これは一見正しいんですけど落とし穴があって、何かと言うと「分からない」って言えるかどうかなんですよね。例えば「安野貴博の誕生日は?」って言われた時に、自信がないので知らなかったら人間は「分かりません」って言うじゃないですか。で、LLMがこの時「分かりません」と言った時にですね、評価されるのは合ってるか間違ってるかだけで評価されるんで、「分かりません」って答えた瞬間に期待値が0なんですよ。絶対に当たらないと。だけれども適当に「3月3日です」とか答えると、適当であったとしても期待値365分の1くらいは当たるんですよね。なので、正解の数だけで自分が評価されるんであれば、絶対に適当な「何月何日です」って言った方が得なんですよ。で、これも皆さん経験あると思うんですけど、ペーパーテストでABCDの4択がある時に、分からないって書くよりもAかBかCかDか適当でいいから答えた方がテストの点って上がるじゃないですか。で、これと同じやり方でAIを評価していたがために、事後学習において「分かりません」という動機が全くなくなってですね、モチベーションが全くなく、とりあえず何でもいいから適当なことを言った方が評価されるっていう、そういう環境で育ってしまったわけなんですよね。なので、こういう風に自信満々で安野の著作は何かって言われた時に、「コンテクスト・オブ・ザ・デッドです」って、存在もしない短編小説の名前を言ってしまうということが起きますね。
これ結構面白いですよね。人間も受験とかをくぐり抜けているとか、ペーパーテストとかを解いていると自然とこうなると思いますけど、似たような評価方法が歪むと出来上がってくるモデルも歪んでしまうと。間違いというか、自分が知らないことを認められずに「いや多分こうっすよ」って言ってしまうっていう、面白い現象が起きてるなと思います。
では、じゃあハルシネーションをどうすれば減らせるのかということなんですが、この評価方法が1つ鍵になるかなということが言われています。先ほどご紹介した通り、今の評価方法だと分かんないって答えるモデルよりも適当に答えるモデルの方が評価が高くなってしまいますが、分からないと答えたものをしっかりと高く評価するような評価方法に変えるというのが一例で挙げられています。で、OpenAIのこの論文では、信頼度の目標っていうのをプロンプトに明記するっていうのを提案しています。つまり、正解ならプラス1点ですと。で、不正解ならマイナス3点になります。でも分からないなら0点ですっていう、そういうルールにする。1、マイナス3、0ってすると。で、こうすると、もちろん正解するのが1番いいんだけれども、間違えてしまうとすごいマイナス点を食らってしまうので、だったら分からないって答えておいた方がいいよねっていう風にした方が良いなと。
先ほどの表でですね、回答を棄権率として記載した確率が、分からないと回答した確率ですと。で、これを見てみるとですね、このo4-miniとGPT-5 Thinking miniの間で、この評価方法を変えたんだなってのがすごいよく分かりますよね。つまりo4-miniは分からないって絶対言わないんですよ。1%くらい言ってますけど、ほとんど言わない。で、一方で52%くらいですね、GPT-5 Thinking miniは言っています。なので、これちゃんと知らないことを知らないと言えてですね、ハルシネーションの率も75%から26%にググっと下がってきたと。26%もハルシネーションの率としては結構高いですけれども、とはいえ信頼度は上がったねと言えると思います。
これね、いい解決策というか、そうだよねっていう感じですよね。逆に私は、小学校、中学校とかのペーパーテストもこれと同じように不正解ならマイナス3点にした方が、運良くなのか運悪くなのか分かんないですけど、当たっちゃってなんかいい点が取れるっていうことも起きなくなるので、そういう戦略性をペーパーテストにも導入した方が、実はハルシネーションを起こしまくる大人の数を減らせるんじゃないかなっていう気が、この論文を読んで逆にしました。
で、最後にちょっと視点を変えてっていうところなんですけど、ハルシネーションって本当に悪いのかっていう論点も一方であります。というのはですね、今までハルシネーションをどう抑えるかって話してきましたけれども、このもっともらしい嘘を言う能力が必要になる場面っていうのもあります。で、例えば創作活動なんか間違いなくそうで、アイデアのブレインストーミングであるとか、小説を書くであるとか、ありえないんだけれども面白い設定を考える時には、実はハルシネーションを起こさないといけないわけですよね。あと答えのない状態に対して、未知のものに対して推論するっていうことにおいても、限定的な情報から「これがそれっぽい」と思えないといけないわけですよ。なので、このハルシネーションを起こす能力自体が必ずしも完全に悪なのかというと、そうでもなさそうっていうのが面白いポイントだと思います。
で、実際にですね、OpenAIのサム・アルトマンさんは、創造性を発揮させたい時はハルシネーションを歓迎して、事実を述べさせたい時にはハルシネーションをなるべく起こさないようにするモデルを作りたいと。そういうモデルを作ることが大事だっていうことを昔どこかの講演会かなんかで言ってたらしくて、ハルシネーションっていうのが一概に悪いかと言うと、LLMの中でハルシネーションを絶対に撲滅しなくちゃいけないかというと、それをしてしまうとちょっと面白みがなくなってしまうんじゃないかという、そういった意見もあるということを補足させていただきます。
はい。ということで本日のポイントをまとめていきます。まず1つ目、ハルシネーションとは何かということですが、これはAIがもっともらしい嘘をつくという現象です。で、この問題で2つ理由が挙げられていて、1つ目は、学習データが完全に正しかったとしてもパターンを読み取れないタイプの情報があるよということ。で、もう1つが、モデルを評価する時に、適当でもいいから何でも答えさせた方が評価を高くしてしまう評価体制を取っていたねという話。じゃあこのハルシネーションを減らすためには、4つ目のポイントとして、評価体制を見直して、適当なことを言ってたらちゃんとしばくような評価体制に変えましょうと。で、それで実際に下がりましたねという話で、5つ目は、ただハルシネーションっていうのは別に完全に悪いものでもなくて使いどころがあるよと。うまく作用する時にちゃんとハルシネーション的な筋肉を使ってですね、AIに筋肉があるわけじゃないですが、ハルシネーション的な「こうかも」っていうそれっぽいことを言ってくれる能力っていうのは、それはそれで必要になる場面もあるよね、ということでした。
ということで、よくAIの負の側面と言われるハルシネーションについての話、結構深掘ってみると面白いなと改めて思いました。ということで、本日の動画は終わりです。チャンネル登録と高評価をぜひよろしくお願いします。ではまた。
記事公開
