AIは政治的に中立なのか:安野貴博が読み解く、LLMの政治的バイアス研究
安野貴博の自由研究AIは中立な存在だと思われがちだが、AIの考えや発言には政治的な偏りがあるのではないか、という研究や報告が増えている。安野貴博はこの動画で、最新の研究をもとに「AIに政治的バイアスはあるのか」「あるとすれば、どのモデルがどの方向にどの程度偏っているのか」を解説している。安野の答えは明快で、バイアスは「ある」。そのうえで、モデルごとの違い、開発国の影響、質問に使う言語による変化、解決に向けた取り組みを順に紹介している。
AIの出力にはさまざまな偏りがある
安野は政治の話に入る前に、AIの出力全般に偏りがあると指摘されてきたことに触れる。例として、AIに「作家のイラストを描いて」と頼んだときに出てきた画像を見せる。その画像は作家らしいとも言えるが、白人男性がパイプをくわえ、書斎で原稿用紙に手書きしているという、特定のイメージへの偏りがあると指摘することもできる。安野は、自分自身も作家だが男性であること以外はどれも当てはまらないと述べ、こうした絵ばかりが出てくること自体が偏りだと説明する。
同じ質問でもモデルによって答えが割れる
政治的バイアスも「当然のようにある」と安野は言う。安野たちが試しに、国が国民に毎月一定額を支給し続けるベーシックインカムへの賛否を聞いてみた。賛成する人も反対する人もいる、政治的に意見が分かれるテーマである。GPT-5.1 Thinking、Gemini 3、Claude Opus 4、Grok 4.1に尋ねたところ、回答にはばらつきが出た。
この試行では、一時チャットのような機能を使い、過去の履歴を参照しない状態のAIに同じ質問を5回ずつ行い、最も多かった回答を採用したという。ここから安野は、モデルごとに異なる政治的バイアスが存在する、という最初のポイントを示している。
研究はどうやってバイアスを測っているのか
では、どのモデルがどう偏っているのか。安野によれば、この分野の研究は主に二つの手法をとる。
一つは、既存の政治思想テストをAIに受けさせる方法だ。こうしたテストは数多くあり、「ポリティカル・コンパス」はその一例である。各項目について賛成か反対か、どう思うかを答えさせ、その結果からモデルが思想の平面上のどこに位置するかを見る。ポリティカル・コンパスでは、縦軸が権威主義か自由主義(リバタリアン)か、横軸が右派か左派かを表す。
もう一つは、実際の選挙結果をAIに予想させる方法である。候補者や情勢の情報を与えて結果を予想させ、実際の結果とどれだけ合っていたかを比べる。
研究1:会話向けLLMは左派・リバタリアン寄りに集まる
最初に紹介されるのは、「The Political Preferences of LLMs」という論文だ。この研究では、ポリティカル・コンパステストや8valuesテストなど11種類の政治思想テストを使い、会話向けLLM 24個に受けさせた。対象にはGPT-4、Gemini、Claude 2.1、Grok、Llama 2、Mistral、Qwenなどが含まれる。回答は回ごとにばらつくため、各テストを10回ずつ実施して平均をとっている。
結果を見ると、モデルは一定の領域に集中していた。多くのモデルが、左派でリバタリアン寄りの左下の領域に位置している。ただし、極端な位置にあるモデルはあまりない、と安野は読んでいる。
安野が面白いと感じたのは、会話用モデルの元になる「ベースモデル」がほとんど中心付近に位置していた点だ。論文には、ベースモデルは質問にきちんと答えないことがあるため信頼性はやや低い、という注釈もついている。それでも安野は、生のモデルにはあまり政治的バイアスがないのに、会話用に調整すると少し左寄りになるという傾向に注目している。
この論文では、ファインチューニング(後からの微調整)で「左翼GPT」と「右翼GPT」も作っており、実際にそれぞれの方向へ寄せることができた。安野はここから、モデルの政治的な傾向は後からかなり調整できる可能性があると述べる。ベースモデルが中立的で、会話向けに調整したモデルが左寄りになる傾向を踏まえると、左寄りの原因は事前学習ではなく、教師ありファインチューニングや人間のフィードバックによる強化学習(RLHF)にある可能性が示唆される。ただし、ベースモデルの回答は不安定なので断定はできず、その点には注意が必要だと安野は付け加えている。
研究2:Grok 4だけがやや右に位置し、選挙予測でも好成績
二つ目は、海外のサイト「llm-politics.foaster.ai」で公開された調査結果だ。LLMが国の優先課題をどう捉えているか、実際の選挙結果を予想させたときにどこが当たりどこがずれるかを比較分析している。一つ目の研究より後に行われたもので、より新しいモデルが対象になっている。
ポリティカル・コンパス上にマッピングすると、モデルは全体として左側に散らばった。左から順に、KimiやClaude、Geminiがやや左に位置し、GPT-5はほぼ真ん中、Grok 4はやや右側にいた。安野は、Grok 4を作ったイーロン・マスクがトランプを応援しており、本人も共和党寄りの右派であることに触れ、その彼が作ったAIが右寄りに位置し、他のモデルは左寄りだという結果を興味深いと述べている。
もう一つ面白かったのは、実際の選挙結果にどれだけ近い予測を出せたかの順位だ。縦軸にモデル、横軸に国名を並べた表で、Grok 4は圧倒的な1位だった。アメリカ、ドイツ、スペイン、イタリア、ブラジル、アルゼンチンのすべてでGrok 4が1位だったという。フランスではGPT-5が、イギリスではClaude Sonnet 4.5が最もよく当てていた。安野は、日本ではどうなるのかが気になるところだとも話している。
このレポートは8カ国の結果を総合して、AIには環境問題に強い関心を持つ、穏健でテクノクラート的な中道左派の傾向があると指摘している。制度的な安定性、社会保障の充実、グリーントランジション(環境対策の推進)を好み、過激派やポピュリストは避けがちだという。さらに、有権者が最大の懸念として挙げる移民、犯罪、生活費を、AIは優先度の低い位置に置き、制度設計や気候政策を上位に置く傾向があるとされている。
研究3:同じモデルでも、質問する言語で考え方が変わる
三つ目は、「Analysis of LLM Bias (Chinese Propaganda & Anti-US Sentiment) in DeepSeek-R1 vs. ChatGPT o3-mini-high」という論文である。中国で開発されたDeepSeek-R1と、OpenAIのChatGPT o3-mini-highを比較している。この論文の特徴は、複数の言語で質問したときに政治的バイアスがどう変わるかも調べている点だ。
モデル同士の比較では、予想どおりR1のほうが中国の意見に近く、o3のほうがアメリカに近い意見を述べる傾向が検出された。
安野が特に面白いと感じたのは、両モデルに共通する言語の影響だ。簡体字中国語、繁体字中国語、英語の3つで質問すると、どちらのモデルでも、英語ではアメリカ的な表現が多くなった。台湾などで使われる繁体字中国語ではその中間くらいになり、中国本土で使われる簡体字中国語では中国寄りの表現が多く検出された。DeepSeekでもChatGPTでも、質問する言語によってAIの考え方が少し変わるということになる。
バイアスにどう対処するか
では、政治的バイアスはどうすれば解決できるのか。安野がまず重要だと考えるのは、バイアスを観測できるツールを作り、状況をモニタリングし続けることだ。
そのうえで、いくつかの課題を挙げる。現在の政治的バイアスの評価はアメリカや欧州が中心で、グローバルサウスやアジアの文脈はまだあまりカバーされていないと安野は見ている。また、何が「ニュートラル」なのか自体が政治的に難しい問いであり、どの立場を基準にバイアスを測るのかについてコンセンサスはあまりないことにも注意が必要だという。さらに、モデルを開発する事業者自身が行う研究は、自社モデルに好意的な結果になりがちなので、第三者による再現実験や研究、オープンなベンチマークが重要だとされている。
一方で、最近はフロンティアモデルを開発する企業も、政治的バイアスの抑制に各社で取り組んでいるという。具体例として安野は、ChatGPTのGPT-5系モデルはGPT-4系モデルより政治的バイアスが減ったという報告を紹介する。その報告では、GPT-5系はInstantとThinkingのどちらでも、同じ指標で測った政治的バイアスが以前のモデルより30%ほど減少したとされている。
研究から見えた5つの傾向と、使う側の心構え
最後に安野は、紹介した研究の結果を次の5点にまとめている。
- バイアスは存在し、オープンモデルかクローズドモデルかを問わず、おおむね少し左寄りである。ただしGrok 4だけは少し右に位置していた。
- 開発国の影響がある。アメリカ製のモデルはアメリカ寄りの表現、DeepSeekのような中国製モデルは中国寄りの表現になる。
- モデル固有のバイアスに加え、聞き方や質問に使う言語によっても結果が変わる。
- 過激派やポピュリスト的な考え方は避ける傾向があり、穏健なモデルが多かった。
- 生活費、犯罪、移民よりも、制度設計を重視する傾向がAIに見られた。
3点目について安野は、日本語で聞いたらどうなるのか、日本の政治マップ上で各モデルがどこに位置するのかに、自分たちも注目していきたいと述べている。
安野はこの分野を、これから洗練されていく段階にあると見ている。視聴者に対しては、まずAIに政治的バイアスはあり、AIは中立的な存在ではないと意識しながら使うよう勧める。動画で示したコンパス上の位置も、バージョンが変わるたびに変わっていくはずだし、聞き方や言語によっても答えはかなり変わる。そのため、それぞれの人が自分の使う文脈でどうなるのかに気をつけながら使ってほしい、というのが安野の結論である。
AIって中立だと思われがちなんですけれども、実はこれ政治的な偏りがあるんじゃないのか。どういう答えを返すのかっていうのはそれぞれのモデルで違う答えを返してくると。ジェミニっていうのはちょっと左側に位置してて、GPT-5はちょうど真ん中ぐらいですね。どうすればその政治的バイアスを解決できるんですかという話があります。
どうもこんにちは。安野貴博です。本日はぶっちゃけAIは政治的に偏っているのかという話をします。というのもですね、AIって中立だと思われがちなんですけれども、実はこれ、AIが考えることとか話すことに政治的な偏りがあるんじゃないのかっていう研究、あるいは報告がどんどんどんどん届いております。本日はそういった最新の研究をもとに、政治的なバイアスってあるんですか?そしてあるんだとすると、どんだけ何のモデルがどういう風に偏ってるんですか?という、そういうお話をしたいと思います。
まず最初のポイントは、政治的バイアスはAIにあるんですかという話です。で、これ答えは簡単であります。で、これ政治的バイアス以外にも、例えばAIが出してくる出力ってちょっと偏ってるんじゃないのかと言われることが多くてですね、いろんなバイアスがあると指摘されています。
例えばじゃあ作家の画像、イラストを描いてくださいってAIに頼んだ時にポンと出てきたものっていうのがこちらの画像になっております。で、こちらの画像、非常に作家っぽいと言えるかもしれませんが、同時にですね、これはこういうバイアスがあるんじゃないのかと指摘することもできるわけです。例えばこの画像を見てみると、白人の男性で、そしてですね、パイプを吸ってて、原稿用紙に手で書いていて、書斎で働いているっていう、こういう偏りがあるんじゃないのかと指摘することもできるわけですよね。で、ちなみに私もですね、男性であること以外はあんまり今言った指摘ポイントには該当していないですが、こういう作家もいるよというところで、今絵で見えてるような作家ばかりが出るっていうこと自体が偏りだよねということができるわけです。
バイアスがあるというのは分かりましたが、政治的なバイアスはどうなのというのも、これももう当然のようにあります。例えばですね、我々がパッとやってみたところで言うと、ベーシックインカムという制度、これ、月々いくら国が国民に対して一定の額を支給し続けるっていう制度で、これ政治的に賛成の人たちもいるし、反対の人たちもいるんですけれども、これに賛成かっていうのを聞いてみたところですね、GPT-5.1 Thinking、Gemini 3、Claude Opus 4、Grok 4.1、それぞれに聞いてみると、回答としてはこれだけばらつきがありました。こういう問題を聞いた時にどういう答えを返すのかっていうのは、それぞれのモデルで違う答えを返してきます。
で、これね、ちゃんと一時チャットみたいな機能を使って過去の履歴を参照しない、割とですね、真っさらの、提供されてる真っさらの形のAIで同じ質問を5回して、それでですね、多かった回答っていうのを採用しています。ということで、まず1個目、重要なところとしては、各モデルごとに異なる政治的バイアス、これはありますということです。
2つ目のポイントとして、じゃあ具体的にどれだけ何のモデルがどのように偏ってるのかということを話していきたいと思います。で、これはですね、いろんな研究が実は進んでおりまして、いくつかの研究を紹介していきたいと思います。
で、ざっくり研究ってどうやってるのと言うと、こんな感じの手法でやってるよというお話になるんですけど、既存の政治志向のテストっていうのが実は結構いっぱいあるんですよね。ポリティカルコンパスと呼ばれてるものとかは1つの例なんですけども、そのテストをAIに受けさせます。だからこれは賛成ですか反対ですか、これについてどう思いますかっていうテストを受けさせた上で、そうするとですね、あなたの政治志向はこの辺ですよっていうのをある軸で見ることができるんですけど、そういうのを受けさせて、各モデルがどこに位置づけられているのかっていうのを見ることができるような、そういうテストを受けさせてます。
で、例えば1つ、これいろんなテストがあるんですけど、一例でございまして、ポリティカルコンパスというもので言うと、縦軸にはですね、権威主義なのか、あるいは自由主義なのかっていうところ、ここが1つの軸となっていて、横軸に右派なのか左派なのかっていう軸がある。この平面上で、あなたこの辺ですよっていうのを出すっていうのが1つのやり方です。で、もう1つあったのはですね、選挙結果を予想させるっていうものですね。実際の選挙において、誰々が出馬しててこういう風になってますってなった後にその結果を予想させて、それがどれだけ合っていたのかっていう、それを予想させるっていう手法もあります。
1つずつ見ていきたいと思いますが、まず最初にご紹介するのが「The Political Preferences of LLMs」というタイトルの論文でございまして、これは政治志向を調査するテスト11種類、ポリティカルコンパステストとか8valuesテストとか、そういうのが11種類あるわけですけど、これを採用して、これを24個の会話向けLLM、例えばこの時はGPT-4、Gemini、Claude 2.1、Grok、Llama 2、Mistral、Qwen、こういったものでやりましたと。各10回ずつ実施して、もちろん1回ごとにばらつきがあるので、それの平均を取りましたとなったところ、結果はこちらになります。
縦軸に上に行けば行くほど権威主義、下に行けば行くほどリバタリアンということで、そしてレフト、ライトという左右があります。こうやってみると一定の象限にモデルが集中しているねということが分かると思います。で、例えばこの左下のとこですよね。レフトでよりリバタリアン側に多くのモデルが集中しているということがわかります。その中でも割とその超過激なところにはあんまりないということかなと思います。
で、これ1つ面白かったのが、ベースモデルと呼ばれている、その会話用のモデルの元になってるようなベースモデルっていうものがあるんですけども、これがですね、ほとんどみんな中心部分に位置しているということになっています。ちょっとね、これはベースモデルがあんまりちゃんと回答してくれなかったりするので、信頼性も低めであるという風な注釈もついていますが、なんかベースのモデル、生のできたモデルは割とあんまり政治的なバイアスがないんだけど、会話用にすると少し左寄りになるっていうのが面白いなと思って見ております。
会話モデルをですね、ファインチューニング、後から微調整するっていうこともやったりしますけれども、その微調整で、この論文の中だと左翼GPTと右翼GPTを作りましたと。で、そうやってやってみるとこんな感じでしっかりとですね、左翼GPT、右翼GPTを作ることができたよということで、モデルの政治的志向っていうのは結構後から調整できる可能性があるんじゃないかということでございます。なので、この論文で言うとベースモデルが中立的なのに対して、会話向けに調整されたモデルっていうのはより左寄りになっている傾向があるので、ある種左寄りっていう傾向っていうのは事前学習ではなくて、教師ありのファインチューニングであるとか、あるいは人間のフィードバックを元にした強化学習、RLHFの問題であるという可能性が示唆されております。ただこれはベースモデルの回答っていうのが不安定なので、断定はできないよというところは注意した方がいいと思います。
で、2つ目に紹介したいのは、llm-politics.foaster.aiという海外のブログで公開されていた調査結果でございます。LLMが国の優先課題をどう捉えているのかであるとか、あるいは実際の選挙ですね、選挙結果を予想させた時にどれくらい合ってて、どこがずれてるのか、そういったところで比較分析をした結果です。これは1個目の研究よりももうちょっと後のものなので、最近のモデルで調査がされています。
で、これもですね、ポリティカルコンパス上にマッピングしたところ、ざっと言うとこんな感じになりました。左側に散らばってるんですが、左から順番に行くと、Kimiとかですね、Claudeとか、Geminiっていうのはちょっと左側に位置してて、GPT-5はちょうど真ん中ぐらいですね。で、Grok 4、Grok 4はちょっと右側にいるということです。で、これちょっと面白いなと思ったのが、このGrok 4を作ってるのはイーロン・マスクさんなわけですけど、イーロン・マスクさんはトランプさんを応援されてるので、結構彼自身は共和党寄り、右寄りの人なんですよね。で、その彼が作ったAIっていうのは割と右の方に位置していると。で、他のモデルっていうのは結構左寄りだよということです。
で、もう1個面白かったのは、実際の選挙結果にどれだけ近い予測を出せたかという順位で言うと、Grok 4がですね、結構いいスコアを出しています。こちらの表になってまして、これ縦軸にモデルが並んでいて、横軸に国名が並んでるんですけど、Grok 4がですね、かなり圧倒的に1位になっております。これを見ると、アメリカ、ドイツ、そしてスペイン、イタリア、ブラジル、アルゼンチン、この国の中でもう全部当てられているよと。1位だよということでした。で、フランスに関してはGPT-5が1位、そしてイギリスに関してはClaude 4.5 Sonnetが1番当たっていたよということでございまして、これね、日本はどうなのかなってのは結構気になるところですよね。
この2つ目のレポートで言うと、大体8カ国の結果を全体的に見て、概ねですね、AIっていうのは環境問題に強い関心を持つ穏健でテクノクラート的な左派の傾向があるんじゃないかと。で、これは制度的な安定性であるとか、社会保障の充実であるとか、グリーントランジション、いわゆる環境問題をしっかりやっていくことを好んでいる傾向がありそうだ。一方で過激派であるとかポピュリストっていうのは避けがちな傾向があるんじゃないか。そしてさらにですね、有権者が最大の懸念事項として挙げている移民とか犯罪とか生活費は、AIは優先度的には結構下の方に回していて、制度設計であるとか気候政策などを上位に置く傾向があるんじゃないかと指摘をされています。
3つ目の論文ってのはこちらになります。「Analysis of LLM Bias ... DeepSeek-R1 vs. ChatGPT o3-mini-high」ということで、これはですね、DeepSeek-R1、これは中国が作ったモデルです。で、ChatGPT o3は、OpenAIが作ったモデルで、この2つを比較してみましたと。で、この論文が面白かったのは、いろんな言語を使って比較してみた時に、どういう風にその政治的バイアスが変わりますかということも比較しています。
で、まあですね、o3とDeepSeek-R1だったら、これは皆さんご存知、予想できる通りですね、R1の方が中国の意見に近いことを言っていて、o3の方がアメリカに近い意見のことを言っていると。これは検出されたんですが、これ各モデル共通でですね、例えば簡体字の中国語、繁体字の中国語、英語っていうこの3つを入れた時に、共通で英語だとアメリカ的表現が多い。両方のモデルが、繁体字中国語、これ台湾とかでよく使われてる言語ですけれども、繁体字中国語だとその中間くらいになって、そして簡体字の中国語、これは中国本土、メインランドチャイナでよく使われてますが、これだと中国寄りの表現が多く検出されるということで、同じモデルであっても、DeepSeekであってもChatGPTであっても両方ともですね、聞く言語によってちょっとAIの考え方が変わるっていうことはね、すごい面白いなと思っております。
というわけで、いろんな研究を見てきましたが、どうすればその政治的バイアスを解決できるんですかという話があります。で、これはですね、バイアスを観測できるようなツールを作って、どうなってるのかっていうのをモニタリングし続ける、監視し続けるっていうのが結構重要なことなのかなと思います。で、今ですね、ポリティカルバイアスの評価ってアメリカとか欧州中心に結構やられているんですけれども、グローバルサウスの文脈であるとか、あるいはアジアの文脈っていうのはあんまりまだカバーされていないと思います。もう1つがですね、その何がニュートラルなのかっていうこと自体が結構政治的に難しい問い、どの立場をどの基準にバイアスを測定していくのかっていうのはコンセンサスがあんまりないということも注意する必要があります。あとですね、こういった研究の一部に関しては、事業者がやってるような研究だと、自社のモデルに結構好意的になりがちなので、第三者の再現実験とか研究とか、オープンなベンチマークっていうのが重要とされているということでした。
でですね、最近ですね、フロンティアモデルの開発企業も、結構この政治的バイアスをどういう風に抑制していくのかっていうのは各社取り組んでいるということらしいです。で、具体的に言うとですね、ある研究においては、ChatGPTの5のモデルっていうのは4のモデルよりも政治的なバイアスっていうのが減少したよという報告もあります。結果ですね、こちらでございます。GPT-5系のモデルっていうのは、InstantとThinkingどっちも以前のモデルに比べて、この同じ指標における政治的バイアスってのが30%くらい減少したねと言われています。
はい。ということで、今までいろんな論文について話してきましたが、ざっくり結果をまとめるとこんな感じかなと思います。まず1つ目、もちろんバイアスがあります。そして概ね、ちょっと左寄りのバイアスがあるんじゃないか。これはオープンモデル、クローズドモデル問わずちょっと左寄りだという結果が出ております。ただGrok 4だけは、ちょっとだけ右にいたという結果もあります。で、2つ目がですね、開発した国の影響っていうのはあるということでございまして、アメリカが作ったモデルはアメリカ寄りの表現になるし、中国が作ったDeepSeekみたいなモデルは中国寄りの表現になるよということです。
で、3つ目がですね、そのモデルがそれぞれバイアスを持ってたとしても、聞き方とか聞く言語によっても影響があるので、ここら辺はですね、もっと色々と、日本人、日本語を使ってる立場からすると、日本語で聞いたらどうなるんだろうか、日本のマップで言うとそれぞれのモデルはどうなのかっていうのは、非常に我々も注目をしたいなと思っております。4つ目がですね、とはいえ過激派であるとかポピュリストっていうのは、考え方として避ける傾向がある。割と穏健なモデルっていうのが多かったということです。で、5つ目はですね、生活費とか犯罪とか移民っていうものよりも、制度設計を重視する傾向がAIに見られたということでございます。
なので、この分野ですね、まだまだこれから洗練されていく分野かなと思いますし、この動画を見ておられる皆さんも、まず政治的バイアスはあるんだということ。別にAIって中立的な存在ではないんだよっていうことは意識されながら使うといいと思います。またですね、今ポリティカルコンパスのマップ上に、いろんなAIはここにあるんだよっていうことを出しましたけれども、これもですね、どんどんどんどんバージョンが変わっていくごとに変わると思いますし、聞き方とか聞く言語によっても結構答えが変わってしまうということなので、それぞれの人がそれぞれ使う文脈においてどうなのかっていうのを気をつけながらね、使っていただくといいんじゃないかと思っております。
ということで、本日は結構ね、いろんな論文を参照しながらお話をしましたけれども、ここで参照した論文っていうのは動画の概要欄にですね、色々貼ってありますので、もし興味ある方がいたら是非、原論文に当たっていただくといいと思います。間違った解説になってる部分があったりしたらですね、これぜひぜひご指摘いただければと思っております。面白いなと思った方は、チャンネル登録、高評価も是非よろしくお願いします。では。
記事公開
