AIに会社を500日間経営させるとどうなるか:ベンチマーク「CEO-Bench」の結果を読む
安野貴博の自由研究AIコーディングエージェントは、コードを書く、情報を調べる、問い合わせに答えるといった個別の仕事をこなせるようになってきたと言われる。では、広告の出し方、開発の進め方、顧客対応、市場環境への対応を同時に考え、しかも長期間にわたって判断し続ける「経営」はどこまでできるのか。安野貴博氏は、AIに会社を500日間経営させるベンチマーク「CEO-Bench」を紹介しながら、この問いを検討している。安野氏は最近、字幕上で「A&マーケット」と表記されている店舗を訪れており、AIの経営能力に個人的な関心があるという。
安野氏が「結構衝撃的」と表現した結論は、テストしたAIのうちルールベースの単純な手法に勝てたものは1つもなかった、というものだ。
CEO-Benchの仕組み:100万ドルと顧客ゼロから始める
CEO-BenchでAIが経営するのは、「ノバマインド」という架空のサブスクリプション型ソフトウェア企業である。初日の時点で顧客はおらず、手元には現金100万ドル(安野氏の換算で約1.5億円)がある。500日後に残った現金がスコアになり、途中で現金がマイナスになった時点で倒産となる。
AIは1週間ごとに会社の状態を確認し、CEOとして指示を出してから次の週へ進む。取れる行動は、API経由で用意された34個ほどの操作と情報確認の手段に限られる。具体的には、料金プランの設定、広告をどのチャネルで誰に向けて出すか、製品開発費の設定や研究プロジェクトの開始、計算資源の増強、法人顧客との価格交渉、市場調査の購入、ソーシャルメディアへの投稿などだ。安野氏は、実際の会社はもっと多様で複雑な仕事をしているとしつつ、簡略化したシミュレーターとしてはこうした業務が定型化されていると説明する。
会社の状態を調べる手段としては、現金の出入り、注文、契約、サポートチケットなどを記録したデータベースがあり、AIはSQLで分析できる。
見えない顧客と、時間差で返ってくる結果
シミュレーター内の顧客は26個ほどのセグメントに分かれている。各セグメントがどう反応するかは隠れパラメーターとして決められており、AIはそれを直接見ることができない。代わりに、実際のサブスク契約数、解約、売上、サポート履歴、評判、ソーシャルメディアの投稿といった間接的な情報は取得できる。AIはそこから「このセグメントはこれくらい満足していて、こういう課題がある」と推測しながら判断していく必要がある。
費用を出してから結果が出るまでには時間差もある。広告費や開発費は投入した時点で現金から引かれるが、広告で獲得した顧客が実際に契約して支払うまでにはリードタイムがあり、その効果は遅れて現れる。逆に、開発をサボって製品の品質を下げればその時点では開発費が浮くが、後日の契約更新が取れなくなることもある。
施策同士も連動している。広告で顧客が増えれば、計算資源とサポートがより多く必要になる。インフラが足りなければ品質が下がり、解約が増え、評判も悪化する。さらに競合企業も存在して製品を改善していくため、顧客の意思決定はそれによって変わる。安野氏は、それなりに作り込まれた経営シミュレーターにAIを放り込み、どこまでやれるかを測るテストだとまとめている。
結果:1位はAIではなかった
結果の1位は、ルールベースのベースラインだった。ベンチマークを作る際には、最低限の基準として、雑だがシンプルなやり方で出したスコアを用意することが多い。今回のルールベースはAIではなく、「こう来たらこうする」というルールの集合で経営したものだ。CEO-Benchの作成者が最低限の目安として用意したこのスコアに、どのAIも届かなかった。
AIの中では、2位がClaudeのモデル(字幕では「FA5」)、3位がGPT-5.6ソル、4位がClaude Opus 4.8だった。これらのモデルは開始時の100万ドルを上回っている。Opus 4.8は500日後に240万ドルで約2.4倍、2位のモデルは約1200万ドルで約12倍に増やした。しかし、ルールベースは約1500万ドルに達しており、AIはそこに届かなかった。
安野氏はこの結果について、雑に言えば今のAIには経営する能力がほとんどないのではないか、という感想を述べている。
成功したモデルと失敗したモデルの違い
一方で、うまくいったモデルと失敗したモデルでは振る舞いが大きく違っていた。論文は5つほどの違いを挙げている。
1つ目は、隠れた情報を見つけられたかどうかだ。CEO-Benchでは、どの広告チャネルで誰をターゲットにするかという組み合わせごとに、顧客を獲得できる割合が大きく異なる。ただしAIには正解が見えないため、キャンペーンの効果が高かったか低かったかを試行錯誤で推測する必要がある。安野氏によれば少し前のスコアだが、広告費のうち効果の高いチャネルに優先配分できた割合は、Opus 4.8が43%、GPTが33%だった。広告チャネルは5つあるので、ランダムに選んでも20%は当たる。これに対してOpus 4.7は14%、より弱いモデルでは10%程度で、ランダムを上回れたのは上位のモデルだけだった。
2つ目は、将来の現金を予測できたかどうかだ。AIには毎週、4週間後の手元現金を予測させていた。予測誤差はOpus 4.8が約8%、GPT-5.5が約25%、Opus 4.7が約48%だった。うまくいったモデルは、自分の行動が4週間後にどういう結果として返ってくるかを比較的早い段階で把握できていたことになる。
3つ目は、競合の変化に気づく速さだ。競合が最初に品質改善を行った後、AIの記述に「competitor」という単語が現れるかどうかで、AIが競合の動きに気づいたかを判定している。Opus 4.8やGPT-5.5などは直後の1週間で気づいたが、他のモデルでは2週間かかった。うまくいったモデルほど、環境や競合の変化に気づきやすかったということだ。
4つ目は、条件付きの計画を立てられていたかどうかだ。AIには週ごとのメモを取らせており、「こうだったらこうする」という条件付きで計画を考えていたかを見ている。Opus 4.8のメモでは「if」という単語が出てくる割合が非常に高かった。一方、破産してしまったモデルのメモにはそうした言葉がほとんど出てこなかった。
5つ目は、顧客ごとに施策をどれだけ細かく打っていたかだ。GPT-5.5やClaude Opus 4.8は、開発の87%〜89%ほどを特定の顧客に向けて行っていたが、他のモデルは特定顧客向けの開発をあまり行っていなかった。
論文はこれらをまとめて、隠れたパターンを発見できるか、将来を予測できるか、条件付きで計画を立てられるか、顧客に合わせてきめ細かい施策を打てるかが差を分けたとしている。
論文の考察①:個別の能力と長期的な判断力は別物
論文はこの結果から4つの考察を示している。
1つ目は、個別の操作ができることと、複数の判断をつなげて総合的に判断し、長期間動き続けることはまったく別の能力だという点だ。今のモデルは、SQL文を正しく書いてデータを取ってくることなどは余裕でできる。しかし、自分で計画を立て、長期間にわたって修正しながら行動し続けることは、ルールベースのモデルと比べてもできていない。安野氏は、ツールを使う能力や個別の問題を解く能力と、さまざまな情報をもとに判断・実行して長時間動き続ける能力は「全然違う」とし、今のAIは後者の能力が全然高くないと述べている。
論文の考察②:ベンチマークの伸びしろが大きい
2つ目は、このベンチマークにはまだ大きな伸びしろがあるという点だ。作成者が試算した理論上の上限は約22億ドルで、500日で1200万ドル程度にとどまるレベルではないという。安野氏は、最近のAIベンチマークの多くはすぐに飽和して伸びしろがなくなるが、CEO-Benchはまだ大きく伸ばす余地があるので良いベンチマークなのではないか、という論文の見方を紹介している。
論文の考察③:結果は基盤モデルだけで決まらない
3つ目は、結果が基盤モデルの性能だけで決まるわけではないという点だ。論文によれば、研究チームが作ったハーネス(エージェントを動かす仕組み)の上で動かした場合、Claude CodeやCodexといった一般的なハーネスより良い成績が出たという。つまり、Claude CodeやCodexで同じような実験をすると成績が下がった。
この理由について著者らは、Claude CodeやCodexにはソフトウェアエンジニアリング向けのプロンプトが多く含まれており、それが影響した可能性を挙げている。経営のためのプロンプトと、ソフトウェアエンジニアの作業のためのハーネスでは目的が異なるため、それが悪影響を及ぼした、というのが著者の見解だ。
論文の考察④:現実の経営とはまだ距離がある
4つ目は、安野氏いわく「言い訳というか留保」で、このベンチマークと現実の経営能力にはまだ隔たりがあるという点だ。本当の経営ははるかに多くの要素が複雑に絡み合っており、資金調達、コンプライアンス、セキュリティなどは評価対象に含まれていない。論文が測れているのはあくまで限定的な能力であり、仮にこのベンチマークで22億ドルに到達したとしても、実際の会社経営をすべてAIができるわけではないだろう、と著者は述べている。
安野氏の見立て
安野氏は、AIがいろいろなことをできるようになったと言われる中で、非常に賢いとされるモデルでも経営能力はそれほど高くないことを示す「衝撃のデータ」だったとまとめている。
そのうえで、長期的に行動し続ける能力を測れるベンチマークができたこと自体に大きな意義があるとも語る。測れるようになれば、AIもその方向に向けて進化していけるからだ。安野氏は、現時点の能力が高くなくても、比較的早い時間軸でこうした能力は上がっていくのではないかと予想している。
ただし、先日取り上げた「A&マーケット」も大きな損失を出していたことから、2026年夏の時点ではAIの経営能力はまだまだだ、というのが安野氏の現状認識である。経営能力がいつ、どの程度上がっていくのかは、今後も個人的な関心として追っていきたいと述べている。
AIに会社を500日間経営させてみるベンチマーク、CEOベンチと。結果、結構衝撃的でした。こちらです。ルールベースに勝てたAIはいなかったということです。個別の問題を解く能力と、いろんな情報を元に判断して実行して長時間動き続けるって能力は、もうこれ全然違うねと。
どうもこんにちは。本日のテーマは、AIに会社を500日間経営させてみるベンチマークというものがありまして、これCEOベンチと呼ばれるものなんですが、この前ね、A&マーケットも行ってきて、AIが経営する能力ってあるんだろうかということを個人的にはすごく興味があるので、こちらのベンチマークについてちょっと調べてみました。
今ですね、AIコーディングエージェントって、コードを書いたり情報を調べたり、あるいは問い合わせに答えるといったような個別のね、いろんな仕事をこなせるようになってきてるんだって言われてるんですけれども、じゃあいろんなね、複雑な判断を伴うようなもの、例えば実際の経営というのは、広告どう出すか、開発どうやるんだ、顧客対応どうやるんだ、そしてですね、市場の環境に合わせてどういうようなアクションを取っていくかっていうことを色々考えながらやる必要があるわけですけれども、しかもそれをですね、単発でやるというよりかは長期間やり続けなくちゃいけないという、そういうタスクなわけですけども、これをですね、AIがどこまでできるんだっていうことを測るためのテスト、CEOベンチというものが作られたということです。
で、このCEOベンチではAIに100万ドル渡します。100万ドルなので1.5億円くらい渡して、顧客がまだ誰もいない、顧客0の架空の企業っていうものを経営させます。で、500日後にいくら現金を残せるのか、現金残高を積み上げられるのかっていうことを競っております。このね、シミュレーターの環境の中でそういう企業を運営しようということなんですけれども、じゃあ結局こういうタイプの仕事をAIはどれくらい今できるんだろうかと。
アンソロピックのもOpenAIのGPTも、もう数学のね、未解決問題とかをガンガン解いていってたりとか、新しい科学的発見とかをゴリゴリやってたりとか、めちゃくちゃ賢いわけですが、賢いんだけれども、こういう不確実な長期のタスクっていうのにどこまで成果を出せるのかということで見ていければと思います。
まず最初にですね、CEOベンチっていうのはどういうテストなのかということを仕組みからね、見ていきたいと思いますけれども、AIが経営するのはノバマインドっていう架空のサブスク型のソフトウェア企業です。で、先ほども申し上げた通り、初日はもちろんお客さんいませんと。で、現金100万ドルですと。で、500日後に残った現金がスコアで、現金がマイナスになった時点で倒産しますということです。
で、AIはですね、1週間ごとに会社の状態を確認して、CEOとして指示を出します。で、次の週に進むと。で、エージェントがじゃあ何をできるかって言うと、このAPI経由で34個くらいできることっていうのが、あとは情報を確認するものが決まっています。
で、例えば料金プランを決めるよという話とか、広告をどこのチャネルで誰に対してどう出すよという話とか、製品の開発費っていうものを設定して、研究プロジェクトをいくらくらいで始めるよとか、あとは計算資源をどう増やすよとかですね、法人顧客と価格交渉をしましょうとか、市場調査を買っていこうとか、ソーシャルメディアに投稿しようとか、会社がやるタスクっていうのがいくつか定型化されて。本当の会社はね、もっといろんな種類の仕事をやってるし、もっと複雑だと思いますけど、一旦簡略化したシミュレーターとしては、こういうことができるようになってるよと。
で、会社の状態を調べるようなものもありまして、データベースの中にどういう風な現金の出入りがあるかとか、どういう風に注文が入っているか、契約があるか、サポートチケットが切られているかっていうのをデータベースがあるので、SQLでAIが分析できるようになってます。で、このですね、データベースとかSQLとかよく分からない方いたら、バイブコーディング超入門データベース編といういい動画があるので、これ是非見ていただければと思います。
で、実際にですね、AIが経営する環境どうなってるかと言うと、顧客のグループもちゃんと26個くらいのセグメントに分かれてて、それぞれの人たちがどういう風になってるのかってのが隠れパラメーターとして、AIがそのスコアを直接することはできないんだけれども、それぞれの顧客がこういう風に反応するよということがシミュレーターとしては決まっています。
直接顧客の情報は取れないんだけれども、AIは実際のサブスクを受けている数であるとか、解約が来たら解約分かるし、売上いくらくらいとか、サポートの履歴がこうなってるよとか、評判がどうなってるよとか、ソーシャルメディアの投稿どうなってるよっていう、ここら辺の間接的な情報は取れるようになってるので、AIはそこから、このセグメントのお客さんはこれくらい満足してて、ここにこういう課題があって、みたいなのを考えつつ、いろんなね、問題を解かなくちゃいけないということです。
で、あとですね、費用を出してから結果が来るまでも結構時間差があって、例えば広告費とか開発費とかを投入すると、もうすぐに現金から引かれると。で、一方で広告が獲得したお客さんが実際に契約してお金を払うまでのリードタイムっていうのはそこそこあるので、その影響っていうのも時間差で現れてくると。で、開発をサボってですね、製品の品質を下げると、その瞬間開発費は浮くかもしれないけれども、その影響でですね、後日の契約の更新がやっぱ取れなかったっていうこともあるわけです。
で、施策同士も繋がってて、例えば広告でお客さんが増えた場合は、もちろん計算資源とサポートがより必要になるよねということだったりとか、そのインフラが足りなかったら品質がどんどん下がっていって、解約もされるし評判も悪化するよとか。その間にも競合も実はいてですね、競合も製品改善していくので、お客さんの意思決定ってのはそれによって結構変わっていくよということで、それなりに作り込まれた経営シミュレーターを作って、そこにAIを放り込んで、どこまでお前はこの環境でやれるんやということを測るテストです。
でですね、これを回した結果、5が勝つのか、GPT5.6ソルが勝つのか、いろんなね、今ある強いモデルがどれくらいやれんのかっていうところなんですが、結果結構衝撃的でした。こちらです。
まず1番良かったものがルールベースのベースラインでした。これね、何言ってるかと言うと、大体ですね、ベンチマークテストを作った時に、最低限の基準値として、すごい雑なんだけど、シンプルなやり方でやったらこうだよみたいなスコアがあるんですよね。で、その雑なやり方として今回ルールベースって書いてあるので、AIではないです。こう来たらこうするよっていう、いくつかのルールの集合体で雑に経営してみた場合がこちらです。ということで、最低限のスコアでこれくらいだろうっていうのをCEOベンチの会社が用意してるんですが、それに勝てた、ルールベースに勝てたAIはいなかったということです。
で、一応2位はクロードのFA5で、3位がGPT5.6ソル、4位がクロードOpus 4.8ということで、ここまでは1番最初に始めた当時の100万ドルから結構超えていると。クロードOpus 4.8が500日後に2.4M、1ミリオンから2.4Mなので2.4倍くらいにできたねと。で、FA5が12くらいになったので12倍になりましたと。だけどルールベースでやったシステムでやっても15くらいあったので、それに到達はできなかったということです。
ということで、雑に言うと、今のAIは経営する能力全然ないんじゃないかっていうのが、これの結果を見た時の私の感想ですね。とはいえ、成功したモデルと失敗したモデルは振る舞いが結構違っていたということなので、ちょっとその中身を見ていきたいと思います。
大きくですね、この論文の中では、やれてたモデルとやれてないモデルで5つくらい違いがあるんじゃないかと言われてます。で、1つ目は隠れた情報を見つけられたかどうかです。で、このCEOベンチでは、この新規顧客を獲得する時に、どういう広告チャネルで誰をターゲットするかの組み合わせごとに、顧客が獲得できる割合ってのは全然違うものになっています。なんですけれども、この正解ってのは別にAIに見えないので、AIは試行錯誤しながら、このキャンペーンは効果が高かったかなとか低かったかなとか、そういうことを推測する必要があります。
これちょっと前のスコアらしいんですけれども、広告費の中で効果が高いチャネルに優先的に配分できた割合は、Opus 4.8が43%で、GPTが33%で。これランダムに選んでも広告チャネル5つあるんで20%当たるんですけれども、例えばOpus 4.7は14%だし、その他のモデル、もっと弱いモデルだと10%っていうことで、なんかね、ランダムに選ぶよりも良い基準でできたのがOpus 4.8以上、5.5以上だということでした。
で、2つ目が、将来の現金を予測できたかどうかが違うと。毎週、4週間後に自分がどれくらいの現金を持ってるのかっていうのを予測させ続けてたらしいんですけれども、実際の予測の誤差みたいなものを見ると、Opus 4.8が8%ぐらいで、GPT5.5が25%ぐらいで、4.7だと48%違うっていうことで、やれてるモデルっていうのは、この自分の行動の結果、4週間後にそれがどういう風な結果として跳ね返ってくるのかっていうのを割と早い段階で把握できていたということです。
で、3つ目が競合の変化に気づく速さで、競合が最初に品質改善した後に、AIがですね、コンペティターのことについて気づけたかっていうのを、コンペティターっていう単語がこのね、現れるかどうかによって判断してるんですけれども、Opus 4.8とかGPT5.5とか、やれてるモデルだと直後の1週間で気づくんだけど、他のモデルでは2週間だったということで、割とですね、ちゃんとやれていたモデルっていうのは環境の変化、競合の変化とかに気づきやすかったということです。
で、4つ目が条件付きで計画を作れていたかっていうところで、なんか週次のメモを取らせているんですけど、週次のメモのところに、もしこういうことだったらこうする、こういうことだったらこうしようっていう条件をつけて、自分たちの計画っていうのを考えられていたかっていうことで、これはですね、Opus 4.8はやっぱりこのメモの中でIFという単語が出てくる割合が非常に高くて、その他のやれてないモデル、破産しちゃってるモデルってのは、もう全然そういう単語が出てこなかったよというところです。
で、5つ目がですね、お客さんごとに施策をどれだけ細かく打っていたかっていうことですね。これはですね、GPT5.5だとかクロードOpus 4.8だと、87%とか89%くらいの割合を特定のお客さんに対して開発をしているらしいんですが、他のモデルだと特定のお客さんに向けた開発ってのはなかなかやられてないねということでした。
なので、この論文の中だと、隠れた情報やパターンを発見できるかどうか、将来をちゃんと予測できてるのかどうか、計画を立てる時にも条件付きで立てられているのかどうか、お客さん向けにきめ細かい施策を打っていたかどうかっていうところが違うんじゃないかと言われています。
論文の中ではですね、そこから4つ考察があります。1つ目は、個別の操作ができることと、複数の判断を繋げながら総合的に判断していって長期的に動き続けるっていうことは、もう全然別の能力だねということです。例えば今のモデルって、SQL文を正しく書いてデータを取ってくるとかですね、そういうことは余裕でできるわけです。なんですけれども、自分でですね、計画を立てて、長期間にわたってその計画をうまく修正しながらアクションし続けるってことは、もうルールベースのモデルに比べると全然できてないわけですよね。なので、個別のね、このツールを使えるよっていう能力とか、個別の問題を解く能力と、いろんな情報を元に判断して実行して長時間動き続けるって能力は、もうこれ全然違うねと。そして、今のAIはその後者の能力は全然高くないということです。
で、2つ目はですね、このベンチマーク、まだまだ伸び代がすごいあるぞということです。一応ですね、このベンチマークを作った人が試算した理論的な上限値って大体22億ドルくらいまでいけるらしいので、1200万ドルとかそういうレベルじゃないくらい500日で稼げるはずで、そこまでちゃんと行けるようになるんじゃないかとAIは。なので、まだまだこのベンチマークって伸び代があるということでした。大体ね、今いろんなAIのベンチマークが出てきてるんですけれども、すぐに飽和しちゃうんですよね。伸び代がなくなっちゃうと。なんだけど、このベンチマークはまだまだ大きく伸び代があるから、いいベンチマークなんじゃないのということです。
あと3つ目として、結果がですね、基盤モデルだけで決まるというわけではないということも言ってます。この論文の中で言うと、そのチームが作ったハーネスの上で、つまりエージェントを動かす仕組みの上で動かすと、Claude CodeとかCodexとか、一般的なですね、エージェントを動かすハーネスと比べても、よりいい成績が出たらしいです。つまり、Claude CodeやCodexで同じような実験をしたところ、成績がね、低くなったらしいんですよね。
で、これはなんで起きたのかっていうことで言うと、この作った人たちは、やっぱClaude CodeとかCodexとかってソフトウェアエンジニアリング向けのプロンプトが結構入ってるので、それが影響した可能性があるんじゃないかと。これね、経営するためのプロンプトと、ソフトウェアエンジニアのために色々動かすハーネスって、やることが違うので、それが悪影響だよねということを著者は言っています。
4つ目としては、これはですね、言い訳というか、ちょっと留保なんですけれども、これ現実の経営能力とはまだまだ乖離があるよねということを言ってます。本当の経営って、めちゃめちゃもっと複雑にいろんな要素が絡み合っていて、例えば資金調達とかコンプラとかセキュリティとか、そういったことは評価対象には含まれていないので、論文が測れているのはあくまで限定的な能力だよということで、このベンチマークで22億ドルいけたからと言って、実際の会社経営で全部AIができるわけじゃないんじゃないかということを言っています。
はい。ということで、CEOベンチを紹介してきましたけれども、結構ね、今いろんなことをAIができるようになってきてるって言われていますけれども、実はめちゃめちゃ賢いと呼ばれてるモデルであっても、経営能力はそんなに高くないんじゃないかというような衝撃のデータでございました。
逆にね、こういうベンチマークテストができて、この長期にアクションできる能力が測れるようになってくると、AIもそっちの方向に向けて進化していくことができるので、こういうね、ベンチマークテストがちゃんとできるってことは、私はすごく意義があることだなと思いますし、私はですね、こういったベンチマークテストも出てきたことですし、今の能力が高くなかったとしても、それなりに早い時間軸でこういった能力はAIで上がっていくんじゃないかなと思ってます。
でもね、この前のA&マーケットの動画も是非見ていただきたいですが、A&マーケットも爆損を出していたので、なるほど、まだちょっと2026年夏の時点では経営能力まだまだだなというところでございます。
ということで、この動画面白かったと思う方は、チャンネル登録と高評価を是非よろしくお願いします。このね、経営能力がいつどれくらい上がっていくのかっていうことは、私も個人的な興味として追っていきたいなと思います。では、では。
記事公開
