AIに会社を500日間経営させるとどうなるか:ベンチマーク「CEO-Bench」の結果を読む

YouTubeで開く ↗
概要

AIコーディングエージェントは、コードを書く、情報を調べる、問い合わせに答えるといった個別の仕事をこなせるようになってきたと言われる。では、広告の出し方、開発の進め方、顧客対応、市場環境への対応を同時に考え、しかも長期間にわたって判断し続ける「経営」はどこまでできるのか。安野貴博氏は、AIに会社を500日間経営させるベンチマーク「CEO-Bench」を紹介しながら、この問いを検討している。安野氏は最近、字幕上で「A&マーケット」と表記されている店舗を訪れており、AIの経営能力に個人的な関心があるという。

9分で読めます

安野氏が「結構衝撃的」と表現した結論は、テストしたAIのうちルールベースの単純な手法に勝てたものは1つもなかった、というものだ。

CEO-Benchの仕組み:100万ドルと顧客ゼロから始める

CEO-BenchでAIが経営するのは、「ノバマインド」という架空のサブスクリプション型ソフトウェア企業である。初日の時点で顧客はおらず、手元には現金100万ドル(安野氏の換算で約1.5億円)がある。500日後に残った現金がスコアになり、途中で現金がマイナスになった時点で倒産となる。

AIは1週間ごとに会社の状態を確認し、CEOとして指示を出してから次の週へ進む。取れる行動は、API経由で用意された34個ほどの操作と情報確認の手段に限られる。具体的には、料金プランの設定、広告をどのチャネルで誰に向けて出すか、製品開発費の設定や研究プロジェクトの開始、計算資源の増強、法人顧客との価格交渉、市場調査の購入、ソーシャルメディアへの投稿などだ。安野氏は、実際の会社はもっと多様で複雑な仕事をしているとしつつ、簡略化したシミュレーターとしてはこうした業務が定型化されていると説明する。

会社の状態を調べる手段としては、現金の出入り、注文、契約、サポートチケットなどを記録したデータベースがあり、AIはSQLで分析できる。

見えない顧客と、時間差で返ってくる結果

シミュレーター内の顧客は26個ほどのセグメントに分かれている。各セグメントがどう反応するかは隠れパラメーターとして決められており、AIはそれを直接見ることができない。代わりに、実際のサブスク契約数、解約、売上、サポート履歴、評判、ソーシャルメディアの投稿といった間接的な情報は取得できる。AIはそこから「このセグメントはこれくらい満足していて、こういう課題がある」と推測しながら判断していく必要がある。

費用を出してから結果が出るまでには時間差もある。広告費や開発費は投入した時点で現金から引かれるが、広告で獲得した顧客が実際に契約して支払うまでにはリードタイムがあり、その効果は遅れて現れる。逆に、開発をサボって製品の品質を下げればその時点では開発費が浮くが、後日の契約更新が取れなくなることもある。

施策同士も連動している。広告で顧客が増えれば、計算資源とサポートがより多く必要になる。インフラが足りなければ品質が下がり、解約が増え、評判も悪化する。さらに競合企業も存在して製品を改善していくため、顧客の意思決定はそれによって変わる。安野氏は、それなりに作り込まれた経営シミュレーターにAIを放り込み、どこまでやれるかを測るテストだとまとめている。

結果:1位はAIではなかった

結果の1位は、ルールベースのベースラインだった。ベンチマークを作る際には、最低限の基準として、雑だがシンプルなやり方で出したスコアを用意することが多い。今回のルールベースはAIではなく、「こう来たらこうする」というルールの集合で経営したものだ。CEO-Benchの作成者が最低限の目安として用意したこのスコアに、どのAIも届かなかった。

AIの中では、2位がClaudeのモデル(字幕では「FA5」)、3位がGPT-5.6ソル、4位がClaude Opus 4.8だった。これらのモデルは開始時の100万ドルを上回っている。Opus 4.8は500日後に240万ドルで約2.4倍、2位のモデルは約1200万ドルで約12倍に増やした。しかし、ルールベースは約1500万ドルに達しており、AIはそこに届かなかった。

安野氏はこの結果について、雑に言えば今のAIには経営する能力がほとんどないのではないか、という感想を述べている。

成功したモデルと失敗したモデルの違い

一方で、うまくいったモデルと失敗したモデルでは振る舞いが大きく違っていた。論文は5つほどの違いを挙げている。

1つ目は、隠れた情報を見つけられたかどうかだ。CEO-Benchでは、どの広告チャネルで誰をターゲットにするかという組み合わせごとに、顧客を獲得できる割合が大きく異なる。ただしAIには正解が見えないため、キャンペーンの効果が高かったか低かったかを試行錯誤で推測する必要がある。安野氏によれば少し前のスコアだが、広告費のうち効果の高いチャネルに優先配分できた割合は、Opus 4.8が43%、GPTが33%だった。広告チャネルは5つあるので、ランダムに選んでも20%は当たる。これに対してOpus 4.7は14%、より弱いモデルでは10%程度で、ランダムを上回れたのは上位のモデルだけだった。

2つ目は、将来の現金を予測できたかどうかだ。AIには毎週、4週間後の手元現金を予測させていた。予測誤差はOpus 4.8が約8%、GPT-5.5が約25%、Opus 4.7が約48%だった。うまくいったモデルは、自分の行動が4週間後にどういう結果として返ってくるかを比較的早い段階で把握できていたことになる。

3つ目は、競合の変化に気づく速さだ。競合が最初に品質改善を行った後、AIの記述に「competitor」という単語が現れるかどうかで、AIが競合の動きに気づいたかを判定している。Opus 4.8やGPT-5.5などは直後の1週間で気づいたが、他のモデルでは2週間かかった。うまくいったモデルほど、環境や競合の変化に気づきやすかったということだ。

4つ目は、条件付きの計画を立てられていたかどうかだ。AIには週ごとのメモを取らせており、「こうだったらこうする」という条件付きで計画を考えていたかを見ている。Opus 4.8のメモでは「if」という単語が出てくる割合が非常に高かった。一方、破産してしまったモデルのメモにはそうした言葉がほとんど出てこなかった。

5つ目は、顧客ごとに施策をどれだけ細かく打っていたかだ。GPT-5.5やClaude Opus 4.8は、開発の87%〜89%ほどを特定の顧客に向けて行っていたが、他のモデルは特定顧客向けの開発をあまり行っていなかった。

論文はこれらをまとめて、隠れたパターンを発見できるか、将来を予測できるか、条件付きで計画を立てられるか、顧客に合わせてきめ細かい施策を打てるかが差を分けたとしている。

論文の考察①:個別の能力と長期的な判断力は別物

論文はこの結果から4つの考察を示している。

1つ目は、個別の操作ができることと、複数の判断をつなげて総合的に判断し、長期間動き続けることはまったく別の能力だという点だ。今のモデルは、SQL文を正しく書いてデータを取ってくることなどは余裕でできる。しかし、自分で計画を立て、長期間にわたって修正しながら行動し続けることは、ルールベースのモデルと比べてもできていない。安野氏は、ツールを使う能力や個別の問題を解く能力と、さまざまな情報をもとに判断・実行して長時間動き続ける能力は「全然違う」とし、今のAIは後者の能力が全然高くないと述べている。

論文の考察②:ベンチマークの伸びしろが大きい

2つ目は、このベンチマークにはまだ大きな伸びしろがあるという点だ。作成者が試算した理論上の上限は約22億ドルで、500日で1200万ドル程度にとどまるレベルではないという。安野氏は、最近のAIベンチマークの多くはすぐに飽和して伸びしろがなくなるが、CEO-Benchはまだ大きく伸ばす余地があるので良いベンチマークなのではないか、という論文の見方を紹介している。

論文の考察③:結果は基盤モデルだけで決まらない

3つ目は、結果が基盤モデルの性能だけで決まるわけではないという点だ。論文によれば、研究チームが作ったハーネス(エージェントを動かす仕組み)の上で動かした場合、Claude CodeやCodexといった一般的なハーネスより良い成績が出たという。つまり、Claude CodeやCodexで同じような実験をすると成績が下がった。

この理由について著者らは、Claude CodeやCodexにはソフトウェアエンジニアリング向けのプロンプトが多く含まれており、それが影響した可能性を挙げている。経営のためのプロンプトと、ソフトウェアエンジニアの作業のためのハーネスでは目的が異なるため、それが悪影響を及ぼした、というのが著者の見解だ。

論文の考察④:現実の経営とはまだ距離がある

4つ目は、安野氏いわく「言い訳というか留保」で、このベンチマークと現実の経営能力にはまだ隔たりがあるという点だ。本当の経営ははるかに多くの要素が複雑に絡み合っており、資金調達、コンプライアンス、セキュリティなどは評価対象に含まれていない。論文が測れているのはあくまで限定的な能力であり、仮にこのベンチマークで22億ドルに到達したとしても、実際の会社経営をすべてAIができるわけではないだろう、と著者は述べている。

安野氏の見立て

安野氏は、AIがいろいろなことをできるようになったと言われる中で、非常に賢いとされるモデルでも経営能力はそれほど高くないことを示す「衝撃のデータ」だったとまとめている。

そのうえで、長期的に行動し続ける能力を測れるベンチマークができたこと自体に大きな意義があるとも語る。測れるようになれば、AIもその方向に向けて進化していけるからだ。安野氏は、現時点の能力が高くなくても、比較的早い時間軸でこうした能力は上がっていくのではないかと予想している。

ただし、先日取り上げた「A&マーケット」も大きな損失を出していたことから、2026年夏の時点ではAIの経営能力はまだまだだ、というのが安野氏の現状認識である。経営能力がいつ、どの程度上がっていくのかは、今後も個人的な関心として追っていきたいと述べている。