どのAIが一番デザインがうまいのか:Design Arenaのカテゴリー別ランキングを読む

YouTubeで開く ↗
概要

数学やコーディングではAIの性能が急速に上がっているが、デザインが一番うまいAIはどれなのかはよく分からない。安野貴博氏はこの疑問から、AIのデザイン能力を対戦形式で比べるサイト「Design Arena」を調べた。答えは「カテゴリーごとに違う」というものだった。以下では、Design Arenaの評価の仕組みと、2026年6月時点のカテゴリー別の結果、そこから安野氏が読み取った点を順に紹介する。

6分で読めます

ペーパーテストで測れない能力は「アリーナ」で比べる

安野氏によれば、AIの性能比較では以前から、ペーパーテストで測りにくい能力を対戦形式で評価する方法が使われてきた。文章の読みやすさ、要約の良し悪し、ボケが面白いかどうかといった能力がその例である。2つのモデルに同じ課題を出し、Aのモデルが作ったものとBのモデルが作ったものを人間に比べさせる。どちらが良いかという判断を大量に積み重ねて、モデルの順位をおおまかに出す。こうした仕組みは「なんとかアリーナ」と呼ばれてきた。安野氏は、Design Arenaをこの仕組みのデザイン版と位置づけている。

4モデルで5回戦うトーナメント

Design Arenaの流れは次のとおりだと安野氏は説明する。まずユーザーがプロンプトを入力する。すると、多数のモデルの中から、そのアリーナで戦う4つのモデルが選ばれる。仮にA、B、C、Dとすると、この4モデルがトーナメントで計5回対戦する。

たとえば「安野貴博のウェブサイトを作ってください」と依頼すると、各モデルが安野貴博のページを出してくる。ユーザーには、それぞれの裏側がChatGPTなのか、Claudeなのか、Geminiなのか、DeepSeekなのかは分からない。ユーザーは出てきたページを見比べ、良いほうを選ぶ。対戦の順序は以下のとおりである。

  1. A対B
  2. C対D
  3. 1回戦の勝者同士による決勝
  4. 1回戦の敗者同士による最下位決定戦
  5. 1勝1敗のモデル2つによるタイブレーク

最弱のモデルもきちんと決め、1勝1敗で並んだ2モデルの上下もつける。こうして4モデルの序列が決まる。

画像:GPT Image 2が全項目で圧勝

安野氏が紹介した結果は2026年6月時点のものである。ランキングは次々に塗り替えられるため、その時点で一番強いモデルを知りたければDesign Arenaのリーダーボードを確認してほしい、と安野氏は念を押している。

Design Arenaでは、デザインが画像、スライド、ウェブサイト、ゲーム、SVGといったカテゴリーに分かれている。安野氏は、カテゴリーごとに強いモデルが微妙に違う点を面白いと述べた。

画像カテゴリーでは、GPT Image 2が圧倒的に強かった。一時期は非常に強いと言われていたGeminiのNano Banana 2も、GPT Image 2には及ばなかった。安野氏はこれを「栄枯盛衰」「盛者必衰」と表現している。画像カテゴリーにはさらに細かい項目があり、ロゴに強いモデルや画像編集に強いモデルなどが個別に示されている。ただし安野氏によれば、基本的にはどの項目でもGPT Image 2が圧勝だった。なお、Claudeは画像生成の分野にあまり参入していないため、このランキングには入っていない。

スライド:Claudeが首位、GPT-5.5はGeminiにも負ける

ビジネスで作る機会の多いスライドでは、1位がClaude、2位がGemini、3位がGPT-5.5だった。

安野氏にとって、GPT-5.5がClaudeに負けるのはなんとなくイメージどおりだった。意外だったのは、GPT-5.5がGeminiにも負けていたことである。安野氏はGPT-5.5を、理路整然としていて数学やコーディングがかなり得意なモデルと見ている。それでもスライドではこの2つに負けた。

Geminiが強い理由について、安野氏は推測として、GoogleがGoogleスライドを持っており、大量のプレゼンテーションデータを抱えていることが大きいのかもしれない、と述べた。またGPT側は、GPT Image 2で画像生成が非常に強いのに、スライドになると負ける。安野氏はこれを「深い」と評し、絵が描けるからといってスライドが描けるわけではない、とまとめている。

ウェブサイト:Claude、Gemini、Grok、GPTの順

最初の例に挙げた「安野貴博のランディングページやホームページを作ってください」という課題は、ウェブサイトのカテゴリーにあたる。ここでもスライドと似た結果になった。1位がClaude、2位がGemini、その次にGrokが入り、GPTはその下だった。安野氏は「GrokにもGPTが負けるのか」と驚き、不思議だと述べている。

安野氏はここで補足を加えている。Design Arenaが評価するのはあくまでデザインだけである。見た目は良くても、実際にクリックするとリンクが動かない、挙動がおかしいといった問題は、基本的に評価の対象外になっている。安野氏は、GPTはそうした部分のコーディング能力がおそらく非常に強いと見ている。そのうえで、ぱっと見たときのデザインでは負けている、という整理である。

ゲーム:見た目の良さとバグの少なさは別問題

ゲームもおおむね同じ傾向で、Claude、Gemini、GPT-5.5の順だった。安野氏はウェブサイトと同様の注意を添えている。ゲームのぱっと見のデザインが優れていても、実際に遊んでバグが出ないかどうかはまったく別の話だという。安野氏の見立てでは、GPT-5.5は賢いのでバグの少ないゲームを作る能力は高いと思われる。一方、デザインに限ればそこまで高くない。

SVG:Geminiが首位、Claudeは最下位

安野氏が「結果が面白かったので載せた」と言うのがSVGである。SVGはScalable Vector Graphicsの略で、拡大・縮小しても画質が劣化しないウェブ向けの画像形式だ。安野氏の説明では、通常の画像形式は「この点は赤、この点は緑」というようにピクセルごとに描く。これに対してSVGは「こういう曲線を描く」という形でベクトルとして記述するため、拡大しても縮小しても劣化しない。

このカテゴリーでは順位が入れ替わった。1位がGemini、2位がGPT-5.5で、スライド・ウェブサイト・ゲームで首位だったClaudeが最下位になった。

用途ごとに向いたAIを使い分ける

安野氏はこの結果を、競い合っているAIモデル同士でも得意分野はまったく違うことの表れだと受け止めている。そのうえで、画像ならこれ、スライドならClaude、というようにジャンルごとに向いたAIを使うとよいのではないか、と提案した。

最後に安野氏は、結果は今後も変わっていくだろうと繰り返した。新しいAIが次々に登場してランキングが上下するため、その時点で一番良いデザインを作りたいならDesign Arenaを確認するとよい、と締めくくっている。なお、自身はDesign Arenaの回し者ではなく、参考になったので共有した、とも述べている。