OpenDesignArena

デザインに合った AI モデルを見つけよう。

実際の評価で、品質・速度・コストを比べて選ぶ。

コストパフォーマンス重視

DeepSeek V4.1 Flash

最小のコストで、優れたデザインを。

本評価で、DeepSeek V4.1 Flash は首位の GPT-6 Astra の平均スコアの 98% を達成しながら、平均コストはその約 1% にとどまりました。

成果物あたりのコスト
$0.023比較: $1.61
評価の平均スコア / 100
81.2比較: 82.7

スコア重視

スピード重視

モデルを比較

2~3 個のモデルを選び、5 つの観点を 1 つのチャートで比較します。形の違いが、それぞれの強みを示します。

5 つの評価軸

すべての軸で外側ほど良好です。完成はより速く、コストはより低くなります。

要件充足度デザイン品質納品基準達成率完成速度コスト効率

    全 13 モデルの各軸の平均

    重視する条件から選ぶ

    評価された品質、コスト、速度のバランスを調整し、ニーズに合うモデルを見つけます。

    何を最も重視しますか?
    品質
    50%
    コスト
    30%
    速度
    20%
    1. 1 DeepSeek V4.1 Flash 78.8 平均スコア:81.2/100; 平均コスト:$0.023; 平均時間:5.3 分
    2. 2 DeepSeek V4 Flash 68.6 平均スコア:70.6/100; 平均コスト:$0.031; 平均時間:11.1 分
    3. 3 GPT-5.6 Sol 65.7 平均スコア:77.6/100; 平均コスト:$0.544; 平均時間:3.2 分
    4. 4 Gemini 3.8 Flash 64.7 平均スコア:68.9/100; 平均コスト:$0.210; 平均時間:3.8 分
    5. 5 DeepSeek V4 Pro 64.6 平均スコア:72.9/100; 平均コスト:$0.061; 平均時間:17.7 分
    6. 6 Muse Spark 1.3 63.2 平均スコア:66.6/100; 平均コスト:$0.267; 平均時間:3.3 分
    7. 7 GLM-5.3 Flash 61.4 平均スコア:69.8/100; 平均コスト:$0.064; 平均時間:23.5 分
    8. 8 GPT-6 Astra 57.5 平均スコア:82.7/100; 平均コスト:$1.61; 平均時間:11.1 分
    9. 9 Grok 4.6 56.5 平均スコア:72.4/100; 平均コスト:$0.599; 平均時間:11.4 分
    10. 10 Hunyuan H4 Preview 54.6 平均スコア:74.6/100; 平均コスト:$0.418; 平均時間:29.2 分
    11. 11 Qwen 3.8-Max 52.3 平均スコア:72.0/100; 平均コスト:$0.595; 平均時間:26.4 分
    12. 12 Claude Fable 5.1 52.1 平均スコア:80.3/100; 平均コスト:$3.66; 平均時間:12.8 分
    13. 13 Kimi K3 52.1 平均スコア:65.7/100; 平均コスト:$0.614; 平均時間:14.0 分

    用途からモデルを選ぶ

    デザイン用途を選ぶと、以下の 5 つの観点から、それぞれおすすめのモデルを表示します。

    総合評価

    GPT-6 Astra

    要件充足度 · 26.5/30デザイン品質 · 56.2/70納品基準達成率 · 60.0%完了時間 · 11.1 分1 回あたりのコスト · $1.61 要件充足度 26.5/30 デザイン品質 56.2/70 納品基準達成率 60.0% 完了時間 11.1 分 1 回あたりのコスト $1.61
    平均スコア
    82.7/100
    平均要件充足度
    26.5/30
    平均デザイン品質
    56.2/70
    平均納品基準達成率
    60.0%
    平均時間
    11.1
    成果物あたりの平均コスト
    $1.61/回
    デザイン品質

    Claude Fable 5.1

    平均デザイン品質
    53.2/70
    平均スコア
    80.3/100
    平均納品基準達成率
    56.7%
    平均要件充足度
    27.1/30
    平均時間
    12.8
    成果物あたりの平均コスト
    $3.66/回
    要件充足度

    DeepSeek V4.1 Flash

    平均要件充足度
    28.4/30
    平均スコア
    81.2/100
    平均納品基準達成率
    57.7%
    平均デザイン品質
    52.8/70
    平均時間
    5.3
    成果物あたりの平均コスト
    $0.023/回
    完了速度

    GPT-5.6 Sol

    平均時間
    3.2
    平均スコア
    77.6/100
    平均納品基準達成率
    53.3%
    平均要件充足度
    25.8/30
    平均デザイン品質
    51.8/70
    成果物あたりの平均コスト
    $0.544/回
    コスト効率

    Hunyuan H4 Preview

    成果物あたりの平均コスト
    $0.418/回
    平均スコア
    74.6/100
    平均納品基準達成率
    40.0%
    平均要件充足度
    26.8/30
    平均デザイン品質
    47.8/70
    平均時間
    29.2

    品質とコスト

    モデルの評価結果と、その実現にかかるコストを比較します。

    品質のランキング

    82.7/100 GPT-6 Astra
    81.2/100 DeepSeek V4.1 Flash
    80.3/100 Claude Fable 5.1
    77.6/100 GPT-5.6 Sol
    74.6/100 Hunyuan H4 Preview
    72.9/100 DeepSeek V4 Pro
    72.4/100 Grok 4.6
    72.0/100 Qwen 3.8-Max
    70.6/100 DeepSeek V4 Flash
    69.8/100 GLM-5.3 Flash
    68.9/100 Gemini 3.8 Flash
    66.6/100 Muse Spark 1.3
    65.7/100 Kimi K3

    コストと品質の比較基準線

    平均スコア 成果物あたりのコスト(米ドル) GPT-6 Astra GPT-6 Astra 平均スコア 82.7 · $1.61 DeepSeek V4.1 Flash DeepSeek V4.1 Flash 平均スコア 81.2 · $0.023 Claude Fable 5.1 Claude Fable 5.1 平均スコア 80.3 · $3.66 GPT-5.6 Sol GPT-5.6 Sol 平均スコア 77.6 · $0.544 Hunyuan H4 Preview Hunyuan H4 Preview 平均スコア 74.6 · $0.418 DeepSeek V4 Pro DeepSeek V4 Pro 平均スコア 72.9 · $0.061 Grok 4.6 Grok 4.6 平均スコア 72.4 · $0.599 Qwen 3.8-Max Qwen 3.8-Max 平均スコア 72.0 · $0.595 DeepSeek V4 Flash DeepSeek V4 Flash 平均スコア 70.6 · $0.031 GLM-5.3 Flash GLM-5.3 Flash 平均スコア 69.8 · $0.064 Gemini 3.8 Flash Gemini 3.8 Flash 平均スコア 68.9 · $0.210 Muse Spark 1.3 Muse Spark 1.3 平均スコア 66.6 · $0.267 Kimi K3 Kimi K3 平均スコア 65.7 · $0.614

    ピンクの領域内の 11 モデルは、DeepSeek V4.1 Flash よりコストが高く、スコアが低くなっています。

    用途別の評価

    Web アプリのランキング

    83.1/100 GPT-5.6 Sol
    82.6/100 Claude Fable 5.1
    82.4/100 DeepSeek V4.1 Flash
    77.1/100 GPT-6 Astra
    68.5/100 Grok 4.6
    68.4/100 Gemini 3.8 Flash
    62.0/100 Muse Spark 1.3
    60.6/100 GLM-5.3 Flash
    60.5/100 Hunyuan H4 Preview
    57.0/100 Qwen 3.8-Max
    56.4/100 DeepSeek V4 Flash
    51.8/100 DeepSeek V4 Pro
    35.9/100 Kimi K3

    Web アプリ · コストと品質の比較基準線

    平均スコア 成果物あたりのコスト(米ドル) GPT-5.6 Sol GPT-5.6 Sol 平均スコア 83.1 · $0.537 Claude Fable 5.1 Claude Fable 5.1 平均スコア 82.6 · $5.55 DeepSeek V4.1 Flash DeepSeek V4.1 Flash 平均スコア 82.4 · $0.030 GPT-6 Astra GPT-6 Astra 平均スコア 77.1 · $1.87 Grok 4.6 Grok 4.6 平均スコア 68.5 · $0.818 Gemini 3.8 Flash Gemini 3.8 Flash 平均スコア 68.4 · $0.185 Muse Spark 1.3 Muse Spark 1.3 平均スコア 62.0 · $0.293 GLM-5.3 Flash GLM-5.3 Flash 平均スコア 60.6 · $0.093 Hunyuan H4 Preview Hunyuan H4 Preview 平均スコア 60.5 · $0.609 Qwen 3.8-Max Qwen 3.8-Max 平均スコア 57.0 · $0.552 DeepSeek V4 Flash DeepSeek V4 Flash 平均スコア 56.4 · $0.041 DeepSeek V4 Pro DeepSeek V4 Pro 平均スコア 51.8 · $0.067 Kimi K3 Kimi K3 平均スコア 35.9 · $0.486

    ピンクの領域内の 10 モデルは、DeepSeek V4.1 Flash よりコストが高く、スコアが低くなっています。

    モデルの効率

    完了時間、キャッシュヒット率、トークン消費量を比較します。数値はすべて実測の平均値です。

    用途
    平均スコア完了時間
    高スコア · 高効率

    評価方法

    要件充足度とデザイン品質を採点し、効率とコストは別に報告します。

    課題とサンプル

    Web アプリ、モバイルアプリ、デスクトップアプリ、ダッシュボード・管理画面、Web サイト・ランディングページの 5 つの用途について、共通のデザイン課題でモデルを評価します。結果が示すのは、実践的なプロトタイプ生成課題での性能であり、モデルの汎用的な能力ではありません。

    ページ表示の確認

    採点前に各成果物を Web ページとして開けるか確認し、白紙のページ、途中で途切れた内容、致命的な実行時エラーがないかを調べます。表示できない成果物は 0 点とし、再実行で結果を差し替えることはありません。正常に開けることは、その後の評価に進むための前提条件であり、要件を満たしていることや納品可能であることを意味しません。

    要件充足度とデザイン品質

    各成果物を 100 点満点で採点します。要件充足度は 30 点で、ページやモジュール、必要な内容、画面の状態、インタラクションを課題の要件と照合し、達成・一部達成・未達成で評価します。デザイン品質は 70 点で、レイアウトと読みやすさ、情報の階層、スタイルと課題の適合性、色とコントラスト、画像の適合性と内容との関連性の 5 項目を均等に評価します。各項目は達成・一部達成・未達成で採点します。

    平均スコアと納品基準達成率

    平均スコアは、モデルごとの採点済み成果物の算術平均です。本評価では、80 点以上の成果物を納品基準達成とみなします。納品基準達成率は、採点済み成果物のうち、この基準を満たす成果物の割合です。モデルが基準を満たす結果をどの程度安定して生成できるかを示します。ここでの納品基準は、本評価におけるプロトタイプの品質基準であり、本番環境で利用できる状態を保証するものではありません。

    効率とコスト

    完了時間、キャッシュヒット率、入力・出力トークン数、ツール呼び出し回数は、品質スコアとは別に実測平均値を報告します。各成果物のコストは、記録されたトークン使用量と標準の入力・出力・キャッシュ読み取り単価から推計し、その平均値を算出します。これはリソース消費を比較するための推計であり、請求額ではありません。記録されていない料金は含みません。効率とコストは評価スコアに加算されません。選定条件を変更するとおすすめ順位は変わりますが、元の評価結果は変わりません。

    OpenDesign デスクトップ版

    ひとつのデザインシステムで、すべての制作物をブランドらしく

    完全な Vibe Design Workspace で、同じブランドルールを Web サイト、スライド、操作できるプロトタイプ、ダッシュボード、画像、HTML 動画に展開できます。ローカルの Codex、Claude Code、Cursor などを接続して無料で制作しましょう。

    • Web、スライド、プロトタイプ、ダッシュボード、画像、動画
    • 140+ のデザインシステムと完全なテンプレート/スキルライブラリ
    • ローカル Codex と 21+ のコーディングエージェントを接続 · 無料
    無料ダウンロード

    macOS と Windows に対応