コストパフォーマンス重視
最小のコストで、優れたデザインを。
本評価で、DeepSeek V4.1 Flash は首位の GPT-6 Astra の平均スコアの 98% を達成しながら、平均コストはその約 1% にとどまりました。
- 成果物あたりのコスト
- $0.023比較: $1.61
- 評価の平均スコア / 100
- 81.2比較: 82.7
スコア重視
スピード重視
モデルを比較
2~3 個のモデルを選び、5 つの観点を 1 つのチャートで比較します。形の違いが、それぞれの強みを示します。
5 つの評価軸
すべての軸で外側ほど良好です。完成はより速く、コストはより低くなります。
全 13 モデルの各軸の平均
重視する条件から選ぶ
評価された品質、コスト、速度のバランスを調整し、ニーズに合うモデルを見つけます。
- 品質
- 50%
- コスト
- 30%
- 速度
- 20%
- 1 DeepSeek V4.1 Flash 78.8 平均スコア:81.2/100; 平均コスト:$0.023; 平均時間:5.3 分
- 2 DeepSeek V4 Flash 68.6 平均スコア:70.6/100; 平均コスト:$0.031; 平均時間:11.1 分
- 3 GPT-5.6 Sol 65.7 平均スコア:77.6/100; 平均コスト:$0.544; 平均時間:3.2 分
- 4 Gemini 3.8 Flash 64.7 平均スコア:68.9/100; 平均コスト:$0.210; 平均時間:3.8 分
- 5 DeepSeek V4 Pro 64.6 平均スコア:72.9/100; 平均コスト:$0.061; 平均時間:17.7 分
- 6 Muse Spark 1.3 63.2 平均スコア:66.6/100; 平均コスト:$0.267; 平均時間:3.3 分
- 7 GLM-5.3 Flash 61.4 平均スコア:69.8/100; 平均コスト:$0.064; 平均時間:23.5 分
- 8 GPT-6 Astra 57.5 平均スコア:82.7/100; 平均コスト:$1.61; 平均時間:11.1 分
- 9 Grok 4.6 56.5 平均スコア:72.4/100; 平均コスト:$0.599; 平均時間:11.4 分
- 10 Hunyuan H4 Preview 54.6 平均スコア:74.6/100; 平均コスト:$0.418; 平均時間:29.2 分
- 11 Qwen 3.8-Max 52.3 平均スコア:72.0/100; 平均コスト:$0.595; 平均時間:26.4 分
- 12 Claude Fable 5.1 52.1 平均スコア:80.3/100; 平均コスト:$3.66; 平均時間:12.8 分
- 13 Kimi K3 52.1 平均スコア:65.7/100; 平均コスト:$0.614; 平均時間:14.0 分
用途からモデルを選ぶ
デザイン用途を選ぶと、以下の 5 つの観点から、それぞれおすすめのモデルを表示します。
GPT-6 Astra
- 平均スコア 平均スコア高いほど良い 評価したすべての成果物の平均スコアです。100 点満点で表示します。
- 82.7/100
- 平均要件充足度 要件充足度高いほど良い 必要なページ、内容、状態、インタラクションが実装されているかを 30 点満点で評価します。
- 26.5/30
- 平均デザイン品質 デザイン品質高いほど良い レイアウト、階層、スタイル、色、画像の適合性を 70 点満点で評価します。
- 56.2/70
- 平均納品基準達成率 納品基準達成率高いほど良い 評価した成果物のうち、80 点以上を獲得した割合です。
- 60.0%
- 平均時間 平均完了時間低いほど良い 採点済み成果物の合計実行時間を、成果物の数で割った値です。
- 11.1 分
- 成果物あたりの平均コスト 成果物あたりのコスト低いほど良い 公式の標準単価と実測トークン使用量から推計します。
- $1.61/回
Claude Fable 5.1
- 平均デザイン品質
- 53.2/70
- 平均スコア
- 80.3/100
- 平均納品基準達成率
- 56.7%
- 平均要件充足度
- 27.1/30
- 平均時間
- 12.8 分
- 成果物あたりの平均コスト
- $3.66/回
DeepSeek V4.1 Flash
- 平均要件充足度
- 28.4/30
- 平均スコア
- 81.2/100
- 平均納品基準達成率
- 57.7%
- 平均デザイン品質
- 52.8/70
- 平均時間
- 5.3 分
- 成果物あたりの平均コスト
- $0.023/回
GPT-5.6 Sol
- 平均時間
- 3.2 分
- 平均スコア
- 77.6/100
- 平均納品基準達成率
- 53.3%
- 平均要件充足度
- 25.8/30
- 平均デザイン品質
- 51.8/70
- 成果物あたりの平均コスト
- $0.544/回
Hunyuan H4 Preview
- 成果物あたりの平均コスト
- $0.418/回
- 平均スコア
- 74.6/100
- 平均納品基準達成率
- 40.0%
- 平均要件充足度
- 26.8/30
- 平均デザイン品質
- 47.8/70
- 平均時間
- 29.2 分
品質とコスト
モデルの評価結果と、その実現にかかるコストを比較します。
品質のランキング
コストと品質の比較基準線
ピンクの領域内の 11 モデルは、DeepSeek V4.1 Flash よりコストが高く、スコアが低くなっています。
用途別の評価
Web アプリ(複数ページの構成と操作フロー)を表示中。GPT-5.6 Sol が 83.1 点で首位、納品基準達成率は 66.7%、1 回あたりのコストは $0.537 です。
モバイルアプリ(タッチ操作とレスポンシブレイアウト)を表示中。Hunyuan H4 Preview が 89.5 点で首位、納品基準達成率は 83.3%、1 回あたりのコストは $0.404 です。
デスクトップアプリ(デスクトップの作業フローと複雑な操作)を表示中。DeepSeek V4 Flash が 90.3 点で首位、納品基準達成率は 83.3%、1 回あたりのコストは $0.027 です。
ダッシュボード(情報密度と階層)を表示中。GPT-6 Astra が 86.3 点で首位、納品基準達成率は 66.7%、1 回あたりのコストは $1.65 です。
ランディングページ(ブランド表現とコンバージョン)を表示中。Qwen 3.8-Max が 82.8 点で首位、納品基準達成率は 66.7%、1 回あたりのコストは $0.609 です。
Web アプリのランキング
Web アプリ · コストと品質の比較基準線
ピンクの領域内の 10 モデルは、DeepSeek V4.1 Flash よりコストが高く、スコアが低くなっています。
モバイルアプリのランキング
モバイルアプリ · コストと品質の比較基準線
ピンクの領域内の 8 モデルは、DeepSeek V4.1 Flash よりコストが高く、スコアが低くなっています。
デスクトップアプリのランキング
デスクトップアプリ · コストと品質の比較基準線
ピンクの領域内の 9 モデルは、DeepSeek V4.1 Flash よりコストが高く、スコアが低くなっています。
ダッシュボードのランキング
ダッシュボード · コストと品質の比較基準線
ピンクの領域内の 3 モデルは、DeepSeek V4.1 Flash よりコストが高く、スコアが低くなっています。
ランディングページのランキング
ランディングページ · コストと品質の比較基準線
ピンクの領域内の 9 モデルは、DeepSeek V4.1 Flash よりコストが高く、スコアが低くなっています。
モデルの効率
完了時間、キャッシュヒット率、トークン消費量を比較します。数値はすべて実測の平均値です。
キャッシュ 81% · 入力 318.7K · 出力 15.5K
キャッシュ 89% · 入力 1462.8K · 出力 29.2K
キャッシュ 94% · 入力 715.7K · 出力 63.6K
キャッシュ 80.7% · 入力 236.6K · 出力 14.5K
キャッシュ 90.9% · 入力 3085.9K · 出力 46.0K
キャッシュ 91.3% · 入力 1422.1K · 出力 24.7K
キャッシュ 58.7% · 入力 517.6K · 出力 10.1K
キャッシュ 79% · 入力 836.8K · 出力 28.6K
キャッシュ 91.9% · 入力 2809.3K · 出力 32.7K
キャッシュ 71.3% · 入力 943.7K · 出力 28.4K
キャッシュ 70.9% · 入力 392.3K · 出力 27.9K
キャッシュ 31.5% · 入力 235.9K · 出力 13.4K
キャッシュ 71.7% · 入力 427.1K · 出力 16.1K
評価方法
要件充足度とデザイン品質を採点し、効率とコストは別に報告します。
課題とサンプル
Web アプリ、モバイルアプリ、デスクトップアプリ、ダッシュボード・管理画面、Web サイト・ランディングページの 5 つの用途について、共通のデザイン課題でモデルを評価します。結果が示すのは、実践的なプロトタイプ生成課題での性能であり、モデルの汎用的な能力ではありません。
ページ表示の確認
採点前に各成果物を Web ページとして開けるか確認し、白紙のページ、途中で途切れた内容、致命的な実行時エラーがないかを調べます。表示できない成果物は 0 点とし、再実行で結果を差し替えることはありません。正常に開けることは、その後の評価に進むための前提条件であり、要件を満たしていることや納品可能であることを意味しません。
要件充足度とデザイン品質
各成果物を 100 点満点で採点します。要件充足度は 30 点で、ページやモジュール、必要な内容、画面の状態、インタラクションを課題の要件と照合し、達成・一部達成・未達成で評価します。デザイン品質は 70 点で、レイアウトと読みやすさ、情報の階層、スタイルと課題の適合性、色とコントラスト、画像の適合性と内容との関連性の 5 項目を均等に評価します。各項目は達成・一部達成・未達成で採点します。
平均スコアと納品基準達成率
平均スコアは、モデルごとの採点済み成果物の算術平均です。本評価では、80 点以上の成果物を納品基準達成とみなします。納品基準達成率は、採点済み成果物のうち、この基準を満たす成果物の割合です。モデルが基準を満たす結果をどの程度安定して生成できるかを示します。ここでの納品基準は、本評価におけるプロトタイプの品質基準であり、本番環境で利用できる状態を保証するものではありません。
効率とコスト
完了時間、キャッシュヒット率、入力・出力トークン数、ツール呼び出し回数は、品質スコアとは別に実測平均値を報告します。各成果物のコストは、記録されたトークン使用量と標準の入力・出力・キャッシュ読み取り単価から推計し、その平均値を算出します。これはリソース消費を比較するための推計であり、請求額ではありません。記録されていない料金は含みません。効率とコストは評価スコアに加算されません。選定条件を変更するとおすすめ順位は変わりますが、元の評価結果は変わりません。
