OpenDesignArena

找到更适合设计任务的 AI 模型。

从效果、速度到成本,用真实评测做选择。

综合推荐

DeepSeek V4.1 Flash

以最低成本,交付出色的设计表现。

DeepSeek V4.1 Flash 的均分达到榜首 GPT-6 Astra 的 98%,平均成本只有其 1%。

单份成本
$0.023vs $1.61
评测均分 / 100
81.2vs 82.7

高分之选

速度之选

模型对比

选择 2–3 个模型,对比需求完成度、设计质量、可交付率、完成耗时和成本

五维表现

五个维度越靠外越好,完成更快、成本更省。

需求完成度设计质量可交付率完成速度成本控制

    全体 13 个模型的各项平均值

    按偏好选模型

    综合评测效果、成本和速度,找到更适合你的模型。

    你更看重什么?
    效果
    50%
    成本
    30%
    速度
    20%
    1. 1 DeepSeek V4.1 Flash 78.8 平均任务得分:81.2/100; 平均任务成本:$0.023; 平均任务耗时:5.3 分钟
    2. 2 DeepSeek V4 Flash 68.6 平均任务得分:70.6/100; 平均任务成本:$0.031; 平均任务耗时:11.1 分钟
    3. 3 GPT-5.6 Sol 65.7 平均任务得分:77.6/100; 平均任务成本:$0.544; 平均任务耗时:3.2 分钟
    4. 4 Gemini 3.8 Flash 64.7 平均任务得分:68.9/100; 平均任务成本:$0.210; 平均任务耗时:3.8 分钟
    5. 5 DeepSeek V4 Pro 64.6 平均任务得分:72.9/100; 平均任务成本:$0.061; 平均任务耗时:17.7 分钟
    6. 6 Muse Spark 1.3 63.2 平均任务得分:66.6/100; 平均任务成本:$0.267; 平均任务耗时:3.3 分钟
    7. 7 GLM-5.3 Flash 61.4 平均任务得分:69.8/100; 平均任务成本:$0.064; 平均任务耗时:23.5 分钟
    8. 8 GPT-6 Astra 57.5 平均任务得分:82.7/100; 平均任务成本:$1.61; 平均任务耗时:11.1 分钟
    9. 9 Grok 4.6 56.5 平均任务得分:72.4/100; 平均任务成本:$0.599; 平均任务耗时:11.4 分钟
    10. 10 Hunyuan H4 Preview 54.6 平均任务得分:74.6/100; 平均任务成本:$0.418; 平均任务耗时:29.2 分钟
    11. 11 Qwen 3.8-Max 52.3 平均任务得分:72.0/100; 平均任务成本:$0.595; 平均任务耗时:26.4 分钟
    12. 12 Claude Fable 5.1 52.1 平均任务得分:80.3/100; 平均任务成本:$3.66; 平均任务耗时:12.8 分钟
    13. 13 Kimi K3 52.1 平均任务得分:65.7/100; 平均任务成本:$0.614; 平均任务耗时:14.0 分钟

    按设计场景选择模型

    从设计场景出发,找到效果、速度与成本之间的理想平衡。

    综合表现

    GPT-6 Astra

    需求完成度 · 26.5/30设计质量 · 56.2/70可交付率 · 60.0%完成耗时 · 11.1 分钟单份成本 · $1.61 需求完成度 26.5/30 设计质量 56.2/70 可交付率 60.0% 完成耗时 11.1 分钟 单份成本 $1.61
    平均分
    82.7/100
    平均需求完成度
    26.5/30
    平均设计质量
    56.2/70
    可交付率
    60.0%
    平均完成耗时
    11.1 分钟
    平均单份成本
    $1.61/份
    设计质量

    Claude Fable 5.1

    平均设计质量
    53.2/70
    平均分
    80.3/100
    可交付率
    56.7%
    平均需求完成度
    27.1/30
    平均完成耗时
    12.8 分钟
    平均单份成本
    $3.66/份
    需求完成度

    DeepSeek V4.1 Flash

    平均需求完成度
    28.4/30
    平均分
    81.2/100
    可交付率
    57.7%
    平均设计质量
    52.8/70
    平均完成耗时
    5.3 分钟
    平均单份成本
    $0.023/份
    完成速度

    GPT-5.6 Sol

    平均完成耗时
    3.2 分钟
    平均分
    77.6/100
    可交付率
    53.3%
    平均需求完成度
    25.8/30
    平均设计质量
    51.8/70
    平均单份成本
    $0.544/份
    成本效率

    Hunyuan H4 Preview

    平均单份成本
    $0.418/份
    平均分
    74.6/100
    可交付率
    40.0%
    平均需求完成度
    26.8/30
    平均设计质量
    47.8/70
    平均完成耗时
    29.2 分钟

    效果与成本

    比较模型的评测表现,以及获得这些表现所需的成本。

    效果排名

    82.7/100 GPT-6 Astra
    81.2/100 DeepSeek V4.1 Flash
    80.3/100 Claude Fable 5.1
    77.6/100 GPT-5.6 Sol
    74.6/100 Hunyuan H4 Preview
    72.9/100 DeepSeek V4 Pro
    72.4/100 Grok 4.6
    72.0/100 Qwen 3.8-Max
    70.6/100 DeepSeek V4 Flash
    69.8/100 GLM-5.3 Flash
    68.9/100 Gemini 3.8 Flash
    66.6/100 Muse Spark 1.3
    65.7/100 Kimi K3

    性价比斩杀线

    平均分 单份成本(美元) GPT-6 Astra GPT-6 Astra 平均分 82.7 · $1.61 DeepSeek V4.1 Flash DeepSeek V4.1 Flash 平均分 81.2 · $0.023 Claude Fable 5.1 Claude Fable 5.1 平均分 80.3 · $3.66 GPT-5.6 Sol GPT-5.6 Sol 平均分 77.6 · $0.544 Hunyuan H4 Preview Hunyuan H4 Preview 平均分 74.6 · $0.418 DeepSeek V4 Pro DeepSeek V4 Pro 平均分 72.9 · $0.061 Grok 4.6 Grok 4.6 平均分 72.4 · $0.599 Qwen 3.8-Max Qwen 3.8-Max 平均分 72.0 · $0.595 DeepSeek V4 Flash DeepSeek V4 Flash 平均分 70.6 · $0.031 GLM-5.3 Flash GLM-5.3 Flash 平均分 69.8 · $0.064 Gemini 3.8 Flash Gemini 3.8 Flash 平均分 68.9 · $0.210 Muse Spark 1.3 Muse Spark 1.3 平均分 66.6 · $0.267 Kimi K3 Kimi K3 平均分 65.7 · $0.614

    粉色区域内的 11 个模型,比 DeepSeek V4.1 Flash 更贵且得分更低。

    场景表现

    Web 应用排名

    83.1/100 GPT-5.6 Sol
    82.6/100 Claude Fable 5.1
    82.4/100 DeepSeek V4.1 Flash
    77.1/100 GPT-6 Astra
    68.5/100 Grok 4.6
    68.4/100 Gemini 3.8 Flash
    62.0/100 Muse Spark 1.3
    60.6/100 GLM-5.3 Flash
    60.5/100 Hunyuan H4 Preview
    57.0/100 Qwen 3.8-Max
    56.4/100 DeepSeek V4 Flash
    51.8/100 DeepSeek V4 Pro
    35.9/100 Kimi K3

    Web 应用 · 性价比斩杀线

    平均分 单份成本(美元) GPT-5.6 Sol GPT-5.6 Sol 平均分 83.1 · $0.537 Claude Fable 5.1 Claude Fable 5.1 平均分 82.6 · $5.55 DeepSeek V4.1 Flash DeepSeek V4.1 Flash 平均分 82.4 · $0.030 GPT-6 Astra GPT-6 Astra 平均分 77.1 · $1.87 Grok 4.6 Grok 4.6 平均分 68.5 · $0.818 Gemini 3.8 Flash Gemini 3.8 Flash 平均分 68.4 · $0.185 Muse Spark 1.3 Muse Spark 1.3 平均分 62.0 · $0.293 GLM-5.3 Flash GLM-5.3 Flash 平均分 60.6 · $0.093 Hunyuan H4 Preview Hunyuan H4 Preview 平均分 60.5 · $0.609 Qwen 3.8-Max Qwen 3.8-Max 平均分 57.0 · $0.552 DeepSeek V4 Flash DeepSeek V4 Flash 平均分 56.4 · $0.041 DeepSeek V4 Pro DeepSeek V4 Pro 平均分 51.8 · $0.067 Kimi K3 Kimi K3 平均分 35.9 · $0.486

    粉色区域内的 10 个模型,比 DeepSeek V4.1 Flash 更贵且得分更低。

    模型效率

    以实测均值,对比模型的完成速度与资源消耗。

    场景
    平均分完成耗时
    高分 · 高效率

    评测方法

    从需求完成度与设计质量两方面评分,效率与成本单独呈现。

    评测任务与样本

    各模型围绕统一的设计任务进行评测,覆盖 Web 应用、移动端 App、桌面客户端、看板与管理后台、官网与落地页五类场景。我们评估的是模型在实际原型生成任务中的表现,而非通用能力。

    页面渲染检查

    评分前,先检查产物能否作为网页正常打开,包括是否出现空白页面、内容被截断或致命运行错误。无法渲染的产物按零分计入,不通过补测替换结果。页面能够打开只是进入后续评估的基础,并不代表需求已经完成,也不代表产物达到可交付标准。

    需求完成度与设计质量

    单份产物满分为 100 分,由需求完成度与设计质量两部分组成。需求完成度占 30 分:根据每道任务的具体要求,逐项检查页面与模块、必要内容、界面状态以及交互行为,按完成、部分完成或未完成计分。设计质量占 70 分:从布局与可读性、信息层级、风格与任务匹配度、配色与对比度、图片适配与内容相关性五个维度等权评分,各维度同样区分达标、部分达标和未达标。

    评测均分与可交付率

    评测均分是模型所有已评分产物总分的算术平均值,用于比较整体表现。单份产物达到 80 分,在本评测中视为可交付;可交付率则是已评分产物中达到这一标准的比例,用于观察模型稳定产出合格结果的能力。这里的“可交付”指达到本评测的原型质量标准,不等同于可直接用于生产环境。

    效率与成本

    除评分外,我们单独统计完成耗时、缓存命中率、输入与输出 Token 用量,以及工具调用次数等效率指标,并采用实测均值。单份成本根据记录的 Token 用量,分别按标准输入、输出和缓存读取单价估算,再计算平均值。该结果用于比较资源消耗,不代表实际账单,也不包含未记录的额外费用。效率与成本不计入评测总分;切换选型偏好只改变推荐排序,不改变模型的原始评测成绩。

    OpenDesign 桌面客户端

    一套设计系统,让每一次创作都保持品牌一致

    在完整的 Vibe Design Workspace 中,用同一套品牌规则生成网页、PPT、可交互原型、数据看板、图像与 HTML 视频。连接本地 Codex、Claude Code、Cursor 等编程助手,即可免费创作。

    • 覆盖网页、PPT、原型、数据看板、图像与视频
    • 140+ 设计系统,以及完整模板与技能库
    • 连接本地 Codex 与 21+ 款编程助手 · 免费使用
    免费下载

    支持 macOS 与 Windows