OpenDesignArena

Encontre o modelo de IA certo para design.

Compare qualidade, velocidade e custo com avaliações reais.

Melhor custo-benefício

DeepSeek V4.1 Flash

Ótimo desempenho de design pelo menor custo.

Nesta avaliação, DeepSeek V4.1 Flash atingiu 98% da pontuação média do líder GPT-6 Astra, por aproximadamente 1% do seu custo médio.

Custo por resultado
$0.023vs. $1.61
Média da avaliação / 100
81.2vs. 82.7

Maior pontuação

Entrega mais rápida

Comparar modelos

Escolha dois ou três modelos e veja as cinco dimensões em um único gráfico. Formas diferentes indicam pontos fortes diferentes.

Perfil em cinco dimensões

Quanto mais longe do centro em cada eixo, melhor: mais qualidade, menos tempo e menor custo.

RequisitosQualidade do designTaxa de entregaVelocidade de entregaEficiência de custo

    Média em cada eixo entre todos os 13 modelos

    Escolha por preferência

    Equilibre qualidade avaliada, custo e velocidade para encontrar o modelo ideal para suas necessidades.

    O que é mais importante para você?
    Qualidade
    50%
    Custo
    30%
    Velocidade
    20%
    1. 1 DeepSeek V4.1 Flash 78.8 Pontuação média: 81.2/100; Custo médio: $0.023; Tempo médio: 5.3 min
    2. 2 DeepSeek V4 Flash 68.6 Pontuação média: 70.6/100; Custo médio: $0.031; Tempo médio: 11.1 min
    3. 3 GPT-5.6 Sol 65.7 Pontuação média: 77.6/100; Custo médio: $0.544; Tempo médio: 3.2 min
    4. 4 Gemini 3.8 Flash 64.7 Pontuação média: 68.9/100; Custo médio: $0.210; Tempo médio: 3.8 min
    5. 5 DeepSeek V4 Pro 64.6 Pontuação média: 72.9/100; Custo médio: $0.061; Tempo médio: 17.7 min
    6. 6 Muse Spark 1.3 63.2 Pontuação média: 66.6/100; Custo médio: $0.267; Tempo médio: 3.3 min
    7. 7 GLM-5.3 Flash 61.4 Pontuação média: 69.8/100; Custo médio: $0.064; Tempo médio: 23.5 min
    8. 8 GPT-6 Astra 57.5 Pontuação média: 82.7/100; Custo médio: $1.61; Tempo médio: 11.1 min
    9. 9 Grok 4.6 56.5 Pontuação média: 72.4/100; Custo médio: $0.599; Tempo médio: 11.4 min
    10. 10 Hunyuan H4 Preview 54.6 Pontuação média: 74.6/100; Custo médio: $0.418; Tempo médio: 29.2 min
    11. 11 Qwen 3.8-Max 52.3 Pontuação média: 72.0/100; Custo médio: $0.595; Tempo médio: 26.4 min
    12. 12 Claude Fable 5.1 52.1 Pontuação média: 80.3/100; Custo médio: $3.66; Tempo médio: 12.8 min
    13. 13 Kimi K3 52.1 Pontuação média: 65.7/100; Custo médio: $0.614; Tempo médio: 14.0 min

    Escolha por caso de uso

    Escolha um cenário de design; cada uma das cinco dimensões abaixo recomenda um modelo.

    Desempenho geral

    GPT-6 Astra

    Requisitos · 26.5/30Qualidade do design · 56.2/70Taxa de entrega · 60.0%Tempo de conclusão · 11.1 minCusto por execução · $1.61 Requisitos 26.5/30 Qualidade do design 56.2/70 Taxa de entrega 60.0% Tempo de conclusão 11.1 min Custo por execução $1.61
    Pontuação média
    82.7/100
    Média de requisitos
    26.5/30
    Qualidade média do design
    56.2/70
    Taxa média de entrega
    60.0%
    Tempo médio
    11.1 min
    Custo médio / resultado
    $1.61/execução
    Qualidade do design

    Claude Fable 5.1

    Qualidade média do design
    53.2/70
    Pontuação média
    80.3/100
    Taxa média de entrega
    56.7%
    Média de requisitos
    27.1/30
    Tempo médio
    12.8 min
    Custo médio / resultado
    $3.66/execução
    Atendimento aos requisitos

    DeepSeek V4.1 Flash

    Média de requisitos
    28.4/30
    Pontuação média
    81.2/100
    Taxa média de entrega
    57.7%
    Qualidade média do design
    52.8/70
    Tempo médio
    5.3 min
    Custo médio / resultado
    $0.023/execução
    Velocidade de conclusão

    GPT-5.6 Sol

    Tempo médio
    3.2 min
    Pontuação média
    77.6/100
    Taxa média de entrega
    53.3%
    Média de requisitos
    25.8/30
    Qualidade média do design
    51.8/70
    Custo médio / resultado
    $0.544/execução
    Eficiência de custo

    Hunyuan H4 Preview

    Custo médio / resultado
    $0.418/execução
    Pontuação média
    74.6/100
    Taxa média de entrega
    40.0%
    Média de requisitos
    26.8/30
    Qualidade média do design
    47.8/70
    Tempo médio
    29.2 min

    Qualidade e custo

    Compare o desempenho dos modelos e o custo para alcançá-lo.

    Ranking de Qualidade

    82.7/100 GPT-6 Astra
    81.2/100 DeepSeek V4.1 Flash
    80.3/100 Claude Fable 5.1
    77.6/100 GPT-5.6 Sol
    74.6/100 Hunyuan H4 Preview
    72.9/100 DeepSeek V4 Pro
    72.4/100 Grok 4.6
    72.0/100 Qwen 3.8-Max
    70.6/100 DeepSeek V4 Flash
    69.8/100 GLM-5.3 Flash
    68.9/100 Gemini 3.8 Flash
    66.6/100 Muse Spark 1.3
    65.7/100 Kimi K3

    Limite de custo e qualidade

    Pontuação média Custo por resultado (USD) GPT-6 Astra GPT-6 Astra Pontuação média 82.7 · $1.61 DeepSeek V4.1 Flash DeepSeek V4.1 Flash Pontuação média 81.2 · $0.023 Claude Fable 5.1 Claude Fable 5.1 Pontuação média 80.3 · $3.66 GPT-5.6 Sol GPT-5.6 Sol Pontuação média 77.6 · $0.544 Hunyuan H4 Preview Hunyuan H4 Preview Pontuação média 74.6 · $0.418 DeepSeek V4 Pro DeepSeek V4 Pro Pontuação média 72.9 · $0.061 Grok 4.6 Grok 4.6 Pontuação média 72.4 · $0.599 Qwen 3.8-Max Qwen 3.8-Max Pontuação média 72.0 · $0.595 DeepSeek V4 Flash DeepSeek V4 Flash Pontuação média 70.6 · $0.031 GLM-5.3 Flash GLM-5.3 Flash Pontuação média 69.8 · $0.064 Gemini 3.8 Flash Gemini 3.8 Flash Pontuação média 68.9 · $0.210 Muse Spark 1.3 Muse Spark 1.3 Pontuação média 66.6 · $0.267 Kimi K3 Kimi K3 Pontuação média 65.7 · $0.614

    11 modelos na área rosa custam mais e pontuam menos que DeepSeek V4.1 Flash.

    Desempenho por cenário

    Ranking de App web

    83.1/100 GPT-5.6 Sol
    82.6/100 Claude Fable 5.1
    82.4/100 DeepSeek V4.1 Flash
    77.1/100 GPT-6 Astra
    68.5/100 Grok 4.6
    68.4/100 Gemini 3.8 Flash
    62.0/100 Muse Spark 1.3
    60.6/100 GLM-5.3 Flash
    60.5/100 Hunyuan H4 Preview
    57.0/100 Qwen 3.8-Max
    56.4/100 DeepSeek V4 Flash
    51.8/100 DeepSeek V4 Pro
    35.9/100 Kimi K3

    App web · Limite de custo e qualidade

    Pontuação média Custo por resultado (USD) GPT-5.6 Sol GPT-5.6 Sol Pontuação média 83.1 · $0.537 Claude Fable 5.1 Claude Fable 5.1 Pontuação média 82.6 · $5.55 DeepSeek V4.1 Flash DeepSeek V4.1 Flash Pontuação média 82.4 · $0.030 GPT-6 Astra GPT-6 Astra Pontuação média 77.1 · $1.87 Grok 4.6 Grok 4.6 Pontuação média 68.5 · $0.818 Gemini 3.8 Flash Gemini 3.8 Flash Pontuação média 68.4 · $0.185 Muse Spark 1.3 Muse Spark 1.3 Pontuação média 62.0 · $0.293 GLM-5.3 Flash GLM-5.3 Flash Pontuação média 60.6 · $0.093 Hunyuan H4 Preview Hunyuan H4 Preview Pontuação média 60.5 · $0.609 Qwen 3.8-Max Qwen 3.8-Max Pontuação média 57.0 · $0.552 DeepSeek V4 Flash DeepSeek V4 Flash Pontuação média 56.4 · $0.041 DeepSeek V4 Pro DeepSeek V4 Pro Pontuação média 51.8 · $0.067 Kimi K3 Kimi K3 Pontuação média 35.9 · $0.486

    10 modelos na área rosa custam mais e pontuam menos que DeepSeek V4.1 Flash.

    Eficiência dos modelos

    Compare tempo de conclusão, taxa de acerto do cache e consumo de tokens. Todos os valores são médias medidas.

    Cenário
    Pontuação médiaTempo de conclusão
    Alta pontuação · Alta eficiência

    Método de avaliação

    Avaliamos o atendimento aos requisitos e a qualidade do design, com eficiência e custo apresentados separadamente.

    Tarefas e amostras

    Os modelos são avaliados com as mesmas tarefas de design em cinco cenários: aplicativos web, aplicativos móveis, aplicativos desktop, dashboards e painéis administrativos, além de sites e landing pages. Estes resultados descrevem o desempenho em tarefas práticas de geração de protótipos, não a capacidade geral dos modelos.

    Verificação de renderização

    Antes de atribuir a pontuação, verificamos se cada resultado abre como uma página web, observando páginas em branco, conteúdo cortado e erros fatais de execução. Resultados que não renderizam recebem zero; não são substituídos por novos testes. Abrir corretamente é apenas um pré-requisito para a avaliação seguinte, não uma prova de que os requisitos foram atendidos ou de que o resultado está pronto para entrega.

    Atendimento aos requisitos e qualidade do design

    Cada resultado recebe uma pontuação de até 100 pontos. O atendimento aos requisitos vale 30 pontos: páginas e módulos, conteúdo obrigatório, estados da interface e interações são comparados com o enunciado e classificados como completos, parcialmente completos ou incompletos. A qualidade do design vale 70 pontos, distribuídos igualmente entre cinco dimensões: layout e legibilidade, hierarquia da informação, adequação do estilo à tarefa, cor e contraste, e adequação das imagens e relevância para o conteúdo. Cada dimensão é classificada como atendida, parcialmente atendida ou não atendida.

    Pontuação média e taxa de entrega

    A pontuação média é a média aritmética de todos os resultados pontuados de um modelo. Nesta avaliação, um resultado com 80 pontos ou mais é considerado pronto para entrega. A taxa de entrega é a proporção de resultados pontuados que atingem esse limite e indica a consistência com que o modelo produz resultados dentro do padrão. Pronto para entrega refere-se ao padrão de qualidade de protótipos desta avaliação, não à prontidão para uso em produção.

    Eficiência e custo

    Apresentamos as médias medidas de tempo de conclusão, taxa de acerto do cache, consumo de tokens de entrada e saída e chamadas de ferramentas separadamente das pontuações de qualidade. O custo de cada resultado é estimado a partir do consumo de tokens registrado e dos preços padrão de entrada, saída e leitura de cache; depois, calculamos a média. Essas estimativas comparam o consumo de recursos: não são valores de faturas e não incluem cobranças não registradas. Eficiência e custo não entram na pontuação da avaliação. Alterar as preferências de seleção afeta o ranking de recomendações, não os resultados originais da avaliação.

    OpenDesign Desktop

    Um design system. Sua marca consistente em tudo

    No Vibe Design Workspace completo, aplique as mesmas regras de marca a sites, apresentações, protótipos interativos, dashboards, imagens e vídeos HTML. Conecte Codex, Claude Code, Cursor e outros agentes de código locais e crie de graça.

    • Sites, apresentações, protótipos, dashboards, imagens e vídeo
    • Mais de 140 design systems e a biblioteca completa de templates e skills
    • Codex local e mais de 21 agentes de código · Grátis
    Baixar grátis

    Disponível para macOS e Windows