OpenDesignArena
Encontre o modelo de IA certo para design.
Compare qualidade, velocidade e custo com avaliações reais.
Melhor custo-benefício
Ótimo desempenho de design pelo menor custo.
Nesta avaliação, DeepSeek V4.1 Flash atingiu 98% da pontuação média do líder GPT-6 Astra, por aproximadamente 1% do seu custo médio.
- Custo por resultado
- $0.023vs. $1.61
- Média da avaliação / 100
- 81.2vs. 82.7
Maior pontuação
Entrega mais rápida
Comparar modelos
Escolha dois ou três modelos e veja as cinco dimensões em um único gráfico. Formas diferentes indicam pontos fortes diferentes.
Perfil em cinco dimensões
Quanto mais longe do centro em cada eixo, melhor: mais qualidade, menos tempo e menor custo.
Média em cada eixo entre todos os 13 modelos
Escolha por preferência
Equilibre qualidade avaliada, custo e velocidade para encontrar o modelo ideal para suas necessidades.
- Qualidade
- 50%
- Custo
- 30%
- Velocidade
- 20%
- 1 DeepSeek V4.1 Flash 78.8 Pontuação média: 81.2/100; Custo médio: $0.023; Tempo médio: 5.3 min
- 2 DeepSeek V4 Flash 68.6 Pontuação média: 70.6/100; Custo médio: $0.031; Tempo médio: 11.1 min
- 3 GPT-5.6 Sol 65.7 Pontuação média: 77.6/100; Custo médio: $0.544; Tempo médio: 3.2 min
- 4 Gemini 3.8 Flash 64.7 Pontuação média: 68.9/100; Custo médio: $0.210; Tempo médio: 3.8 min
- 5 DeepSeek V4 Pro 64.6 Pontuação média: 72.9/100; Custo médio: $0.061; Tempo médio: 17.7 min
- 6 Muse Spark 1.3 63.2 Pontuação média: 66.6/100; Custo médio: $0.267; Tempo médio: 3.3 min
- 7 GLM-5.3 Flash 61.4 Pontuação média: 69.8/100; Custo médio: $0.064; Tempo médio: 23.5 min
- 8 GPT-6 Astra 57.5 Pontuação média: 82.7/100; Custo médio: $1.61; Tempo médio: 11.1 min
- 9 Grok 4.6 56.5 Pontuação média: 72.4/100; Custo médio: $0.599; Tempo médio: 11.4 min
- 10 Hunyuan H4 Preview 54.6 Pontuação média: 74.6/100; Custo médio: $0.418; Tempo médio: 29.2 min
- 11 Qwen 3.8-Max 52.3 Pontuação média: 72.0/100; Custo médio: $0.595; Tempo médio: 26.4 min
- 12 Claude Fable 5.1 52.1 Pontuação média: 80.3/100; Custo médio: $3.66; Tempo médio: 12.8 min
- 13 Kimi K3 52.1 Pontuação média: 65.7/100; Custo médio: $0.614; Tempo médio: 14.0 min
Escolha por caso de uso
Escolha um cenário de design; cada uma das cinco dimensões abaixo recomenda um modelo.
GPT-6 Astra
- Pontuação média Pontuação médiaQuanto maior, melhor A pontuação média de todos os resultados avaliados, de um total de 100 pontos.
- 82.7/100
- Média de requisitos Atendimento aos requisitosQuanto maior, melhor Verifica a presença de páginas, conteúdo, estados e interações exigidos, até 30 pontos.
- 26.5/30
- Qualidade média do design Qualidade do designQuanto maior, melhor Avalia layout, hierarquia, estilo, cor e adequação das imagens, até 70 pontos.
- 56.2/70
- Taxa média de entrega Taxa de entregaQuanto maior, melhor A proporção de resultados avaliados com 80 pontos ou mais.
- 60.0%
- Tempo médio Tempo médio de conclusãoQuanto menor, melhor O tempo total de execução dos resultados pontuados dividido pela quantidade de resultados.
- 11.1 min
- Custo médio / resultado Custo por resultadoQuanto menor, melhor Estimado com base nos preços oficiais de tabela e no consumo de tokens medido.
- $1.61/execução
Claude Fable 5.1
- Qualidade média do design
- 53.2/70
- Pontuação média
- 80.3/100
- Taxa média de entrega
- 56.7%
- Média de requisitos
- 27.1/30
- Tempo médio
- 12.8 min
- Custo médio / resultado
- $3.66/execução
DeepSeek V4.1 Flash
- Média de requisitos
- 28.4/30
- Pontuação média
- 81.2/100
- Taxa média de entrega
- 57.7%
- Qualidade média do design
- 52.8/70
- Tempo médio
- 5.3 min
- Custo médio / resultado
- $0.023/execução
GPT-5.6 Sol
- Tempo médio
- 3.2 min
- Pontuação média
- 77.6/100
- Taxa média de entrega
- 53.3%
- Média de requisitos
- 25.8/30
- Qualidade média do design
- 51.8/70
- Custo médio / resultado
- $0.544/execução
Hunyuan H4 Preview
- Custo médio / resultado
- $0.418/execução
- Pontuação média
- 74.6/100
- Taxa média de entrega
- 40.0%
- Média de requisitos
- 26.8/30
- Qualidade média do design
- 47.8/70
- Tempo médio
- 29.2 min
Qualidade e custo
Compare o desempenho dos modelos e o custo para alcançá-lo.
Ranking de Qualidade
Limite de custo e qualidade
11 modelos na área rosa custam mais e pontuam menos que DeepSeek V4.1 Flash.
Desempenho por cenário
Exibindo App web (Estrutura com várias páginas e fluxos); GPT-5.6 Sol lidera com 83.1 pontos, taxa de entrega de 66.7% e $0.537 por execução.
Exibindo App móvel (Experiência de toque e layout responsivo); Hunyuan H4 Preview lidera com 89.5 pontos, taxa de entrega de 83.3% e $0.404 por execução.
Exibindo App desktop (Fluxos de trabalho desktop e interações complexas); DeepSeek V4 Flash lidera com 90.3 pontos, taxa de entrega de 83.3% e $0.027 por execução.
Exibindo Dashboard (Densidade e hierarquia da informação); GPT-6 Astra lidera com 86.3 pontos, taxa de entrega de 66.7% e $1.65 por execução.
Exibindo Landing page (Expressão da marca e conversão); Qwen 3.8-Max lidera com 82.8 pontos, taxa de entrega de 66.7% e $0.609 por execução.
Ranking de App web
App web · Limite de custo e qualidade
10 modelos na área rosa custam mais e pontuam menos que DeepSeek V4.1 Flash.
Ranking de App móvel
App móvel · Limite de custo e qualidade
8 modelos na área rosa custam mais e pontuam menos que DeepSeek V4.1 Flash.
Ranking de App desktop
App desktop · Limite de custo e qualidade
9 modelos na área rosa custam mais e pontuam menos que DeepSeek V4.1 Flash.
Ranking de Dashboard
Dashboard · Limite de custo e qualidade
3 modelos na área rosa custam mais e pontuam menos que DeepSeek V4.1 Flash.
Ranking de Landing page
Landing page · Limite de custo e qualidade
9 modelos na área rosa custam mais e pontuam menos que DeepSeek V4.1 Flash.
Eficiência dos modelos
Compare tempo de conclusão, taxa de acerto do cache e consumo de tokens. Todos os valores são médias medidas.
Cache 81% · Entrada 318.7K · Saída 15.5K
Cache 89% · Entrada 1462.8K · Saída 29.2K
Cache 94% · Entrada 715.7K · Saída 63.6K
Cache 80.7% · Entrada 236.6K · Saída 14.5K
Cache 90.9% · Entrada 3085.9K · Saída 46.0K
Cache 91.3% · Entrada 1422.1K · Saída 24.7K
Cache 58.7% · Entrada 517.6K · Saída 10.1K
Cache 79% · Entrada 836.8K · Saída 28.6K
Cache 91.9% · Entrada 2809.3K · Saída 32.7K
Cache 71.3% · Entrada 943.7K · Saída 28.4K
Cache 70.9% · Entrada 392.3K · Saída 27.9K
Cache 31.5% · Entrada 235.9K · Saída 13.4K
Cache 71.7% · Entrada 427.1K · Saída 16.1K
Método de avaliação
Avaliamos o atendimento aos requisitos e a qualidade do design, com eficiência e custo apresentados separadamente.
Tarefas e amostras
Os modelos são avaliados com as mesmas tarefas de design em cinco cenários: aplicativos web, aplicativos móveis, aplicativos desktop, dashboards e painéis administrativos, além de sites e landing pages. Estes resultados descrevem o desempenho em tarefas práticas de geração de protótipos, não a capacidade geral dos modelos.
Verificação de renderização
Antes de atribuir a pontuação, verificamos se cada resultado abre como uma página web, observando páginas em branco, conteúdo cortado e erros fatais de execução. Resultados que não renderizam recebem zero; não são substituídos por novos testes. Abrir corretamente é apenas um pré-requisito para a avaliação seguinte, não uma prova de que os requisitos foram atendidos ou de que o resultado está pronto para entrega.
Atendimento aos requisitos e qualidade do design
Cada resultado recebe uma pontuação de até 100 pontos. O atendimento aos requisitos vale 30 pontos: páginas e módulos, conteúdo obrigatório, estados da interface e interações são comparados com o enunciado e classificados como completos, parcialmente completos ou incompletos. A qualidade do design vale 70 pontos, distribuídos igualmente entre cinco dimensões: layout e legibilidade, hierarquia da informação, adequação do estilo à tarefa, cor e contraste, e adequação das imagens e relevância para o conteúdo. Cada dimensão é classificada como atendida, parcialmente atendida ou não atendida.
Pontuação média e taxa de entrega
A pontuação média é a média aritmética de todos os resultados pontuados de um modelo. Nesta avaliação, um resultado com 80 pontos ou mais é considerado pronto para entrega. A taxa de entrega é a proporção de resultados pontuados que atingem esse limite e indica a consistência com que o modelo produz resultados dentro do padrão. Pronto para entrega refere-se ao padrão de qualidade de protótipos desta avaliação, não à prontidão para uso em produção.
Eficiência e custo
Apresentamos as médias medidas de tempo de conclusão, taxa de acerto do cache, consumo de tokens de entrada e saída e chamadas de ferramentas separadamente das pontuações de qualidade. O custo de cada resultado é estimado a partir do consumo de tokens registrado e dos preços padrão de entrada, saída e leitura de cache; depois, calculamos a média. Essas estimativas comparam o consumo de recursos: não são valores de faturas e não incluem cobranças não registradas. Eficiência e custo não entram na pontuação da avaliação. Alterar as preferências de seleção afeta o ranking de recomendações, não os resultados originais da avaliação.
