OpenDesignArena

Encuentra el modelo de IA adecuado para diseñar.

Compara calidad, velocidad y costo con evaluaciones reales.

Mejor relación calidad-precio

DeepSeek V4.1 Flash

Un diseño de gran calidad al menor costo.

En esta evaluación, DeepSeek V4.1 Flash alcanzó el 98% de la puntuación media del líder, GPT-6 Astra, con aproximadamente el 1% de su costo medio.

Costo por resultado
$0.023frente a $1.61
Puntuación media / 100
81.2frente a 82.7

Mayor puntuación

Entrega más rápida

Comparar modelos

Elige dos o tres modelos y compara las cinco dimensiones en un solo gráfico. Las distintas formas muestran sus diferentes fortalezas.

Perfil en cinco dimensiones

Cuanto más lejos del centro en cada eje, mejor: mayor calidad, menos tiempo y menor costo.

RequisitosCalidad del diseñoTasa de entregablesVelocidad de entregaEficiencia de costos

    Promedio de cada eje entre los 13 modelos

    Elige según tus prioridades

    Equilibra la calidad evaluada, el costo y la velocidad para encontrar el modelo que se ajuste a tus necesidades.

    ¿Qué es lo más importante para ti?
    Calidad
    50%
    Costo
    30%
    Velocidad
    20%
    1. 1 DeepSeek V4.1 Flash 78.8 Puntuación media: 81.2/100; Costo medio: $0.023; Tiempo medio: 5.3 min
    2. 2 DeepSeek V4 Flash 68.6 Puntuación media: 70.6/100; Costo medio: $0.031; Tiempo medio: 11.1 min
    3. 3 GPT-5.6 Sol 65.7 Puntuación media: 77.6/100; Costo medio: $0.544; Tiempo medio: 3.2 min
    4. 4 Gemini 3.8 Flash 64.7 Puntuación media: 68.9/100; Costo medio: $0.210; Tiempo medio: 3.8 min
    5. 5 DeepSeek V4 Pro 64.6 Puntuación media: 72.9/100; Costo medio: $0.061; Tiempo medio: 17.7 min
    6. 6 Muse Spark 1.3 63.2 Puntuación media: 66.6/100; Costo medio: $0.267; Tiempo medio: 3.3 min
    7. 7 GLM-5.3 Flash 61.4 Puntuación media: 69.8/100; Costo medio: $0.064; Tiempo medio: 23.5 min
    8. 8 GPT-6 Astra 57.5 Puntuación media: 82.7/100; Costo medio: $1.61; Tiempo medio: 11.1 min
    9. 9 Grok 4.6 56.5 Puntuación media: 72.4/100; Costo medio: $0.599; Tiempo medio: 11.4 min
    10. 10 Hunyuan H4 Preview 54.6 Puntuación media: 74.6/100; Costo medio: $0.418; Tiempo medio: 29.2 min
    11. 11 Qwen 3.8-Max 52.3 Puntuación media: 72.0/100; Costo medio: $0.595; Tiempo medio: 26.4 min
    12. 12 Claude Fable 5.1 52.1 Puntuación media: 80.3/100; Costo medio: $3.66; Tiempo medio: 12.8 min
    13. 13 Kimi K3 52.1 Puntuación media: 65.7/100; Costo medio: $0.614; Tiempo medio: 14.0 min

    Elige según el uso

    Selecciona un tipo de proyecto; cada uno de los cinco criterios siguientes recomienda un modelo.

    Rendimiento global

    GPT-6 Astra

    Requisitos · 26.5/30Calidad del diseño · 56.2/70Tasa de entregables · 60.0%Tiempo de ejecución · 11.1 minCosto por ejecución · $1.61 Requisitos 26.5/30 Calidad del diseño 56.2/70 Tasa de entregables 60.0% Tiempo de ejecución 11.1 min Costo por ejecución $1.61
    Puntuación media
    82.7/100
    Requisitos: promedio
    26.5/30
    Diseño: promedio
    56.2/70
    Tasa media de entregables
    60.0%
    Tiempo medio
    11.1 min
    Costo medio / resultado
    $1.61/ejecución
    Calidad del diseño

    Claude Fable 5.1

    Diseño: promedio
    53.2/70
    Puntuación media
    80.3/100
    Tasa media de entregables
    56.7%
    Requisitos: promedio
    27.1/30
    Tiempo medio
    12.8 min
    Costo medio / resultado
    $3.66/ejecución
    Cumplimiento de requisitos

    DeepSeek V4.1 Flash

    Requisitos: promedio
    28.4/30
    Puntuación media
    81.2/100
    Tasa media de entregables
    57.7%
    Diseño: promedio
    52.8/70
    Tiempo medio
    5.3 min
    Costo medio / resultado
    $0.023/ejecución
    Velocidad de ejecución

    GPT-5.6 Sol

    Tiempo medio
    3.2 min
    Puntuación media
    77.6/100
    Tasa media de entregables
    53.3%
    Requisitos: promedio
    25.8/30
    Diseño: promedio
    51.8/70
    Costo medio / resultado
    $0.544/ejecución
    Eficiencia de costos

    Hunyuan H4 Preview

    Costo medio / resultado
    $0.418/ejecución
    Puntuación media
    74.6/100
    Tasa media de entregables
    40.0%
    Requisitos: promedio
    26.8/30
    Diseño: promedio
    47.8/70
    Tiempo medio
    29.2 min

    Calidad y costo

    Compara el rendimiento de los modelos y el costo de conseguirlo.

    Clasificación: Calidad

    82.7/100 GPT-6 Astra
    81.2/100 DeepSeek V4.1 Flash
    80.3/100 Claude Fable 5.1
    77.6/100 GPT-5.6 Sol
    74.6/100 Hunyuan H4 Preview
    72.9/100 DeepSeek V4 Pro
    72.4/100 Grok 4.6
    72.0/100 Qwen 3.8-Max
    70.6/100 DeepSeek V4 Flash
    69.8/100 GLM-5.3 Flash
    68.9/100 Gemini 3.8 Flash
    66.6/100 Muse Spark 1.3
    65.7/100 Kimi K3

    Umbral de costo y calidad

    Puntuación media Costo por resultado (USD) GPT-6 Astra GPT-6 Astra Puntuación media 82.7 · $1.61 DeepSeek V4.1 Flash DeepSeek V4.1 Flash Puntuación media 81.2 · $0.023 Claude Fable 5.1 Claude Fable 5.1 Puntuación media 80.3 · $3.66 GPT-5.6 Sol GPT-5.6 Sol Puntuación media 77.6 · $0.544 Hunyuan H4 Preview Hunyuan H4 Preview Puntuación media 74.6 · $0.418 DeepSeek V4 Pro DeepSeek V4 Pro Puntuación media 72.9 · $0.061 Grok 4.6 Grok 4.6 Puntuación media 72.4 · $0.599 Qwen 3.8-Max Qwen 3.8-Max Puntuación media 72.0 · $0.595 DeepSeek V4 Flash DeepSeek V4 Flash Puntuación media 70.6 · $0.031 GLM-5.3 Flash GLM-5.3 Flash Puntuación media 69.8 · $0.064 Gemini 3.8 Flash Gemini 3.8 Flash Puntuación media 68.9 · $0.210 Muse Spark 1.3 Muse Spark 1.3 Puntuación media 66.6 · $0.267 Kimi K3 Kimi K3 Puntuación media 65.7 · $0.614

    11 modelos en la zona rosa cuestan más y puntúan menos que DeepSeek V4.1 Flash.

    Rendimiento por uso

    Clasificación: Aplicación web

    83.1/100 GPT-5.6 Sol
    82.6/100 Claude Fable 5.1
    82.4/100 DeepSeek V4.1 Flash
    77.1/100 GPT-6 Astra
    68.5/100 Grok 4.6
    68.4/100 Gemini 3.8 Flash
    62.0/100 Muse Spark 1.3
    60.6/100 GLM-5.3 Flash
    60.5/100 Hunyuan H4 Preview
    57.0/100 Qwen 3.8-Max
    56.4/100 DeepSeek V4 Flash
    51.8/100 DeepSeek V4 Pro
    35.9/100 Kimi K3

    Aplicación web · Umbral de costo y calidad

    Puntuación media Costo por resultado (USD) GPT-5.6 Sol GPT-5.6 Sol Puntuación media 83.1 · $0.537 Claude Fable 5.1 Claude Fable 5.1 Puntuación media 82.6 · $5.55 DeepSeek V4.1 Flash DeepSeek V4.1 Flash Puntuación media 82.4 · $0.030 GPT-6 Astra GPT-6 Astra Puntuación media 77.1 · $1.87 Grok 4.6 Grok 4.6 Puntuación media 68.5 · $0.818 Gemini 3.8 Flash Gemini 3.8 Flash Puntuación media 68.4 · $0.185 Muse Spark 1.3 Muse Spark 1.3 Puntuación media 62.0 · $0.293 GLM-5.3 Flash GLM-5.3 Flash Puntuación media 60.6 · $0.093 Hunyuan H4 Preview Hunyuan H4 Preview Puntuación media 60.5 · $0.609 Qwen 3.8-Max Qwen 3.8-Max Puntuación media 57.0 · $0.552 DeepSeek V4 Flash DeepSeek V4 Flash Puntuación media 56.4 · $0.041 DeepSeek V4 Pro DeepSeek V4 Pro Puntuación media 51.8 · $0.067 Kimi K3 Kimi K3 Puntuación media 35.9 · $0.486

    10 modelos en la zona rosa cuestan más y puntúan menos que DeepSeek V4.1 Flash.

    Eficiencia de los modelos

    Compara el tiempo de ejecución, la tasa de aciertos de caché y el consumo de tokens. Todas las cifras son promedios medidos.

    Tipo de proyecto
    Puntuación mediaTiempo de ejecución
    Puntuación alta · Eficiencia alta

    Método de evaluación

    Se puntúan el cumplimiento de requisitos y la calidad del diseño; la eficiencia y el costo se presentan por separado.

    Tareas y muestras

    Los modelos se evalúan con tareas de diseño comunes en cinco tipos de proyectos: aplicaciones web, aplicaciones móviles, aplicaciones de escritorio, paneles de datos y administración, y sitios web y páginas de destino. Estos resultados describen el rendimiento en tareas prácticas de generación de prototipos, no las capacidades generales del modelo.

    Comprobaciones de visualización

    Antes de puntuar, comprobamos que cada resultado se abra como una página web, incluidos los casos de páginas en blanco, contenido truncado y errores de ejecución graves. Los resultados que no se pueden mostrar reciben cero; no se sustituyen mediante nuevas pruebas. Abrirse correctamente es solo un requisito previo para continuar la evaluación, no una prueba de que se cumplan los requisitos o de que el resultado sea entregable.

    Cumplimiento de requisitos y calidad del diseño

    Cada resultado se puntúa sobre 100. El cumplimiento de requisitos aporta 30 puntos: se comprueban las páginas y módulos, el contenido requerido, los estados de la interfaz y las interacciones frente a las instrucciones de la tarea, y se califican como completos, parcialmente completos o incompletos. La calidad del diseño aporta 70 puntos repartidos por igual entre cinco dimensiones: composición y legibilidad, jerarquía de la información, adecuación del estilo a la tarea, color y contraste, y adecuación de las imágenes y su relación con el contenido. Cada dimensión se califica como cumplida, parcialmente cumplida o no cumplida.

    Puntuación media y tasa de entregables

    La puntuación media es la media aritmética de todos los resultados puntuados para un modelo. Un resultado con 80 puntos o más se considera entregable en esta evaluación. La tasa de entregables es la proporción de resultados puntuados que alcanza ese umbral e indica la regularidad con la que un modelo produce resultados que cumplen el criterio. Aquí, entregable se refiere al estándar de calidad de prototipos de esta evaluación, no a que esté listo para usarse en producción.

    Eficiencia y costo

    Presentamos los promedios medidos del tiempo de ejecución, la tasa de aciertos de caché, el uso de tokens de entrada y salida y las llamadas a herramientas por separado de las puntuaciones de calidad. El costo de cada resultado se estima a partir del uso de tokens registrado y de las tarifas estándar de entrada, salida y lectura de caché; después se calcula el promedio. Estas estimaciones comparan el consumo de recursos: no son facturas y excluyen cargos no registrados. La eficiencia y el costo no contribuyen a la puntuación de evaluación. Cambiar las prioridades de selección modifica la clasificación de recomendaciones, no los resultados originales de evaluación.

    OpenDesign Desktop

    Un sistema de diseño. Tu marca, coherente en cada resultado

    En el Vibe Design Workspace completo, aplica las mismas reglas de marca a sitios web, presentaciones, prototipos interactivos, dashboards, imágenes y vídeo HTML. Conecta Codex, Claude Code, Cursor y otros agentes de código locales y crea gratis.

    • Web, presentaciones, prototipos, dashboards, imágenes y vídeo
    • Más de 140 sistemas de diseño y la biblioteca completa de plantillas y skills
    • Codex local y más de 21 agentes de código · Gratis
    Descargar gratis

    Disponible para macOS y Windows