OpenDesignArena
Encuentra el modelo de IA adecuado para diseñar.
Compara calidad, velocidad y costo con evaluaciones reales.
Mejor relación calidad-precio
Un diseño de gran calidad al menor costo.
En esta evaluación, DeepSeek V4.1 Flash alcanzó el 98% de la puntuación media del líder, GPT-6 Astra, con aproximadamente el 1% de su costo medio.
- Costo por resultado
- $0.023frente a $1.61
- Puntuación media / 100
- 81.2frente a 82.7
Mayor puntuación
Entrega más rápida
Comparar modelos
Elige dos o tres modelos y compara las cinco dimensiones en un solo gráfico. Las distintas formas muestran sus diferentes fortalezas.
Perfil en cinco dimensiones
Cuanto más lejos del centro en cada eje, mejor: mayor calidad, menos tiempo y menor costo.
Promedio de cada eje entre los 13 modelos
Elige según tus prioridades
Equilibra la calidad evaluada, el costo y la velocidad para encontrar el modelo que se ajuste a tus necesidades.
- Calidad
- 50%
- Costo
- 30%
- Velocidad
- 20%
- 1 DeepSeek V4.1 Flash 78.8 Puntuación media: 81.2/100; Costo medio: $0.023; Tiempo medio: 5.3 min
- 2 DeepSeek V4 Flash 68.6 Puntuación media: 70.6/100; Costo medio: $0.031; Tiempo medio: 11.1 min
- 3 GPT-5.6 Sol 65.7 Puntuación media: 77.6/100; Costo medio: $0.544; Tiempo medio: 3.2 min
- 4 Gemini 3.8 Flash 64.7 Puntuación media: 68.9/100; Costo medio: $0.210; Tiempo medio: 3.8 min
- 5 DeepSeek V4 Pro 64.6 Puntuación media: 72.9/100; Costo medio: $0.061; Tiempo medio: 17.7 min
- 6 Muse Spark 1.3 63.2 Puntuación media: 66.6/100; Costo medio: $0.267; Tiempo medio: 3.3 min
- 7 GLM-5.3 Flash 61.4 Puntuación media: 69.8/100; Costo medio: $0.064; Tiempo medio: 23.5 min
- 8 GPT-6 Astra 57.5 Puntuación media: 82.7/100; Costo medio: $1.61; Tiempo medio: 11.1 min
- 9 Grok 4.6 56.5 Puntuación media: 72.4/100; Costo medio: $0.599; Tiempo medio: 11.4 min
- 10 Hunyuan H4 Preview 54.6 Puntuación media: 74.6/100; Costo medio: $0.418; Tiempo medio: 29.2 min
- 11 Qwen 3.8-Max 52.3 Puntuación media: 72.0/100; Costo medio: $0.595; Tiempo medio: 26.4 min
- 12 Claude Fable 5.1 52.1 Puntuación media: 80.3/100; Costo medio: $3.66; Tiempo medio: 12.8 min
- 13 Kimi K3 52.1 Puntuación media: 65.7/100; Costo medio: $0.614; Tiempo medio: 14.0 min
Elige según el uso
Selecciona un tipo de proyecto; cada uno de los cinco criterios siguientes recomienda un modelo.
GPT-6 Astra
- Puntuación media Puntuación mediaCuanto mayor, mejor La puntuación media de todos los resultados evaluados, sobre 100.
- 82.7/100
- Requisitos: promedio Cumplimiento de requisitosCuanto mayor, mejor Comprueba la presencia de las páginas, contenidos, estados e interacciones requeridos, sobre 30 puntos.
- 26.5/30
- Diseño: promedio Calidad del diseñoCuanto mayor, mejor Evalúa la composición, la jerarquía, el estilo, el color y la adecuación de las imágenes, sobre 70 puntos.
- 56.2/70
- Tasa media de entregables Tasa de entregablesCuanto mayor, mejor La proporción de resultados evaluados que obtiene 80 puntos o más.
- 60.0%
- Tiempo medio Tiempo medio de ejecuciónCuanto menor, mejor El tiempo total de ejecución de los resultados puntuados dividido entre su número.
- 11.1 min
- Costo medio / resultado Costo por resultadoCuanto menor, mejor Estimado a partir de los precios oficiales y del uso medido de tokens.
- $1.61/ejecución
Claude Fable 5.1
- Diseño: promedio
- 53.2/70
- Puntuación media
- 80.3/100
- Tasa media de entregables
- 56.7%
- Requisitos: promedio
- 27.1/30
- Tiempo medio
- 12.8 min
- Costo medio / resultado
- $3.66/ejecución
DeepSeek V4.1 Flash
- Requisitos: promedio
- 28.4/30
- Puntuación media
- 81.2/100
- Tasa media de entregables
- 57.7%
- Diseño: promedio
- 52.8/70
- Tiempo medio
- 5.3 min
- Costo medio / resultado
- $0.023/ejecución
GPT-5.6 Sol
- Tiempo medio
- 3.2 min
- Puntuación media
- 77.6/100
- Tasa media de entregables
- 53.3%
- Requisitos: promedio
- 25.8/30
- Diseño: promedio
- 51.8/70
- Costo medio / resultado
- $0.544/ejecución
Hunyuan H4 Preview
- Costo medio / resultado
- $0.418/ejecución
- Puntuación media
- 74.6/100
- Tasa media de entregables
- 40.0%
- Requisitos: promedio
- 26.8/30
- Diseño: promedio
- 47.8/70
- Tiempo medio
- 29.2 min
Calidad y costo
Compara el rendimiento de los modelos y el costo de conseguirlo.
Clasificación: Calidad
Umbral de costo y calidad
11 modelos en la zona rosa cuestan más y puntúan menos que DeepSeek V4.1 Flash.
Rendimiento por uso
Mostrando Aplicación web (Estructura de varias páginas y flujos); GPT-5.6 Sol lidera con 83.1, una tasa de entregables del 66.7% y un costo de $0.537 por ejecución.
Mostrando Aplicación móvil (Experiencia táctil y diseño adaptable); Hunyuan H4 Preview lidera con 89.5, una tasa de entregables del 83.3% y un costo de $0.404 por ejecución.
Mostrando Aplicación de escritorio (Flujos de trabajo e interacciones complejas); DeepSeek V4 Flash lidera con 90.3, una tasa de entregables del 83.3% y un costo de $0.027 por ejecución.
Mostrando Panel de datos (Densidad y jerarquía de la información); GPT-6 Astra lidera con 86.3, una tasa de entregables del 66.7% y un costo de $1.65 por ejecución.
Mostrando Página de destino (Expresión de marca y conversión); Qwen 3.8-Max lidera con 82.8, una tasa de entregables del 66.7% y un costo de $0.609 por ejecución.
Clasificación: Aplicación web
Aplicación web · Umbral de costo y calidad
10 modelos en la zona rosa cuestan más y puntúan menos que DeepSeek V4.1 Flash.
Clasificación: Aplicación móvil
Aplicación móvil · Umbral de costo y calidad
8 modelos en la zona rosa cuestan más y puntúan menos que DeepSeek V4.1 Flash.
Clasificación: Aplicación de escritorio
Aplicación de escritorio · Umbral de costo y calidad
9 modelos en la zona rosa cuestan más y puntúan menos que DeepSeek V4.1 Flash.
Clasificación: Panel de datos
Panel de datos · Umbral de costo y calidad
3 modelos en la zona rosa cuestan más y puntúan menos que DeepSeek V4.1 Flash.
Clasificación: Página de destino
Página de destino · Umbral de costo y calidad
9 modelos en la zona rosa cuestan más y puntúan menos que DeepSeek V4.1 Flash.
Eficiencia de los modelos
Compara el tiempo de ejecución, la tasa de aciertos de caché y el consumo de tokens. Todas las cifras son promedios medidos.
Caché 81% · Entrada 318.7K · Salida 15.5K
Caché 89% · Entrada 1462.8K · Salida 29.2K
Caché 94% · Entrada 715.7K · Salida 63.6K
Caché 80.7% · Entrada 236.6K · Salida 14.5K
Caché 90.9% · Entrada 3085.9K · Salida 46.0K
Caché 91.3% · Entrada 1422.1K · Salida 24.7K
Caché 58.7% · Entrada 517.6K · Salida 10.1K
Caché 79% · Entrada 836.8K · Salida 28.6K
Caché 91.9% · Entrada 2809.3K · Salida 32.7K
Caché 71.3% · Entrada 943.7K · Salida 28.4K
Caché 70.9% · Entrada 392.3K · Salida 27.9K
Caché 31.5% · Entrada 235.9K · Salida 13.4K
Caché 71.7% · Entrada 427.1K · Salida 16.1K
Método de evaluación
Se puntúan el cumplimiento de requisitos y la calidad del diseño; la eficiencia y el costo se presentan por separado.
Tareas y muestras
Los modelos se evalúan con tareas de diseño comunes en cinco tipos de proyectos: aplicaciones web, aplicaciones móviles, aplicaciones de escritorio, paneles de datos y administración, y sitios web y páginas de destino. Estos resultados describen el rendimiento en tareas prácticas de generación de prototipos, no las capacidades generales del modelo.
Comprobaciones de visualización
Antes de puntuar, comprobamos que cada resultado se abra como una página web, incluidos los casos de páginas en blanco, contenido truncado y errores de ejecución graves. Los resultados que no se pueden mostrar reciben cero; no se sustituyen mediante nuevas pruebas. Abrirse correctamente es solo un requisito previo para continuar la evaluación, no una prueba de que se cumplan los requisitos o de que el resultado sea entregable.
Cumplimiento de requisitos y calidad del diseño
Cada resultado se puntúa sobre 100. El cumplimiento de requisitos aporta 30 puntos: se comprueban las páginas y módulos, el contenido requerido, los estados de la interfaz y las interacciones frente a las instrucciones de la tarea, y se califican como completos, parcialmente completos o incompletos. La calidad del diseño aporta 70 puntos repartidos por igual entre cinco dimensiones: composición y legibilidad, jerarquía de la información, adecuación del estilo a la tarea, color y contraste, y adecuación de las imágenes y su relación con el contenido. Cada dimensión se califica como cumplida, parcialmente cumplida o no cumplida.
Puntuación media y tasa de entregables
La puntuación media es la media aritmética de todos los resultados puntuados para un modelo. Un resultado con 80 puntos o más se considera entregable en esta evaluación. La tasa de entregables es la proporción de resultados puntuados que alcanza ese umbral e indica la regularidad con la que un modelo produce resultados que cumplen el criterio. Aquí, entregable se refiere al estándar de calidad de prototipos de esta evaluación, no a que esté listo para usarse en producción.
Eficiencia y costo
Presentamos los promedios medidos del tiempo de ejecución, la tasa de aciertos de caché, el uso de tokens de entrada y salida y las llamadas a herramientas por separado de las puntuaciones de calidad. El costo de cada resultado se estima a partir del uso de tokens registrado y de las tarifas estándar de entrada, salida y lectura de caché; después se calcula el promedio. Estas estimaciones comparan el consumo de recursos: no son facturas y excluyen cargos no registrados. La eficiencia y el costo no contribuyen a la puntuación de evaluación. Cambiar las prioridades de selección modifica la clasificación de recomendaciones, no los resultados originales de evaluación.
