OpenDesignArena

Trouvez le bon modèle d’IA pour le design.

Comparez qualité, rapidité et coût à partir d’évaluations réelles.

Meilleur rapport qualité-prix

DeepSeek V4.1 Flash

Un design de qualité au coût le plus bas.

Dans cette évaluation, DeepSeek V4.1 Flash atteint 98% de la note moyenne du modèle en tête, GPT-6 Astra, pour environ 1% de son coût moyen.

Coût par réalisation
$0.023contre $1.61
Note moyenne / 100
81.2contre 82.7

Meilleure note

Livraison la plus rapide

Comparer les modèles

Choisissez deux ou trois modèles et comparez les cinq axes sur un seul graphique. Des profils différents révèlent des atouts différents.

Profil en cinq dimensions

Plus le tracé est éloigné du centre, mieux c’est : de meilleurs résultats, une réalisation plus rapide et un coût réduit.

ExigencesQualité du designTaux de livrabilitéRapidité de réalisationEfficacité économique

    Moyenne de chaque axe sur les 13 modèles

    Choisir selon vos priorités

    Ajustez l’équilibre entre qualité évaluée, coût et rapidité pour trouver le modèle adapté à vos besoins.

    Qu’est-ce qui compte le plus pour vous ?
    Qualité
    50%
    Coût
    30%
    Rapidité
    20%
    1. 1 DeepSeek V4.1 Flash 78.8 Note moyenne : 81.2/100 ; Coût moyen : $0.023 ; Temps moyen : 5.3 min
    2. 2 DeepSeek V4 Flash 68.6 Note moyenne : 70.6/100 ; Coût moyen : $0.031 ; Temps moyen : 11.1 min
    3. 3 GPT-5.6 Sol 65.7 Note moyenne : 77.6/100 ; Coût moyen : $0.544 ; Temps moyen : 3.2 min
    4. 4 Gemini 3.8 Flash 64.7 Note moyenne : 68.9/100 ; Coût moyen : $0.210 ; Temps moyen : 3.8 min
    5. 5 DeepSeek V4 Pro 64.6 Note moyenne : 72.9/100 ; Coût moyen : $0.061 ; Temps moyen : 17.7 min
    6. 6 Muse Spark 1.3 63.2 Note moyenne : 66.6/100 ; Coût moyen : $0.267 ; Temps moyen : 3.3 min
    7. 7 GLM-5.3 Flash 61.4 Note moyenne : 69.8/100 ; Coût moyen : $0.064 ; Temps moyen : 23.5 min
    8. 8 GPT-6 Astra 57.5 Note moyenne : 82.7/100 ; Coût moyen : $1.61 ; Temps moyen : 11.1 min
    9. 9 Grok 4.6 56.5 Note moyenne : 72.4/100 ; Coût moyen : $0.599 ; Temps moyen : 11.4 min
    10. 10 Hunyuan H4 Preview 54.6 Note moyenne : 74.6/100 ; Coût moyen : $0.418 ; Temps moyen : 29.2 min
    11. 11 Qwen 3.8-Max 52.3 Note moyenne : 72.0/100 ; Coût moyen : $0.595 ; Temps moyen : 26.4 min
    12. 12 Claude Fable 5.1 52.1 Note moyenne : 80.3/100 ; Coût moyen : $3.66 ; Temps moyen : 12.8 min
    13. 13 Kimi K3 52.1 Note moyenne : 65.7/100 ; Coût moyen : $0.614 ; Temps moyen : 14.0 min

    Choisir selon l’usage

    Choisissez un type de projet : chacun des cinq critères ci-dessous recommande un modèle.

    Performance globale

    GPT-6 Astra

    Exigences · 26.5/30Qualité du design · 56.2/70Taux de livrabilité · 60.0%Temps d’exécution · 11.1 minCoût par exécution · $1.61 Exigences 26.5/30 Qualité du design 56.2/70 Taux de livrabilité 60.0% Temps d’exécution 11.1 min Coût par exécution $1.61
    Note moyenne
    82.7/100
    Exigences : moyenne
    26.5/30
    Design : moyenne
    56.2/70
    Taux moyen de livrabilité
    60.0%
    Temps moyen
    11.1 min
    Coût moyen / réalisation
    $1.61/exécution
    Qualité du design

    Claude Fable 5.1

    Design : moyenne
    53.2/70
    Note moyenne
    80.3/100
    Taux moyen de livrabilité
    56.7%
    Exigences : moyenne
    27.1/30
    Temps moyen
    12.8 min
    Coût moyen / réalisation
    $3.66/exécution
    Respect des exigences

    DeepSeek V4.1 Flash

    Exigences : moyenne
    28.4/30
    Note moyenne
    81.2/100
    Taux moyen de livrabilité
    57.7%
    Design : moyenne
    52.8/70
    Temps moyen
    5.3 min
    Coût moyen / réalisation
    $0.023/exécution
    Rapidité d’exécution

    GPT-5.6 Sol

    Temps moyen
    3.2 min
    Note moyenne
    77.6/100
    Taux moyen de livrabilité
    53.3%
    Exigences : moyenne
    25.8/30
    Design : moyenne
    51.8/70
    Coût moyen / réalisation
    $0.544/exécution
    Efficacité économique

    Hunyuan H4 Preview

    Coût moyen / réalisation
    $0.418/exécution
    Note moyenne
    74.6/100
    Taux moyen de livrabilité
    40.0%
    Exigences : moyenne
    26.8/30
    Design : moyenne
    47.8/70
    Temps moyen
    29.2 min

    Qualité et coût

    Comparez les performances des modèles et le coût nécessaire pour les obtenir.

    Classement : Qualité

    82.7/100 GPT-6 Astra
    81.2/100 DeepSeek V4.1 Flash
    80.3/100 Claude Fable 5.1
    77.6/100 GPT-5.6 Sol
    74.6/100 Hunyuan H4 Preview
    72.9/100 DeepSeek V4 Pro
    72.4/100 Grok 4.6
    72.0/100 Qwen 3.8-Max
    70.6/100 DeepSeek V4 Flash
    69.8/100 GLM-5.3 Flash
    68.9/100 Gemini 3.8 Flash
    66.6/100 Muse Spark 1.3
    65.7/100 Kimi K3

    Seuil coût–qualité

    Note moyenne Coût par réalisation (USD) GPT-6 Astra GPT-6 Astra Note moyenne 82.7 · $1.61 DeepSeek V4.1 Flash DeepSeek V4.1 Flash Note moyenne 81.2 · $0.023 Claude Fable 5.1 Claude Fable 5.1 Note moyenne 80.3 · $3.66 GPT-5.6 Sol GPT-5.6 Sol Note moyenne 77.6 · $0.544 Hunyuan H4 Preview Hunyuan H4 Preview Note moyenne 74.6 · $0.418 DeepSeek V4 Pro DeepSeek V4 Pro Note moyenne 72.9 · $0.061 Grok 4.6 Grok 4.6 Note moyenne 72.4 · $0.599 Qwen 3.8-Max Qwen 3.8-Max Note moyenne 72.0 · $0.595 DeepSeek V4 Flash DeepSeek V4 Flash Note moyenne 70.6 · $0.031 GLM-5.3 Flash GLM-5.3 Flash Note moyenne 69.8 · $0.064 Gemini 3.8 Flash Gemini 3.8 Flash Note moyenne 68.9 · $0.210 Muse Spark 1.3 Muse Spark 1.3 Note moyenne 66.6 · $0.267 Kimi K3 Kimi K3 Note moyenne 65.7 · $0.614

    11 modèles dans la zone rose coûtent plus cher et obtiennent une note inférieure à celle de DeepSeek V4.1 Flash.

    Résultats par usage

    Classement : Application web

    83.1/100 GPT-5.6 Sol
    82.6/100 Claude Fable 5.1
    82.4/100 DeepSeek V4.1 Flash
    77.1/100 GPT-6 Astra
    68.5/100 Grok 4.6
    68.4/100 Gemini 3.8 Flash
    62.0/100 Muse Spark 1.3
    60.6/100 GLM-5.3 Flash
    60.5/100 Hunyuan H4 Preview
    57.0/100 Qwen 3.8-Max
    56.4/100 DeepSeek V4 Flash
    51.8/100 DeepSeek V4 Pro
    35.9/100 Kimi K3

    Application web · Seuil coût–qualité

    Note moyenne Coût par réalisation (USD) GPT-5.6 Sol GPT-5.6 Sol Note moyenne 83.1 · $0.537 Claude Fable 5.1 Claude Fable 5.1 Note moyenne 82.6 · $5.55 DeepSeek V4.1 Flash DeepSeek V4.1 Flash Note moyenne 82.4 · $0.030 GPT-6 Astra GPT-6 Astra Note moyenne 77.1 · $1.87 Grok 4.6 Grok 4.6 Note moyenne 68.5 · $0.818 Gemini 3.8 Flash Gemini 3.8 Flash Note moyenne 68.4 · $0.185 Muse Spark 1.3 Muse Spark 1.3 Note moyenne 62.0 · $0.293 GLM-5.3 Flash GLM-5.3 Flash Note moyenne 60.6 · $0.093 Hunyuan H4 Preview Hunyuan H4 Preview Note moyenne 60.5 · $0.609 Qwen 3.8-Max Qwen 3.8-Max Note moyenne 57.0 · $0.552 DeepSeek V4 Flash DeepSeek V4 Flash Note moyenne 56.4 · $0.041 DeepSeek V4 Pro DeepSeek V4 Pro Note moyenne 51.8 · $0.067 Kimi K3 Kimi K3 Note moyenne 35.9 · $0.486

    10 modèles dans la zone rose coûtent plus cher et obtiennent une note inférieure à celle de DeepSeek V4.1 Flash.

    Efficacité des modèles

    Comparez le temps d’exécution, le taux de succès du cache et la consommation de tokens. Tous les chiffres sont des moyennes mesurées.

    Type de projet
    Note moyenneTemps d’exécution
    Note élevée · Haute efficacité

    Méthode d’évaluation

    Le respect des exigences et la qualité du design sont notés ; l’efficacité et le coût sont présentés séparément.

    Tâches et échantillons

    Les modèles sont évalués sur des tâches de design communes couvrant cinq types de projets : applications web, applications mobiles, applications de bureau, tableaux de bord et interfaces d’administration, sites web et pages de destination. Ces résultats décrivent leurs performances sur des tâches concrètes de génération de prototypes, et non leurs capacités générales.

    Vérification de l’affichage

    Avant la notation, nous vérifions que chaque réalisation s’ouvre comme une page web, en recherchant notamment les pages blanches, les contenus tronqués et les erreurs d’exécution fatales. Les réalisations qui ne s’affichent pas reçoivent zéro ; leurs résultats ne sont pas remplacés par de nouveaux essais. Une ouverture réussie est uniquement un préalable à l’évaluation, pas la preuve que les exigences sont respectées ou que le résultat est livrable.

    Respect des exigences et qualité du design

    Chaque réalisation est notée sur 100. Le respect des exigences compte pour 30 points : pages et modules, contenu requis, états de l’interface et interactions sont vérifiés par rapport au cahier des charges, puis jugés complets, partiellement complets ou incomplets. La qualité du design compte pour 70 points, répartis à parts égales entre cinq critères : mise en page et lisibilité, hiérarchie de l’information, adéquation du style à la tâche, couleurs et contraste, adéquation des images et pertinence par rapport au contenu. Chaque critère est jugé satisfait, partiellement satisfait ou non satisfait.

    Note moyenne et taux de livrabilité

    La note moyenne est la moyenne arithmétique de toutes les réalisations notées pour un modèle. Une réalisation obtenant au moins 80 points est considérée comme livrable dans cette évaluation. Le taux de livrabilité est la proportion de réalisations notées atteignant ce seuil ; il indique la régularité avec laquelle le modèle produit un résultat conforme à ce niveau. La livrabilité désigne ici le niveau de qualité attendu d’un prototype, et non une aptitude à la mise en production.

    Efficacité et coût

    Nous présentons séparément des notes de qualité les moyennes mesurées du temps d’exécution, du taux de succès du cache, des tokens d’entrée et de sortie et des appels d’outils. Le coût de chaque réalisation est estimé à partir de la consommation de tokens enregistrée et des tarifs standard d’entrée, de sortie et de lecture du cache, puis moyenné. Ces estimations servent à comparer la consommation de ressources ; elles ne sont pas des factures et excluent les frais non enregistrés. L’efficacité et le coût n’entrent pas dans la note d’évaluation. Modifier les priorités de sélection change le classement des recommandations, pas les résultats d’évaluation d’origine.

    OpenDesign Desktop

    Un seul design system. Votre marque, cohérente partout

    Dans le Vibe Design Workspace complet, appliquez les mêmes règles de marque aux sites, slides, prototypes interactifs, dashboards, images et vidéos HTML. Connectez Codex, Claude Code, Cursor et vos autres agents de code locaux, puis créez gratuitement.

    • Sites, slides, prototypes, dashboards, images et vidéos
    • Plus de 140 design systems et la bibliothèque complète de modèles et skills
    • Codex local et plus de 21 agents de code · Gratuit
    Télécharger gratuitement

    Disponible sur macOS et Windows