OpenDesignArena
Trouvez le bon modèle d’IA pour le design.
Comparez qualité, rapidité et coût à partir d’évaluations réelles.
Meilleur rapport qualité-prix
Un design de qualité au coût le plus bas.
Dans cette évaluation, DeepSeek V4.1 Flash atteint 98% de la note moyenne du modèle en tête, GPT-6 Astra, pour environ 1% de son coût moyen.
- Coût par réalisation
- $0.023contre $1.61
- Note moyenne / 100
- 81.2contre 82.7
Meilleure note
Livraison la plus rapide
Comparer les modèles
Choisissez deux ou trois modèles et comparez les cinq axes sur un seul graphique. Des profils différents révèlent des atouts différents.
Profil en cinq dimensions
Plus le tracé est éloigné du centre, mieux c’est : de meilleurs résultats, une réalisation plus rapide et un coût réduit.
Moyenne de chaque axe sur les 13 modèles
Choisir selon vos priorités
Ajustez l’équilibre entre qualité évaluée, coût et rapidité pour trouver le modèle adapté à vos besoins.
- Qualité
- 50%
- Coût
- 30%
- Rapidité
- 20%
- 1 DeepSeek V4.1 Flash 78.8 Note moyenne : 81.2/100 ; Coût moyen : $0.023 ; Temps moyen : 5.3 min
- 2 DeepSeek V4 Flash 68.6 Note moyenne : 70.6/100 ; Coût moyen : $0.031 ; Temps moyen : 11.1 min
- 3 GPT-5.6 Sol 65.7 Note moyenne : 77.6/100 ; Coût moyen : $0.544 ; Temps moyen : 3.2 min
- 4 Gemini 3.8 Flash 64.7 Note moyenne : 68.9/100 ; Coût moyen : $0.210 ; Temps moyen : 3.8 min
- 5 DeepSeek V4 Pro 64.6 Note moyenne : 72.9/100 ; Coût moyen : $0.061 ; Temps moyen : 17.7 min
- 6 Muse Spark 1.3 63.2 Note moyenne : 66.6/100 ; Coût moyen : $0.267 ; Temps moyen : 3.3 min
- 7 GLM-5.3 Flash 61.4 Note moyenne : 69.8/100 ; Coût moyen : $0.064 ; Temps moyen : 23.5 min
- 8 GPT-6 Astra 57.5 Note moyenne : 82.7/100 ; Coût moyen : $1.61 ; Temps moyen : 11.1 min
- 9 Grok 4.6 56.5 Note moyenne : 72.4/100 ; Coût moyen : $0.599 ; Temps moyen : 11.4 min
- 10 Hunyuan H4 Preview 54.6 Note moyenne : 74.6/100 ; Coût moyen : $0.418 ; Temps moyen : 29.2 min
- 11 Qwen 3.8-Max 52.3 Note moyenne : 72.0/100 ; Coût moyen : $0.595 ; Temps moyen : 26.4 min
- 12 Claude Fable 5.1 52.1 Note moyenne : 80.3/100 ; Coût moyen : $3.66 ; Temps moyen : 12.8 min
- 13 Kimi K3 52.1 Note moyenne : 65.7/100 ; Coût moyen : $0.614 ; Temps moyen : 14.0 min
Choisir selon l’usage
Choisissez un type de projet : chacun des cinq critères ci-dessous recommande un modèle.
GPT-6 Astra
- Note moyenne Note moyennePlus élevé = mieux Moyenne des notes de toutes les réalisations évaluées, sur 100.
- 82.7/100
- Exigences : moyenne Respect des exigencesPlus élevé = mieux Vérifie la présence des pages, contenus, états et interactions requis, sur 30 points.
- 26.5/30
- Design : moyenne Qualité du designPlus élevé = mieux Évalue la mise en page, la hiérarchie, le style, les couleurs et l’adéquation des images, sur 70 points.
- 56.2/70
- Taux moyen de livrabilité Taux de livrabilitéPlus élevé = mieux Part des réalisations évaluées ayant obtenu 80 points ou plus.
- 60.0%
- Temps moyen Temps moyen d’exécutionPlus bas = mieux Temps total d’exécution des réalisations notées, divisé par leur nombre.
- 11.1 min
- Coût moyen / réalisation Coût par réalisationPlus bas = mieux Estimé à partir des tarifs officiels et de la consommation mesurée de tokens.
- $1.61/exécution
Claude Fable 5.1
- Design : moyenne
- 53.2/70
- Note moyenne
- 80.3/100
- Taux moyen de livrabilité
- 56.7%
- Exigences : moyenne
- 27.1/30
- Temps moyen
- 12.8 min
- Coût moyen / réalisation
- $3.66/exécution
DeepSeek V4.1 Flash
- Exigences : moyenne
- 28.4/30
- Note moyenne
- 81.2/100
- Taux moyen de livrabilité
- 57.7%
- Design : moyenne
- 52.8/70
- Temps moyen
- 5.3 min
- Coût moyen / réalisation
- $0.023/exécution
GPT-5.6 Sol
- Temps moyen
- 3.2 min
- Note moyenne
- 77.6/100
- Taux moyen de livrabilité
- 53.3%
- Exigences : moyenne
- 25.8/30
- Design : moyenne
- 51.8/70
- Coût moyen / réalisation
- $0.544/exécution
Hunyuan H4 Preview
- Coût moyen / réalisation
- $0.418/exécution
- Note moyenne
- 74.6/100
- Taux moyen de livrabilité
- 40.0%
- Exigences : moyenne
- 26.8/30
- Design : moyenne
- 47.8/70
- Temps moyen
- 29.2 min
Qualité et coût
Comparez les performances des modèles et le coût nécessaire pour les obtenir.
Classement : Qualité
Seuil coût–qualité
11 modèles dans la zone rose coûtent plus cher et obtiennent une note inférieure à celle de DeepSeek V4.1 Flash.
Résultats par usage
Résultats pour Application web (Structure multipage et parcours) : GPT-5.6 Sol est en tête avec 83.1, un taux de livrabilité de 66.7% et un coût de $0.537 par exécution.
Résultats pour Application mobile (Expérience tactile et mise en page adaptative) : Hunyuan H4 Preview est en tête avec 89.5, un taux de livrabilité de 83.3% et un coût de $0.404 par exécution.
Résultats pour Application de bureau (Parcours de travail et interactions complexes) : DeepSeek V4 Flash est en tête avec 90.3, un taux de livrabilité de 83.3% et un coût de $0.027 par exécution.
Résultats pour Tableau de bord (Densité et hiérarchie de l’information) : GPT-6 Astra est en tête avec 86.3, un taux de livrabilité de 66.7% et un coût de $1.65 par exécution.
Résultats pour Page de destination (Expression de marque et conversion) : Qwen 3.8-Max est en tête avec 82.8, un taux de livrabilité de 66.7% et un coût de $0.609 par exécution.
Classement : Application web
Application web · Seuil coût–qualité
10 modèles dans la zone rose coûtent plus cher et obtiennent une note inférieure à celle de DeepSeek V4.1 Flash.
Classement : Application mobile
Application mobile · Seuil coût–qualité
8 modèles dans la zone rose coûtent plus cher et obtiennent une note inférieure à celle de DeepSeek V4.1 Flash.
Classement : Application de bureau
Application de bureau · Seuil coût–qualité
9 modèles dans la zone rose coûtent plus cher et obtiennent une note inférieure à celle de DeepSeek V4.1 Flash.
Classement : Tableau de bord
Tableau de bord · Seuil coût–qualité
3 modèles dans la zone rose coûtent plus cher et obtiennent une note inférieure à celle de DeepSeek V4.1 Flash.
Classement : Page de destination
Page de destination · Seuil coût–qualité
9 modèles dans la zone rose coûtent plus cher et obtiennent une note inférieure à celle de DeepSeek V4.1 Flash.
Efficacité des modèles
Comparez le temps d’exécution, le taux de succès du cache et la consommation de tokens. Tous les chiffres sont des moyennes mesurées.
Cache 81% · Entrée 318.7K · Sortie 15.5K
Cache 89% · Entrée 1462.8K · Sortie 29.2K
Cache 94% · Entrée 715.7K · Sortie 63.6K
Cache 80.7% · Entrée 236.6K · Sortie 14.5K
Cache 90.9% · Entrée 3085.9K · Sortie 46.0K
Cache 91.3% · Entrée 1422.1K · Sortie 24.7K
Cache 58.7% · Entrée 517.6K · Sortie 10.1K
Cache 79% · Entrée 836.8K · Sortie 28.6K
Cache 91.9% · Entrée 2809.3K · Sortie 32.7K
Cache 71.3% · Entrée 943.7K · Sortie 28.4K
Cache 70.9% · Entrée 392.3K · Sortie 27.9K
Cache 31.5% · Entrée 235.9K · Sortie 13.4K
Cache 71.7% · Entrée 427.1K · Sortie 16.1K
Méthode d’évaluation
Le respect des exigences et la qualité du design sont notés ; l’efficacité et le coût sont présentés séparément.
Tâches et échantillons
Les modèles sont évalués sur des tâches de design communes couvrant cinq types de projets : applications web, applications mobiles, applications de bureau, tableaux de bord et interfaces d’administration, sites web et pages de destination. Ces résultats décrivent leurs performances sur des tâches concrètes de génération de prototypes, et non leurs capacités générales.
Vérification de l’affichage
Avant la notation, nous vérifions que chaque réalisation s’ouvre comme une page web, en recherchant notamment les pages blanches, les contenus tronqués et les erreurs d’exécution fatales. Les réalisations qui ne s’affichent pas reçoivent zéro ; leurs résultats ne sont pas remplacés par de nouveaux essais. Une ouverture réussie est uniquement un préalable à l’évaluation, pas la preuve que les exigences sont respectées ou que le résultat est livrable.
Respect des exigences et qualité du design
Chaque réalisation est notée sur 100. Le respect des exigences compte pour 30 points : pages et modules, contenu requis, états de l’interface et interactions sont vérifiés par rapport au cahier des charges, puis jugés complets, partiellement complets ou incomplets. La qualité du design compte pour 70 points, répartis à parts égales entre cinq critères : mise en page et lisibilité, hiérarchie de l’information, adéquation du style à la tâche, couleurs et contraste, adéquation des images et pertinence par rapport au contenu. Chaque critère est jugé satisfait, partiellement satisfait ou non satisfait.
Note moyenne et taux de livrabilité
La note moyenne est la moyenne arithmétique de toutes les réalisations notées pour un modèle. Une réalisation obtenant au moins 80 points est considérée comme livrable dans cette évaluation. Le taux de livrabilité est la proportion de réalisations notées atteignant ce seuil ; il indique la régularité avec laquelle le modèle produit un résultat conforme à ce niveau. La livrabilité désigne ici le niveau de qualité attendu d’un prototype, et non une aptitude à la mise en production.
Efficacité et coût
Nous présentons séparément des notes de qualité les moyennes mesurées du temps d’exécution, du taux de succès du cache, des tokens d’entrée et de sortie et des appels d’outils. Le coût de chaque réalisation est estimé à partir de la consommation de tokens enregistrée et des tarifs standard d’entrée, de sortie et de lecture du cache, puis moyenné. Ces estimations servent à comparer la consommation de ressources ; elles ne sont pas des factures et excluent les frais non enregistrés. L’efficacité et le coût n’entrent pas dans la note d’évaluation. Modifier les priorités de sélection change le classement des recommandations, pas les résultats d’évaluation d’origine.
