OpenDesignArena
Finden Sie das richtige KI-Modell für Design.
Vergleichen Sie Qualität, Geschwindigkeit und Kosten anhand realer Bewertungen.
Bestes Preis-Leistungs-Verhältnis
Starke Designleistung zu den niedrigsten Kosten.
In dieser Bewertung erreichte DeepSeek V4.1 Flash 98% der Durchschnittspunktzahl des Spitzenreiters GPT-6 Astra – bei etwa 1% seiner durchschnittlichen Kosten.
- Kosten pro Ergebnis
- $0.023vs. $1.61
- Durchschnittspunktzahl / 100
- 81.2vs. 82.7
Höchste Punktzahl
Schnellste Umsetzung
Modelle vergleichen
Wählen Sie zwei oder drei Modelle und vergleichen Sie alle fünf Dimensionen in einem Diagramm. Unterschiedliche Formen zeigen unterschiedliche Stärken.
Leistung in fünf Dimensionen
Auf allen fünf Achsen ist weiter außen besser: stärkere Ergebnisse, kürzere Bearbeitungszeit und geringere Kosten.
Mittelwert jeder Achse über alle 13 Modelle
Nach Prioritäten auswählen
Gewichten Sie bewertete Qualität, Kosten und Geschwindigkeit, um das passende Modell zu finden.
- Qualität
- 50%
- Kosten
- 30%
- Geschwindigkeit
- 20%
- 1 DeepSeek V4.1 Flash 78.8 Durchschnittspunktzahl: 81.2/100; Durchschnittliche Kosten: $0.023; Durchschnittliche Zeit: 5.3 Min.
- 2 DeepSeek V4 Flash 68.6 Durchschnittspunktzahl: 70.6/100; Durchschnittliche Kosten: $0.031; Durchschnittliche Zeit: 11.1 Min.
- 3 GPT-5.6 Sol 65.7 Durchschnittspunktzahl: 77.6/100; Durchschnittliche Kosten: $0.544; Durchschnittliche Zeit: 3.2 Min.
- 4 Gemini 3.8 Flash 64.7 Durchschnittspunktzahl: 68.9/100; Durchschnittliche Kosten: $0.210; Durchschnittliche Zeit: 3.8 Min.
- 5 DeepSeek V4 Pro 64.6 Durchschnittspunktzahl: 72.9/100; Durchschnittliche Kosten: $0.061; Durchschnittliche Zeit: 17.7 Min.
- 6 Muse Spark 1.3 63.2 Durchschnittspunktzahl: 66.6/100; Durchschnittliche Kosten: $0.267; Durchschnittliche Zeit: 3.3 Min.
- 7 GLM-5.3 Flash 61.4 Durchschnittspunktzahl: 69.8/100; Durchschnittliche Kosten: $0.064; Durchschnittliche Zeit: 23.5 Min.
- 8 GPT-6 Astra 57.5 Durchschnittspunktzahl: 82.7/100; Durchschnittliche Kosten: $1.61; Durchschnittliche Zeit: 11.1 Min.
- 9 Grok 4.6 56.5 Durchschnittspunktzahl: 72.4/100; Durchschnittliche Kosten: $0.599; Durchschnittliche Zeit: 11.4 Min.
- 10 Hunyuan H4 Preview 54.6 Durchschnittspunktzahl: 74.6/100; Durchschnittliche Kosten: $0.418; Durchschnittliche Zeit: 29.2 Min.
- 11 Qwen 3.8-Max 52.3 Durchschnittspunktzahl: 72.0/100; Durchschnittliche Kosten: $0.595; Durchschnittliche Zeit: 26.4 Min.
- 12 Claude Fable 5.1 52.1 Durchschnittspunktzahl: 80.3/100; Durchschnittliche Kosten: $3.66; Durchschnittliche Zeit: 12.8 Min.
- 13 Kimi K3 52.1 Durchschnittspunktzahl: 65.7/100; Durchschnittliche Kosten: $0.614; Durchschnittliche Zeit: 14.0 Min.
Nach Anwendungsfall auswählen
Wählen Sie ein Design-Szenario. Für jede der fünf Dimensionen empfehlen wir ein Modell.
GPT-6 Astra
- Ø Punktzahl DurchschnittspunktzahlHöher ist besser Die mittlere Punktzahl aller bewerteten Ergebnisse, maximal 100 Punkte.
- 82.7/100
- Ø Anforderungserfüllung AnforderungserfüllungHöher ist besser Bewertet mit bis zu 30 Punkten, ob erforderliche Seiten, Inhalte, Zustände und Interaktionen vorhanden sind.
- 26.5/30
- Ø Designqualität DesignqualitätHöher ist besser Bewertet Layout, Hierarchie, Stil, Farbe und Bildauswahl mit bis zu 70 Punkten.
- 56.2/70
- Ø Übergabequote ÜbergabequoteHöher ist besser Der Anteil der bewerteten Ergebnisse mit mindestens 80 Punkten.
- 60.0%
- Ø Zeit Durchschnittliche BearbeitungszeitNiedriger ist besser Gesamte Ausführungszeit der bewerteten Ergebnisse, geteilt durch ihre Anzahl.
- 11.1 Min.
- Ø Kosten / Ergebnis Kosten pro ErgebnisNiedriger ist besser Geschätzt anhand offizieller Listenpreise und des gemessenen Token-Verbrauchs.
- $1.61/Durchlauf
Claude Fable 5.1
- Ø Designqualität
- 53.2/70
- Ø Punktzahl
- 80.3/100
- Ø Übergabequote
- 56.7%
- Ø Anforderungserfüllung
- 27.1/30
- Ø Zeit
- 12.8 Min.
- Ø Kosten / Ergebnis
- $3.66/Durchlauf
DeepSeek V4.1 Flash
- Ø Anforderungserfüllung
- 28.4/30
- Ø Punktzahl
- 81.2/100
- Ø Übergabequote
- 57.7%
- Ø Designqualität
- 52.8/70
- Ø Zeit
- 5.3 Min.
- Ø Kosten / Ergebnis
- $0.023/Durchlauf
GPT-5.6 Sol
- Ø Zeit
- 3.2 Min.
- Ø Punktzahl
- 77.6/100
- Ø Übergabequote
- 53.3%
- Ø Anforderungserfüllung
- 25.8/30
- Ø Designqualität
- 51.8/70
- Ø Kosten / Ergebnis
- $0.544/Durchlauf
Hunyuan H4 Preview
- Ø Kosten / Ergebnis
- $0.418/Durchlauf
- Ø Punktzahl
- 74.6/100
- Ø Übergabequote
- 40.0%
- Ø Anforderungserfüllung
- 26.8/30
- Ø Designqualität
- 47.8/70
- Ø Zeit
- 29.2 Min.
Qualität und Kosten
Vergleichen Sie die Modellleistung und die dafür anfallenden Kosten.
Qualität: Rangliste
Kosten-Qualitäts-Grenze
11 Modelle im rosa Bereich kosten mehr und erzielen weniger Punkte als DeepSeek V4.1 Flash.
Leistung nach Szenario
Angezeigt: Web-App (Mehrseitige Struktur und Abläufe). GPT-5.6 Sol führt mit 83.1 Punkten, einer Übergabequote von 66.7% und $0.537 pro Durchlauf.
Angezeigt: Mobile App (Touch-Bedienung und responsives Layout). Hunyuan H4 Preview führt mit 89.5 Punkten, einer Übergabequote von 83.3% und $0.404 pro Durchlauf.
Angezeigt: Desktop-App (Desktop-Arbeitsabläufe und komplexe Interaktionen). DeepSeek V4 Flash führt mit 90.3 Punkten, einer Übergabequote von 83.3% und $0.027 pro Durchlauf.
Angezeigt: Dashboard (Informationsdichte und Hierarchie). GPT-6 Astra führt mit 86.3 Punkten, einer Übergabequote von 66.7% und $1.65 pro Durchlauf.
Angezeigt: Landingpage (Markenwirkung und Conversion). Qwen 3.8-Max führt mit 82.8 Punkten, einer Übergabequote von 66.7% und $0.609 pro Durchlauf.
Web-App: Rangliste
Web-App · Kosten-Qualitäts-Grenze
10 Modelle im rosa Bereich kosten mehr und erzielen weniger Punkte als DeepSeek V4.1 Flash.
Mobile App: Rangliste
Mobile App · Kosten-Qualitäts-Grenze
8 Modelle im rosa Bereich kosten mehr und erzielen weniger Punkte als DeepSeek V4.1 Flash.
Desktop-App: Rangliste
Desktop-App · Kosten-Qualitäts-Grenze
9 Modelle im rosa Bereich kosten mehr und erzielen weniger Punkte als DeepSeek V4.1 Flash.
Dashboard: Rangliste
Dashboard · Kosten-Qualitäts-Grenze
3 Modelle im rosa Bereich kosten mehr und erzielen weniger Punkte als DeepSeek V4.1 Flash.
Landingpage: Rangliste
Landingpage · Kosten-Qualitäts-Grenze
9 Modelle im rosa Bereich kosten mehr und erzielen weniger Punkte als DeepSeek V4.1 Flash.
Modelleffizienz
Vergleichen Sie Bearbeitungszeit, Cache-Trefferquote und Token-Verbrauch. Alle Angaben sind gemessene Mittelwerte.
Cache 81% · Eingabe 318.7K · Ausgabe 15.5K
Cache 89% · Eingabe 1462.8K · Ausgabe 29.2K
Cache 94% · Eingabe 715.7K · Ausgabe 63.6K
Cache 80.7% · Eingabe 236.6K · Ausgabe 14.5K
Cache 90.9% · Eingabe 3085.9K · Ausgabe 46.0K
Cache 91.3% · Eingabe 1422.1K · Ausgabe 24.7K
Cache 58.7% · Eingabe 517.6K · Ausgabe 10.1K
Cache 79% · Eingabe 836.8K · Ausgabe 28.6K
Cache 91.9% · Eingabe 2809.3K · Ausgabe 32.7K
Cache 71.3% · Eingabe 943.7K · Ausgabe 28.4K
Cache 70.9% · Eingabe 392.3K · Ausgabe 27.9K
Cache 31.5% · Eingabe 235.9K · Ausgabe 13.4K
Cache 71.7% · Eingabe 427.1K · Ausgabe 16.1K
Bewertungsmethode
Anforderungserfüllung und Designqualität werden bewertet; Effizienz und Kosten werden separat ausgewiesen.
Aufgaben und Stichproben
Alle Modelle bearbeiten dieselben Design-Aufgaben in fünf Szenarien: Web-Apps, mobile Apps, Desktop-Apps, Dashboards und Verwaltungsoberflächen sowie Websites und Landingpages. Die Ergebnisse beschreiben die Leistung bei praxisnahen Aufgaben zur Prototyperstellung, nicht die allgemeinen Fähigkeiten der Modelle.
Prüfung der Seitendarstellung
Vor der Bewertung prüfen wir, ob sich jedes Ergebnis als Webseite öffnen lässt. Dabei berücksichtigen wir leere Seiten, abgeschnittene Inhalte und schwerwiegende Laufzeitfehler. Nicht darstellbare Ergebnisse erhalten null Punkte und werden nicht durch erneute Tests ersetzt. Eine funktionierende Darstellung ist lediglich Voraussetzung für die weitere Bewertung. Sie belegt weder, dass die Anforderungen erfüllt sind, noch dass das Ergebnis übergabefähig ist.
Anforderungserfüllung und Designqualität
Jedes Ergebnis wird mit bis zu 100 Punkten bewertet. Die Anforderungserfüllung zählt 30 Punkte: Seiten und Module, erforderliche Inhalte, Oberflächenzustände und Interaktionen werden anhand der Aufgabenstellung als vollständig, teilweise oder nicht erfüllt bewertet. Die Designqualität zählt 70 Punkte, verteilt auf fünf gleich gewichtete Dimensionen: Layout und Lesbarkeit, Informationshierarchie, Passung von Stil und Aufgabe, Farbe und Kontrast sowie Bildauswahl und inhaltliche Relevanz. Jede Dimension wird als erfüllt, teilweise erfüllt oder nicht erfüllt bewertet.
Durchschnittspunktzahl und Übergabequote
Die Durchschnittspunktzahl ist das arithmetische Mittel aller bewerteten Ergebnisse eines Modells. Ein Ergebnis mit mindestens 80 Punkten gilt in dieser Auswertung als übergabefähig. Die Übergabequote ist der Anteil der bewerteten Ergebnisse, die diesen Schwellenwert erreichen. Sie zeigt, wie zuverlässig ein Modell Ergebnisse liefert, die den Anforderungen dieser Bewertung entsprechen. Übergabefähig bezieht sich auf den hier festgelegten Qualitätsstandard für Prototypen, nicht auf die Eignung für den produktiven Einsatz.
Effizienz und Kosten
Gemessene Mittelwerte für Bearbeitungszeit, Cache-Trefferquote, Eingabe- und Ausgabe-Token-Verbrauch sowie Werkzeugaufrufe werden getrennt von den Qualitätspunktzahlen angegeben. Die Kosten jedes Ergebnisses werden aus dem erfassten Token-Verbrauch und den Standardpreisen für Eingabe, Ausgabe und Cache-Lesezugriffe geschätzt und anschließend gemittelt. Diese Schätzungen dienen dem Vergleich des Ressourcenverbrauchs. Sie sind keine Rechnungsbeträge und enthalten keine nicht erfassten Gebühren. Effizienz und Kosten fließen nicht in die Bewertungspunktzahl ein. Eine Änderung der Auswahlprioritäten beeinflusst die Empfehlungsrangfolge, nicht die ursprünglichen Bewertungsergebnisse.
