OpenDesignArena
Trova il modello di IA giusto per il design.
Confronta qualità, velocità e costo con valutazioni reali.
Miglior rapporto qualità-prezzo
Un design di qualità al costo più basso.
In questa valutazione, DeepSeek V4.1 Flash ha raggiunto il 98% del punteggio medio del primo in classifica, GPT-6 Astra, con circa il 1% del suo costo medio.
- Costo per elaborato
- $0.023rispetto a $1.61
- Punteggio medio / 100
- 81.2rispetto a 82.7
Punteggio più alto
Consegna più rapida
Confronta i modelli
Scegli due o tre modelli e confronta le cinque dimensioni in un unico grafico. Forme diverse indicano punti di forza diversi.
Profilo in cinque dimensioni
Più lontano dal centro su ogni asse significa risultati migliori, completamento più rapido e costi inferiori.
Media di ciascun asse su tutti i 13 modelli
Scegli in base alle tue priorità
Bilancia qualità valutata, costo e velocità per trovare il modello più adatto alle tue esigenze.
- Qualità
- 50%
- Costo
- 30%
- Velocità
- 20%
- 1 DeepSeek V4.1 Flash 78.8 Punteggio medio: 81.2/100; Costo medio: $0.023; Tempo medio: 5.3 min
- 2 DeepSeek V4 Flash 68.6 Punteggio medio: 70.6/100; Costo medio: $0.031; Tempo medio: 11.1 min
- 3 GPT-5.6 Sol 65.7 Punteggio medio: 77.6/100; Costo medio: $0.544; Tempo medio: 3.2 min
- 4 Gemini 3.8 Flash 64.7 Punteggio medio: 68.9/100; Costo medio: $0.210; Tempo medio: 3.8 min
- 5 DeepSeek V4 Pro 64.6 Punteggio medio: 72.9/100; Costo medio: $0.061; Tempo medio: 17.7 min
- 6 Muse Spark 1.3 63.2 Punteggio medio: 66.6/100; Costo medio: $0.267; Tempo medio: 3.3 min
- 7 GLM-5.3 Flash 61.4 Punteggio medio: 69.8/100; Costo medio: $0.064; Tempo medio: 23.5 min
- 8 GPT-6 Astra 57.5 Punteggio medio: 82.7/100; Costo medio: $1.61; Tempo medio: 11.1 min
- 9 Grok 4.6 56.5 Punteggio medio: 72.4/100; Costo medio: $0.599; Tempo medio: 11.4 min
- 10 Hunyuan H4 Preview 54.6 Punteggio medio: 74.6/100; Costo medio: $0.418; Tempo medio: 29.2 min
- 11 Qwen 3.8-Max 52.3 Punteggio medio: 72.0/100; Costo medio: $0.595; Tempo medio: 26.4 min
- 12 Claude Fable 5.1 52.1 Punteggio medio: 80.3/100; Costo medio: $3.66; Tempo medio: 12.8 min
- 13 Kimi K3 52.1 Punteggio medio: 65.7/100; Costo medio: $0.614; Tempo medio: 14.0 min
Scegli in base all’uso
Seleziona un tipo di progetto: ciascuno dei cinque criteri seguenti consiglia un modello.
GPT-6 Astra
- Punteggio medio Punteggio medioPiù alto è meglio La media dei punteggi di tutti gli elaborati valutati, su 100.
- 82.7/100
- Requisiti: media Rispetto dei requisitiPiù alto è meglio Verifica la presenza di pagine, contenuti, stati e interazioni richiesti, su 30 punti.
- 26.5/30
- Design: media Qualità del designPiù alto è meglio Valuta layout, gerarchia, stile, colori e adeguatezza delle immagini, su 70 punti.
- 56.2/70
- Tasso medio di consegnabilità Tasso di consegnabilitàPiù alto è meglio La quota di elaborati valutati che ottiene almeno 80 punti.
- 60.0%
- Tempo medio Tempo medio di esecuzionePiù basso è meglio Il tempo totale di esecuzione degli elaborati valutati, diviso per il loro numero.
- 11.1 min
- Costo medio / elaborato Costo per elaboratoPiù basso è meglio Stimato in base ai prezzi ufficiali e al consumo misurato di token.
- $1.61/esecuzione
Claude Fable 5.1
- Design: media
- 53.2/70
- Punteggio medio
- 80.3/100
- Tasso medio di consegnabilità
- 56.7%
- Requisiti: media
- 27.1/30
- Tempo medio
- 12.8 min
- Costo medio / elaborato
- $3.66/esecuzione
DeepSeek V4.1 Flash
- Requisiti: media
- 28.4/30
- Punteggio medio
- 81.2/100
- Tasso medio di consegnabilità
- 57.7%
- Design: media
- 52.8/70
- Tempo medio
- 5.3 min
- Costo medio / elaborato
- $0.023/esecuzione
GPT-5.6 Sol
- Tempo medio
- 3.2 min
- Punteggio medio
- 77.6/100
- Tasso medio di consegnabilità
- 53.3%
- Requisiti: media
- 25.8/30
- Design: media
- 51.8/70
- Costo medio / elaborato
- $0.544/esecuzione
Hunyuan H4 Preview
- Costo medio / elaborato
- $0.418/esecuzione
- Punteggio medio
- 74.6/100
- Tasso medio di consegnabilità
- 40.0%
- Requisiti: media
- 26.8/30
- Design: media
- 47.8/70
- Tempo medio
- 29.2 min
Qualità e costo
Confronta le prestazioni dei modelli e il costo necessario per ottenerle.
Classifica: Qualità
Soglia costo–qualità
11 modelli nell’area rosa costano di più e ottengono un punteggio inferiore a DeepSeek V4.1 Flash.
Prestazioni per utilizzo
Risultati per App web (Struttura multipagina e flussi): GPT-5.6 Sol è in testa con 83.1, un tasso di consegnabilità del 66.7% e un costo di $0.537 per esecuzione.
Risultati per App mobile (Esperienza tattile e layout responsive): Hunyuan H4 Preview è in testa con 89.5, un tasso di consegnabilità del 83.3% e un costo di $0.404 per esecuzione.
Risultati per App desktop (Flussi di lavoro desktop e interazioni complesse): DeepSeek V4 Flash è in testa con 90.3, un tasso di consegnabilità del 83.3% e un costo di $0.027 per esecuzione.
Risultati per Dashboard (Densità e gerarchia delle informazioni): GPT-6 Astra è in testa con 86.3, un tasso di consegnabilità del 66.7% e un costo di $1.65 per esecuzione.
Risultati per Landing page (Identità del brand e conversione): Qwen 3.8-Max è in testa con 82.8, un tasso di consegnabilità del 66.7% e un costo di $0.609 per esecuzione.
Classifica: App web
App web · Soglia costo–qualità
10 modelli nell’area rosa costano di più e ottengono un punteggio inferiore a DeepSeek V4.1 Flash.
Classifica: App mobile
App mobile · Soglia costo–qualità
8 modelli nell’area rosa costano di più e ottengono un punteggio inferiore a DeepSeek V4.1 Flash.
Classifica: App desktop
App desktop · Soglia costo–qualità
9 modelli nell’area rosa costano di più e ottengono un punteggio inferiore a DeepSeek V4.1 Flash.
Classifica: Dashboard
Dashboard · Soglia costo–qualità
3 modelli nell’area rosa costano di più e ottengono un punteggio inferiore a DeepSeek V4.1 Flash.
Classifica: Landing page
Landing page · Soglia costo–qualità
9 modelli nell’area rosa costano di più e ottengono un punteggio inferiore a DeepSeek V4.1 Flash.
Efficienza dei modelli
Confronta tempo di esecuzione, tasso di successo della cache e consumo di token. Tutti i valori sono medie misurate.
Cache 81% · Ingresso 318.7K · Uscita 15.5K
Cache 89% · Ingresso 1462.8K · Uscita 29.2K
Cache 94% · Ingresso 715.7K · Uscita 63.6K
Cache 80.7% · Ingresso 236.6K · Uscita 14.5K
Cache 90.9% · Ingresso 3085.9K · Uscita 46.0K
Cache 91.3% · Ingresso 1422.1K · Uscita 24.7K
Cache 58.7% · Ingresso 517.6K · Uscita 10.1K
Cache 79% · Ingresso 836.8K · Uscita 28.6K
Cache 91.9% · Ingresso 2809.3K · Uscita 32.7K
Cache 71.3% · Ingresso 943.7K · Uscita 28.4K
Cache 70.9% · Ingresso 392.3K · Uscita 27.9K
Cache 31.5% · Ingresso 235.9K · Uscita 13.4K
Cache 71.7% · Ingresso 427.1K · Uscita 16.1K
Metodo di valutazione
Il rispetto dei requisiti e la qualità del design ricevono un punteggio; efficienza e costo vengono riportati separatamente.
Attività e campioni
I modelli vengono valutati su attività di design comuni in cinque tipi di progetto: applicazioni web, applicazioni mobili, applicazioni desktop, dashboard e pannelli di amministrazione, siti web e landing page. I risultati descrivono le prestazioni in attività pratiche di generazione di prototipi, non le capacità generali del modello.
Verifica della visualizzazione
Prima dell’assegnazione del punteggio, verifichiamo che ogni elaborato si apra come pagina web, controllando anche pagine vuote, contenuti troncati ed errori di esecuzione irreversibili. Gli elaborati che non vengono visualizzati ricevono zero; i risultati non vengono sostituiti con nuove prove. L’apertura corretta è solo un prerequisito per proseguire la valutazione, non una prova del rispetto dei requisiti o della consegnabilità dell’elaborato.
Rispetto dei requisiti e qualità del design
Ogni elaborato riceve un punteggio su 100. Il rispetto dei requisiti vale 30 punti: pagine e moduli, contenuti richiesti, stati dell’interfaccia e interazioni vengono confrontati con le specifiche dell’attività e valutati come completi, parzialmente completi o incompleti. La qualità del design vale 70 punti, distribuiti in parti uguali su cinque dimensioni: layout e leggibilità, gerarchia delle informazioni, coerenza dello stile con l’attività, colori e contrasto, adeguatezza delle immagini e pertinenza rispetto al contenuto. Ogni dimensione viene valutata come soddisfatta, parzialmente soddisfatta o non soddisfatta.
Punteggio medio e tasso di consegnabilità
Il punteggio medio è la media aritmetica di tutti gli elaborati valutati per un modello. Un elaborato con almeno 80 punti è considerato consegnabile in questa valutazione. Il tasso di consegnabilità è la quota di elaborati valutati che raggiunge tale soglia e indica con quale regolarità un modello produce risultati conformi al criterio. Per consegnabilità si intende lo standard qualitativo dei prototipi adottato in questa valutazione, non l’idoneità all’uso in produzione.
Efficienza e costo
Riportiamo le medie misurate di tempo di esecuzione, tasso di successo della cache, utilizzo di token in ingresso e in uscita e chiamate agli strumenti separatamente dai punteggi di qualità. Il costo di ogni elaborato viene stimato in base al consumo di token registrato e alle tariffe standard per ingresso, uscita e lettura della cache, quindi ne viene calcolata la media. Queste stime servono a confrontare il consumo di risorse: non sono fatture ed escludono gli addebiti non registrati. Efficienza e costo non contribuiscono al punteggio di valutazione. Cambiare le priorità di selezione modifica la classifica dei modelli consigliati, non i risultati originali della valutazione.
