OpenDesignArena
Tasarım için doğru yapay zekâ modelini bulun.
Gerçek değerlendirmelerle kalite, hız ve maliyeti karşılaştırın.
En iyi fiyat-performans
En düşük maliyetle güçlü tasarım performansı.
Bu değerlendirmede DeepSeek V4.1 Flash, lider GPT-6 Astra modelinin ortalama puanının %98 düzeyine, ortalama maliyetinin yaklaşık %1 tutarıyla ulaştı.
- Çıktı başına maliyet
- $0.023$1.61 ile karşılaştırma
- Değerlendirme ortalaması / 100
- 81.282.7 ile karşılaştırma
En yüksek puan
En hızlı teslimat
Modelleri karşılaştırın
İki veya üç model seçerek beş boyutun tamamını tek grafikte görün. Farklı şekiller farklı güçlü yönleri gösterir.
Beş boyutta performans
Beş eksenin tamamında dışa doğru ilerlemek daha iyi sonuç, daha hızlı tamamlama ve daha düşük maliyet demektir.
Tüm 13 modelin her eksendeki ortalaması
Önceliklerinize göre seçin
İhtiyaçlarınıza uygun modeli bulmak için değerlendirilen kalite, maliyet ve hız arasında denge kurun.
- Kalite
- 50%
- Maliyet
- 30%
- Hız
- 20%
- 1 DeepSeek V4.1 Flash 78.8 Ortalama puan: 81.2/100; Ortalama maliyet: $0.023; Ortalama süre: 5.3 dk
- 2 DeepSeek V4 Flash 68.6 Ortalama puan: 70.6/100; Ortalama maliyet: $0.031; Ortalama süre: 11.1 dk
- 3 GPT-5.6 Sol 65.7 Ortalama puan: 77.6/100; Ortalama maliyet: $0.544; Ortalama süre: 3.2 dk
- 4 Gemini 3.8 Flash 64.7 Ortalama puan: 68.9/100; Ortalama maliyet: $0.210; Ortalama süre: 3.8 dk
- 5 DeepSeek V4 Pro 64.6 Ortalama puan: 72.9/100; Ortalama maliyet: $0.061; Ortalama süre: 17.7 dk
- 6 Muse Spark 1.3 63.2 Ortalama puan: 66.6/100; Ortalama maliyet: $0.267; Ortalama süre: 3.3 dk
- 7 GLM-5.3 Flash 61.4 Ortalama puan: 69.8/100; Ortalama maliyet: $0.064; Ortalama süre: 23.5 dk
- 8 GPT-6 Astra 57.5 Ortalama puan: 82.7/100; Ortalama maliyet: $1.61; Ortalama süre: 11.1 dk
- 9 Grok 4.6 56.5 Ortalama puan: 72.4/100; Ortalama maliyet: $0.599; Ortalama süre: 11.4 dk
- 10 Hunyuan H4 Preview 54.6 Ortalama puan: 74.6/100; Ortalama maliyet: $0.418; Ortalama süre: 29.2 dk
- 11 Qwen 3.8-Max 52.3 Ortalama puan: 72.0/100; Ortalama maliyet: $0.595; Ortalama süre: 26.4 dk
- 12 Claude Fable 5.1 52.1 Ortalama puan: 80.3/100; Ortalama maliyet: $3.66; Ortalama süre: 12.8 dk
- 13 Kimi K3 52.1 Ortalama puan: 65.7/100; Ortalama maliyet: $0.614; Ortalama süre: 14.0 dk
Kullanım amacına göre seçin
Bir tasarım senaryosu seçin; aşağıdaki beş boyutun her biri için bir model önerilir.
GPT-6 Astra
- Ort. puan Ortalama puanYüksek olması daha iyi Değerlendirilen tüm çıktıların 100 üzerinden ortalama puanı.
- 82.7/100
- Ort. gereksinim puanı Gereksinimleri karşılamaYüksek olması daha iyi Gerekli sayfaları, içeriği, durumları ve etkileşimleri 30 üzerinden değerlendirir.
- 26.5/30
- Ort. tasarım kalitesi Tasarım kalitesiYüksek olması daha iyi Düzeni, hiyerarşiyi, stili, rengi ve görsel uygunluğunu 70 üzerinden değerlendirir.
- 56.2/70
- Ort. teslim edilebilirlik oranı Teslim edilebilirlik oranıYüksek olması daha iyi Değerlendirilen çıktılar arasında 80 ve üzeri puan alanların oranı.
- 60.0%
- Ort. süre Ortalama tamamlanma süresiDüşük olması daha iyi Puanlanan çıktıların toplam çalıştırma süresinin çıktı sayısına bölünmesiyle hesaplanır.
- 11.1 dk
- Ort. maliyet / çıktı Çıktı başına maliyetDüşük olması daha iyi Resmî liste fiyatları ve ölçülen token tüketimi üzerinden tahmin edilir.
- $1.61/çalıştırma
Claude Fable 5.1
- Ort. tasarım kalitesi
- 53.2/70
- Ort. puan
- 80.3/100
- Ort. teslim edilebilirlik oranı
- 56.7%
- Ort. gereksinim puanı
- 27.1/30
- Ort. süre
- 12.8 dk
- Ort. maliyet / çıktı
- $3.66/çalıştırma
DeepSeek V4.1 Flash
- Ort. gereksinim puanı
- 28.4/30
- Ort. puan
- 81.2/100
- Ort. teslim edilebilirlik oranı
- 57.7%
- Ort. tasarım kalitesi
- 52.8/70
- Ort. süre
- 5.3 dk
- Ort. maliyet / çıktı
- $0.023/çalıştırma
GPT-5.6 Sol
- Ort. süre
- 3.2 dk
- Ort. puan
- 77.6/100
- Ort. teslim edilebilirlik oranı
- 53.3%
- Ort. gereksinim puanı
- 25.8/30
- Ort. tasarım kalitesi
- 51.8/70
- Ort. maliyet / çıktı
- $0.544/çalıştırma
Hunyuan H4 Preview
- Ort. maliyet / çıktı
- $0.418/çalıştırma
- Ort. puan
- 74.6/100
- Ort. teslim edilebilirlik oranı
- 40.0%
- Ort. gereksinim puanı
- 26.8/30
- Ort. tasarım kalitesi
- 47.8/70
- Ort. süre
- 29.2 dk
Kalite ve maliyet
Modellerin performansını ve bu performansa ulaşmanın maliyetini karşılaştırın.
Kalite sıralaması
Maliyet–kalite sınırı
Pembe alandaki 11 model, DeepSeek V4.1 Flash modelinden daha pahalı ve daha düşük puanlı.
Senaryoya göre performans
Web uygulaması (Çok sayfalı yapı ve akışlar) görüntüleniyor; GPT-5.6 Sol, 83.1 puan, %66.7 teslim edilebilirlik oranı ve çalıştırma başına $0.537 maliyetle lider.
Mobil uygulama (Dokunmatik deneyim ve duyarlı düzen) görüntüleniyor; Hunyuan H4 Preview, 89.5 puan, %83.3 teslim edilebilirlik oranı ve çalıştırma başına $0.404 maliyetle lider.
Masaüstü uygulaması (Masaüstü iş akışları ve karmaşık etkileşimler) görüntüleniyor; DeepSeek V4 Flash, 90.3 puan, %83.3 teslim edilebilirlik oranı ve çalıştırma başına $0.027 maliyetle lider.
Gösterge paneli (Bilgi yoğunluğu ve hiyerarşisi) görüntüleniyor; GPT-6 Astra, 86.3 puan, %66.7 teslim edilebilirlik oranı ve çalıştırma başına $1.65 maliyetle lider.
Açılış sayfası (Marka anlatımı ve dönüşüm) görüntüleniyor; Qwen 3.8-Max, 82.8 puan, %66.7 teslim edilebilirlik oranı ve çalıştırma başına $0.609 maliyetle lider.
Web uygulaması sıralaması
Web uygulaması · Maliyet–kalite sınırı
Pembe alandaki 10 model, DeepSeek V4.1 Flash modelinden daha pahalı ve daha düşük puanlı.
Mobil uygulama sıralaması
Mobil uygulama · Maliyet–kalite sınırı
Pembe alandaki 8 model, DeepSeek V4.1 Flash modelinden daha pahalı ve daha düşük puanlı.
Masaüstü uygulaması sıralaması
Masaüstü uygulaması · Maliyet–kalite sınırı
Pembe alandaki 9 model, DeepSeek V4.1 Flash modelinden daha pahalı ve daha düşük puanlı.
Gösterge paneli sıralaması
Gösterge paneli · Maliyet–kalite sınırı
Pembe alandaki 3 model, DeepSeek V4.1 Flash modelinden daha pahalı ve daha düşük puanlı.
Açılış sayfası sıralaması
Açılış sayfası · Maliyet–kalite sınırı
Pembe alandaki 9 model, DeepSeek V4.1 Flash modelinden daha pahalı ve daha düşük puanlı.
Model verimliliği
Tamamlanma süresini, önbellek isabet oranını ve token tüketimini karşılaştırın. Tüm değerler ölçülen ortalamalardır.
Önbellek 81% · Girdi 318.7K · Çıktı 15.5K
Önbellek 89% · Girdi 1462.8K · Çıktı 29.2K
Önbellek 94% · Girdi 715.7K · Çıktı 63.6K
Önbellek 80.7% · Girdi 236.6K · Çıktı 14.5K
Önbellek 90.9% · Girdi 3085.9K · Çıktı 46.0K
Önbellek 91.3% · Girdi 1422.1K · Çıktı 24.7K
Önbellek 58.7% · Girdi 517.6K · Çıktı 10.1K
Önbellek 79% · Girdi 836.8K · Çıktı 28.6K
Önbellek 91.9% · Girdi 2809.3K · Çıktı 32.7K
Önbellek 71.3% · Girdi 943.7K · Çıktı 28.4K
Önbellek 70.9% · Girdi 392.3K · Çıktı 27.9K
Önbellek 31.5% · Girdi 235.9K · Çıktı 13.4K
Önbellek 71.7% · Girdi 427.1K · Çıktı 16.1K
Değerlendirme yöntemi
Gereksinimleri karşılama ve tasarım kalitesi puanlanır; verimlilik ve maliyet ayrı sunulur.
Görevler ve örneklem
Modeller beş senaryoda ortak tasarım görevleriyle değerlendirilir: web uygulamaları, mobil uygulamalar, masaüstü uygulamaları, gösterge panoları ve yönetim panelleri, web siteleri ve açılış sayfaları. Bu sonuçlar, modellerin genel yeteneklerini değil, pratik prototip oluşturma görevlerindeki performanslarını gösterir.
Sayfa görüntüleme kontrolleri
Puanlamadan önce her çıktının web sayfası olarak açılıp açılmadığını kontrol eder; boş sayfaları, kesilmiş içeriği ve kritik çalışma zamanı hatalarını inceleriz. Görüntülenemeyen çıktılar sıfır puan alır; sonuçları yeniden test edilerek değiştirilmez. Başarıyla açılmak yalnızca sonraki değerlendirme için bir ön koşuldur; gereksinimlerin karşılandığını veya çıktının teslim edilebilir olduğunu kanıtlamaz.
Gereksinimleri karşılama ve tasarım kalitesi
Her çıktı 100 üzerinden puanlanır. Gereksinimleri karşılama 30 puandır: sayfalar ve modüller, gerekli içerik, arayüz durumları ve etkileşimler görev tanımına göre kontrol edilir ve tamamlandı, kısmen tamamlandı veya tamamlanmadı olarak değerlendirilir. Tasarım kalitesi, eşit ağırlıklı beş boyutta toplam 70 puandır: düzen ve okunabilirlik, bilgi hiyerarşisi, stilin göreve uygunluğu, renk ve kontrast, görsellerin uygunluğu ve içerikle ilgisi. Her boyut karşılandı, kısmen karşılandı veya karşılanmadı olarak değerlendirilir.
Ortalama puan ve teslim edilebilirlik oranı
Ortalama puan, bir modelin puanlanan tüm çıktılarının aritmetik ortalamasıdır. Bu değerlendirmede 80 ve üzeri puan alan bir çıktı teslim edilebilir kabul edilir. Teslim edilebilirlik oranı, puanlanan çıktılar arasında bu eşiğe ulaşanların oranıdır ve modelin uygun sonuçları ne kadar tutarlı ürettiğini gösterir. Teslim edilebilirlik, bu değerlendirmenin prototip kalite standardını ifade eder; üretim ortamında kullanıma hazır olunduğu anlamına gelmez.
Verimlilik ve maliyet
Tamamlanma süresi, önbellek isabet oranı, girdi ve çıktı token tüketimi ile araç çağrılarının ölçülen ortalamalarını kalite puanlarından ayrı sunarız. Her çıktının maliyeti, kayıtlı token tüketimi ve standart girdi, çıktı ve önbellek okuma fiyatları kullanılarak tahmin edilir; ardından ortalaması alınır. Bu tahminler kaynak tüketimini karşılaştırmak içindir; fatura tutarı değildir ve kaydedilmemiş ücretleri içermez. Verimlilik ve maliyet değerlendirme puanına katılmaz. Seçim önceliklerini değiştirmek, özgün değerlendirme sonuçlarını değil, öneri sıralamalarını etkiler.
