OpenDesignArena

디자인 작업에 맞는 AI 모델을 찾아보세요.

실제 평가로 품질, 속도, 비용을 비교하고 선택하세요.

가성비 추천

DeepSeek V4.1 Flash

최저 비용으로 구현하는 뛰어난 디자인 성능.

이번 평가에서 DeepSeek V4.1 Flash의 평균 점수는 1위인 GPT-6 Astra의 98%에 달했으며, 평균 비용은 약 1%에 불과했습니다.

결과물당 비용
$0.023비교: $1.61
평가 평균 / 100
81.2비교: 82.7

고득점 추천

속도 추천

모델 비교

모델 2~3개를 선택해 다섯 가지 기준을 하나의 차트에서 비교하세요. 서로 다른 형태는 서로 다른 강점을 나타냅니다.

다섯 가지 성능 지표

다섯 축 모두 바깥쪽일수록 좋습니다. 더 빠르게 완성하고 비용도 줄입니다.

요구사항 충족도디자인 품질납품 가능 비율완성 속도비용 효율

    전체 13개 모델의 축별 평균

    우선순위에 따른 모델 선택

    평가된 품질, 비용, 속도의 비중을 조정하여 필요에 맞는 모델을 찾아보세요.

    무엇이 가장 중요한가요?
    품질
    50%
    비용
    30%
    속도
    20%
    1. 1 DeepSeek V4.1 Flash 78.8 평균 점수: 81.2/100; 평균 비용: $0.023; 평균 시간: 5.3분
    2. 2 DeepSeek V4 Flash 68.6 평균 점수: 70.6/100; 평균 비용: $0.031; 평균 시간: 11.1분
    3. 3 GPT-5.6 Sol 65.7 평균 점수: 77.6/100; 평균 비용: $0.544; 평균 시간: 3.2분
    4. 4 Gemini 3.8 Flash 64.7 평균 점수: 68.9/100; 평균 비용: $0.210; 평균 시간: 3.8분
    5. 5 DeepSeek V4 Pro 64.6 평균 점수: 72.9/100; 평균 비용: $0.061; 평균 시간: 17.7분
    6. 6 Muse Spark 1.3 63.2 평균 점수: 66.6/100; 평균 비용: $0.267; 평균 시간: 3.3분
    7. 7 GLM-5.3 Flash 61.4 평균 점수: 69.8/100; 평균 비용: $0.064; 평균 시간: 23.5분
    8. 8 GPT-6 Astra 57.5 평균 점수: 82.7/100; 평균 비용: $1.61; 평균 시간: 11.1분
    9. 9 Grok 4.6 56.5 평균 점수: 72.4/100; 평균 비용: $0.599; 평균 시간: 11.4분
    10. 10 Hunyuan H4 Preview 54.6 평균 점수: 74.6/100; 평균 비용: $0.418; 평균 시간: 29.2분
    11. 11 Qwen 3.8-Max 52.3 평균 점수: 72.0/100; 평균 비용: $0.595; 평균 시간: 26.4분
    12. 12 Claude Fable 5.1 52.1 평균 점수: 80.3/100; 평균 비용: $3.66; 평균 시간: 12.8분
    13. 13 Kimi K3 52.1 평균 점수: 65.7/100; 평균 비용: $0.614; 평균 시간: 14.0분

    용도에 맞는 모델 선택

    디자인 시나리오를 선택하면 아래 다섯 가지 기준별로 모델을 하나씩 추천합니다.

    종합 성능

    GPT-6 Astra

    요구사항 충족도 · 26.5/30디자인 품질 · 56.2/70납품 가능 비율 · 60.0%완료 시간 · 11.1분실행당 비용 · $1.61 요구사항 충족도 26.5/30 디자인 품질 56.2/70 납품 가능 비율 60.0% 완료 시간 11.1분 실행당 비용 $1.61
    평균 점수
    82.7/100
    평균 요구사항 충족도
    26.5/30
    평균 디자인 품질
    56.2/70
    평균 납품 가능 비율
    60.0%
    평균 시간
    11.1
    결과물당 평균 비용
    $1.61/회
    디자인 품질

    Claude Fable 5.1

    평균 디자인 품질
    53.2/70
    평균 점수
    80.3/100
    평균 납품 가능 비율
    56.7%
    평균 요구사항 충족도
    27.1/30
    평균 시간
    12.8
    결과물당 평균 비용
    $3.66/회
    요구사항 충족도

    DeepSeek V4.1 Flash

    평균 요구사항 충족도
    28.4/30
    평균 점수
    81.2/100
    평균 납품 가능 비율
    57.7%
    평균 디자인 품질
    52.8/70
    평균 시간
    5.3
    결과물당 평균 비용
    $0.023/회
    완료 속도

    GPT-5.6 Sol

    평균 시간
    3.2
    평균 점수
    77.6/100
    평균 납품 가능 비율
    53.3%
    평균 요구사항 충족도
    25.8/30
    평균 디자인 품질
    51.8/70
    결과물당 평균 비용
    $0.544/회
    비용 효율

    Hunyuan H4 Preview

    결과물당 평균 비용
    $0.418/회
    평균 점수
    74.6/100
    평균 납품 가능 비율
    40.0%
    평균 요구사항 충족도
    26.8/30
    평균 디자인 품질
    47.8/70
    평균 시간
    29.2

    품질과 비용

    모델의 성능과 해당 결과를 얻는 데 필요한 비용을 비교합니다.

    품질 순위

    82.7/100 GPT-6 Astra
    81.2/100 DeepSeek V4.1 Flash
    80.3/100 Claude Fable 5.1
    77.6/100 GPT-5.6 Sol
    74.6/100 Hunyuan H4 Preview
    72.9/100 DeepSeek V4 Pro
    72.4/100 Grok 4.6
    72.0/100 Qwen 3.8-Max
    70.6/100 DeepSeek V4 Flash
    69.8/100 GLM-5.3 Flash
    68.9/100 Gemini 3.8 Flash
    66.6/100 Muse Spark 1.3
    65.7/100 Kimi K3

    비용·품질 기준선

    평균 점수 결과물당 비용(미국 달러) GPT-6 Astra GPT-6 Astra 평균 점수 82.7 · $1.61 DeepSeek V4.1 Flash DeepSeek V4.1 Flash 평균 점수 81.2 · $0.023 Claude Fable 5.1 Claude Fable 5.1 평균 점수 80.3 · $3.66 GPT-5.6 Sol GPT-5.6 Sol 평균 점수 77.6 · $0.544 Hunyuan H4 Preview Hunyuan H4 Preview 평균 점수 74.6 · $0.418 DeepSeek V4 Pro DeepSeek V4 Pro 평균 점수 72.9 · $0.061 Grok 4.6 Grok 4.6 평균 점수 72.4 · $0.599 Qwen 3.8-Max Qwen 3.8-Max 평균 점수 72.0 · $0.595 DeepSeek V4 Flash DeepSeek V4 Flash 평균 점수 70.6 · $0.031 GLM-5.3 Flash GLM-5.3 Flash 평균 점수 69.8 · $0.064 Gemini 3.8 Flash Gemini 3.8 Flash 평균 점수 68.9 · $0.210 Muse Spark 1.3 Muse Spark 1.3 평균 점수 66.6 · $0.267 Kimi K3 Kimi K3 평균 점수 65.7 · $0.614

    분홍색 영역의 모델 11개는 DeepSeek V4.1 Flash보다 비싸고 점수는 낮습니다.

    시나리오별 성능

    웹 앱 순위

    83.1/100 GPT-5.6 Sol
    82.6/100 Claude Fable 5.1
    82.4/100 DeepSeek V4.1 Flash
    77.1/100 GPT-6 Astra
    68.5/100 Grok 4.6
    68.4/100 Gemini 3.8 Flash
    62.0/100 Muse Spark 1.3
    60.6/100 GLM-5.3 Flash
    60.5/100 Hunyuan H4 Preview
    57.0/100 Qwen 3.8-Max
    56.4/100 DeepSeek V4 Flash
    51.8/100 DeepSeek V4 Pro
    35.9/100 Kimi K3

    웹 앱 · 비용·품질 기준선

    평균 점수 결과물당 비용(미국 달러) GPT-5.6 Sol GPT-5.6 Sol 평균 점수 83.1 · $0.537 Claude Fable 5.1 Claude Fable 5.1 평균 점수 82.6 · $5.55 DeepSeek V4.1 Flash DeepSeek V4.1 Flash 평균 점수 82.4 · $0.030 GPT-6 Astra GPT-6 Astra 평균 점수 77.1 · $1.87 Grok 4.6 Grok 4.6 평균 점수 68.5 · $0.818 Gemini 3.8 Flash Gemini 3.8 Flash 평균 점수 68.4 · $0.185 Muse Spark 1.3 Muse Spark 1.3 평균 점수 62.0 · $0.293 GLM-5.3 Flash GLM-5.3 Flash 평균 점수 60.6 · $0.093 Hunyuan H4 Preview Hunyuan H4 Preview 평균 점수 60.5 · $0.609 Qwen 3.8-Max Qwen 3.8-Max 평균 점수 57.0 · $0.552 DeepSeek V4 Flash DeepSeek V4 Flash 평균 점수 56.4 · $0.041 DeepSeek V4 Pro DeepSeek V4 Pro 평균 점수 51.8 · $0.067 Kimi K3 Kimi K3 평균 점수 35.9 · $0.486

    분홍색 영역의 모델 10개는 DeepSeek V4.1 Flash보다 비싸고 점수는 낮습니다.

    모델 효율

    완료 시간, 캐시 적중률, 토큰 사용량을 비교합니다. 모든 수치는 실측 평균값입니다.

    시나리오
    평균 점수완료 시간
    높은 점수 · 높은 효율

    평가 방법

    요구사항 충족도와 디자인 품질을 평가하며, 효율과 비용은 별도로 제공합니다.

    과제와 표본

    모든 모델은 웹 앱, 모바일 앱, 데스크톱 앱, 대시보드 및 관리자 화면, 웹사이트 및 랜딩 페이지의 다섯 가지 시나리오에서 동일한 디자인 과제로 평가합니다. 결과는 실제 프로토타입 생성 과제에서의 성능을 나타내며, 모델의 전반적인 능력을 의미하지 않습니다.

    페이지 렌더링 검사

    채점에 앞서 각 결과물이 웹페이지로 열리는지 확인하고, 빈 페이지, 잘린 콘텐츠, 치명적인 실행 오류가 있는지 검사합니다. 렌더링되지 않는 결과물은 0점으로 처리하며, 재평가로 결과를 대체하지 않습니다. 정상적으로 열리는 것은 후속 평가의 전제 조건일 뿐, 요구사항을 충족하거나 납품 가능한 상태라는 뜻은 아닙니다.

    요구사항 충족도와 디자인 품질

    각 결과물은 100점 만점으로 평가합니다. 요구사항 충족도는 30점으로, 과제에 명시된 페이지와 모듈, 필수 콘텐츠, 인터페이스 상태, 상호작용을 확인하여 충족, 부분 충족, 미충족으로 평가합니다. 디자인 품질은 70점으로, 레이아웃과 가독성, 정보 계층, 스타일과 과제의 적합성, 색상과 대비, 이미지 적합성과 콘텐츠 관련성의 다섯 항목에 동일한 비중을 부여합니다. 각 항목은 충족, 부분 충족, 미충족으로 평가합니다.

    평균 점수와 납품 가능 비율

    평균 점수는 해당 모델의 채점된 모든 결과물 점수에 대한 산술평균입니다. 이번 평가에서는 80점 이상인 결과물을 납품 가능한 것으로 분류합니다. 납품 가능 비율은 채점된 결과물 중 이 기준을 충족한 비율로, 모델이 기준에 부합하는 결과물을 얼마나 일관되게 생성하는지 보여줍니다. 여기서 납품 가능이란 본 평가의 프로토타입 품질 기준을 충족한다는 의미이며, 실제 서비스에 바로 배포할 수 있다는 뜻은 아닙니다.

    효율과 비용

    완료 시간, 캐시 적중률, 입력·출력 토큰 사용량, 도구 호출 횟수는 실측 평균값으로 산출하여 품질 점수와 별도로 제공합니다. 각 결과물의 비용은 기록된 토큰 사용량에 표준 입력, 출력, 캐시 읽기 단가를 적용해 추정한 뒤 평균을 구합니다. 이 추정치는 자원 소비를 비교하기 위한 것으로 실제 청구 금액이 아니며, 기록되지 않은 요금은 제외합니다. 효율과 비용은 평가 점수에 반영하지 않습니다. 선택 우선순위를 변경하면 추천 순위만 달라지며, 원래 평가 결과는 유지됩니다.

    OpenDesign 데스크톱

    하나의 디자인 시스템으로 모든 결과물에 브랜드 일관성을

    완전한 Vibe Design Workspace에서 하나의 브랜드 규칙을 웹사이트, 슬라이드, 인터랙티브 프로토타입, 대시보드, 이미지, HTML 영상에 적용하세요. 로컬 Codex, Claude Code, Cursor 등을 연결해 무료로 제작할 수 있습니다.

    • 웹, 슬라이드, 프로토타입, 대시보드, 이미지, 영상
    • 140개+ 디자인 시스템과 전체 템플릿·스킬 라이브러리
    • 로컬 Codex 및 21개+ 코딩 에이전트 연결 · 무료
    무료 다운로드

    macOS, Windows 지원