가성비 추천
최저 비용으로 구현하는 뛰어난 디자인 성능.
이번 평가에서 DeepSeek V4.1 Flash의 평균 점수는 1위인 GPT-6 Astra의 98%에 달했으며, 평균 비용은 약 1%에 불과했습니다.
- 결과물당 비용
- $0.023비교: $1.61
- 평가 평균 / 100
- 81.2비교: 82.7
고득점 추천
속도 추천
모델 비교
모델 2~3개를 선택해 다섯 가지 기준을 하나의 차트에서 비교하세요. 서로 다른 형태는 서로 다른 강점을 나타냅니다.
다섯 가지 성능 지표
다섯 축 모두 바깥쪽일수록 좋습니다. 더 빠르게 완성하고 비용도 줄입니다.
전체 13개 모델의 축별 평균
우선순위에 따른 모델 선택
평가된 품질, 비용, 속도의 비중을 조정하여 필요에 맞는 모델을 찾아보세요.
- 품질
- 50%
- 비용
- 30%
- 속도
- 20%
- 1 DeepSeek V4.1 Flash 78.8 평균 점수: 81.2/100; 평균 비용: $0.023; 평균 시간: 5.3분
- 2 DeepSeek V4 Flash 68.6 평균 점수: 70.6/100; 평균 비용: $0.031; 평균 시간: 11.1분
- 3 GPT-5.6 Sol 65.7 평균 점수: 77.6/100; 평균 비용: $0.544; 평균 시간: 3.2분
- 4 Gemini 3.8 Flash 64.7 평균 점수: 68.9/100; 평균 비용: $0.210; 평균 시간: 3.8분
- 5 DeepSeek V4 Pro 64.6 평균 점수: 72.9/100; 평균 비용: $0.061; 평균 시간: 17.7분
- 6 Muse Spark 1.3 63.2 평균 점수: 66.6/100; 평균 비용: $0.267; 평균 시간: 3.3분
- 7 GLM-5.3 Flash 61.4 평균 점수: 69.8/100; 평균 비용: $0.064; 평균 시간: 23.5분
- 8 GPT-6 Astra 57.5 평균 점수: 82.7/100; 평균 비용: $1.61; 평균 시간: 11.1분
- 9 Grok 4.6 56.5 평균 점수: 72.4/100; 평균 비용: $0.599; 평균 시간: 11.4분
- 10 Hunyuan H4 Preview 54.6 평균 점수: 74.6/100; 평균 비용: $0.418; 평균 시간: 29.2분
- 11 Qwen 3.8-Max 52.3 평균 점수: 72.0/100; 평균 비용: $0.595; 평균 시간: 26.4분
- 12 Claude Fable 5.1 52.1 평균 점수: 80.3/100; 평균 비용: $3.66; 평균 시간: 12.8분
- 13 Kimi K3 52.1 평균 점수: 65.7/100; 평균 비용: $0.614; 평균 시간: 14.0분
용도에 맞는 모델 선택
디자인 시나리오를 선택하면 아래 다섯 가지 기준별로 모델을 하나씩 추천합니다.
GPT-6 Astra
- 평균 점수 평균 점수높을수록 좋음 평가된 모든 결과물의 평균 점수로, 100점 만점입니다.
- 82.7/100
- 평균 요구사항 충족도 요구사항 충족도높을수록 좋음 필수 페이지, 콘텐츠, 상태, 상호작용의 구현 여부를 30점 만점으로 평가합니다.
- 26.5/30
- 평균 디자인 품질 디자인 품질높을수록 좋음 레이아웃, 계층 구조, 스타일, 색상, 이미지 적합성을 70점 만점으로 평가합니다.
- 56.2/70
- 평균 납품 가능 비율 납품 가능 비율높을수록 좋음 평가된 결과물 중 80점 이상인 결과물의 비율입니다.
- 60.0%
- 평균 시간 평균 완료 시간낮을수록 좋음 채점된 결과물의 총 실행 시간을 결과물 수로 나눈 값입니다.
- 11.1분
- 결과물당 평균 비용 결과물당 비용낮을수록 좋음 공식 정가와 실측 토큰 사용량으로 추정합니다.
- $1.61/회
Claude Fable 5.1
- 평균 디자인 품질
- 53.2/70
- 평균 점수
- 80.3/100
- 평균 납품 가능 비율
- 56.7%
- 평균 요구사항 충족도
- 27.1/30
- 평균 시간
- 12.8분
- 결과물당 평균 비용
- $3.66/회
DeepSeek V4.1 Flash
- 평균 요구사항 충족도
- 28.4/30
- 평균 점수
- 81.2/100
- 평균 납품 가능 비율
- 57.7%
- 평균 디자인 품질
- 52.8/70
- 평균 시간
- 5.3분
- 결과물당 평균 비용
- $0.023/회
GPT-5.6 Sol
- 평균 시간
- 3.2분
- 평균 점수
- 77.6/100
- 평균 납품 가능 비율
- 53.3%
- 평균 요구사항 충족도
- 25.8/30
- 평균 디자인 품질
- 51.8/70
- 결과물당 평균 비용
- $0.544/회
Hunyuan H4 Preview
- 결과물당 평균 비용
- $0.418/회
- 평균 점수
- 74.6/100
- 평균 납품 가능 비율
- 40.0%
- 평균 요구사항 충족도
- 26.8/30
- 평균 디자인 품질
- 47.8/70
- 평균 시간
- 29.2분
품질과 비용
모델의 성능과 해당 결과를 얻는 데 필요한 비용을 비교합니다.
품질 순위
비용·품질 기준선
분홍색 영역의 모델 11개는 DeepSeek V4.1 Flash보다 비싸고 점수는 낮습니다.
시나리오별 성능
웹 앱(다중 페이지 구조와 흐름) 결과입니다. GPT-5.6 Sol이 83.1점으로 1위이며, 납품 가능 비율은 66.7%, 실행당 비용은 $0.537입니다.
모바일 앱(터치 경험과 반응형 레이아웃) 결과입니다. Hunyuan H4 Preview이 89.5점으로 1위이며, 납품 가능 비율은 83.3%, 실행당 비용은 $0.404입니다.
데스크톱 앱(데스크톱 작업 흐름과 복잡한 상호작용) 결과입니다. DeepSeek V4 Flash이 90.3점으로 1위이며, 납품 가능 비율은 83.3%, 실행당 비용은 $0.027입니다.
대시보드(정보 밀도와 계층 구조) 결과입니다. GPT-6 Astra이 86.3점으로 1위이며, 납품 가능 비율은 66.7%, 실행당 비용은 $1.65입니다.
랜딩 페이지(브랜드 표현과 전환) 결과입니다. Qwen 3.8-Max이 82.8점으로 1위이며, 납품 가능 비율은 66.7%, 실행당 비용은 $0.609입니다.
웹 앱 순위
웹 앱 · 비용·품질 기준선
분홍색 영역의 모델 10개는 DeepSeek V4.1 Flash보다 비싸고 점수는 낮습니다.
모바일 앱 순위
모바일 앱 · 비용·품질 기준선
분홍색 영역의 모델 8개는 DeepSeek V4.1 Flash보다 비싸고 점수는 낮습니다.
데스크톱 앱 순위
데스크톱 앱 · 비용·품질 기준선
분홍색 영역의 모델 9개는 DeepSeek V4.1 Flash보다 비싸고 점수는 낮습니다.
대시보드 순위
대시보드 · 비용·품질 기준선
분홍색 영역의 모델 3개는 DeepSeek V4.1 Flash보다 비싸고 점수는 낮습니다.
랜딩 페이지 순위
랜딩 페이지 · 비용·품질 기준선
분홍색 영역의 모델 9개는 DeepSeek V4.1 Flash보다 비싸고 점수는 낮습니다.
모델 효율
완료 시간, 캐시 적중률, 토큰 사용량을 비교합니다. 모든 수치는 실측 평균값입니다.
캐시 81% · 입력 318.7K · 출력 15.5K
캐시 89% · 입력 1462.8K · 출력 29.2K
캐시 94% · 입력 715.7K · 출력 63.6K
캐시 80.7% · 입력 236.6K · 출력 14.5K
캐시 90.9% · 입력 3085.9K · 출력 46.0K
캐시 91.3% · 입력 1422.1K · 출력 24.7K
캐시 58.7% · 입력 517.6K · 출력 10.1K
캐시 79% · 입력 836.8K · 출력 28.6K
캐시 91.9% · 입력 2809.3K · 출력 32.7K
캐시 71.3% · 입력 943.7K · 출력 28.4K
캐시 70.9% · 입력 392.3K · 출력 27.9K
캐시 31.5% · 입력 235.9K · 출력 13.4K
캐시 71.7% · 입력 427.1K · 출력 16.1K
평가 방법
요구사항 충족도와 디자인 품질을 평가하며, 효율과 비용은 별도로 제공합니다.
과제와 표본
모든 모델은 웹 앱, 모바일 앱, 데스크톱 앱, 대시보드 및 관리자 화면, 웹사이트 및 랜딩 페이지의 다섯 가지 시나리오에서 동일한 디자인 과제로 평가합니다. 결과는 실제 프로토타입 생성 과제에서의 성능을 나타내며, 모델의 전반적인 능력을 의미하지 않습니다.
페이지 렌더링 검사
채점에 앞서 각 결과물이 웹페이지로 열리는지 확인하고, 빈 페이지, 잘린 콘텐츠, 치명적인 실행 오류가 있는지 검사합니다. 렌더링되지 않는 결과물은 0점으로 처리하며, 재평가로 결과를 대체하지 않습니다. 정상적으로 열리는 것은 후속 평가의 전제 조건일 뿐, 요구사항을 충족하거나 납품 가능한 상태라는 뜻은 아닙니다.
요구사항 충족도와 디자인 품질
각 결과물은 100점 만점으로 평가합니다. 요구사항 충족도는 30점으로, 과제에 명시된 페이지와 모듈, 필수 콘텐츠, 인터페이스 상태, 상호작용을 확인하여 충족, 부분 충족, 미충족으로 평가합니다. 디자인 품질은 70점으로, 레이아웃과 가독성, 정보 계층, 스타일과 과제의 적합성, 색상과 대비, 이미지 적합성과 콘텐츠 관련성의 다섯 항목에 동일한 비중을 부여합니다. 각 항목은 충족, 부분 충족, 미충족으로 평가합니다.
평균 점수와 납품 가능 비율
평균 점수는 해당 모델의 채점된 모든 결과물 점수에 대한 산술평균입니다. 이번 평가에서는 80점 이상인 결과물을 납품 가능한 것으로 분류합니다. 납품 가능 비율은 채점된 결과물 중 이 기준을 충족한 비율로, 모델이 기준에 부합하는 결과물을 얼마나 일관되게 생성하는지 보여줍니다. 여기서 납품 가능이란 본 평가의 프로토타입 품질 기준을 충족한다는 의미이며, 실제 서비스에 바로 배포할 수 있다는 뜻은 아닙니다.
효율과 비용
완료 시간, 캐시 적중률, 입력·출력 토큰 사용량, 도구 호출 횟수는 실측 평균값으로 산출하여 품질 점수와 별도로 제공합니다. 각 결과물의 비용은 기록된 토큰 사용량에 표준 입력, 출력, 캐시 읽기 단가를 적용해 추정한 뒤 평균을 구합니다. 이 추정치는 자원 소비를 비교하기 위한 것으로 실제 청구 금액이 아니며, 기록되지 않은 요금은 제외합니다. 효율과 비용은 평가 점수에 반영하지 않습니다. 선택 우선순위를 변경하면 추천 순위만 달라지며, 원래 평가 결과는 유지됩니다.
