본문으로 건너뛰기
fedi.software

웹 개발

LMArena WebDev 아레나에서 프롬프트로 작동하는 웹 앱을 만드는 능력에 따른 모델 순위. 가격과 컨텍스트 포함.

업데이트 · 출처: LMArena, LiteLLM, models.dev

월 비용
티어 모델 Elo 입력 / 출력, 100만당 월 컨텍스트 앱 비교
B1,413US$0.95 / US$4.05무료 262K
B1,408US$0.45 / US$1.20 524K
C1,255— —
D1,190US$0.05 / US$0.10 131K
비교하기 ()

티어는 자체 기준입니다. 순위표에서 모델의 위치를 정할 때 신뢰 구간 전체가 그 모델보다 위에 있는 모델만 셉니다. S — 상위 10%, A — 30%까지, B — 60%까지, C — 85%까지, D — 나머지.

품질 대비 가격 세로축 평점, 가로축 혼합 가격(입력 3 : 출력 1), USD/100만 토큰
1,000 1,200 1,400 1,600 1,800 2,000 US$0.01 US$0.10 US$1 US$10 Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

앱을 만들게 해서 비교하는 아레나

이 보드는 LMArena의 WebDev 아레나를 바탕으로 합니다. 같은 요청문으로 두 모델이 각각 동작하는 웹 앱을 만들고, 사람은 완성된 앱을 직접 써 본 뒤 더 나은 쪽에 투표합니다. 답변 글이 아니라 실제로 동작하는 결과물로 비교한다는 점이 특징입니다.

평가받는 모델 구성은 텍스트나 코딩 보드와 다릅니다. 열 구성은 같아서 티어, 신뢰 구간이 붙은 Elo, 가격, 컨텍스트를 확인할 수 있습니다.

레이팅이 보여 주는 것

투표하는 사람은 화면 배치, 코드가 동작하는지, 요청대로 만들어졌는지를 한꺼번에 판단합니다. 그래서 레이팅은 코드 스타일만이 아니라 결과 전체의 완성도를 반영합니다.

  • 티어는 95% 신뢰 구간을 고려한 순위로 계산합니다.
  • 투표가 300표 미만인 모델은 「아직 티어 없음」입니다.
  • 「저렴한 가격」은 혼합 가격이 1M 토큰당 1 USD 미만입니다.

티어와 가격 보는 법

티어는 레이팅이 있고 투표가 300표 이상인 모델 가운데, 95% 신뢰 구간 전체가 자기보다 위에 있는 모델 수로 순위를 정하고, 그 비율로 S부터 D까지 나눕니다. 가격은 데이터 날짜에 찾은 최저가이며, 「품질 대비 가격」 차트에서는 입력 3 대 출력 1의 혼합 가격으로 비교합니다.

쓸 때 주의할 점

아레나에서 만드는 앱은 작은 규모입니다. 큰 프로젝트에서의 실력은 평가되지 않습니다. 실제 개발에 쓰기 전에 손에 익은 작은 과제로 시험해 보면 판단하기 쉽습니다. 같은 요청을 여러 모델에 맡겨 비교하고 싶다면 비교 페이지가 편합니다.