본문으로 건너뛰기
fedi.software

에이전트

LMArena 에이전트 순위표에 따른 에이전트 작업(도구 호출, 여러 단계 작업) 모델 순위입니다. 점수는 Elo가 아니라 0을 중심으로 한 값입니다.

업데이트 · 출처: LMArena, LiteLLM, models.dev

월 비용
티어 모델 점수 입력 / 출력, 100만당 월 컨텍스트 앱 비교
B-0.007US$0.10 / US$0.20 262K
C-0.017US$0.045 / US$0.32 262K
D-0.124US$1.50 / US$7.50 256K
비교하기 ()

티어는 자체 기준입니다. 순위표에서 모델의 위치를 정할 때 신뢰 구간 전체가 그 모델보다 위에 있는 모델만 셉니다. S — 상위 10%, A — 30%까지, B — 60%까지, C — 85%까지, D — 나머지.

품질 대비 가격 세로축 평점, 가로축 혼합 가격(입력 3 : 출력 1), USD/100만 토큰
-0.2 -0.1 0.0 0.1 0.2 US$0.01 US$0.10 US$1 US$10 Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

먼저 알아 둘 점

이 보드의 숫자는 Elo가 아닙니다. LMArena 에이전트 리더보드는 0을 중심으로 음수에서 양수까지 움직이는 점수를 쓰며, 표에서도 「점수」 열에 소수점 셋째 자리까지 보여 줍니다. 다른 보드의 Elo와는 척도가 다르므로, 비교는 이 보드 안에서만 하십시오.

무엇을 평가하나요

도구를 호출하며 여러 단계를 거치는 작업을 사람이 평가한 결과입니다. 투표 단위는 대화 한 번이 아니라 작업 전체 세션입니다. 점수가 0보다 크면 이 보드의 평균 모델보다 더 자주 선택받았다는 뜻입니다.

  • 티어는 다른 보드와 같은 규칙(95% 신뢰 구간, 300표 기준)으로 계산합니다.
  • 가격과 컨텍스트 열은 텍스트 보드와 같습니다.
  • 「저렴한 가격」은 혼합 가격이 1M 토큰당 1 USD 미만입니다.

점수 읽는 예

점수가 양수인 모델과 음수인 모델이 있다면, 앞의 모델이 이 보드 안에서 선택받은 경우가 더 많았다고 읽으면 됩니다. 다만 95% 신뢰 구간이 겹치면 그 차이는 뚜렷하지 않습니다. 점수의 절댓값 자체에는 의미가 없으니, 순위와 티어로 판단하십시오. 세션이 300개에 못 미치는 모델은 「아직 티어 없음」입니다.

결과의 한계

아직 새로운 보드라 텍스트 보드보다 모델 수가 적습니다. 또 아레나에서 쓰는 에이전트 구조는 여러분이 쓸 도구와 다릅니다. 코딩 에이전트를 고를 때는 이 보드와 함께 코딩, 웹 개발 보드도 참고하십시오.