에이전트
LMArena 에이전트 순위표에 따른 에이전트 작업(도구 호출, 여러 단계 작업) 모델 순위입니다. 점수는 Elo가 아니라 0을 중심으로 한 값입니다.
업데이트 · 출처: LMArena, LiteLLM, models.dev
티어는 자체 기준입니다. 순위표에서 모델의 위치를 정할 때 신뢰 구간 전체가 그 모델보다 위에 있는 모델만 셉니다. S — 상위 10%, A — 30%까지, B — 60%까지, C — 85%까지, D — 나머지.
먼저 알아 둘 점
이 보드의 숫자는 Elo가 아닙니다. LMArena 에이전트 리더보드는 0을 중심으로 음수에서 양수까지 움직이는 점수를 쓰며, 표에서도 「점수」 열에 소수점 셋째 자리까지 보여 줍니다. 다른 보드의 Elo와는 척도가 다르므로, 비교는 이 보드 안에서만 하십시오.
무엇을 평가하나요
도구를 호출하며 여러 단계를 거치는 작업을 사람이 평가한 결과입니다. 투표 단위는 대화 한 번이 아니라 작업 전체 세션입니다. 점수가 0보다 크면 이 보드의 평균 모델보다 더 자주 선택받았다는 뜻입니다.
- 티어는 다른 보드와 같은 규칙(95% 신뢰 구간, 300표 기준)으로 계산합니다.
- 가격과 컨텍스트 열은 텍스트 보드와 같습니다.
- 「저렴한 가격」은 혼합 가격이 1M 토큰당 1 USD 미만입니다.
점수 읽는 예
점수가 양수인 모델과 음수인 모델이 있다면, 앞의 모델이 이 보드 안에서 선택받은 경우가 더 많았다고 읽으면 됩니다. 다만 95% 신뢰 구간이 겹치면 그 차이는 뚜렷하지 않습니다. 점수의 절댓값 자체에는 의미가 없으니, 순위와 티어로 판단하십시오. 세션이 300개에 못 미치는 모델은 「아직 티어 없음」입니다.
결과의 한계
아직 새로운 보드라 텍스트 보드보다 모델 수가 적습니다. 또 아레나에서 쓰는 에이전트 구조는 여러분이 쓸 도구와 다릅니다. 코딩 에이전트를 고를 때는 이 보드와 함께 코딩, 웹 개발 보드도 참고하십시오.