본문으로 건너뛰기
fedi.software

fedi-index: 에이전트

에이전트로서의 모델: 도구 사용과 다단계 작업 — Arena 에이전트 세션과 τ²-bench 실행 결과.

2026-10 실시간 데이터(매일 재계산) · 방법론 v1 · 방법론 · 추이 · JSON

전체 오픈 웨이트 비공개
# 티어 모델 fedi-index 백분위 사람의 선호 문제 해결 가성비 소스 점수 구성
1A1,491 ±8100.01,503— +47 A›
2A1,488 ±9981,501— +76◆ A›
3A1,481 ±10961,494— +12 A›
4A1,479 ±13951,493— +50 A›
5A1,475 ±6931,4791,466 +59 Aτ›
6A1,475 ±12911,488— +53 A›
7A1,470 ±10901,482— +22 A›
8A1,470 ±6881,4771,453 +33 Aτ›
9A1,467 ±6861,4691,464 +40 Aτ›
10A1,465 ±6841,4701,453 +27 Aτ›
11A1,462 ±8821,473— — A›
12A1,459 ±5811,4591,460 +29 Aτ›
15B1,451 ±5751,4461,465 +35 Aτ›
16B1,449 ±7741,459— +32 A›
18B1,449 ±3701,458— +74 A›
20B1,448 ±7671,458— +11 A›
21B1,447 ±5651,4451,453 +39 Aτ›
22B1,444 ±4631,454— +84◆ A›
23B1,442 ±3611,452— +54 A›
25B1,437 ±5581,446— +80 A›
26B1,437 ±4561,446— +32 A›
28B1,433 ±5531,442— +38 A›
29B1,432 ±6511,442— +32 A›
31C1,429 ±4471,4191,454 +58 Aτ›
34C1,426 ±3421,435— +80 A›
35C1,425 ±3401,434— +81 A›
37C1,422 ±1337—1,454 +35 τ›
38C1,417 ±3351,426— +62 A›
39C1,414 ±5331,4061,433 +42 Aτ›
40C1,412 ±1232—1,442 +12 τ›
41C1,409 ±4301,417— +39 A›
43D1,407 ±1225—1,435 +41 τ›
44D1,407 ±1225—1,435 +57 τ›
45D1,404 ±1223—1,432 -2 τ›
46D1,404 ±1121—1,432 +2 τ›
48D1,400 ±6181,408— +52 A›
50D1,398 ±5141,406— +68 A›
51D1,396 ±1012—1,422 +33 τ›
52D1,392 ±910—1,416 +5 τ›
58D1,362 ±801,368— — A›

…

AArena(사람 투표)ττ²-bench(에이전트) ◆ 파레토 경계: 더 좋으면서 더 저렴한 모델이 없음

fedi-index는 고정 척도의 Elo 환산값으로, 같은 방법론 버전 안에서는 월별로 비교할 수 있습니다. 등급 S–D: 분야 내 백분위로 정하되 신뢰 구간이 허용하는 수준을 넘지 않습니다(기준은 방법론 참고). ‘잠정’ — 여기서 이 모델을 측정한 소스 계열이 하나뿐입니다. 방법론

내 사이트에 삽입

표를 사이트용 위젯으로 넣으세요. 자동으로 업데이트되며 소스 출처 표기도 유지됩니다.

JSON fedi-index © fedi.software, CC BY 4.0; 구성 요소는 각 소스의 라이선스를 따릅니다.