fedi-index: 에이전트
에이전트로서의 모델: 도구 사용과 다단계 작업 — Arena 에이전트 세션과 τ²-bench 실행 결과.
| # | 티어 | 모델 | fedi-index | 백분위 | 사람의 선호 | 문제 해결 | 가성비 | 소스 | 점수 구성 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | A | 1,491 ±8 | 100.0 | 1,503 | — | +47 | A | › | |
| 2 | A | 1,488 ±9 | 98 | 1,501 | — | +76◆ | A | › | |
| 3 | A | 1,481 ±10 | 96 | 1,494 | — | +12 | A | › | |
| 4 | A | 1,479 ±13 | 95 | 1,493 | — | +50 | A | › | |
| 5 | A | 1,475 ±6 | 93 | 1,479 | 1,466 | +59 | Aτ | › | |
| 6 | A | 1,475 ±12 | 91 | 1,488 | — | +53 | A | › | |
| 7 | A | 1,470 ±10 | 90 | 1,482 | — | +22 | A | › | |
| 8 | A | 1,470 ±6 | 88 | 1,477 | 1,453 | +33 | Aτ | › | |
| 9 | A | 1,467 ±6 | 86 | 1,469 | 1,464 | +40 | Aτ | › | |
| 10 | A | 1,465 ±6 | 84 | 1,470 | 1,453 | +27 | Aτ | › | |
| 11 | A | 1,462 ±8 | 82 | 1,473 | — | — | A | › | |
| 12 | A | 1,459 ±5 | 81 | 1,459 | 1,460 | +29 | Aτ | › | |
| 15 | B | 1,451 ±5 | 75 | 1,446 | 1,465 | +35 | Aτ | › | |
| 16 | B | 1,449 ±7 | 74 | 1,459 | — | +32 | A | › | |
| 18 | B | 1,449 ±3 | 70 | 1,458 | — | +74 | A | › | |
| 20 | B | 1,448 ±7 | 67 | 1,458 | — | +11 | A | › | |
| 21 | B | 1,447 ±5 | 65 | 1,445 | 1,453 | +39 | Aτ | › | |
| 22 | B | 1,444 ±4 | 63 | 1,454 | — | +84◆ | A | › | |
| 23 | B | 1,442 ±3 | 61 | 1,452 | — | +54 | A | › | |
| 25 | B | 1,437 ±5 | 58 | 1,446 | — | +80 | A | › | |
| 26 | B | 1,437 ±4 | 56 | 1,446 | — | +32 | A | › | |
| 28 | B | 1,433 ±5 | 53 | 1,442 | — | +38 | A | › | |
| 29 | B | 1,432 ±6 | 51 | 1,442 | — | +32 | A | › | |
| 31 | C | 1,429 ±4 | 47 | 1,419 | 1,454 | +58 | Aτ | › | |
| 34 | C | 1,426 ±3 | 42 | 1,435 | — | +80 | A | › | |
| 35 | C | 1,425 ±3 | 40 | 1,434 | — | +81 | A | › | |
| 37 | C | 1,422 ±13 | 37 | — | 1,454 | +35 | τ | › | |
| 38 | C | 1,417 ±3 | 35 | 1,426 | — | +62 | A | › | |
| 39 | C | 1,414 ±5 | 33 | 1,406 | 1,433 | +42 | Aτ | › | |
| 40 | C | 1,412 ±12 | 32 | — | 1,442 | +12 | τ | › | |
| 41 | C | 1,409 ±4 | 30 | 1,417 | — | +39 | A | › | |
| 43 | D | 1,407 ±12 | 25 | — | 1,435 | +41 | τ | › | |
| 44 | D | 1,407 ±12 | 25 | — | 1,435 | +57 | τ | › | |
| 45 | D | 1,404 ±12 | 23 | — | 1,432 | -2 | τ | › | |
| 46 | D | 1,404 ±11 | 21 | — | 1,432 | +2 | τ | › | |
| 48 | D | 1,400 ±6 | 18 | 1,408 | — | +52 | A | › | |
| 50 | D | 1,398 ±5 | 14 | 1,406 | — | +68 | A | › | |
| 51 | D | 1,396 ±10 | 12 | — | 1,422 | +33 | τ | › | |
| 52 | D | 1,392 ±9 | 10 | — | 1,416 | +5 | τ | › | |
| 58 | D | 1,362 ±8 | 0 | 1,368 | — | — | A | › |
AArena(사람 투표)ττ²-bench(에이전트) ◆ 파레토 경계: 더 좋으면서 더 저렴한 모델이 없음
fedi-index는 고정 척도의 Elo 환산값으로, 같은 방법론 버전 안에서는 월별로 비교할 수 있습니다. 등급 S–D: 분야 내 백분위로 정하되 신뢰 구간이 허용하는 수준을 넘지 않습니다(기준은 방법론 참고). ‘잠정’ — 여기서 이 모델을 측정한 소스 계열이 하나뿐입니다. 방법론
내 사이트에 삽입
표를 사이트용 위젯으로 넣으세요. 자동으로 업데이트되며 소스 출처 표기도 유지됩니다.