fedi-index: Agents
Models as agents: tool use and multi-step tasks — Arena agent sessions and τ²-bench runs.
Live data for 2026-10 (recalculated daily) · Methodology v1 · Methodology · History · JSON
| # | Tier | Model | fedi-index | Percentile | People prefer | Solves tasks | Value | Sources | Score decomposition |
|---|---|---|---|---|---|---|---|---|---|
| 1 | A | 1,491 ±8 | 100.0 | 1,503 | — | +47 | A | › | |
| 2 | A | 1,488 ±9 | 98 | 1,501 | — | +76◆ | A | › | |
| 3 | A | 1,481 ±10 | 96 | 1,494 | — | +12 | A | › | |
| 4 | A | 1,479 ±13 | 95 | 1,493 | — | +50 | A | › | |
| 5 | A | 1,475 ±6 | 93 | 1,479 | 1,466 | +59 | Aτ | › | |
| 6 | A | 1,475 ±12 | 91 | 1,488 | — | +53 | A | › | |
| 7 | A | 1,470 ±10 | 90 | 1,482 | — | +22 | A | › | |
| 8 | A | 1,470 ±6 | 88 | 1,477 | 1,453 | +33 | Aτ | › | |
| 9 | A | 1,467 ±6 | 86 | 1,469 | 1,464 | +40 | Aτ | › | |
| 10 | A | 1,465 ±6 | 84 | 1,470 | 1,453 | +27 | Aτ | › | |
| 11 | A | 1,462 ±8 | 82 | 1,473 | — | — | A | › | |
| 12 | A | 1,459 ±5 | 81 | 1,459 | 1,460 | +29 | Aτ | › | |
| 15 | B | 1,451 ±5 | 75 | 1,446 | 1,465 | +35 | Aτ | › | |
| 16 | B | 1,449 ±7 | 74 | 1,459 | — | +32 | A | › | |
| 18 | B | 1,449 ±3 | 70 | 1,458 | — | +74 | A | › | |
| 20 | B | 1,448 ±7 | 67 | 1,458 | — | +11 | A | › | |
| 21 | B | 1,447 ±5 | 65 | 1,445 | 1,453 | +39 | Aτ | › | |
| 22 | B | 1,444 ±4 | 63 | 1,454 | — | +84◆ | A | › | |
| 23 | B | 1,442 ±3 | 61 | 1,452 | — | +54 | A | › | |
| 25 | B | 1,437 ±5 | 58 | 1,446 | — | +80 | A | › | |
| 26 | B | 1,437 ±4 | 56 | 1,446 | — | +32 | A | › | |
| 28 | B | 1,433 ±5 | 53 | 1,442 | — | +38 | A | › | |
| 29 | B | 1,432 ±6 | 51 | 1,442 | — | +32 | A | › | |
| 31 | C | 1,429 ±4 | 47 | 1,419 | 1,454 | +58 | Aτ | › | |
| 34 | C | 1,426 ±3 | 42 | 1,435 | — | +80 | A | › | |
| 35 | C | 1,425 ±3 | 40 | 1,434 | — | +81 | A | › | |
| 37 | C | 1,422 ±13 | 37 | — | 1,454 | +35 | τ | › | |
| 38 | C | 1,417 ±3 | 35 | 1,426 | — | +62 | A | › | |
| 39 | C | 1,414 ±5 | 33 | 1,406 | 1,433 | +42 | Aτ | › | |
| 40 | C | 1,412 ±12 | 32 | — | 1,442 | +12 | τ | › | |
| 41 | C | 1,409 ±4 | 30 | 1,417 | — | +39 | A | › | |
| 43 | D | 1,407 ±12 | 25 | — | 1,435 | +41 | τ | › | |
| 44 | D | 1,407 ±12 | 25 | — | 1,435 | +57 | τ | › | |
| 45 | D | 1,404 ±12 | 23 | — | 1,432 | -2 | τ | › | |
| 46 | D | 1,404 ±11 | 21 | — | 1,432 | +2 | τ | › | |
| 48 | D | 1,400 ±6 | 18 | 1,408 | — | +52 | A | › | |
| 50 | D | 1,398 ±5 | 14 | 1,406 | — | +68 | A | › | |
| 51 | D | 1,396 ±10 | 12 | — | 1,422 | +33 | τ | › | |
| 52 | D | 1,392 ±9 | 10 | — | 1,416 | +5 | τ | › | |
| 58 | D | 1,362 ±8 | 0 | 1,368 | — | — | A | › |
AArena (human votes)ττ²-bench (agents) ◆ Pareto frontier: nothing is both better and cheaper
fedi-index is an Elo-equivalent on a fixed scale: comparable between months within one methodology version. Tiers S–D: by percentile in the slice, and no better than the confidence interval allows (cut-offs in the methodology). “Provisional” — only one source family measured the model here. Methodology
Embed on your site
The table as a widget for your site: it updates by itself and keeps the attribution of the sources.