本文へスキップ
fedi.software

fedi-index:エージェント

エージェントとしてのモデル:ツール利用とマルチステップのタスク — Arenaのエージェントセッションとτ²-benchの実行結果。

2026-10のライブデータ(毎日再計算) · 算出方法 v1 · 算出方法 · 推移 · JSON

# ティア モデル fedi-index パーセンタイル 人間の評価 タスク解決 コスパ ソース スコアの内訳
1A1,491 ±8100.01,503— +47 A›
2A1,488 ±9981,501— +76◆ A›
3A1,481 ±10961,494— +12 A›
4A1,479 ±13951,493— +50 A›
5A1,475 ±6931,4791,466 +59 Aτ›
6A1,475 ±12911,488— +53 A›
7A1,470 ±10901,482— +22 A›
8A1,470 ±6881,4771,453 +33 Aτ›
9A1,467 ±6861,4691,464 +40 Aτ›
10A1,465 ±6841,4701,453 +27 Aτ›
11A1,462 ±8821,473— — A›
12A1,459 ±5811,4591,460 +29 Aτ›
15B1,451 ±5751,4461,465 +35 Aτ›
16B1,449 ±7741,459— +32 A›
18B1,449 ±3701,458— +74 A›
20B1,448 ±7671,458— +11 A›
21B1,447 ±5651,4451,453 +39 Aτ›
22B1,444 ±4631,454— +84◆ A›
23B1,442 ±3611,452— +54 A›
25B1,437 ±5581,446— +80 A›
26B1,437 ±4561,446— +32 A›
28B1,433 ±5531,442— +38 A›
29B1,432 ±6511,442— +32 A›
31C1,429 ±4471,4191,454 +58 Aτ›
34C1,426 ±3421,435— +80 A›
35C1,425 ±3401,434— +81 A›
37C1,422 ±1337—1,454 +35 τ›
38C1,417 ±3351,426— +62 A›
39C1,414 ±5331,4061,433 +42 Aτ›
40C1,412 ±1232—1,442 +12 τ›
41C1,409 ±4301,417— +39 A›
43D1,407 ±1225—1,435 +41 τ›
44D1,407 ±1225—1,435 +57 τ›
45D1,404 ±1223—1,432 -2 τ›
46D1,404 ±1121—1,432 +2 τ›
48D1,400 ±6181,408— +52 A›
50D1,398 ±5141,406— +68 A›
51D1,396 ±1012—1,422 +33 τ›
52D1,392 ±910—1,416 +5 τ›
58D1,362 ±801,368— — A›

…

AArena(人間の投票)ττ²-bench(エージェント) ◆ パレートフロンティア:より高性能かつより安いモデルが存在しない

fedi-indexは固定スケール上のElo換算値で、同じ算出方法バージョン内なら月をまたいで比較できます。 ティアS–D:カテゴリ内のパーセンタイルで決まり、信頼区間が許す範囲を超えません(閾値は算出方法を参照)。 「暫定」— このモデルをここで測定したソースファミリーは1つのみです。 算出方法

ご自身のサイトに埋め込む

表をサイト用ウィジェットとして埋め込めます。自動で更新され、ソースのクレジット表記も保持されます。

JSON fedi-index © fedi.software、CC BY 4.0。各要素はそれぞれのソースのライセンスに従います。