fedi-index:エージェント
エージェントとしてのモデル:ツール利用とマルチステップのタスク — Arenaのエージェントセッションとτ²-benchの実行結果。
| # | ティア | モデル | fedi-index | パーセンタイル | 人間の評価 | タスク解決 | コスパ | ソース | スコアの内訳 |
|---|---|---|---|---|---|---|---|---|---|
| 13 | B | 1,456 ±5 | 79 | 1,459 | 1,449 | +44 | Aτ | › | |
| 14 | B | 1,454 ±5 | 77 | 1,456 | 1,449 | +45 | Aτ | › | |
| 17 | B | 1,449 ±2 | 72 | 1,459 | — | +92◆ | A | › | |
| 19 | B | 1,448 ±3 | 68 | 1,458 | — | — | A | › | |
| 24 | B | 1,442 ±3 | 60 | 1,451 | — | +60 | A | › | |
| 27 | B | 1,435 ±7 | 54 | 1,445 | — | +33 | A | › | |
| 30 | C | 1,430 ±2 | 49 | 1,439 | — | +105◆ | A | › | |
| 32 | C | 1,428 ±3 | 46 | 1,437 | — | — | A | › | |
| 33 | C | 1,428 ±6 | 44 | 1,438 | — | +98◆ | A | › | |
| 36 | C | 1,424 ±3 | 39 | 1,433 | — | +46 | A | › | |
| 42 | C | 1,408 ±5 | 28 | 1,416 | — | +68 | A | › | |
| 47 | D | 1,402 ±4 | 19 | 1,410 | — | +50 | A | › | |
| 49 | D | 1,399 ±4 | 16 | 1,407 | — | +80 | A | › | |
| 53 | D | 1,388 ±8 | 7 | — | 1,411 | +23 | τ | › | |
| 54 | D | 1,388 ±8 | 7 | — | 1,411 | +27 | τ | › | |
| 55 | D | 1,386 ±6 | 5 | 1,394 | — | +38 | A | › | |
| 56 | D | 1,384 ±4 | 4 | 1,392 | — | +26 | A | › | |
| 57 | D | 1,377 ±6 | 2 | 1,384 | — | -19 | A | › |
AArena(人間の投票)ττ²-bench(エージェント) ◆ パレートフロンティア:より高性能かつより安いモデルが存在しない
fedi-indexは固定スケール上のElo換算値で、同じ算出方法バージョン内なら月をまたいで比較できます。 ティアS–D:カテゴリ内のパーセンタイルで決まり、信頼区間が許す範囲を超えません(閾値は算出方法を参照)。 「暫定」— このモデルをここで測定したソースファミリーは1つのみです。 算出方法
ご自身のサイトに埋め込む
表をサイト用ウィジェットとして埋め込めます。自動で更新され、ソースのクレジット表記も保持されます。