エージェント
エージェント的なタスク(ツール呼び出しや複数ステップの作業)でのモデルランキング。LMArenaのエージェントリーダーボードに基づきます。スコアはEloではなく、ゼロを中心とした値です。
更新日 · 出典: LMArena, LiteLLM, models.dev
ティアは当サイト独自のものです。ボード内での順位を、信頼区間全体がそのモデルより上にあるモデルだけを数えて決めます。S — 上位10%、A — 30%まで、B — 60%まで、C — 85%まで、D — それ以外。
最初に知っておきたいこと
このボードの数字は Elo ではありません。LMArena のエージェント用リーダーボードは、ゼロを中心に負から正の値をとる「スコア」を使っており、表でも「スコア」の列に小数点以下 3 桁で表示しています。ほかのボードの Elo と並べて比べることはできないので、比較はこのボードの中だけで行ってください。
何を評価しているか
ツールを呼び出しながら何段階も進める作業を、人が評価した結果です。投票の単位は一回ごとの対話ではなく、作業全体のセッションです。スコアがゼロより上なら、このボードの平均的なモデルより好まれることが多かったという意味になります。
- ティアはほかのボードと同じ規則(95% 信頼区間と 300 票の基準)で計算しています。
- 価格とコンテキストの列はテキストボードと同じです。
- 「低価格」は混合価格が 1M トークンあたり 1 USD 未満です。
スコアの読み方の例
たとえばスコアがプラスのモデルとマイナスのモデルがあれば、前者の方がこのボードの中で好まれる場面が多かったと読めます。ただし、95% 信頼区間が重なっていれば、その差ははっきりしません。スコアの絶対値そのものに意味はないので、「何点だから十分」とは考えず、順位とティアで判断してください。投票が 300 セッションに満たないモデルは「ティア未判定」です。
結果の限界
まだ新しいボードで、テキストボードより掲載モデルが少なめです。また、アリーナで使われているエージェントの仕組みは、あなたが使うツールとは違います。コーディングエージェントを選ぶときは、このボードに加えてコーディングやWeb 開発のボードも参考にしましょう。エージェントはあなたのパソコンでコマンドを実行するので、どのモデルを選んでも、変更の内容を確かめながら使うことが大切です。