К содержимому
fedi.software

Агенты

Модели, ранжированные по агентным задачам — вызовам инструментов и многошаговой работе — в агентском рейтинге LMArena. Его оценка отсчитывается от нуля, это не Elo.

Обновлено · Источники: LMArena, LiteLLM, models.dev

Стоимость в месяц
Тир Модель Оценка Вход / выход, за 1M В месяц Контекст Приложение Сравнить
S0,1238 $ / 40 $ 1M
S0,1122 $ / 10 $ 1M
S0,0971,60 $ / 8 $ 1M
S0,076— —
A0,0642 $ / 10 $ 1M
A0,0421,50 $ / 12 $ 1M
A0,0300,75 $ / 3,75 $ 1M
B0,0140,08 $ / 0,40 $ 1M
B0,0100,75 $ / 6 $ 1M
B0,0041,50 $ / 2 $ 1M
B-0,0120,06 $ / 0,37 $ 1M
B-0,0150,75 $ / 3,75 $ 1M
C-0,0770,375 $ / 1,88 $ 1M
C-0,0771 $ / 6 $ 1M
D-0,159— —
Сравнить ()

Тиры — наши: место модели в рейтинге с учётом только тех моделей, чей доверительный интервал целиком выше её. S — лучшие 10%, A — до 30%, B — до 60%, C — до 85%, D — остальные.

Качество и цена вверх — рейтинг, вправо — смешанная цена (3 части входа : 1 выхода), USD за 1M токенов
-0,2 -0,1 0,0 0,1 0,2 0,01 $ 0,10 $ 1 $ 10 $ Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Что здесь сравнивают?

Страница следует рейтингу агентов LMArena. Моделям дают задачи в несколько шагов с вызовом инструментов — поиск, чтение файлов, запуск кода, — и люди решают, какая модель справилась лучше. Сравниваются не отдельные ответы, а целые сессии.

Почему вместо Elo колонка «Оценка»?

Этот рейтинг публикует не Elo, а показатель с центром в нуле. Модель выше нуля выбирали чаще, чем среднюю модель этой таблицы, ниже нуля — реже. Колонка называется «Оценка» и показывает три знака после запятой, а в качестве голосов считаются сессии. Шкала другая, поэтому эти числа нельзя сравнивать с Elo текстового рейтинга или рейтинга программирования — сравнивайте модели только внутри этой страницы.

Тиры считаются так же?

Да, правило от шкалы не зависит: важны только доверительные интервалы и доля таблицы. Для тира нужно не меньше 300 сессий. Место — один плюс число моделей, чей интервал целиком выше; первые 10% мест получают S, до 30% — A, до 60% — B, до 85% — C, остальные — D.

Что ещё видно в строке?

  • производитель и пометка об открытых весах;
  • минимальная цена за миллион токенов у провайдеров — по данным models.dev и LiteLLM;
  • контекст: агенту, который много читает, нужен большой;
  • график цены за 30 дней.

Какие есть оговорки?

Рейтинг моложе текстовой арены, моделей в нём меньше. К тому же окружение, в котором агенты работают на арене, не совпадает с тем, что будет у вас: модель, сильная там, может вести себя иначе в вашем агенте для кода или в сценарии автоматизации. Сами инструменты собраны на странице агентов для кода, а перед выбором стоит проверить двух-трёх кандидатов на реальной задаче из своей работы.