К содержимому
fedi.software

Агенты

Модели, ранжированные по агентным задачам — вызовам инструментов и многошаговой работе — в агентском рейтинге LMArena. Его оценка отсчитывается от нуля, это не Elo.

Обновлено · Источники: LMArena, LiteLLM, models.dev

Стоимость в месяц
Тир Модель Оценка Вход / выход, за 1M В месяц Контекст Приложение Сравнить
A0,0401,60 $ / 4,80 $ 500K
A0,0350,30 $ / 1,05 $Бесплатно 1M
B0,0240,40 $ / 1,40 $Бесплатно 1M
B0,0131,25 $ / 6 $ 500K
B0,0122 $ / 6 $ 500K
B-0,0040,03 $ / 0,10 $Бесплатно 1M
Сравнить ()

Тиры — наши: место модели в рейтинге с учётом только тех моделей, чей доверительный интервал целиком выше её. S — лучшие 10%, A — до 30%, B — до 60%, C — до 85%, D — остальные.

Качество и цена вверх — рейтинг, вправо — смешанная цена (3 части входа : 1 выхода), USD за 1M токенов
-0,2 -0,1 0,0 0,1 0,2 0,01 $ 0,10 $ 1 $ 10 $ Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Что здесь сравнивают?

Страница следует рейтингу агентов LMArena. Моделям дают задачи в несколько шагов с вызовом инструментов — поиск, чтение файлов, запуск кода, — и люди решают, какая модель справилась лучше. Сравниваются не отдельные ответы, а целые сессии.

Почему вместо Elo колонка «Оценка»?

Этот рейтинг публикует не Elo, а показатель с центром в нуле. Модель выше нуля выбирали чаще, чем среднюю модель этой таблицы, ниже нуля — реже. Колонка называется «Оценка» и показывает три знака после запятой, а в качестве голосов считаются сессии. Шкала другая, поэтому эти числа нельзя сравнивать с Elo текстового рейтинга или рейтинга программирования — сравнивайте модели только внутри этой страницы.

Тиры считаются так же?

Да, правило от шкалы не зависит: важны только доверительные интервалы и доля таблицы. Для тира нужно не меньше 300 сессий. Место — один плюс число моделей, чей интервал целиком выше; первые 10% мест получают S, до 30% — A, до 60% — B, до 85% — C, остальные — D.

Что ещё видно в строке?

  • производитель и пометка об открытых весах;
  • минимальная цена за миллион токенов у провайдеров — по данным models.dev и LiteLLM;
  • контекст: агенту, который много читает, нужен большой;
  • график цены за 30 дней.

Какие есть оговорки?

Рейтинг моложе текстовой арены, моделей в нём меньше. К тому же окружение, в котором агенты работают на арене, не совпадает с тем, что будет у вас: модель, сильная там, может вести себя иначе в вашем агенте для кода или в сценарии автоматизации. Сами инструменты собраны на странице агентов для кода, а перед выбором стоит проверить двух-трёх кандидатов на реальной задаче из своей работы.