Агенты
Модели, ранжированные по агентным задачам — вызовам инструментов и многошаговой работе — в агентском рейтинге LMArena. Его оценка отсчитывается от нуля, это не Elo.
Обновлено · Источники: LMArena, LiteLLM, models.dev
Тиры — наши: место модели в рейтинге с учётом только тех моделей, чей доверительный интервал целиком выше её. S — лучшие 10%, A — до 30%, B — до 60%, C — до 85%, D — остальные.
Что здесь сравнивают?
Страница следует рейтингу агентов LMArena. Моделям дают задачи в несколько шагов с вызовом инструментов — поиск, чтение файлов, запуск кода, — и люди решают, какая модель справилась лучше. Сравниваются не отдельные ответы, а целые сессии.
Почему вместо Elo колонка «Оценка»?
Этот рейтинг публикует не Elo, а показатель с центром в нуле. Модель выше нуля выбирали чаще, чем среднюю модель этой таблицы, ниже нуля — реже. Колонка называется «Оценка» и показывает три знака после запятой, а в качестве голосов считаются сессии. Шкала другая, поэтому эти числа нельзя сравнивать с Elo текстового рейтинга или рейтинга программирования — сравнивайте модели только внутри этой страницы.
Тиры считаются так же?
Да, правило от шкалы не зависит: важны только доверительные интервалы и доля таблицы. Для тира нужно не меньше 300 сессий. Место — один плюс число моделей, чей интервал целиком выше; первые 10% мест получают S, до 30% — A, до 60% — B, до 85% — C, остальные — D.
Что ещё видно в строке?
- производитель и пометка об открытых весах;
- минимальная цена за миллион токенов у провайдеров — по данным models.dev и LiteLLM;
- контекст: агенту, который много читает, нужен большой;
- график цены за 30 дней.
Какие есть оговорки?
Рейтинг моложе текстовой арены, моделей в нём меньше. К тому же окружение, в котором агенты работают на арене, не совпадает с тем, что будет у вас: модель, сильная там, может вести себя иначе в вашем агенте для кода или в сценарии автоматизации. Сами инструменты собраны на странице агентов для кода, а перед выбором стоит проверить двух-трёх кандидатов на реальной задаче из своей работы.