К содержимому
fedi.software

Программирование

Модели, ранжированные по задачам программирования: тир, Elo с доверительным интервалом, цена за миллион токенов и контекстное окно.

Обновлено · Источники: LMArena, LiteLLM, models.dev

Стоимость в месяц
Тир Модель Elo Вход / выход, за 1M В месяц Контекст Приложение Сравнить
S1 5020,338 $ / 1,01 $ 1M
S1 4920,1857 $ / 1,11 $ 1M
S1 4920,375 $ / 1,88 $ 1M
S1 4850,045 $ / 0,32 $ 262K
S1 4730,282 $ / 1,13 $ 1M
A1 4670,276 $ / 1,65 $ 1M
A1 4640,1644 $ / 0,9864 $Бесплатно 262K
A1 4600,07 $ / 0,43 $ 1M
A1 4590,10 $ / 0,25 $Бесплатно 262K
A1 4560,36 $ / 1,43 $ 262K
A1 4520,15 $ / 1,25 $ 1M
A1 4460,042 $ / 0,22 $Бесплатно 262K
A1 4450,09 $ / 0,55 $ 131K
A1 4400,144 $ / 0,574 $Бесплатно 131K
A1 4380,20 $ / 0,88 $ 131K
A1 4360,1126 $ / 0,9008 $Бесплатно 262K
A1 4270,0846 $ / 0,6768 $ 262K
A1 4250,287 $ / 2,87 $ 131K
A1 4240,11 $ / 0,60 $ 131K
A1 4240,09 $ / 0,71 $ 1M
B1 4160,09 $ / 0,30 $ 256K
B1 4120,13 $ / 0,50 $Бесплатно 262K
B1 4120,0282 $ / 0,282 $ 1M
B1 4100,0564 $ / 0,4512 $ 262K
B1 4000,30 $ / 2,50 $ 1M
B1 4000,125 $ / 0,75 $ 1M
B1 3920,15 $ / 0,65 $ 131K
B1 3730,10 $ / 0,10 $ 1M
B1 3720,09 $ / 0,36 $ 1M
B1 3580,05 $ / 0,10 $ 131K
B1 3510,10 $ / 0,42 $ 990K
B1 3370,0509 $ / 0,335 $ 41K
B1 3330,18 $ / 0,20 $ 24K
B1 3280,115 $ / 0,287 $ 1M
B1 3220,08 $ / 0,16 $Бесплатно 131K
B1 3220,052 $ / 0,21 $ 990K
B1 2920,12 $ / 0,30 $ 131K
B1 2880,345 $ / 1,38 $ 33K
B1 2810,05 $ / 0,10 $Бесплатно 131K
B1 2760,06 $ / 0,20 $Бесплатно 33K
C1 2300,04 $ / 0,08 $Бесплатно 131K
C1 2110,65 $ / 0,65 $ 8K
C1 1960,90 $ / 0,90 $ 33K
C1 1740,20 $ / 0,20 $ 8K
D1 0480,15 $ / 0,15 $ 8K
Сравнить ()

Тиры — наши: место модели в рейтинге с учётом только тех моделей, чей доверительный интервал целиком выше её. S — лучшие 10%, A — до 30%, B — до 60%, C — до 85%, D — остальные.

Качество и цена вверх — рейтинг, вправо — смешанная цена (3 части входа : 1 выхода), USD за 1M токенов
1 000 1 200 1 400 1 600 0,01 $ 0,10 $ 1 $ 10 $ 100 $ MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Чем этот рейтинг отличается от текстового?

Методика та же — два анонимных ответа и голос человека, — но в зачёт идут только запросы о программировании из категории coding текстовой арены LMArena: написать функцию, найти ошибку, объяснить чужой код, переписать фрагмент. У каждой модели — рейтинг Elo с 95% доверительным интервалом.

А веб-разработка и агенты — это не то же самое?

Нет. Здесь оцениваются ответы в чате о коде. Как модель собирает целое веб-приложение по одному запросу, показывает отдельный рейтинг веб-разработки, а многошаговую работу с инструментами — рейтинг агентов. Модель может быть сильна в одном и заметно слабее в другом, поэтому для помощника программиста стоит заглянуть во все три.

Какие колонки важны для кода?

  • тир и рейтинг Elo с полоской интервала;
  • цена за миллион входных и выходных токенов у самого дешёвого провайдера;
  • контекст — сколько кода модель примет за один запрос, что критично при работе с целым репозиторием;
  • график цены за 30 дней.

Калькулятор здесь особенно полезен. При работе с кодом модели отправляют гораздо больше, чем получают в ответ, так что поставьте долю входных токенов повыше — и увидите реальную стоимость месяца для каждой модели.

Как считаются тиры?

По общему правилу раздела. Нужно не меньше 300 голосов. Место модели — это один плюс число моделей, у которых весь доверительный интервал выше её собственного. Если место попадает в первые 10% таблицы — S, до 30% — A, до 60% — B, до 85% — C, дальше — D. Лидеры, между которыми нет статистической разницы, делят S.

Откуда цены?

Из models.dev и LiteLLM, с ежедневным обновлением. Мы храним историю, поэтому видно, дешевеет модель или дорожает.

О чём помнить?

Голосование за ответ в чате — не то же самое, что прогон тестов на реальном проекте. Модель может красиво объяснить решение, а её код всё равно не соберётся в вашем окружении; к тому же запросы на арене короткие. Используйте рейтинг, чтобы сузить выбор, а затем проверьте две-три модели на своём коде.