К содержимому
fedi.software

Веб-разработка

Модели, ранжированные по созданию работающих веб-приложений по запросу на арене WebDev от LMArena, с ценами и контекстом.

Обновлено · Источники: LMArena, LiteLLM, models.dev

Стоимость в месяц
Тир Модель Elo Вход / выход, за 1M В месяц Контекст Приложение Сравнить
S1 680— —
A1 5920,75 $ / 3,75 $ 1M
A1 5830,75 $ / 3,75 $ 1M
A1 5360,375 $ / 1,88 $ 1M
B1 4990,1857 $ / 1,11 $ 1M
B1 4461 $ / 6 $ 1M
–1 4400,15 $ / 1,25 $ 1M
B1 4390,57 $ / 3,43 $ 1M
B1 4390,07 $ / 0,43 $ 1M
B1 4130,95 $ / 4,05 $Бесплатно 262K
B1 4080,45 $ / 1,20 $ 524K
C1 3650,10 $ / 0,25 $Бесплатно 262K
C1 3580,042 $ / 0,22 $Бесплатно 262K
C1 348— 262K
C1 302— 33K
C1 2560,125 $ / 0,75 $ 1M
D1 2270,87 $ / 7 $ 1M
Сравнить ()

Тиры — наши: место модели в рейтинге с учётом только тех моделей, чей доверительный интервал целиком выше её. S — лучшие 10%, A — до 30%, B — до 60%, C — до 85%, D — остальные.

Качество и цена вверх — рейтинг, вправо — смешанная цена (3 части входа : 1 выхода), USD за 1M токенов
1 000 1 200 1 400 1 600 1 800 2 000 0,01 $ 0,10 $ 1 $ 10 $ Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

Что измеряет этот рейтинг

Страница строится по арене WebDev от LMArena. Двум анонимным моделям дают одно задание — собрать работающее веб-приложение: список дел, лендинг, простую игру. Получаются два приложения, и голосующий выбирает то, которое работает и выглядит лучше. Из голосов складывается рейтинг Elo с 95% доверительным интервалом.

У арены WebDev свой набор моделей. Часть моделей из текстового рейтинга и рейтинга программирования здесь отсутствует, а некоторые есть только тут, так что список не дублирует соседние страницы.

Как понимать оценку

Голос отражает результат целиком, каким его видит человек: запускается ли приложение, соответствует ли заданию, как выглядит интерфейс. Стиль кода сам по себе не оценивается. Поэтому рейтинг хорошо подсказывает, кто справится с прототипами и фронтендом, и хуже — кто потянет серверную логику, работу с базой данных или большой рефакторинг.

  • Тир — положение модели внутри этой арены.
  • Полоска вокруг рейтинга — доверительный интервал; пересекаются полоски — явной разницы нет.
  • Цены за миллион токенов, контекст и график за 30 дней — из models.dev и LiteLLM.

Тиры

Модель получает тир, когда у неё не меньше 300 голосов; до этого она отмечена «Тир ещё не присвоен». Место считается по числу моделей, чей интервал целиком выше, а доля таблицы определяет букву: до 10% — S, до 30% — A, до 60% — B, до 85% — C, остальные — D.

Границы метода

На арене собирают небольшие одностраничные проекты за один подход. Как модель ведёт себя в долгой сессии, в большом проекте с многолетней историей или с вашим фреймворком и библиотеками, голосование показать не может. Сверьтесь с рейтингом программирования, а если модель будет работать агентом — с рейтингом агентов.