К содержимому
fedi.software

Веб-разработка

Модели, ранжированные по созданию работающих веб-приложений по запросу на арене WebDev от LMArena, с ценами и контекстом.

Обновлено · Источники: LMArena, LiteLLM, models.dev

Стоимость в месяц
Тир Модель Elo Вход / выход, за 1M В месяц Контекст Приложение Сравнить
A1 5700,959 $ / 2,74 $ 1M
C1 255— —
Сравнить ()

Тиры — наши: место модели в рейтинге с учётом только тех моделей, чей доверительный интервал целиком выше её. S — лучшие 10%, A — до 30%, B — до 60%, C — до 85%, D — остальные.

Качество и цена вверх — рейтинг, вправо — смешанная цена (3 части входа : 1 выхода), USD за 1M токенов
1 000 1 200 1 400 1 600 1 800 2 000 0,01 $ 0,10 $ 1 $ 10 $ Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

Что измеряет этот рейтинг

Страница строится по арене WebDev от LMArena. Двум анонимным моделям дают одно задание — собрать работающее веб-приложение: список дел, лендинг, простую игру. Получаются два приложения, и голосующий выбирает то, которое работает и выглядит лучше. Из голосов складывается рейтинг Elo с 95% доверительным интервалом.

У арены WebDev свой набор моделей. Часть моделей из текстового рейтинга и рейтинга программирования здесь отсутствует, а некоторые есть только тут, так что список не дублирует соседние страницы.

Как понимать оценку

Голос отражает результат целиком, каким его видит человек: запускается ли приложение, соответствует ли заданию, как выглядит интерфейс. Стиль кода сам по себе не оценивается. Поэтому рейтинг хорошо подсказывает, кто справится с прототипами и фронтендом, и хуже — кто потянет серверную логику, работу с базой данных или большой рефакторинг.

  • Тир — положение модели внутри этой арены.
  • Полоска вокруг рейтинга — доверительный интервал; пересекаются полоски — явной разницы нет.
  • Цены за миллион токенов, контекст и график за 30 дней — из models.dev и LiteLLM.

Тиры

Модель получает тир, когда у неё не меньше 300 голосов; до этого она отмечена «Тир ещё не присвоен». Место считается по числу моделей, чей интервал целиком выше, а доля таблицы определяет букву: до 10% — S, до 30% — A, до 60% — B, до 85% — C, остальные — D.

Границы метода

На арене собирают небольшие одностраничные проекты за один подход. Как модель ведёт себя в долгой сессии, в большом проекте с многолетней историей или с вашим фреймворком и библиотеками, голосование показать не может. Сверьтесь с рейтингом программирования, а если модель будет работать агентом — с рейтингом агентов.