Тиры — наши: место модели в рейтинге с учётом только тех моделей, чей доверительный интервал целиком выше её. S — лучшие 10%, A — до 30%, B — до 60%, C — до 85%, D — остальные.
Качество и ценавверх — рейтинг, вправо — смешанная цена (3 части входа : 1 выхода), USD за 1M токенов
Что измеряет этот рейтинг
Страница строится по арене WebDev от LMArena. Двум анонимным моделям дают одно задание — собрать работающее веб-приложение: список дел, лендинг, простую игру. Получаются два приложения, и голосующий выбирает то, которое работает и выглядит лучше. Из голосов складывается рейтинг Elo с 95% доверительным интервалом.
У арены WebDev свой набор моделей. Часть моделей из текстового рейтинга и рейтинга программирования здесь отсутствует, а некоторые есть только тут, так что список не дублирует соседние страницы.
Как понимать оценку
Голос отражает результат целиком, каким его видит человек: запускается ли приложение, соответствует ли заданию, как выглядит интерфейс. Стиль кода сам по себе не оценивается. Поэтому рейтинг хорошо подсказывает, кто справится с прототипами и фронтендом, и хуже — кто потянет серверную логику, работу с базой данных или большой рефакторинг.
Тир — положение модели внутри этой арены.
Полоска вокруг рейтинга — доверительный интервал; пересекаются полоски — явной разницы нет.
Цены за миллион токенов, контекст и график за 30 дней — из models.dev и LiteLLM.
Тиры
Модель получает тир, когда у неё не меньше 300 голосов; до этого она отмечена «Тир ещё не присвоен». Место считается по числу моделей, чей интервал целиком выше, а доля таблицы определяет букву: до 10% — S, до 30% — A, до 60% — B, до 85% — C, остальные — D.
Границы метода
На арене собирают небольшие одностраничные проекты за один подход. Как модель ведёт себя в долгой сессии, в большом проекте с многолетней историей или с вашим фреймворком и библиотеками, голосование показать не может. Сверьтесь с рейтингом программирования, а если модель будет работать агентом — с рейтингом агентов.