Przejdź do treści
fedi.software

Web dev

Modele uszeregowane według tworzenia działających aplikacji webowych z promptu na arenie WebDev LMArena, z cenami i kontekstem.

Zaktualizowano · Źródła: LMArena, LiteLLM, models.dev

Koszt miesięczny
Tier Model Elo Wejście / wyjście, za 1M Miesięcznie Kontekst Aplikacja Porównaj
S1 680— —
S1 6230,40 USD / 1,40 USDZa darmo 1M
A1 6160,03 USD / 0,10 USDZa darmo 1M
A1 6050,30 USD / 1,05 USDZa darmo 1M
A1 5920,75 USD / 3,75 USD 1M
A1 5830,75 USD / 3,75 USD 1M
A1 5360,375 USD / 1,88 USD 1M
B1 5080,45 USD / 2,15 USD 200K
B1 4990,1857 USD / 1,11 USD 1M
B1 4461 USD / 6 USD 1M
–1 4400,15 USD / 1,25 USD 1M
B1 4390,57 USD / 3,43 USD 1M
B1 4390,07 USD / 0,43 USD 1M
B1 4340,2740 USD / 1,10 USD 205K
B1 4340,40 USD / 1,75 USD 205K
B1 4000,7042 USD / 3,10 USD 200K
C1 3650,10 USD / 0,25 USDZa darmo 262K
C1 3580,042 USD / 0,22 USDZa darmo 262K
C1 3390,2740 USD / 1,10 USD 205K
C1 2560,125 USD / 0,75 USD 1M
D1 2270,87 USD / 7 USD 1M
D1 1700,25 USD / 0,75 USD 128K
Porównaj ()

Tiery są nasze: miejsce modelu w rankingu liczone tylko względem modeli, których cały przedział ufności leży powyżej. S — górne 10%, A — do 30%, B — do 60%, C — do 85%, D — reszta.

Jakość a cena ocena w pionie, cena łączona (3 części wejścia : 1 wyjścia) w poziomie, USD za 1M tokenów
1 000 1 200 1 400 1 600 1 800 2 000 0,01 USD 0,10 USD 1 USD 10 USD Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

Arena, w której modele budują aplikacje

Ranking WebDev pochodzi z osobnej areny LMArena. Dwa anonimowe modele dostają to samo polecenie i każdy buduje działającą aplikację webową – stronę, grę w przeglądarce, prosty panel. Człowiek ogląda oba wyniki, klika w nie i głosuje na lepszą aplikację. Głosy zamieniają się w ocenę Elo, tak jak na pozostałych arenach.

Na tej arenie występuje własny zestaw modeli, inny niż w rankingu tekstowym i programistycznym, więc nie każdy model z tamtych tabel znajdziesz tutaj.

Co oznacza ocena

Ocena odzwierciedla cały efekt: wygląd strony, działający kod i to, na ile model trzymał się polecenia. Nie jest to więc ocena samego stylu kodu. Model, który pisze elegancki kod, ale zapomina o połowie wymagań, przegra z modelem, którego aplikacja po prostu działa i wygląda tak, jak chciał użytkownik.

Kolumny i tiery

  • tier od S do D, liczony według tej samej zasady co w rankingu tekstowym (co najmniej 300 głosów, przedział ufności 95%);
  • Elo z paskiem przedziału – nakładające się paski oznaczają brak pewnej różnicy;
  • ceny za 1M tokenów wejścia i wyjścia oraz okno kontekstu;
  • modele z mniejszą liczbą głosów oznaczamy „Jeszcze bez tieru”.

Ograniczenia

Aplikacje tworzone na arenie są małe. Ranking nie mówi, jak model poradzi sobie z dużym projektem, istniejącym kodem firmy czy długą serią poprawek. Do takich zadań zajrzyj też do rankingu programowania i agentów, a kandydatów zestaw na stronie porównania.

Jak korzystać z tabeli

Jeśli budujesz prototypy stron lub małe narzędzia, zacznij od modeli z tieru S i A, a potem sprawdź ich ceny i okno kontekstu. Filtry „Otwarte wagi” i „Niska cena” pomogą znaleźć tańsze lub samodzielnie hostowane modele. Pamiętaj, że miejsce w tabeli to obraz jednego dnia – czołówka zmienia się często, gdy pojawiają się nowe modele.