Salt la conținut
fedi.software

Dezvoltare web

Modele clasate după crearea de aplicații web funcționale dintr-un prompt în arena WebDev a LMArena, cu prețuri și context.

Actualizat · Surse: LMArena, LiteLLM, models.dev

Cost pe lună
Tier Model Elo Intrare / ieșire, per 1M Pe lună Context Aplicație Comparare
S1.6710,338 USD / 1,01 USD 1M
S1.6370,10 USD / 0,20 USD 262K
A1.5910,045 USD / 0,32 USD 262K
A1.5700,959 USD / 2,74 USD 1M
B1.5150,825 USD / 2,48 USD 1M
B1.4821,03 USD / 6,16 USD 262K
B1.4610,276 USD / 1,65 USD 1M
B1.3990,1644 USD / 0,9864 USDGratuit 262K
C1.3600,1126 USD / 0,9008 USDGratuit 262K
C1.3570,0846 USD / 0,6768 USD 262K
C1.2740,13 USD / 0,50 USDGratuit 262K
C1.2530,0564 USD / 0,4512 USD 262K
C1.2430,0282 USD / 0,282 USD 1M
D1.2380,25 USD / 0,80 USD 262K
Compară ()

Tier-urile sunt ale noastre: locul unui model în clasament, numărând doar modelele al căror interval de încredere este în întregime deasupra lui. S — primele 10%, A — până la 30%, B — până la 60%, C — până la 85%, D — restul.

Calitate și preț scorul pe verticală, prețul combinat (3 părți intrare : 1 ieșire) pe orizontală, USD per 1M de tokeni
1.000 1.200 1.400 1.600 1.800 2.000 0,01 USD 0,10 USD 1 USD 10 USD Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

Ce este arena WebDev?

Arena WebDev a LMArena compară modele care construiesc aplicații web funcționale. Două modele primesc aceeași cerere — de exemplu un joc simplu, o pagină de prezentare sau un mic instrument — și fiecare generează o aplicație care rulează. Oamenii încearcă ambele variante și votează aplicația mai bună, fără să știe ce model a creat-o. Voturile devin un scor Elo cu interval de încredere de 95%.

Ce anume se evaluează?

Rezultatul întreg: dacă aplicația pornește, cum arată, dacă face ce s-a cerut și cât de bine funcționează interacțiunile. Nu se evaluează doar stilul codului. Un model care scrie cod elegant, dar produce o interfață stricată, pierde voturi aici.

De ce lista diferă de celelalte clasamente?

Arena WebDev are propriul set de modele, diferit de clasamentele de text și de programare, iar voturile se adună separat. Un model poate fi în tier-ul S la Programare și mai jos aici, sau invers. Comparați modelele numai în interiorul aceluiași clasament.

Cum citesc tabelul?

  • Tier: regula comună — cel puțin 300 de voturi, locul calculat din intervalele de 95%, praguri de 10, 30, 60 și 85%.
  • Elo: scorul cu bara intervalului; intervalele care se suprapun înseamnă diferență neclară.
  • Prețuri: cel mai mic preț per 1M de tokeni găsit la furnizori, în USD; „Preț mic” înseamnă un preț combinat sub 1 USD.
  • Context: cât cod și câte instrucțiuni încap într-o cerere.

Ce limite are clasamentul?

Aplicațiile din arenă sunt mici, construite dintr-o singură cerere. Proiectele mari, cu multe fișiere, iterații și testare, nu sunt evaluate. Pentru munca pe un depozit real, priviți și clasamentul Agenți și paginile despre agenții de programare. Modelele fără suficiente voturi apar cu „Fără tier deocamdată”.

Cum folosesc clasamentul în practică?

Alegeți două sau trei modele din tier-urile de sus și dați-le aceeași sarcină din proiectul dumneavoastră. Comparați nu doar dacă aplicația merge, ci și cât de ușor se modifică apoi codul. Pagina Comparare pune modelele unul lângă altul, cu prețuri și context.