Hopp til innholdet
fedi.software

Webutvikling

Modeller rangert etter hvordan de bygger fungerende webapper fra en prompt i LMArenas WebDev-arena, med priser og kontekst.

Oppdatert · Kilder: LMArena, LiteLLM, models.dev

Kostnad per måned
Nivå Modell Elo Input / output, per 1 mill. Per måned Kontekst App Sammenlign
C1 370USD 0,03 / USD 0,12 524K
C1 348— 262K
C1 302— 33K
D1 170USD 0,25 / USD 0,75 128K

Nivåene er våre: en modells plass på rangeringen, der bare modeller med hele konfidensintervallet over den telles. S — topp 10 %, A — opptil 30 %, B — opptil 60 %, C — opptil 85 %, D — resten.

Kvalitet mot pris vurdering loddrett, blandet pris (3 deler input : 1 output) vannrett, USD per 1 mill. tokens
1 000 1 200 1 400 1 600 1 800 2 000 USD 0,01 USD 0,10 USD 1 USD 10 Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

Hvordan vurderes modellene?

Topplisten for webutvikling bygger på LMArenas WebDev-arena. To anonyme modeller får samme beskrivelse av en nettapp – for eksempel en gjøremålsliste, en enkel nettbutikk eller et lite spill – og bygger hver sin fungerende versjon. Den som sendte oppgaven, prøver begge og stemmer på appen som ble best. Stemmene blir til en Elo-vurdering med 95 %-konfidensintervall.

Hva sier vurderingen noe om?

Den gjenspeiler hele resultatet: oppsett, kode som faktisk virker, og hvor godt appen følger bestillingen. Det handler altså ikke bare om kodestil eller hvor pent svaret er formulert.

Hva viser tabellen?

  • tier og Elo med konfidensintervall;
  • laveste aktuelle pris per 1M tokens og prisutvikling over 30 dager;
  • kontekstvindu, og i detaljvisningen leverandører, lisens og lanseringsdato;
  • avkrysningsboksen «Sammenlign» for opptil 4 modeller.

Hvorfor mangler en modell jeg kjenner?

WebDev-arenaen har sitt eget utvalg av modeller, som er forskjellig fra topplistene for tekst og koding. En modell kan derfor mangle her selv om den finnes der, og omvendt.

Hvordan regnes tier?

Som på alle topplistene våre: modeller med minst 300 stemmer rangeres etter hvor mange modeller som har hele 95 %-intervallet sitt over deres eget. Plass innenfor 10 % av listen gir S, innenfor 30 % A, innenfor 60 % B, innenfor 85 % C og resten D. Den som har færre stemmer, står som «Ikke plassert ennå», og modeller som statistisk ikke kan skilles fra lederen, deler førsteplassen.

Hva bør jeg være obs på?

Appene i arenaen er små. Store prosjekter med mange filer, databaser og innlogging vurderes ikke, så en høy vurdering her sier ikke sikkert noe om hvordan modellen takler din eksisterende kodebase. Bruk listen til å finne kandidater, prøv dem på en liten oppgave fra ditt eget prosjekt, og sammenlign deretter pris og kontekst. Vurderingene kommer fra LMArena WebDev og prisene fra models.dev og LiteLLM, oppdatert daglig.