Hopp til innholdet
fedi.software

Webutvikling

Modeller rangert etter hvordan de bygger fungerende webapper fra en prompt i LMArenas WebDev-arena, med priser og kontekst.

Oppdatert · Kilder: LMArena, LiteLLM, models.dev

Kostnad per måned
Nivå Modell Elo Input / output, per 1 mill. Per måned Kontekst App Sammenlign
S1 671USD 0,338 / USD 1,01 1M
S1 637USD 0,10 / USD 0,20 262K
S1 623USD 0,40 / USD 1,40Gratis 1M
S1 620USD 0,0015 / USD 0,09Gratis 1M
A1 616USD 0,03 / USD 0,10Gratis 1M
A1 605USD 0,30 / USD 1,05Gratis 1M
A1 591USD 0,045 / USD 0,32 262K
A1 583USD 0,2088 / USD 0,4176 1M
A1 581USD 0,035 / USD 0,07 1M
B1 515USD 0,825 / USD 2,48 1M
B1 508USD 0,45 / USD 2,15 200K
B1 482USD 1,03 / USD 6,16 262K
B1 461USD 0,276 / USD 1,65 1M
B1 434USD 0,2740 / USD 1,10 205K
B1 434USD 0,40 / USD 1,75 205K
B1 400USD 0,7042 / USD 3,10 200K
B1 399USD 0,1644 / USD 0,9864Gratis 262K
C1 362USD 0,18 / USD 0,35 164K
C1 360USD 0,1126 / USD 0,9008Gratis 262K
C1 357USD 0,0846 / USD 0,6768 262K
C1 339USD 0,2740 / USD 1,10 205K
C1 274USD 0,13 / USD 0,50Gratis 262K
C1 272USD 0,22 / USD 0,33 164K
C1 253USD 0,0564 / USD 0,4512 262K
C1 243USD 0,0282 / USD 0,282 1M

Nivåene er våre: en modells plass på rangeringen, der bare modeller med hele konfidensintervallet over den telles. S — topp 10 %, A — opptil 30 %, B — opptil 60 %, C — opptil 85 %, D — resten.

Kvalitet mot pris vurdering loddrett, blandet pris (3 deler input : 1 output) vannrett, USD per 1 mill. tokens
1 000 1 200 1 400 1 600 1 800 2 000 USD 0,01 USD 0,10 USD 1 USD 10 Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

Hvordan vurderes modellene?

Topplisten for webutvikling bygger på LMArenas WebDev-arena. To anonyme modeller får samme beskrivelse av en nettapp – for eksempel en gjøremålsliste, en enkel nettbutikk eller et lite spill – og bygger hver sin fungerende versjon. Den som sendte oppgaven, prøver begge og stemmer på appen som ble best. Stemmene blir til en Elo-vurdering med 95 %-konfidensintervall.

Hva sier vurderingen noe om?

Den gjenspeiler hele resultatet: oppsett, kode som faktisk virker, og hvor godt appen følger bestillingen. Det handler altså ikke bare om kodestil eller hvor pent svaret er formulert.

Hva viser tabellen?

  • tier og Elo med konfidensintervall;
  • laveste aktuelle pris per 1M tokens og prisutvikling over 30 dager;
  • kontekstvindu, og i detaljvisningen leverandører, lisens og lanseringsdato;
  • avkrysningsboksen «Sammenlign» for opptil 4 modeller.

Hvorfor mangler en modell jeg kjenner?

WebDev-arenaen har sitt eget utvalg av modeller, som er forskjellig fra topplistene for tekst og koding. En modell kan derfor mangle her selv om den finnes der, og omvendt.

Hvordan regnes tier?

Som på alle topplistene våre: modeller med minst 300 stemmer rangeres etter hvor mange modeller som har hele 95 %-intervallet sitt over deres eget. Plass innenfor 10 % av listen gir S, innenfor 30 % A, innenfor 60 % B, innenfor 85 % C og resten D. Den som har færre stemmer, står som «Ikke plassert ennå», og modeller som statistisk ikke kan skilles fra lederen, deler førsteplassen.

Hva bør jeg være obs på?

Appene i arenaen er små. Store prosjekter med mange filer, databaser og innlogging vurderes ikke, så en høy vurdering her sier ikke sikkert noe om hvordan modellen takler din eksisterende kodebase. Bruk listen til å finne kandidater, prøv dem på en liten oppgave fra ditt eget prosjekt, og sammenlign deretter pris og kontekst. Vurderingene kommer fra LMArena WebDev og prisene fra models.dev og LiteLLM, oppdatert daglig.