Hoppa till innehållet
fedi.software

Webbutveckling

Modeller rankade efter hur de bygger fungerande webbappar från en prompt i LMArenas WebDev-arena, med priser och kontext.

Uppdaterad · Källor: LMArena, LiteLLM, models.dev

Kostnad per månad
Tier Modell Elo Input / output, per 1M Per månad Kontext App Jämför
S1 680— —
S1 6330,67 US$ / 2 US$ 1M
A1 5920,75 US$ / 3,75 US$ 1M
A1 5830,75 US$ / 3,75 US$ 1M
A1 5700,959 US$ / 2,74 US$ 1M
A1 5360,375 US$ / 1,88 US$ 1M
B1 5070,066 US$ / 0,26 US$ 262K
B1 4990,1857 US$ / 1,11 US$ 1M
B1 4461 US$ / 6 US$ 1M
–1 4400,15 US$ / 1,25 US$ 1M
B1 4390,57 US$ / 3,43 US$ 1M
B1 4390,07 US$ / 0,43 US$ 1M
C1 3650,10 US$ / 0,25 US$Gratis 262K
C1 3580,042 US$ / 0,22 US$Gratis 262K
C1 356— —
C1 2560,125 US$ / 0,75 US$ 1M
D1 2270,87 US$ / 7 US$ 1M
Jämför ()

Tiers är våra egna: en modells plats på topplistan där bara de modeller räknas vars hela konfidensintervall ligger ovanför den. S – topp 10%, A – upp till 30%, B – upp till 60%, C – upp till 85%, D – resten.

Kvalitet mot pris uppåt betyg, åt sidan blandat pris (3 delar input : 1 output), USD per 1M tokens
1 000 1 200 1 400 1 600 1 800 2 000 0,01 US$ 0,10 US$ 1 US$ 10 US$ Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

Metoden: två modeller, en app

Topplistan för webbutveckling bygger på LMArenas WebDev-arena. Där får två anonyma modeller samma beskrivning av en webbapp – till exempel en att göra-lista, en enkel webbutik eller ett litet spel – och bygger var sin fungerande version. Den som skickade uppgiften provar båda och röstar på den app som blev bättre. Rösterna räknas om till ett Elo-betyg med 95%-konfidensintervall.

Eftersom det är resultatet som bedöms speglar betyget helheten: layout, kod som faktiskt fungerar och hur väl appen följer beställningen. Det handlar alltså inte bara om kodstil eller om hur snyggt svaret är formulerat.

Vad du ser i tabellen

  • tier och Elo med konfidensintervall;
  • det lägsta aktuella priset per 1M tokens och prisutvecklingen under 30 dagar;
  • kontextfönster och, i detaljvyn, leverantörer, licens och lanseringsdatum;
  • kryssrutan för att jämföra upp till 4 modeller.

WebDev-arenan har sin egen uppsättning modeller, som skiljer sig från topplistorna för text och kod. En modell kan därför saknas här fast den finns där, och tvärtom.

Tiers på samma villkor

Regeln är densamma som på alla våra topplistor. Modeller med minst 300 röster rangordnas efter hur många modeller vars hela 95%-intervall ligger ovanför deras eget. Plats inom 10% av listan ger S, inom 30% A, inom 60% B, inom 85% C och resten D. Den som har färre röster får ”Ingen tier ännu”. Modeller som statistiskt inte går att skilja från ledaren delar första platsen.

Gränser att känna till

Apparna i arenan är små. Stora projekt med många filer, databaser och inloggning bedöms inte, så ett högt betyg här säger inget säkert om hur modellen klarar din befintliga kodbas. Använd topplistan för att hitta kandidater, prova dem på en liten uppgift ur ditt eget projekt och jämför sedan pris och kontext. Betygen kommer från LMArena WebDev och priserna från models.dev och LiteLLM, uppdaterade dagligen.