Hoppa till innehållet
fedi.software

Programmering

Modeller rankade på programmeringsuppgifter: tier, Elo med konfidensintervall, pris per miljon tokens och kontextfönster.

Uppdaterad · Källor: LMArena, LiteLLM, models.dev

Kostnad per månad
Tier Modell Elo Input / output, per 1M Per månad Kontext App Jämför
S1 5070,0015 US$ / 0,09 US$Gratis 1M
S1 5020,338 US$ / 1,01 US$ 1M
S1 4970,825 US$ / 2,48 US$ 1M
S1 487— —
S1 4850,045 US$ / 0,32 US$ 262K
S1 483— —
S1 4730,282 US$ / 1,13 US$ 1M
S1 4721,03 US$ / 6,16 US$ 262K
S1 4690,2088 US$ / 0,4176 US$ 1M
A1 4670,276 US$ / 1,65 US$ 1M
A1 4640,1644 US$ / 0,9864 US$Gratis 262K
A1 4570,035 US$ / 0,07 US$ 1M
A1 4560,36 US$ / 1,43 US$ 262K
A1 4540,18 US$ / 0,35 US$ 164K
A1 4450,09 US$ / 0,55 US$ 131K
A1 4400,144 US$ / 0,574 US$Gratis 131K
A1 4390,22 US$ / 0,33 US$ 164K
A1 4380,20 US$ / 0,88 US$ 131K
A1 4360,1126 US$ / 0,9008 US$Gratis 262K
A1 433— —
A1 4270,25 US$ / 0,25 US$ 164K
A1 4270,0846 US$ / 0,6768 US$ 262K
A1 4260,25 US$ / 0,70 US$ 128K
A1 4250,287 US$ / 2,87 US$ 131K
A1 4240,11 US$ / 0,60 US$ 131K
A1 4170,19 US$ / 0,71 US$ 164K
B1 4160,09 US$ / 0,30 US$ 256K
B1 4120,13 US$ / 0,50 US$Gratis 262K
B1 4120,0282 US$ / 0,282 US$ 1M
B1 4100,0564 US$ / 0,4512 US$ 262K
B1 3920,15 US$ / 0,65 US$ 131K
B1 3860,30 US$ / 2,50 US$ 1M
B1 3710,40 US$ / 0,40 US$ 80K
B1 3680,10 US$ / 0,425 US$ 164K
B1 359— —
B1 3580,05 US$ / 0,10 US$ 131K
B1 3370,0509 US$ / 0,335 US$ 41K
B1 3330,18 US$ / 0,20 US$ 24K
B1 3280,115 US$ / 0,287 US$ 1M
B1 314— —
B1 309— —
B1 2920,12 US$ / 0,30 US$ 131K
B1 2880,345 US$ / 1,38 US$ 33K
B1 2760,06 US$ / 0,20 US$Gratis 33K
C1 270— —
C1 251— 33K
C1 239— —
C1 218— —
C1 1960,90 US$ / 0,90 US$ 33K
C1 184— —
C1 165— —
C1 155— —
C1 138— —
C1 107— —
C1 096— —
D1 072— —
D999— —
Jämför ()

Tiers är våra egna: en modells plats på topplistan där bara de modeller räknas vars hela konfidensintervall ligger ovanför den. S – topp 10%, A – upp till 30%, B – upp till 60%, C – upp till 85%, D – resten.

Kvalitet mot pris uppåt betyg, åt sidan blandat pris (3 delar input : 1 output), USD per 1M tokens
1 000 1 200 1 400 1 600 0,01 US$ 0,10 US$ 1 US$ 10 US$ 100 US$ MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Vad mäter topplistan för kod?

Den visar kodkategorin i LMArenas textarena. Metoden är densamma som på topplistan för text – blinda röster mellan två anonyma svar – men bara på frågor som handlar om programmering: att förklara ett felmeddelande, skriva en funktion, föreslå en refaktorering eller översätta kod mellan språk. Betyget är ett Elo-tal med 95%-konfidensintervall.

Vilka kolumner finns?

Samma som på texttopplistan: tier, Elo med intervall, pris per 1M tokens, kontextfönster och prisutveckling under 30 dagar. Kalkylatorn för ”Kostnad per månad”, diagrammet ”Kvalitet mot pris” och kryssrutan för att jämföra upp till 4 modeller fungerar likadant. Priserna hämtas dagligen från models.dev och LiteLLM.

Hur skiljer den sig från webbutveckling och agenter?

  • Kod: svar i en chatt om kod, bedömda av människor.
  • Webbutveckling: modeller bygger hela, fungerande webbappar och bedöms på resultatet.
  • Agenter: uppgifter i flera steg med verktygsanrop, med en egen skala.

Ska du välja modell för en kodagent i terminalen är det klokt att titta på alla tre.

Varför är kontextfönstret viktigt här?

När du arbetar med ett helt repository behöver modellen se många filer samtidigt. Ett långt kontextfönster gör det möjligt, men långa frågor kostar också fler tokens. Jämför därför kontext och pris sida vid sida innan du bestämmer dig, och räkna med kalkylatorn på din egen förväntade användning.

Hur räknas tiers?

Som på alla topplistor: bara modeller med minst 300 röster får en tier. Placeringen bestäms av hur många modeller vars hela konfidensintervall ligger ovanför modellens eget, och gränserna är 10, 30, 60 och 85% för S, A, B och C. Modeller med färre röster visas som ”Ingen tier ännu”.

Vad bör jag vara försiktig med?

Ett bra chattsvar om kod är inte samma sak som kod som klarar testerna i ett riktigt projekt. Arenan bedömer hur svaret upplevs, inte om det kompilerar i din kodbas. Prova därför modellen på din egen kod, kör testerna och granska ändringarna innan de går vidare. En placering gäller dessutom en viss dag – ledarna byts ofta.