Hoppa till innehållet
fedi.software

Programmering

Modeller rankade på programmeringsuppgifter: tier, Elo med konfidensintervall, pris per miljon tokens och kontextfönster.

Uppdaterad · Källor: LMArena, LiteLLM, models.dev

Kostnad per månad
Tier Modell Elo Input / output, per 1M Per månad Kontext App Jämför
S1 5150,10 US$ / 0,20 US$ 1M
S1 5101 US$ / 4 US$Gratis 1M
S1 4971,25 US$ / 4,25 US$ 1M
S1 4940,10 US$ / 0,20 US$ 1M
S1 4890,275 US$ / 1,10 US$Gratis 262K
S1 4830,30 US$ / 1,90 US$ 262K
S1 482— —
A1 4531,15 US$ / 8 US$ 262K
A1 417— —
B1 3990,40 US$ / 1,80 US$ 256K
B1 3910,25 US$ / 0,75 US$ 128K
B1 323— —
B1 3020,05 US$ / 0,10 US$Gratis 1M
B1 2913,50 US$ / 3,50 US$ 4K
B1 2860,05 US$ / 0,10 US$ 328K
C1 2680,05 US$ / 0,23 US$Gratis 24K
C1 2600,40 US$ / 0,40 US$Gratis 131K
C1 2060,51 US$ / 0,74 US$ 8K
C1 1950,02 US$ / 0,04 US$Gratis 32K
C1 1520,04 US$ / 0,04 US$ 8K
C1 0980,02 US$ / 0,02 US$Gratis 80K
D1 0791 US$ / 1 US$ 4K
D1 0710,01 US$ / 0,01 US$Gratis 60K
D1 0620,10 US$ / 0,50 US$ 4K
D1 046— —
D1 0020,05 US$ / 0,25 US$ 4K
D683— —
Jämför ()

Tiers är våra egna: en modells plats på topplistan där bara de modeller räknas vars hela konfidensintervall ligger ovanför den. S – topp 10%, A – upp till 30%, B – upp till 60%, C – upp till 85%, D – resten.

Kvalitet mot pris uppåt betyg, åt sidan blandat pris (3 delar input : 1 output), USD per 1M tokens
1 000 1 200 1 400 1 600 0,01 US$ 0,10 US$ 1 US$ 10 US$ 100 US$ MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Vad mäter topplistan för kod?

Den visar kodkategorin i LMArenas textarena. Metoden är densamma som på topplistan för text – blinda röster mellan två anonyma svar – men bara på frågor som handlar om programmering: att förklara ett felmeddelande, skriva en funktion, föreslå en refaktorering eller översätta kod mellan språk. Betyget är ett Elo-tal med 95%-konfidensintervall.

Vilka kolumner finns?

Samma som på texttopplistan: tier, Elo med intervall, pris per 1M tokens, kontextfönster och prisutveckling under 30 dagar. Kalkylatorn för ”Kostnad per månad”, diagrammet ”Kvalitet mot pris” och kryssrutan för att jämföra upp till 4 modeller fungerar likadant. Priserna hämtas dagligen från models.dev och LiteLLM.

Hur skiljer den sig från webbutveckling och agenter?

  • Kod: svar i en chatt om kod, bedömda av människor.
  • Webbutveckling: modeller bygger hela, fungerande webbappar och bedöms på resultatet.
  • Agenter: uppgifter i flera steg med verktygsanrop, med en egen skala.

Ska du välja modell för en kodagent i terminalen är det klokt att titta på alla tre.

Varför är kontextfönstret viktigt här?

När du arbetar med ett helt repository behöver modellen se många filer samtidigt. Ett långt kontextfönster gör det möjligt, men långa frågor kostar också fler tokens. Jämför därför kontext och pris sida vid sida innan du bestämmer dig, och räkna med kalkylatorn på din egen förväntade användning.

Hur räknas tiers?

Som på alla topplistor: bara modeller med minst 300 röster får en tier. Placeringen bestäms av hur många modeller vars hela konfidensintervall ligger ovanför modellens eget, och gränserna är 10, 30, 60 och 85% för S, A, B och C. Modeller med färre röster visas som ”Ingen tier ännu”.

Vad bör jag vara försiktig med?

Ett bra chattsvar om kod är inte samma sak som kod som klarar testerna i ett riktigt projekt. Arenan bedömer hur svaret upplevs, inte om det kompilerar i din kodbas. Prova därför modellen på din egen kod, kör testerna och granska ändringarna innan de går vidare. En placering gäller dessutom en viss dag – ledarna byts ofta.