Hoppa till innehållet
fedi.software

Programmering

Modeller rankade på programmeringsuppgifter: tier, Elo med konfidensintervall, pris per miljon tokens och kontextfönster.

Uppdaterad · Källor: LMArena, LiteLLM, models.dev

Kostnad per månad
Tier Modell Elo Input / output, per 1M Per månad Kontext App Jämför
A1 4611,50 US$ / 7,50 US$ 256K
A1 4470,50 US$ / 1,50 US$ 262K
A1 4340,40 US$ / 2 US$ 262K
B1 3910,25 US$ / 0,75 US$ 128K
B1 3860,36 US$ / 1,22 US$ 131K
B1 381— —
B1 375— —
B1 3630,075 US$ / 0,20 US$ 128K
B1 323— —
B1 3192 US$ / 5 US$ 128K
B1 312— —
B1 312— —
B1 3090,10 US$ / 0,30 US$ 128K
C1 2772 US$ / 6 US$ 131K
C1 2760,50 US$ / 1,50 US$ 131K
C1 267— —
C1 2460,05 US$ / 0,08 US$ 33K
C1 230— —
C1 2020,10 US$ / 0,10 US$ 128K
C1 190— —
C1 169— —
C1 1660,60 US$ / 0,60 US$ 66K
C1 165— —
C1 159— —
C1 154— —
C1 143— —
C1 132— —
C1 129— —
C1 1260,15 US$ / 0,15 US$ 32K
C1 116— —
C1 113— —
C1 112— —
C1 098— —
C1 089— —
D1 0820,05 US$ / 0,25 US$ 32K
C1 080— —
D1 078— —
D1 067— —
D1 064— —
–1 053— —
D1 048— —
D1 045— —
D1 041— —
–1 039— —
D1 0180,07 US$ / 0,28 US$ 33K
D1 010— —
D1 001— —
–996— —
D945— —
D928— —
D913— —
D900— —
D886— —
D799— —
D776— —
D764— —
Jämför ()

Tiers är våra egna: en modells plats på topplistan där bara de modeller räknas vars hela konfidensintervall ligger ovanför den. S – topp 10%, A – upp till 30%, B – upp till 60%, C – upp till 85%, D – resten.

Kvalitet mot pris uppåt betyg, åt sidan blandat pris (3 delar input : 1 output), USD per 1M tokens
1 000 1 200 1 400 1 600 0,01 US$ 0,10 US$ 1 US$ 10 US$ 100 US$ MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Vad mäter topplistan för kod?

Den visar kodkategorin i LMArenas textarena. Metoden är densamma som på topplistan för text – blinda röster mellan två anonyma svar – men bara på frågor som handlar om programmering: att förklara ett felmeddelande, skriva en funktion, föreslå en refaktorering eller översätta kod mellan språk. Betyget är ett Elo-tal med 95%-konfidensintervall.

Vilka kolumner finns?

Samma som på texttopplistan: tier, Elo med intervall, pris per 1M tokens, kontextfönster och prisutveckling under 30 dagar. Kalkylatorn för ”Kostnad per månad”, diagrammet ”Kvalitet mot pris” och kryssrutan för att jämföra upp till 4 modeller fungerar likadant. Priserna hämtas dagligen från models.dev och LiteLLM.

Hur skiljer den sig från webbutveckling och agenter?

  • Kod: svar i en chatt om kod, bedömda av människor.
  • Webbutveckling: modeller bygger hela, fungerande webbappar och bedöms på resultatet.
  • Agenter: uppgifter i flera steg med verktygsanrop, med en egen skala.

Ska du välja modell för en kodagent i terminalen är det klokt att titta på alla tre.

Varför är kontextfönstret viktigt här?

När du arbetar med ett helt repository behöver modellen se många filer samtidigt. Ett långt kontextfönster gör det möjligt, men långa frågor kostar också fler tokens. Jämför därför kontext och pris sida vid sida innan du bestämmer dig, och räkna med kalkylatorn på din egen förväntade användning.

Hur räknas tiers?

Som på alla topplistor: bara modeller med minst 300 röster får en tier. Placeringen bestäms av hur många modeller vars hela konfidensintervall ligger ovanför modellens eget, och gränserna är 10, 30, 60 och 85% för S, A, B och C. Modeller med färre röster visas som ”Ingen tier ännu”.

Vad bör jag vara försiktig med?

Ett bra chattsvar om kod är inte samma sak som kod som klarar testerna i ett riktigt projekt. Arenan bedömer hur svaret upplevs, inte om det kompilerar i din kodbas. Prova därför modellen på din egen kod, kör testerna och granska ändringarna innan de går vidare. En placering gäller dessutom en viss dag – ledarna byts ofta.