Hoppa till innehållet
fedi.software

Programmering

Modeller rankade på programmeringsuppgifter: tier, Elo med konfidensintervall, pris per miljon tokens och kontextfönster.

Uppdaterad · Källor: LMArena, LiteLLM, models.dev

Kostnad per månad
Tier Modell Elo Input / output, per 1M Per månad Kontext App Jämför
S1 5354 US$ / 20 US$ 1M
S1 5354,30 US$ / 21 US$ 1M
S1 5345 US$ / 25 US$ 1M
S1 52510 US$ / 50 US$ 1M
S1 5203 US$ / 18,50 US$ 1M
S1 5192 US$ / 10 US$ 1M
S1 5184,30 US$ / 21 US$ 1M
S1 5040,90 US$ / 5,55 US$ 1M
S1 5030,71 US$ / 3,57 US$ 200K
S1 4900,425 US$ / 2,12 US$ 1M
S1 4880,43 US$ / 2,14 US$ 1M
S1 4831,44 US$ / 7,20 US$ 1M
S1 47913 US$ / 64 US$ 197K
A1 4530,14 US$ / 0,71 US$ 200K
A1 44213 US$ / 64 US$ 193K
B1 4142,60 US$ / 13 US$ 983K
B1 3613 US$ / 15 US$ 200K
B1 3423 US$ / 15 US$ 200K
B1 2870,80 US$ / 4 US$ 200K
C1 26415 US$ / 75 US$ 200K
C1 2310,07 US$ / 0,14 US$ 16K
C1 2233 US$ / 15 US$ 200K
C1 1990,25 US$ / 1,25 US$ 200K
C1 1300,17 US$ / 0,68 US$ 4K
C1 1010,15 US$ / 0,60 US$ 8K
C1 093— —
C1 0930,13 US$ / 0,52 US$ 4K
C1 081— —
D1 0390,13 US$ / 0,52 US$ 128K
D1 035— —
Jämför ()

Tiers är våra egna: en modells plats på topplistan där bara de modeller räknas vars hela konfidensintervall ligger ovanför den. S – topp 10%, A – upp till 30%, B – upp till 60%, C – upp till 85%, D – resten.

Kvalitet mot pris uppåt betyg, åt sidan blandat pris (3 delar input : 1 output), USD per 1M tokens
1 000 1 200 1 400 1 600 0,01 US$ 0,10 US$ 1 US$ 10 US$ 100 US$ MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Vad mäter topplistan för kod?

Den visar kodkategorin i LMArenas textarena. Metoden är densamma som på topplistan för text – blinda röster mellan två anonyma svar – men bara på frågor som handlar om programmering: att förklara ett felmeddelande, skriva en funktion, föreslå en refaktorering eller översätta kod mellan språk. Betyget är ett Elo-tal med 95%-konfidensintervall.

Vilka kolumner finns?

Samma som på texttopplistan: tier, Elo med intervall, pris per 1M tokens, kontextfönster och prisutveckling under 30 dagar. Kalkylatorn för ”Kostnad per månad”, diagrammet ”Kvalitet mot pris” och kryssrutan för att jämföra upp till 4 modeller fungerar likadant. Priserna hämtas dagligen från models.dev och LiteLLM.

Hur skiljer den sig från webbutveckling och agenter?

  • Kod: svar i en chatt om kod, bedömda av människor.
  • Webbutveckling: modeller bygger hela, fungerande webbappar och bedöms på resultatet.
  • Agenter: uppgifter i flera steg med verktygsanrop, med en egen skala.

Ska du välja modell för en kodagent i terminalen är det klokt att titta på alla tre.

Varför är kontextfönstret viktigt här?

När du arbetar med ett helt repository behöver modellen se många filer samtidigt. Ett långt kontextfönster gör det möjligt, men långa frågor kostar också fler tokens. Jämför därför kontext och pris sida vid sida innan du bestämmer dig, och räkna med kalkylatorn på din egen förväntade användning.

Hur räknas tiers?

Som på alla topplistor: bara modeller med minst 300 röster får en tier. Placeringen bestäms av hur många modeller vars hela konfidensintervall ligger ovanför modellens eget, och gränserna är 10, 30, 60 och 85% för S, A, B och C. Modeller med färre röster visas som ”Ingen tier ännu”.

Vad bör jag vara försiktig med?

Ett bra chattsvar om kod är inte samma sak som kod som klarar testerna i ett riktigt projekt. Arenan bedömer hur svaret upplevs, inte om det kompilerar i din kodbas. Prova därför modellen på din egen kod, kör testerna och granska ändringarna innan de går vidare. En placering gäller dessutom en viss dag – ledarna byts ofta.