Naar de inhoud
fedi.software

Programmeren

Modellen gerangschikt op programmeeropdrachten: tier, Elo met betrouwbaarheidsinterval, prijs per miljoen tokens en contextvenster.

Bijgewerkt · Bronnen: LMArena, LiteLLM, models.dev

Kosten per maand
Tier Model Elo Input / output, per 1M Per maand Context App Vergelijken
A1.464US$ 0,066 / US$ 0,26 262K
A1.436US$ 0,09 / US$ 0,30Gratis 256K
B1.367US$ 0,21 / US$ 0,57 66K

De tiers zijn van ons: de plaats van een model in de ranglijst, waarbij alleen modellen meetellen waarvan het hele betrouwbaarheidsinterval erboven ligt. S — top 10%, A — tot 30%, B — tot 60%, C — tot 85%, D — de rest.

Kwaliteit versus prijs omhoog score, opzij gemengde prijs (3 delen input : 1 output), USD per 1M tokens
1.000 1.200 1.400 1.600 US$ 0,01 US$ 0,10 US$ 1 US$ 10 US$ 100 MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Wat meet deze ranglijst?

Het gaat om de categorie coding binnen de tekstarena van LMArena. Het principe is hetzelfde als bij de gewone tekstranglijst: mensen vergelijken blind twee antwoorden en stemmen, maar hier tellen alleen prompts over code mee. Denk aan een functie laten schrijven, een fout laten opsporen of uitleg vragen over een stuk code. Zo ontstaat een rating in de stijl van Elo, met een 95%-betrouwbaarheidsinterval dat je als balk naast het getal ziet. Het is een oordeel over antwoorden in een chat. Of een model een werkend project oplevert als het zelf tests draait en bestanden wijzigt, blijkt hier niet.

Waarin verschilt het van webontwikkeling en agents?

Drie ranglijsten gaan over programmeren, elk vanuit een andere hoek:

  • deze ranglijst beoordeelt antwoorden in een gesprek over code;
  • webontwikkeling laat modellen complete webapps bouwen;
  • agents kijkt naar taken in meerdere stappen met toolaanroepen.

Wie een codeeragent wil gebruiken, doet er goed aan alle drie te bekijken.

Welke kolommen zie ik?

Dezelfde als op de tekstranglijst: tier, Elo met interval, prijs per 1M tokens, contextvenster, de prijsontwikkeling over 30 dagen, de calculator “Kosten per maand”, de grafiek “Kwaliteit versus prijs” en de mogelijkheid om tot 4 modellen te vergelijken. Let bij programmeren vooral op het contextvenster: wie een model op een hele repository loslaat, heeft een lang venster nodig. Zet het naast de prijs, want een groot venster vullen kost ook meer tokens.

Hoe komen de tiers tot stand?

Net als elders: alleen modellen met minstens 300 stemmen krijgen een tier, de rest toont “Nog geen tier”. De plaats is één plus het aantal modellen met een interval dat volledig hoger ligt. Delen door het aantal modellen geeft S onder 10%, A onder 30%, B onder 60%, C onder 85% en D daarboven.

Waar moet ik op letten?

Een goed antwoord in een chat is iets anders dan tests laten slagen in een echt project. Probeer de modellen uit je kortere lijst dus op je eigen code voordat je kiest. Prijzen komen van models.dev en LiteLLM en zijn de laagste die we op de dag van de gegevens vonden. De tools zelf staan onder codeeragents.