Naar de inhoud
fedi.software

Agents

Modellen gerangschikt op agenttaken — toolaanroepen en werk in meerdere stappen — volgens de agentranglijst van LMArena. De score ligt rond nul en is geen Elo.

Bijgewerkt · Bronnen: LMArena, LiteLLM, models.dev

Kosten per maand
Tier Model Score Input / output, per 1M Per maand Context App Vergelijken
S0,076— —
A0,040US$ 0,67 / US$ 2 1M
A0,030US$ 0,75 / US$ 3,75 1M
B0,025US$ 0,338 / US$ 1,01 1M
B-0,007US$ 0,10 / US$ 0,20 262K
B-0,015US$ 0,75 / US$ 3,75 1M
C-0,017US$ 0,045 / US$ 0,32 262K
C-0,051US$ 0,825 / US$ 2,48 1M
C-0,054US$ 0,066 / US$ 0,26 262K
C-0,072US$ 0,282 / US$ 1,13 1M
C-0,077US$ 0,375 / US$ 1,88 1M
C-0,077US$ 1 / US$ 6 1M

De tiers zijn van ons: de plaats van een model in de ranglijst, waarbij alleen modellen meetellen waarvan het hele betrouwbaarheidsinterval erboven ligt. S — top 10%, A — tot 30%, B — tot 60%, C — tot 85%, D — de rest.

Kwaliteit versus prijs omhoog score, opzij gemengde prijs (3 delen input : 1 output), USD per 1M tokens
-0,2 -0,1 0,0 0,1 0,2 US$ 0,01 US$ 0,10 US$ 1 US$ 10 Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Wat wordt hier beoordeeld?

Deze pagina volgt de agentranglijst van LMArena. Modellen krijgen taken die meerdere stappen en toolaanroepen vragen, zoals informatie opzoeken, bestanden lezen of code uitvoeren, en mensen beoordelen welk model de taak beter afrondde. Niet losse antwoorden, maar hele sessies worden vergeleken; als stemmen tellen dan ook sessies.

Waarom zie ik “Score” en geen Elo?

Deze bron publiceert geen Elo, maar een score die rond nul ligt, van negatieve tot positieve waarden. Een score boven nul betekent dat het model vaker de voorkeur kreeg dan het gemiddelde model op deze ranglijst; onder nul minder vaak. De kolom heet “Score” en toont drie decimalen. Omdat het een andere schaal is, vergelijk je deze getallen nooit met de Elo-ratings van de ranglijsten tekst, programmeren of webontwikkeling. Vergelijk modellen alleen binnen deze pagina.

Werken de tiers hetzelfde?

Ja. De regel kijkt alleen naar betrouwbaarheidsintervallen en naar de positie in de tabel, niet naar de schaal:

  • een tier vraagt minstens 300 sessies;
  • de plaats is één plus het aantal modellen met een 95%-interval dat volledig hoger ligt;
  • plaats gedeeld door het aantal modellen: S onder 10%, A onder 30%, B onder 60%, C onder 85%, D de rest.

Wat staat er verder in de tabel?

Per model zie je de leverancier, of het open gewichten heeft, de laagste prijs per 1M tokens bij aanbieders volgens models.dev en LiteLLM, het contextvenster en de prijsontwikkeling over 30 dagen. Voor agents die veel lezen, zoals een agent die door een codebase zoekt, is dat contextvenster een belangrijk gegeven. “Lage prijs” betekent ook hier een gemengde prijs onder 1 USD per 1M tokens.

Welke kanttekeningen zijn er?

De ranglijst is jonger dan de tekstarena en bevat minder modellen. Bovendien is de agentomgeving in de arena niet dezelfde als die van jou: een model dat daar overtuigt, kan zich in je eigen agent of automatisering anders gedragen. De tools vind je onder codeeragents en automatisering; probeer de kandidaten op een echte taak voordat je kiest.