Hopp til innholdet
fedi.software

Agenter

Modeller rangert på agentoppgaver — verktøykall og arbeid i flere trinn — etter agentrangeringen til LMArena. Poengsummen er sentrert rundt null og er ikke Elo.

Oppdatert · Kilder: LMArena, LiteLLM, models.dev

Kostnad per måned
Nivå Modell Poeng Input / output, per 1 mill. Per måned Kontekst App Sammenlign
A0,040USD 0,10 / USD 0,20 1M
A0,040USD 0,67 / USD 2 1M
C−0,033USD 0,10 / USD 0,20 1M
C−0,049USD 1,25 / USD 4,25 1M
C−0,054USD 0,066 / USD 0,26 262K

Nivåene er våre: en modells plass på rangeringen, der bare modeller med hele konfidensintervallet over den telles. S — topp 10 %, A — opptil 30 %, B — opptil 60 %, C — opptil 85 %, D — resten.

Kvalitet mot pris vurdering loddrett, blandet pris (3 deler input : 1 output) vannrett, USD per 1 mill. tokens
−0,2 −0,1 0,0 0,1 0,2 USD 0,01 USD 0,10 USD 1 USD 10 Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Viktig å vite: ikke sammenlign med Elo

Topplisten for agenter bruker ikke Elo. Målet er en poengsum sentrert rundt null, omtrent fra negative til positive verdier. Kolonnen heter derfor «Poeng» og viser tre desimaler. En poengsum over null betyr at modellen ble foretrukket oftere enn en gjennomsnittlig modell på akkurat denne listen. Sammenlign bare modeller innenfor denne listen – aldri poengene her med Elo-tallene på topplistene for tekst, koding eller bilde.

Hva som vurderes

Listen kommer fra LMArenas topplister for agenter. Modellene får oppgaver i flere trinn der de må kalle verktøy, for eksempel søke, lese en fil, kjøre en kommando og bruke resultatet i neste trinn. Mennesker vurderer hele forløpet, og stemmene telles per økt. Det ligger nærmere hvordan en kodeagent eller en assistent med verktøy arbeider enn ett enkelt chattesvar.

Tier etter samme regel som ellers

  • Bare modeller med minst 300 stemmer får tier; andre vises som «Ikke plassert ennå».
  • Plassen avgjøres av hvor mange modeller som har hele 95 %-konfidensintervallet sitt over modellens eget.
  • Grenser: S innenfor 10 %, A innenfor 30 %, B innenfor 60 %, C innenfor 85 %, D resten.

Priser per 1M tokens, kontekstvindu og sammenligning av opptil 4 modeller fungerer som på de andre listene, med data fra models.dev og LiteLLM.

Begrensninger

Listen er ung og har færre modeller enn topplisten for tekst, så plasseringene kan flytte seg mer. Arenaen bruker dessuten sitt eget rammeverk for agenter, som ikke er det du selv kommer til å bruke. En modell som gjør det godt her, kan oppføre seg annerledes i ditt verktøy, med dine instruksjoner og dine filer.

Slik bruker du listen

Bruk den til å finne kandidater til en agentarbeidsflyt, og les den sammen med topplistene for koding og webutvikling. Se deretter på kodeagentene, og prøv modellen i verktøyet du faktisk skal bruke, på en avgrenset oppgave, før du slipper den løs på et større prosjekt.