Gå til indhold
fedi.software

Agenter

Modeller rangeret på agentopgaver – værktøjskald og arbejde i flere trin – efter LMArenas agentrangliste. Dens score er centreret omkring nul og er ikke Elo.

Opdateret · Kilder: LMArena, LiteLLM, models.dev

Pris pr. måned
Tier Model Score Input / output, pr. 1M Pr. måned Kontekst App Sammenlign
A0,0400,0015 US$ / 0,09 US$Gratis 1M
B0,0250,338 US$ / 1,01 US$ 1M
B0,0120,2088 US$ / 0,4176 US$ 1M
B-0,0070,10 US$ / 0,20 US$ 262K
C-0,0170,045 US$ / 0,32 US$ 262K
C-0,0510,825 US$ / 2,48 US$ 1M
C-0,0720,282 US$ / 1,13 US$ 1M

Tiers er vores egne: en models plads på ranglisten, hvor kun de modeller tæller, hvis hele konfidensinterval ligger over den. S – top 10%, A – op til 30%, B – op til 60%, C – op til 85%, D – resten.

Kvalitet mod pris opad bedømmelse, til siden blandet pris (3 dele input : 1 output), USD pr. 1M tokens
-0,2 -0,1 0,0 0,1 0,2 0,01 US$ 0,10 US$ 1 US$ 10 US$ Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Først det vigtigste: en anden skala

Agentranglisten bruger ikke Elo. LMArenas agentrangliste giver hver model en score, der er centreret omkring nul – fra negative til positive værdier. Kolonnen hedder »Score« og viser tre decimaler. Sammenlign derfor kun modeller inden for denne liste, og aldrig med Elo-tal fra tekst-, kode- eller billedlisterne.

Hvad bliver bedømt?

Opgaverne består af flere trin, hvor modellen kalder værktøjer undervejs – slår op, kører kode, læser resultatet og fortsætter. Mennesker bedømmer hele forløbet, og stemmerne tælles i sessioner. En score over nul betyder, at modellen blev foretrukket oftere end den gennemsnitlige model på listen.

  • Tiers beregnes med samme regel som ellers: mindst 300 stemmer og 95 % intervaller.
  • Priser pr. 1M tokens og kontekst kommer fra models.dev og LiteLLM.
  • »Lav pris« betyder en blandet pris under 1 USD pr. 1M tokens.

Hvorfor listen skal læses forsigtigt

Ranglisten er ung og har færre modeller end tekstlisten. Arenaen bruger sit eget agent-framework, som ikke er det, du selv kommer til at bruge – dit værktøj, dine prompter og dine data påvirker resultatet. Brug derfor listen som et fingerpeg om, hvilke modeller der håndterer værktøjskald godt.

Sådan kommer du videre med listen

Vælg to eller tre modeller med en høj score og en pris, der passer til dit forbrug – agenter bruger mange tokens, fordi de læser og skriver i flere runder. Brug beregneren »Pris pr. måned« til at se, hvad det betyder. Test dem derefter på en opgave fra din egen hverdag, og hold øje med, hvor ofte de går i stå eller kalder værktøjer forkert.

Videre herfra

Skal modellen arbejde i en terminal eller editor, så se kodeagenterne, og kig også på ranglisten for programmering, fordi en agent aldrig er bedre end modellen bag den.