Hoppa till innehållet
fedi.software

Agenter

Modeller rankade på agentuppgifter – verktygsanrop och arbete i flera steg – enligt LMArenas agenttopplista. Poängen är centrerad kring noll och är inte Elo.

Uppdaterad · Källor: LMArena, LiteLLM, models.dev

Kostnad per månad
Tier Modell Poäng Input / output, per 1M Per månad Kontext App Jämför
A0,0421 US$ / 4 US$Gratis 1M
B0,0250,338 US$ / 1,01 US$ 1M
B0,0050,959 US$ / 2,74 US$ 1M
B−0,0070,10 US$ / 0,20 US$ 262K
C−0,0170,045 US$ / 0,32 US$ 262K
C−0,0510,825 US$ / 2,48 US$ 1M
C−0,0720,282 US$ / 1,13 US$ 1M
Jämför ()

Tiers är våra egna: en modells plats på topplistan där bara de modeller räknas vars hela konfidensintervall ligger ovanför den. S – topp 10%, A – upp till 30%, B – upp till 60%, C – upp till 85%, D – resten.

Kvalitet mot pris uppåt betyg, åt sidan blandat pris (3 delar input : 1 output), USD per 1M tokens
−0,2 −0,1 0,0 0,1 0,2 0,01 US$ 0,10 US$ 1 US$ 10 US$ Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Viktigt först: en annan skala

Topplistan för agenter använder inte Elo. Måttet är en poäng centrerad kring noll, ungefär från negativa till positiva värden. Kolumnen heter därför ”Poäng” och visar tre decimaler. En poäng över noll betyder att modellen föredrogs oftare än den genomsnittliga modellen på just den här topplistan. Jämför bara modeller inom denna lista – aldrig poängen här med Elo-tal från topplistorna för text, kod eller bild.

Vad bedöms?

Listan kommer från LMArenas topplista för agenter. Modellerna får uppgifter i flera steg där de måste anropa verktyg, till exempel söka, läsa en fil, köra ett kommando och använda resultatet i nästa steg. Människor bedömer hela förloppet, och rösterna räknas per session. Det ligger närmare hur en kodagent eller en assistent med verktyg arbetar än ett enskilt chattsvar gör.

Tiers med samma regel

  • Bara modeller med minst 300 röster får en tier; andra visas som ”Ingen tier ännu”.
  • Platsen bestäms av hur många modeller vars hela 95%-konfidensintervall ligger ovanför modellens eget.
  • Gränser: S inom 10%, A inom 30%, B inom 60%, C inom 85%, D resten.

Priserna per 1M tokens, kontextfönstret och jämförelsen av upp till 4 modeller fungerar som på övriga topplistor, med data från models.dev och LiteLLM.

Begränsningar

Topplistan är ung och har färre modeller än topplistan för text, så placeringarna kan röra sig mer. Arenan använder dessutom sitt eget ramverk för agenter, som inte är det du själv kommer att använda. En modell som gör bra ifrån sig här kan bete sig annorlunda i ditt verktyg, med dina instruktioner och dina filer.

Så använder du listan

Använd den för att hitta kandidater till ett agentflöde och läs den tillsammans med topplistorna för kod och webbutveckling. Titta sedan på kodagenterna och prova modellen i det verktyg du faktiskt tänker använda, på en avgränsad uppgift, innan du släpper in den i ett större projekt.