Siirry sisältöön
fedi.software

Agentit

Mallit agenttitehtävien — työkalukutsujen ja monivaiheisen työn — mukaan LMArenan agenttitaulukossa. Sen pisteet on keskitetty nollaan, eivätkä ne ole Elo-lukuja.

Päivitetty · Lähteet: LMArena, LiteLLM, models.dev

Kuukausikustannus
Taso Malli Pisteet Syöte / tuloste, 1 milj. Kuukaudessa Konteksti Sovellus Vertaa
A0,0400,0015 $ / 0,09 $Ilmainen 1M
B0,0120,2088 $ / 0,4176 $ 1M
B0,0050,959 $ / 2,74 $ 1M
Vertaa ()

Tasot ovat omiamme: mallin sija taulukossa, kun lasketaan vain mallit, joiden koko luottamusväli on sen yläpuolella. S — parhaat 10 %, A — enintään 30 %, B — enintään 60 %, C — enintään 85 %, D — loput.

Laatu vs. hinta arvio pystyakselilla, yhdistetty hinta (3 osaa syötettä : 1 tulostetta) vaaka-akselilla, USD / 1 milj. tokenia
−0,2 −0,1 0,0 0,1 0,2 0,01 $ 0,10 $ 1 $ 10 $ Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Ensin tärkein: eri asteikko

Agenttien tulostaulukko ei käytä Eloa. LMArenan agenttitaulukko antaa jokaiselle mallille pisteet, jotka on keskitetty nollan ympärille – negatiivisista positiivisiin. Sarakkeen nimi on ”Pisteet”, ja siinä on kolme desimaalia. Vertaa siis malleja vain tämän taulukon sisällä, äläkä koskaan teksti-, koodi- tai kuvataulukoiden Elo-lukuihin.

Mitä arvioidaan?

Tehtävät ovat monivaiheisia, ja malli kutsuu niiden aikana työkaluja – hakee tietoa, ajaa koodia, lukee tuloksen ja jatkaa. Ihmiset arvioivat koko suorituksen, ja äänet lasketaan istuntoina. Nollan ylittävät pisteet tarkoittavat, että mallia pidettiin parempana useammin kuin taulukon keskimääräistä mallia.

  • Tasot lasketaan samalla säännöllä kuin muualla: vähintään 300 ääntä ja 95 %:n välit.
  • Hinnat miljoonaa tokenia kohden ja konteksti tulevat models.devistä ja LiteLLM:stä.
  • ”Edullinen” tarkoittaa sekahintaa alle 1 USD miljoonalta tokenilta.

Miksi taulukkoa pitää lukea varoen

Taulukko on nuori, ja siinä on vähemmän malleja kuin tekstitaulukossa. Areena käyttää omaa agenttikehystään, joka ei ole se, jota itse käytät – oma työkalusi, kehotteesi ja aineistosi vaikuttavat tulokseen. Käytä taulukkoa suuntaa antavana tietona siitä, mitkä mallit hallitsevat työkalukutsut.

Näin etenet

Valitse kaksi tai kolme mallia, joilla on korkeat pisteet ja käyttöösi sopiva hinta – agentit kuluttavat paljon tokeneita, koska ne lukevat ja kirjoittavat useita kierroksia. ”Kuukausikustannus”-laskuri näyttää, mitä se tarkoittaa. Testaa ne sitten omalla tehtävällä ja seuraa, kuinka usein ne jumittuvat tai kutsuvat työkaluja väärin.

Seuraavaksi

Jos mallin pitää toimia päätteessä tai editorissa, katso koodausagentit ja myös ohjelmoinnin taulukko, koska agentti ei ole koskaan taustalla olevaa malliaan parempi.