Przejdź do treści
fedi.software

Agenci

Modele uszeregowane na zadaniach agentowych — wywołaniach narzędzi i pracy wieloetapowej — według rankingu agentów LMArena. Jego wynik jest wyśrodkowany na zerze, to nie Elo.

Zaktualizowano · Źródła: LMArena, LiteLLM, models.dev

Koszt miesięczny
Tier Model Wynik Wejście / wyjście, za 1M Miesięcznie Kontekst Aplikacja Porównaj
S0,076— —
A0,0300,75 USD / 3,75 USD 1M
B0,0050,959 USD / 2,74 USD 1M
B-0,0150,75 USD / 3,75 USD 1M
C-0,0690,20 USD / 0,90 USDZa darmo 1M
C-0,0770,375 USD / 1,88 USD 1M
C-0,0771 USD / 6 USD 1M
Porównaj ()

Tiery są nasze: miejsce modelu w rankingu liczone tylko względem modeli, których cały przedział ufności leży powyżej. S — górne 10%, A — do 30%, B — do 60%, C — do 85%, D — reszta.

Jakość a cena ocena w pionie, cena łączona (3 części wejścia : 1 wyjścia) w poziomie, USD za 1M tokenów
-0,2 -0,1 0,0 0,1 0,2 0,01 USD 0,10 USD 1 USD 10 USD Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Co ocenia ten ranking?

Ranking agentów pochodzi z tablicy agentowej LMArena. Modele wykonują tu zadania wieloetapowe – wywołują narzędzia, przeszukują, planują kolejne kroki – a ludzie oceniają, który przebieg był lepszy. Głosem jest cała sesja, a nie pojedyncza odpowiedź.

Dlaczego zamiast Elo jest „Wynik”?

Ta tablica używa innej miary: wyniku skupionego wokół zera, mniej więcej od wartości ujemnych do dodatnich. Kolumna nazywa się „Wynik” i pokazuje trzy miejsca po przecinku. Wynik powyżej zera oznacza, że model był wybierany częściej niż przeciętny model tej tablicy, a poniżej zera – rzadziej.

Czy mogę porównać wynik z Elo z innych rankingów?

Nie. Wynik agentów i oceny Elo z rankingu tekstowego czy programistycznego to różne skale. Porównuj modele tylko w obrębie tej tablicy. Na stronie porównania obie wartości stoją w osobnych wierszach właśnie z tego powodu.

Jak liczone są tiery?

Tak samo jak w innych rankingach: miejsce modelu wynika z tego, ile modeli ma cały 95-procentowy przedział powyżej jego przedziału, a progi to 10, 30, 60 i 85%. Wymagane jest co najmniej 300 głosów – tutaj głosami są sesje.

  • S – poniżej 10% stawki,
  • A – poniżej 30%,
  • B – poniżej 60%,
  • C – poniżej 85%,
  • D – pozostałe modele.

Na co uważać?

To młoda tablica z mniejszą liczbą modeli niż ranking tekstowy, więc kolejność może się szybko zmieniać. Poza tym framework agentowy używany na arenie nie jest tym, którego użyjesz ty – w twoim narzędziu, z twoimi instrukcjami i uprawnieniami model może zachowywać się inaczej. Traktuj ranking jako wskazówkę, a nie wyrok.

Jak wykorzystać ranking w praktyce?

Wybierz kilka modeli z górnych tierów, sprawdź ich ceny za 1M tokenów – zadania agentowe zużywają ich dużo, bo model wielokrotnie czyta wyniki narzędzi – i przetestuj je na własnym, krótkim zadaniu. Dopiero wtedy zdecyduj, który model podłączysz na stałe. Gotowe narzędzia znajdziesz w dziale agentów programistycznych.