Przejdź do treści
fedi.software

Agenci

Modele uszeregowane na zadaniach agentowych — wywołaniach narzędzi i pracy wieloetapowej — według rankingu agentów LMArena. Jego wynik jest wyśrodkowany na zerze, to nie Elo.

Zaktualizowano · Źródła: LMArena, LiteLLM, models.dev

Koszt miesięczny
Tier Model Wynik Wejście / wyjście, za 1M Miesięcznie Kontekst Aplikacja Porównaj
S0,1238 USD / 40 USD 1M
S0,1122 USD / 10 USD 1M
S0,0971,60 USD / 8 USD 1M
A0,0642 USD / 10 USD 1M
A0,0421,50 USD / 12 USD 1M
B0,0140,08 USD / 0,40 USD 1M
B0,0100,75 USD / 6 USD 1M
B0,0041,50 USD / 2 USD 1M
B-0,0120,06 USD / 0,37 USD 1M
Porównaj ()

Tiery są nasze: miejsce modelu w rankingu liczone tylko względem modeli, których cały przedział ufności leży powyżej. S — górne 10%, A — do 30%, B — do 60%, C — do 85%, D — reszta.

Jakość a cena ocena w pionie, cena łączona (3 części wejścia : 1 wyjścia) w poziomie, USD za 1M tokenów
-0,2 -0,1 0,0 0,1 0,2 0,01 USD 0,10 USD 1 USD 10 USD Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Co ocenia ten ranking?

Ranking agentów pochodzi z tablicy agentowej LMArena. Modele wykonują tu zadania wieloetapowe – wywołują narzędzia, przeszukują, planują kolejne kroki – a ludzie oceniają, który przebieg był lepszy. Głosem jest cała sesja, a nie pojedyncza odpowiedź.

Dlaczego zamiast Elo jest „Wynik”?

Ta tablica używa innej miary: wyniku skupionego wokół zera, mniej więcej od wartości ujemnych do dodatnich. Kolumna nazywa się „Wynik” i pokazuje trzy miejsca po przecinku. Wynik powyżej zera oznacza, że model był wybierany częściej niż przeciętny model tej tablicy, a poniżej zera – rzadziej.

Czy mogę porównać wynik z Elo z innych rankingów?

Nie. Wynik agentów i oceny Elo z rankingu tekstowego czy programistycznego to różne skale. Porównuj modele tylko w obrębie tej tablicy. Na stronie porównania obie wartości stoją w osobnych wierszach właśnie z tego powodu.

Jak liczone są tiery?

Tak samo jak w innych rankingach: miejsce modelu wynika z tego, ile modeli ma cały 95-procentowy przedział powyżej jego przedziału, a progi to 10, 30, 60 i 85%. Wymagane jest co najmniej 300 głosów – tutaj głosami są sesje.

  • S – poniżej 10% stawki,
  • A – poniżej 30%,
  • B – poniżej 60%,
  • C – poniżej 85%,
  • D – pozostałe modele.

Na co uważać?

To młoda tablica z mniejszą liczbą modeli niż ranking tekstowy, więc kolejność może się szybko zmieniać. Poza tym framework agentowy używany na arenie nie jest tym, którego użyjesz ty – w twoim narzędziu, z twoimi instrukcjami i uprawnieniami model może zachowywać się inaczej. Traktuj ranking jako wskazówkę, a nie wyrok.

Jak wykorzystać ranking w praktyce?

Wybierz kilka modeli z górnych tierów, sprawdź ich ceny za 1M tokenów – zadania agentowe zużywają ich dużo, bo model wielokrotnie czyta wyniki narzędzi – i przetestuj je na własnym, krótkim zadaniu. Dopiero wtedy zdecyduj, który model podłączysz na stałe. Gotowe narzędzia znajdziesz w dziale agentów programistycznych.