Agenci
Modele uszeregowane na zadaniach agentowych — wywołaniach narzędzi i pracy wieloetapowej — według rankingu agentów LMArena. Jego wynik jest wyśrodkowany na zerze, to nie Elo.
Zaktualizowano · Źródła: LMArena, LiteLLM, models.dev
Tiery są nasze: miejsce modelu w rankingu liczone tylko względem modeli, których cały przedział ufności leży powyżej. S — górne 10%, A — do 30%, B — do 60%, C — do 85%, D — reszta.
Co ocenia ten ranking?
Ranking agentów pochodzi z tablicy agentowej LMArena. Modele wykonują tu zadania wieloetapowe – wywołują narzędzia, przeszukują, planują kolejne kroki – a ludzie oceniają, który przebieg był lepszy. Głosem jest cała sesja, a nie pojedyncza odpowiedź.
Dlaczego zamiast Elo jest „Wynik”?
Ta tablica używa innej miary: wyniku skupionego wokół zera, mniej więcej od wartości ujemnych do dodatnich. Kolumna nazywa się „Wynik” i pokazuje trzy miejsca po przecinku. Wynik powyżej zera oznacza, że model był wybierany częściej niż przeciętny model tej tablicy, a poniżej zera – rzadziej.
Czy mogę porównać wynik z Elo z innych rankingów?
Nie. Wynik agentów i oceny Elo z rankingu tekstowego czy programistycznego to różne skale. Porównuj modele tylko w obrębie tej tablicy. Na stronie porównania obie wartości stoją w osobnych wierszach właśnie z tego powodu.
Jak liczone są tiery?
Tak samo jak w innych rankingach: miejsce modelu wynika z tego, ile modeli ma cały 95-procentowy przedział powyżej jego przedziału, a progi to 10, 30, 60 i 85%. Wymagane jest co najmniej 300 głosów – tutaj głosami są sesje.
- S – poniżej 10% stawki,
- A – poniżej 30%,
- B – poniżej 60%,
- C – poniżej 85%,
- D – pozostałe modele.
Na co uważać?
To młoda tablica z mniejszą liczbą modeli niż ranking tekstowy, więc kolejność może się szybko zmieniać. Poza tym framework agentowy używany na arenie nie jest tym, którego użyjesz ty – w twoim narzędziu, z twoimi instrukcjami i uprawnieniami model może zachowywać się inaczej. Traktuj ranking jako wskazówkę, a nie wyrok.
Jak wykorzystać ranking w praktyce?
Wybierz kilka modeli z górnych tierów, sprawdź ich ceny za 1M tokenów – zadania agentowe zużywają ich dużo, bo model wielokrotnie czyta wyniki narzędzi – i przetestuj je na własnym, krótkim zadaniu. Dopiero wtedy zdecyduj, który model podłączysz na stałe. Gotowe narzędzia znajdziesz w dziale agentów programistycznych.