İçeriğe geç
fedi.software

Ajanlar

Ajan görevlerinde — araç çağrıları ve çok adımlı işler — LMArena ajan sıralamasına göre sıralanan modeller. Puanı sıfır merkezlidir, Elo değildir.

Güncellendi · Kaynaklar: LMArena, LiteLLM, models.dev

Aylık maliyet
Seviye Model Puan Girdi / çıktı, 1 milyon başına Aylık Bağlam Uygulama Karşılaştır
S0,076— —
A0,042$1 / $4Ücretsiz 1M
A0,030$0,75 / $3,75 1M
B0,025$0,338 / $1,01 1M
B-0,007$0,10 / $0,20 262K
B-0,015$0,75 / $3,75 1M
C-0,017$0,045 / $0,32 262K
C-0,051$0,825 / $2,48 1M
C-0,072$0,282 / $1,13 1M
C-0,077$0,375 / $1,88 1M
C-0,077$1 / $6 1M

Seviyeler bizim hesabımızdır: bir modelin sıralamadaki yeri, yalnızca güven aralığının tamamı onun üzerinde olan modeller sayılarak belirlenir. S — ilk %10, A — %30'a kadar, B — %60'a kadar, C — %85'e kadar, D — geri kalanlar.

Kalite ve fiyat dikeyde puan, yatayda karma fiyat (3 birim girdi : 1 birim çıktı), 1 milyon token başına USD
-0,2 -0,1 0,0 0,1 0,2 $0,01 $0,10 $1 $10 Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Önce en önemli nokta: bu bir Elo değil

LMArena'nın ajan sıralaması başka bir ölçü kullanır. Modellerin Elo yerine sıfır etrafında ortalanmış bir puanı vardır; değerler kabaca negatiften pozitife uzanır. Sütunun adı «Puan»dır ve üç ondalık basamak gösterir. Sıfırın üzerindeki bir değer, insanların o modeli bu tablodaki ortalama modelden daha sık tercih ettiği anlamına gelir; sıfırın altı daha seyrek tercih edildiğini gösterir.

Pratik sonucu açıktır: modelleri yalnızca bu tablonun içinde karşılaştırın. Buradaki «Puan»ı metin ya da kodlama tablosundaki Elo ile yan yana koymak anlamsızdır, çünkü ölçekler farklıdır.

Neler değerlendiriliyor?

Görevler ajan türündedir: modelin araç çağırdığı, sonuçları okuduğu ve sonraki adıma karar verdiği çok adımlı işler. İnsanlar oturumun tamamını değerlendirir; burada oylar tek tek yanıtlar değil oturumlar olarak sayılır. Bir soruyu yanıtlamanın yetmediği işlerde hangi modellerin iş gördüğünü anlamanın bir yoludur.

Diğer sütunlar alışıldık olanlardır:

  • diğer tablolardaki kuralla hesaplanan seviye;
  • models.dev ve LiteLLM'den 1M token başına girdi ve çıktı fiyatı;
  • bağlam penceresi ve 30 günlük fiyat değişimi;
  • «Aylık maliyet» hesaplayıcısı ve karşılaştırma kutucuğu.

Seviyeler burada nasıl işler?

Bir modelin harf alması için en az 300 oy gerekir; yoksa «Henüz seviye yok» yazar. Sıra %95 güven aralıklarıyla hesaplanır: aralığı tamamen üstte kalan modellerin sayısına bir eklenir. Ardından harfler %10, %30, %60 ve %85 eşikleriyle dağıtılır. Ajanlar genç bir tablo olduğu ve metin tablosundan daha az model içerdiği için dağılım günden güne daha çok oynayabilir.

Diğer uyarılar

Arenada kullanılan ajan ortamı sizin kullanacağınız ortam değildir. Sizin ajanınızın başka araçları, başka talimatları ve başka sınırları olacak; bu da sonucu değiştirir. Tabloyu kısa liste çıkarmak için bir ipucu olarak görün, sonra modelleri kendi iş akışınızda deneyin. Ajanı çalıştıran programı arıyorsanız kodlama ajanlarına, ajanın yeteneklerini genişletmek istiyorsanız ajan becerileri dizinine bakın.