İçeriğe geç
fedi.software

fedi-index: Ajanlar

Ajan olarak modeller: araç kullanımı ve çok adımlı görevler — Arena ajan oturumları ve τ²-bench çalıştırmaları.

2026-10 canlı verileri (her gün yeniden hesaplanır) · Metodoloji v1 · Metodoloji · Geçmiş · JSON

# Seviye Model fedi-index Yüzdelik İnsanlar tercih ediyor Görevleri çözüyor Fiyat/performans Kaynaklar Puan ayrıştırması
13B1.456 ±5791.4591.449 +44 Aτ›
14B1.454 ±5771.4561.449 +45 Aτ›
17B1.449 ±2721.459— +92◆ A›
19B1.448 ±3681.458— — A›
24B1.442 ±3601.451— +60 A›
27B1.435 ±7541.445— +33 A›
30C1.430 ±2491.439— +105◆ A›
32C1.428 ±3461.437— — A›
33C1.428 ±6441.438— +98◆ A›
36C1.424 ±3391.433— +46 A›
42C1.408 ±5281.416— +68 A›
47D1.402 ±4191.410— +50 A›
49D1.399 ±4161.407— +80 A›
53D1.388 ±87—1.411 +23 τ›
54D1.388 ±87—1.411 +27 τ›
55D1.386 ±651.394— +38 A›
56D1.384 ±441.392— +26 A›
57D1.377 ±621.384— -19 A›

…

AArena (insan oyları)ττ²-bench (ajanlar) ◆ Pareto sınırı: hem daha iyi hem daha ucuz olan yok

fedi-index sabit ölçekte bir Elo eşdeğeridir: aynı metodoloji sürümünde aylar arasında karşılaştırılabilir. S–D kademeleri: kesitteki yüzdeliğe göre ve güven aralığının izin verdiğinden iyi olmamak üzere (eşikler metodolojide). “Geçici” — modeli burada yalnızca bir kaynak ailesi ölçtü. Metodoloji

Sitenize ekleyin

Siteniz için widget olarak tablo: kendini günceller ve kaynakların atıfını korur.

JSON fedi-index © fedi.software, CC BY 4.0; bileşenler kaynaklarının lisanslarını korur.