Zum Inhalt springen
fedi.software

Agenten

Modelle, gereiht nach agentischen Aufgaben – Tool-Aufrufe und mehrstufige Arbeit – in der Agenten-Rangliste von LMArena. Ihr Wert ist um null zentriert und kein Elo.

Aktualisiert · Quellen: LMArena, LiteLLM, models.dev

Kosten pro Monat
Tier Modell Wert Input / Output, pro 1M Pro Monat Kontext App Vergleichen
A0.035$ 0.30 / $ 1.05Kostenlos 1M
B0.024$ 0.40 / $ 1.40Kostenlos 1M
B-0.004$ 0.03 / $ 0.10Kostenlos 1M

Die Tiers stammen von uns: die Position eines Modells in der Rangliste, wobei nur Modelle zählen, deren gesamtes Konfidenzintervall darüber liegt. S – obere 10%, A – bis 30%, B – bis 60%, C – bis 85%, D – der Rest.

Qualität vs. Preis nach oben Wertung, nach rechts Mischpreis (3 Teile Input : 1 Output), USD pro 1M Tokens
-0.2 -0.1 0.0 0.1 0.2 $ 0.01 $ 0.10 $ 1 $ 10 Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Was wird hier verglichen?

Die Seite folgt der Agenten-Rangliste von LMArena. Die Modelle bekommen Aufgaben, die mehrere Schritte und den Einsatz von Werkzeugen verlangen – suchen, Dateien lesen, Code ausführen –, und Menschen beurteilen, welches Modell die Aufgabe besser gelöst hat. Verglichen werden nicht einzelne Antworten, sondern ganze Sitzungen.

Warum steht dort «Wert» statt Elo?

Diese Rangliste veröffentlicht keine Elo-Zahl, sondern einen Wert, der um null zentriert ist. Liegt ein Modell über null, wurde es häufiger bevorzugt als das durchschnittliche Modell dieser Tabelle, darunter seltener. Die Spalte heisst «Wert» und zeigt drei Nachkommastellen; als Stimmen zählen Sitzungen. Weil die Skala eine andere ist, dürfen Sie diese Zahlen nicht mit den Elo-Wertungen der Text- oder Coding-Rangliste vergleichen – nur Modelle innerhalb dieser Seite miteinander.

Werden die Tiers gleich berechnet?

Ja. Die Regel hängt nur von den Konfidenzintervallen und dem Anteil an der Tabelle ab, nicht von der Skala. Für ein Tier sind mindestens 300 Sitzungen nötig. Die Position ist eins plus die Zahl der Modelle, deren Intervall vollständig darüber liegt; die ersten 10% der Positionen erhalten S, bis 30% A, bis 60% B, bis 85% C, der Rest D.

Was zeigt eine Zeile ausserdem?

  • Hersteller und ob die Gewichte offen sind;
  • den günstigsten Preis pro Million Tokens bei den Anbietern, laut models.dev und LiteLLM;
  • das Kontextfenster – für Agenten, die viel lesen, ein wichtiger Wert;
  • den Preisverlauf über 30 Tage.

Welche Einschränkungen gibt es?

Die Rangliste ist jünger als die Text-Arena und umfasst weniger Modelle. Ausserdem entspricht die Umgebung, in der die Agenten in der Arena arbeiten, nicht Ihrer eigenen: Ein Modell, das dort überzeugt, kann sich in Ihrem Coding-Agenten oder Ihrer Automatisierung anders verhalten. Die Werkzeuge selbst finden Sie unter Coding-Agenten; testen Sie die engere Wahl an einer echten Aufgabe, bevor Sie sich festlegen.