Zum Inhalt springen
fedi.software

Text

Chatmodelle, gereiht nach blinden Abstimmungen von Menschen auf LMArena, mit dem Konfidenzintervall jeder Wertung und dem aktuellen Preis pro Million Tokens.

Aktualisiert · Quellen: LMArena, LiteLLM, models.dev

Kosten pro Monat
Tier Modell Elo Input / Output, pro 1M Pro Monat Kontext App Vergleichen
A1’438$ 0.1644 / $ 0.9864Kostenlos 262K
A1’417$ 0.144 / $ 0.574Kostenlos 131K
A1’417$ 0.1126 / $ 0.9008Kostenlos 262K
B1’356$ 0.13 / $ 0.50Kostenlos 262K
B1’348$ 0.05 / $ 0.20Kostenlos 131K
B1’338$ 0.40 / $ 0.40Kostenlos 131K
B1’320Kostenlos 128K
B1’283$ 0.357 / $ 0.408Kostenlos 128K
C1’230$ 0.06 / $ 0.20Kostenlos 33K

Die Tiers stammen von uns: die Position eines Modells in der Rangliste, wobei nur Modelle zählen, deren gesamtes Konfidenzintervall darüber liegt. S – obere 10%, A – bis 30%, B – bis 60%, C – bis 85%, D – der Rest.

Qualität vs. Preis nach oben Wertung, nach rechts Mischpreis (3 Teile Input : 1 Output), USD pro 1M Tokens
1’000 1’200 1’400 1’600 $ 0.01 $ 0.10 $ 1 $ 10 $ 100 Claude Opus 5.5 Claude Fable 5.1 Claude Opus 5

Wie die Rangliste entsteht

Grundlage ist die Text-Arena von LMArena in der Gesamtkategorie. Eine Person schickt eine Anfrage, zwei anonyme Modelle antworten, die Person wählt die überzeugendere Antwort – erst danach werden die Namen aufgedeckt. Aus sehr vielen solcher Duelle entsteht eine Wertung nach dem Elo-Prinzip, wie man es vom Schach kennt.

Jede Zeile ergänzt diese Wertung um Daten aus weiteren Quellen: Hersteller, Kennzeichnung für offene Gewichte, der niedrigste aktuelle Preis pro Million Input- und Output-Tokens bei allen Anbietern, das Kontextfenster, der Preisverlauf der letzten 30 Tage und – wenn es vom Hersteller eine App in unserem Katalog gibt – ein Download-Link.

Eine Zeile richtig lesen

  • Tier: unser Buchstabe von S bis D.
  • Elo mit Balken: der Balken zeigt das 95%-Konfidenzintervall. Überschneiden sich die Intervalle zweier Modelle, ist der Unterschied statistisch nicht gesichert.
  • Preis: das günstigste Angebot am Stichtag der Daten, in US-Dollar, getrennt nach Input und Output.
  • Kontext: wie viele Tokens das Modell pro Anfrage aufnimmt.

Ein Klick auf die Zeile öffnet Details: Anbieter nach Preis sortiert, Modalitäten, maximale Ausgabe, Zahl der Stimmen, Rang bei der Quelle, Lizenz, Veröffentlichung und Wissensstand.

So vergeben wir Tiers

Berücksichtigt werden Modelle mit mindestens 300 Stimmen. Für jedes Modell zählen wir, wie viele andere ihr gesamtes Intervall oberhalb seines Intervalls haben; diese Zahl, geteilt durch die Anzahl der Modelle, ergibt die Position. Unter 10% heisst S, unter 30% A, unter 60% B, unter 85% C, der Rest D. Modelle, die sich statistisch nicht vom Spitzenreiter unterscheiden, teilen sich S. Neue Modelle mit wenigen Stimmen tragen den Hinweis «Noch kein Tier».

Werkzeuge auf der Seite

Die Filter-Chips grenzen nach offenen Gewichten, kostenlosem Zugang, «Günstig» (Mischpreis unter 1 US-Dollar pro Million Tokens) und Hersteller ein. Der Rechner «Kosten pro Monat» macht aus Ihrem monatlichen Token-Volumen und dem Input-Anteil einen Betrag für jedes Modell. Die Grafik «Qualität vs. Preis» nutzt einen Mischpreis aus 3 Teilen Input und 1 Teil Output. Bis zu 4 Modelle lassen sich für einen Vergleich markieren.

Was die Rangliste nicht sagt

Arena-Stimmen messen Vorlieben, überwiegend bei englischen Anfragen. Über Geschwindigkeit sagen sie nichts, über Spezialaufgaben wie Vertragsentwürfe oder Mathematik wenig. Der Preis bei einem Anbieter kann ausserdem vom Listenpreis des Herstellers abweichen; Rabatte für Caching, Batch-Anfragen und regionale Preise sind nicht abgebildet.