Zum Inhalt springen
fedi.software

Grok 4.20 Multi-Agent im fedi-index

Der Wert in jedem Bereich, woraus er besteht, Preis-Leistung, lokaler Betrieb und Verlauf.

fedi-index · Allgemein

B 1’413 ±2

Perzentil 76 · #71 · vorläufig

Menschen bevorzugen / Löst Aufgaben

1’426 / —

Menschliche Stimmen vs. Benchmarks, Elo-eq

Preis-Leistung

+24

$ 1.56 pro 1 Mio. Tokens, Median von 5 Anbietern · beim Hersteller $ 1.56

Auf deiner Hardware

Geschlossene Gewichte: nur Cloud.

Aufschlüsselung des Werts

B Allgemein 1’413 [1’411–1’415] Perzentil 76 · #71 · Komponenten: 6 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/overall 1’450 ±1.88 1’450 ±2 25.6% 2026-10-02 —
LMArena text/hard_prompts 1’448 ±2.26 1’438 ±2 25.5% 2026-10-02 —
LMArena text/instruction_following 1’420 ±2.71 1’432 ±3 12.6% 2026-10-02 —
LMArena text/expert 1’445 ±4.10 1’432 ±3 12.4% 2026-10-02 —
LMArena text/longer_query 1’431 ±2.64 1’429 ±2 6.3% 2026-10-02 —
LMArena text/multi_turn 1’452 ±3.40 1’446 ±3 6.2% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

B Code 1’410 [1’406–1’415] Perzentil 74 · #74 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/coding 1’458 ±2.91 1’433 ±3 90.3% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

B Mathematik 1’405 [1’396–1’413] Perzentil 74 · #67 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/math 1’441 ±5.36 1’433 ±5 87.7% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

B Vision 1’421 [1’418–1’425] Perzentil 58 · #48 · Komponenten: 3 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena vision/overall 1’259 ±3.13 1’438 ±3 63.0% 2026-10-02 —
LMArena vision/ocr 1’261 ±3.15 1’434 ±3 15.7% 2026-10-02 —
LMArena vision/diagram 1’261 ±4.41 1’428 ±4 15.3% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

B Suche 1’431 [1’426–1’436] Perzentil 66 · #12 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena search/overall 1’204 ±2.70 1’446 ±3 93.9% 2026-08-24 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

A Schreiben 1’438 [1’433–1’442] Perzentil 83 · #47 · Komponenten: 2 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/creative_writing 1’436 ±3.45 1’465 ±4 62.0% 2026-10-02 —
LMArena text/longer_query 1’431 ±2.64 1’429 ±2 31.8% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

B Sprache: 繁體中文 1’419 [1’412–1’426] Perzentil 71 · #65 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/chinese 1’475 ±5.02 1’434 ±4 93.7% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

A Sprache: Deutsch 1’432 [1’417–1’448] Perzentil 80 · #29 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/german 1’457 ±9.87 1’451 ±8 92.4% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

A Sprache: English 1’429 [1’424–1’434] Perzentil 82 · #51 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/english 1’453 ±2.49 1’444 ±3 94.0% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

B Sprache: Español 1’426 [1’414–1’438] Perzentil 73 · #41 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/spanish 1’448 ±7.31 1’443 ±7 93.0% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

B Sprache: Français 1’431 [1’419–1’443] Perzentil 73 · #37 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/french 1’467 ±7.23 1’448 ±7 93.0% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

B Sprache: 日本語 1’412 [1’395–1’429] Perzentil 64 · #47 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/japanese 1’405 ±13 1’430 ±10 92.0% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

B Sprache: 한국어 1’430 [1’416–1’444] Perzentil 78 · #30 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/korean 1’417 ±9.93 1’448 ±8 92.7% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

A Sprache: Polski 1’436 [1’423–1’449] Perzentil 81 · #26 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/polish 1’455 ±8.30 1’454 ±7 92.9% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

A Sprache: Русский 1’442 [1’436–1’449] Perzentil 86 · #34 · Komponenten: 1 vorläufig
Quelle Komponente Wert Elo-eq Gewicht Gemessen Variante
LMArena text/russian 1’457 ±3.93 1’458 ±4 93.8% 2026-10-02 —

Das Gewicht ist der Anteil der Komponente am Wert (der Rest ist der Prior, der Modelle mit wenig Daten zum Median der Population zieht). Methodik

Verlauf

fedi-index nach Monat
Dasselbe als Tabelle
Modell 2026-10
Grok 4.20 Multi-Agent 1’413 B

Badge

Zeige den fedi-index des Modells auf deiner Website oder in einer README. Das Badge aktualisiert sich selbst und verlinkt auf diese Seite.

fedi-index: Grok 4.20 Multi-Agent

Daten CC BY 4.0: Link zu fedi.software beibehalten.