Aller au contenu
fedi.software

grok-4.1-thinking dans le fedi-index

Le score dans chaque catégorie, sa composition, le rapport qualité-prix, l'exécution locale et l'historique.

fedi-index · Général

B 1 400 ±2

Percentile 68 · #95 · provisoire

Préféré par les humains / Résout des tâches

1 411 / —

Votes humains et benchmarks, Elo-eq

Rapport qualité-prix

-12

4 $US par million de tokens, médiane de 1 fournisseurs

Sur votre matériel

Poids fermés : cloud uniquement.

Décomposition du score

B Général 1 400 [1 398–1 401] Percentile 68 · #95 · composantes : 6 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/overall 1 437 ±1,61 1 437 ±2 25,6% 2026-10-02 thinking
LMArena text/hard_prompts 1 435 ±2,02 1 427 ±2 25,6% 2026-10-02 —
LMArena text/instruction_following 1 400 ±2,57 1 413 ±2 12,6% 2026-10-02 —
LMArena text/expert 1 417 ±4,45 1 409 ±4 12,2% 2026-10-02 thinking
LMArena text/longer_query 1 416 ±2,54 1 415 ±2 6,3% 2026-10-02 —
LMArena text/multi_turn 1 438 ±3,15 1 433 ±3 6,3% 2026-10-02 —

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Code 1 380 [1 377–1 382] Percentile 57 · #120 · composantes : 2 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena webdev/overall 1 241 ±5,65 1 376 ±2 45,6% 2026-10-01 fast-reasoning
LMArena text/coding 1 445 ±2,80 1 422 ±2 44,8% 2026-10-02 thinking

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Maths 1 389 [1 381–1 397] Percentile 62 · #98 · composantes : 1 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/math 1 422 ±4,91 1 414 ±5 87,9% 2026-10-02 thinking

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

C Vision 1 371 [1 367–1 376] Percentile 38 · #70 · composantes : 3 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena vision/overall 1 201 ±3,54 1 385 ±3 63,3% 2026-10-02 fast-reasoning
LMArena vision/ocr 1 195 ±3,78 1 370 ±4 15,6% 2026-10-02 fast-reasoning
LMArena vision/diagram 1 210 ±5,59 1 384 ±5 14,9% 2026-10-02 fast-reasoning

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Écriture 1 418 [1 413–1 422] Percentile 73 · #72 · composantes : 2 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/creative_writing 1 411 ±3,37 1 440 ±3 62,0% 2026-10-02 —
LMArena text/longer_query 1 416 ±2,54 1 415 ±2 31,8% 2026-10-02 —

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Langue : 繁體中文 1 411 [1 405–1 418] Percentile 67 · #74 · composantes : 1 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/chinese 1 464 ±4,42 1 425 ±4 93,8% 2026-10-02 —

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Langue : Deutsch 1 425 [1 411–1 439] Percentile 74 · #38 · composantes : 1 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/german 1 446 ±9,00 1 442 ±8 92,7% 2026-10-02 —

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Langue : English 1 423 [1 419–1 427] Percentile 75 · #69 · composantes : 1 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/english 1 447 ±2,24 1 437 ±2 94,0% 2026-10-02 —

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Langue : Español 1 418 [1 406–1 430] Percentile 64 · #55 · composantes : 1 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/spanish 1 438 ±7,27 1 434 ±7 93,0% 2026-10-02 thinking

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Langue : Français 1 414 [1 401–1 427] Percentile 55 · #61 · composantes : 1 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/french 1 448 ±7,97 1 430 ±7 92,8% 2026-10-02 thinking

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Langue : 日本語 1 407 [1 391–1 422] Percentile 58 · #54 · composantes : 1 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/japanese 1 396 ±11 1 424 ±8 92,4% 2026-10-02 —

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Langue : 한국어 1 423 [1 410–1 436] Percentile 72 · #39 · composantes : 1 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/korean 1 407 ±9,39 1 440 ±7 92,9% 2026-10-02 —

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

A Langue : Polski 1 437 [1 426–1 448] Percentile 82 · #25 · composantes : 1 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/polish 1 455 ±7,00 1 454 ±6 93,3% 2026-10-02 thinking

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

B Langue : Русский 1 423 [1 417–1 429] Percentile 75 · #60 · composantes : 1 provisoire
Source Composante Valeur Elo-eq Poids Mesuré le Variante
LMArena text/russian 1 434 ±3,63 1 437 ±3 93,9% 2026-10-02 thinking

Le poids est la part de la composante dans le score (le reste est le prior, qui ramène les modèles peu mesurés vers la médiane de la population). Méthodologie

Historique

fedi-index par mois
La même chose en tableau
Modèle 2026-10
grok-4.1-thinking 1 400 B

Badge

Affichez le fedi-index du modèle sur votre site ou dans un README. Le badge se met à jour tout seul et renvoie vers cette page.

fedi-index: grok-4.1-thinking

Données CC BY 4.0 : conservez le lien vers fedi.software.