К содержимому
fedi.software

Grok 4.20 (Reasoning) в fedi-index

Балл в каждом срезе, из чего он состоит, выгода, локальный запуск и история.

fedi-index · Общий

B 1 414 ±2

Процентиль 76 · #70

Люди предпочитают / Решает задачи

1 426 / 1 374

Голоса людей и бенчмарки, Elo-eq

Выгода

+26

1,56 $ за 1M токенов, медиана 13 провайдеров · у вендора 1,56 $

На твоём железе

Закрытые веса: только облако.

Разложение балла

B Общий 1 414 [1 412–1 417] Процентиль 76 · #70 · компонентов: 8
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/overall 1 451 ±1,87 1 451 ±2 21,0% 2026-10-02 —
LMArena text/hard_prompts 1 451 ±2,25 1 441 ±2 21,0% 2026-10-02 —
Epoch AI simpleqa_verified выброс устаревание ×0,61 0,30 ±0,01 1 392 ±5 10,4% 2026-08-27 —
LMArena text/instruction_following 1 420 ±2,71 1 432 ±3 10,4% 2026-10-02 —
LMArena text/expert 1 440 ±4,12 1 427 ±3 10,2% 2026-10-02 —
Epoch AI gpqa_diamond устаревание ×0,26 0,89 ±0,02 1 455 ±9 7,4% 2026-07-13 —
LMArena text/longer_query 1 436 ±2,62 1 434 ±2 5,2% 2026-10-02 —
LMArena text/multi_turn 1 456 ±3,33 1 450 ±3 5,1% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

B Код 1 402 [1 400–1 405] Процентиль 69 · #87 · компонентов: 2 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena webdev/overall 1 374 ±3,09 1 414 ±1 45,8% 2026-10-01 —
LMArena text/coding 1 459 ±2,93 1 434 ±3 44,6% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

A Математика 1 417 [1 411–1 424] Процентиль 82 · #47 · компонентов: 3
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/math 1 455 ±5,33 1 446 ±5 52,3% 2026-10-02 —
Epoch AI frontiermath_t1_3 устаревание ×0,86 0,45 ±0,03 1 418 ±6 28,4% 2026-07-13 —
Epoch AI frontiermath_t4 устаревание ×0,86 0,17 ±0,06 1 420 ±10 12,0% 2026-07-13 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

B Зрение 1 425 [1 421–1 429] Процентиль 62 · #44 · компонентов: 3 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena vision/overall 1 263 ±3,11 1 441 ±3 63,0% 2026-10-02 —
LMArena vision/ocr 1 266 ±3,11 1 439 ±3 15,7% 2026-10-02 —
LMArena vision/diagram 1 266 ±4,36 1 433 ±4 15,3% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

A Тексты 1 437 [1 432–1 441] Процентиль 82 · #50 · компонентов: 2 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/creative_writing 1 432 ±3,44 1 461 ±4 62,0% 2026-10-02 —
LMArena text/longer_query 1 436 ±2,62 1 434 ±2 31,9% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

B Язык: 繁體中文 1 424 [1 417–1 431] Процентиль 75 · #57 · компонентов: 1 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/chinese 1 481 ±4,99 1 439 ±4 93,7% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

B Язык: Deutsch 1 420 [1 404–1 435] Процентиль 68 · #47 · компонентов: 1 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/german 1 441 ±9,76 1 437 ±8 92,4% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

A Язык: English 1 433 [1 429–1 438] Процентиль 84 · #44 · компонентов: 1 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/english 1 457 ±2,47 1 448 ±3 94,0% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

B Язык: Español 1 423 [1 410–1 435] Процентиль 70 · #46 · компонентов: 1 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/spanish 1 444 ±7,18 1 439 ±7 93,0% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

A Язык: Français 1 439 [1 427–1 451] Процентиль 81 · #26 · компонентов: 1 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/french 1 476 ±7,34 1 457 ±7 93,0% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

B Язык: 日本語 1 418 [1 402–1 434] Процентиль 70 · #39 · компонентов: 1 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/japanese 1 413 ±12 1 436 ±9 92,2% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

B Язык: 한국어 1 430 [1 416–1 444] Процентиль 78 · #31 · компонентов: 1 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/korean 1 416 ±10 1 448 ±8 92,7% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

B Язык: Polski 1 433 [1 420–1 446] Процентиль 79 · #28 · компонентов: 1 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/polish 1 451 ±8,56 1 451 ±7 92,8% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

A Язык: Русский 1 443 [1 436–1 449] Процентиль 86 · #33 · компонентов: 1 предварительно
Источник Компонент Значение Elo-eq Вес Измерено Вариант
LMArena text/russian 1 458 ±3,91 1 459 ±4 93,8% 2026-10-02 —

Вес — доля компонента в балле (остальное — априорное значение, которое тянет модели с малым количеством данных к медиане популяции). Методика

История

fedi-index по месяцам
То же таблицей
Модель 2026-10
Grok 4.20 (Reasoning) 1 414 B

Бейдж

Покажите fedi-index модели на своём сайте или в README. Бейдж обновляется сам и ведёт на эту страницу.

fedi-index: Grok 4.20 (Reasoning)

Данные CC BY 4.0: сохраните ссылку на fedi.software.