Przejdź do treści
fedi.software

Metodologia fedi-index

Źródła, licencje, wagi i wzory indeksu — generowane z tej samej konfiguracji, której używają obliczenia.

Metodologia v1 · Dane bieżące za 2026-10 (przeliczane codziennie) · Historia · JSON

  • Do indeksu trafiają tylko źródła z jawną otwartą licencją (CC BY, MIT, Apache); źródła czekające na zgodę pozostają wyłączone.
  • Liczą się niezależne przebiegi; deklaracje producentów są pokazywane z oznaczeniem i nie mają wagi.
  • Jedna rodzina źródeł to jeden głos: skorelowane kategorie tych samych głosujących się nie sumują.
  • Każdy wynik ma publiczny rozkład: składnik, źródło, wartość, waga i data.
  • Niepewność jest widoczna: wynik podawany jest z przedziałem, mało danych oznacza „wstępny”.

Źródła i licencje

Źródło Rodzina Licencja W indeksie
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (głosy ludzi) CC BY 4.0 tak
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (benchmarki) CC BY 4.0 tak
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (agenci) MIT tak
LiveBench LiveBench — czeka na zgodę
Terminal-Bench Terminal-Bench — czeka na zgodę
SWE-rebench SWE-rebench — czeka na zgodę
Toolathlon Toolathlon — czeka na zgodę
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT tak
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT tak
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — tak

Przekroje i wagi

Ogólny

Arena (głosy ludzi) udział 50%

  • text/overall text/overall2
  • text/hard_prompts text/hard_prompts2
  • text/expert text/expert1
  • text/instruction_following text/instruction_following1
  • text/multi_turn text/multi_turn0,50
  • text/longer_query text/longer_query0,50

Epoch AI (benchmarki) udział 50%

  • Epoch Capabilities Index eci3
  • GPQA Diamond gpqa_diamond0,50
  • SimpleQA Verified simpleqa_verified0,50

Programowanie

Arena (głosy ludzi) udział 60%

  • text/coding text/coding1,5
  • webdev/overall webdev/overall1,5

Epoch AI (benchmarki) udział 40%

  • SWE-bench Verified swe_bench_verified1

Agenci

Arena (głosy ludzi) udział 60%

  • agent/overall agent/overall1

τ²-bench (agenci) udział 40%

  • τ-Knowledge banking tau2/banking_knowledge1,5
  • τ²-bench retail tau2/retail1
  • τ²-bench airline tau2/airline1
  • τ²-bench telecom tau2/telecom1

Matematyka

Arena (głosy ludzi) udział 50%

  • text/math text/math1

Epoch AI (benchmarki) udział 50%

  • FrontierMath Tiers 1–3 frontiermath_t1_32
  • FrontierMath Tier 4 frontiermath_t41

Obraz wstępny

Arena (głosy ludzi) udział 100%

  • vision/overall vision/overall2
  • vision/ocr vision/ocr0,50
  • vision/diagram vision/diagram0,50

Wyszukiwanie wstępny

Arena (głosy ludzi) udział 100%

  • search/overall search/overall1

Pisanie wstępny

Arena (głosy ludzi) udział 100%

  • text/creative_writing text/creative_writing2
  • text/longer_query text/longer_query1

Języki wstępny

Głosy Arena w każdym języku; przekrój jest pokazywany w wersji strony w tym języku.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

Benchmarki i ich wiek

Składnik Wydanie wersji
Epoch Capabilities Index eci na bieżąco (bez wygaszania)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

Starsza wersja benchmarku dostaje mniejszą wagę (kontaminacja, nasycenie): waga spada o połowę co decay_half_life miesięcy, aż do decay_min.

Wzory

Każdy składnik jest przenoszony na skalę Arena przez liniowe zrównanie na modelach zmierzonych przez oba źródła (kotwica A = Arena text overall). Parametry są ustalane na migawce referencyjnej wersji metodologii, dzięki czemu miesiące pozostają porównywalne.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

W obrębie przekroju składniki są uśredniane z ich wagami, wiarygodnością (τ) i wiekiem benchmarku; model z małą ilością danych jest przyciągany do prioru. Parametry:

anchor
arena:text/overall
total_weight
8
tau
15
w0
0,50
prior_pct
25
min_anchors
8
min_votes
300
min_confidence
0,90
decay_half_life
18
decay_min
0,25
outlier_sigma
3
outlier_factor
0,50
population_months
18
jump_sigma
3

Poziom = gorszy z poziomu według percentyla i poziomu według przedziału ufności; model z jedną rodziną źródeł dostaje najwyżej A.

Poziom = gorszy z poziomu według percentyla i poziomu według przedziału ufności; model z jedną rodziną źródeł dostaje najwyżej A.

provisional_max
A

S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25

Poziom według przedziału ufności (górna granica pozycji / modele): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%

Opłacalność: jakość za cenę

Opłacalność to odległość powyżej linii regresji jakości względem log₂ ceny; cena to mediana dostawców.

slice
general
input_share
3
output_share
1
price_sources
modelsdev, litellm
unit
1m_tokens

Na twoim sprzęcie

Lokalnie: tylko otwarte wagi, najlepsza kwantyzacja mieszcząca się w konfiguracji, wynik skalowany szybkością generowania.

slice
general
context
8 192
speed_ref
20
low_penalty
0,60
  • GPU 12 GB
  • GPU 24 GB
  • Mac 64 GB
  • 128 GB pamięci zunifikowanej
  • CPU, 32 GB RAM

Dane, licencja i archiwum

Indeks (nasze liczby i rozkłady) jest na licencji CC BY 4.0: „fedi-index by fedi.software” z linkiem. Składniki zachowują licencje swoich źródeł, wymienione w sources[] w JSON.

Migawka jest zamrażana 1. dnia każdego miesiąca i nigdy się nie zmienia; nowa wersja metodologii rozpoczyna nową serię.

Miesięczny JSON: 2026-10

Lista zmian

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.