Naar de inhoud
fedi.software

Methodologie van fedi-index

Bronnen, licenties, gewichten en formules van de index — weergegeven vanuit dezelfde configuratie die de berekening gebruikt.

Methodologie v1 · Live data voor 2026-10 (dagelijks herberekend) · Geschiedenis · JSON

  • Alleen bronnen met een expliciete open licentie (CC BY, MIT, Apache) komen in de index; bronnen die nog op toestemming wachten blijven uitgeschakeld.
  • Onafhankelijke runs tellen; eigen opgaven van makers worden met een label getoond en krijgen geen gewicht.
  • Eén bronfamilie is één stem: gecorreleerde categorieën van dezelfde stemmers tellen niet op.
  • Elke score heeft een openbare opbouw: onderdeel, bron, waarde, gewicht en datum.
  • Onzekerheid is zichtbaar: een score komt met zijn interval, weinig data betekent ‘voorlopig’.

Bronnen en licenties

Bron Familie Licentie In de index
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (menselijke stemmen) CC BY 4.0 ja
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (benchmarks) CC BY 4.0 ja
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (agents) MIT ja
LiveBench LiveBench — wacht op toestemming
Terminal-Bench Terminal-Bench — wacht op toestemming
SWE-rebench SWE-rebench — wacht op toestemming
Toolathlon Toolathlon — wacht op toestemming
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT ja
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT ja
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — ja

Doorsneden en gewichten

Algemeen

Arena (menselijke stemmen) aandeel 50%

  • text/overall text/overall2
  • text/hard_prompts text/hard_prompts2
  • text/expert text/expert1
  • text/instruction_following text/instruction_following1
  • text/multi_turn text/multi_turn0,50
  • text/longer_query text/longer_query0,50

Epoch AI (benchmarks) aandeel 50%

  • Epoch Capabilities Index eci3
  • GPQA Diamond gpqa_diamond0,50
  • SimpleQA Verified simpleqa_verified0,50

Coderen

Arena (menselijke stemmen) aandeel 60%

  • text/coding text/coding1,5
  • webdev/overall webdev/overall1,5

Epoch AI (benchmarks) aandeel 40%

  • SWE-bench Verified swe_bench_verified1

Agents

Arena (menselijke stemmen) aandeel 60%

  • agent/overall agent/overall1

τ²-bench (agents) aandeel 40%

  • τ-Knowledge banking tau2/banking_knowledge1,5
  • τ²-bench retail tau2/retail1
  • τ²-bench airline tau2/airline1
  • τ²-bench telecom tau2/telecom1

Wiskunde

Arena (menselijke stemmen) aandeel 50%

  • text/math text/math1

Epoch AI (benchmarks) aandeel 50%

  • FrontierMath Tiers 1–3 frontiermath_t1_32
  • FrontierMath Tier 4 frontiermath_t41

Beeld voorlopig

Arena (menselijke stemmen) aandeel 100%

  • vision/overall vision/overall2
  • vision/ocr vision/ocr0,50
  • vision/diagram vision/diagram0,50

Zoeken voorlopig

Arena (menselijke stemmen) aandeel 100%

  • search/overall search/overall1

Schrijven voorlopig

Arena (menselijke stemmen) aandeel 100%

  • text/creative_writing text/creative_writing2
  • text/longer_query text/longer_query1

Talen voorlopig

Arena-stemmen in elke taal; een doorsnede wordt getoond op de versie van de site in die taal.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

Benchmarks en hun leeftijd

Onderdeel Versie uitgebracht
Epoch Capabilities Index eci live (geen verval)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

Een oudere benchmarkversie krijgt minder gewicht (contaminatie, verzadiging): het gewicht halveert elke decay_half_life maanden, tot minimaal decay_min.

Formules

Elk onderdeel wordt naar de Arena-schaal gebracht door lineaire equating op de modellen die door beide zijn gemeten (anker A = Arena text overall). De parameters worden vastgelegd op de referentiemomentopname van de methodologieversie, zodat maanden vergelijkbaar blijven.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

Binnen een doorsnede worden de onderdelen gemiddeld met hun gewichten, betrouwbaarheid (τ) en de leeftijd van de benchmark; een model met weinig data wordt naar de prior getrokken. Parameters:

anchor
arena:text/overall
total_weight
8
tau
15
w0
0,50
prior_pct
25
min_anchors
8
min_votes
300
min_confidence
0,90
decay_half_life
18
decay_min
0,25
outlier_sigma
3
outlier_factor
0,50
population_months
18
jump_sigma
3

Niveau = het slechtste van het niveau op percentiel en het niveau op betrouwbaarheidsinterval; een model met één bronfamilie krijgt hoogstens A.

Niveau = het slechtste van het niveau op percentiel en het niveau op betrouwbaarheidsinterval; een model met één bronfamilie krijgt hoogstens A.

provisional_max
A

S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25

Niveau op betrouwbaarheidsinterval (bovengrens van de rang / modellen): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%

Prijs-kwaliteit: kwaliteit voor de prijs

Prijs-kwaliteit is de afstand boven de regressielijn van kwaliteit op log₂ van de prijs; de prijs is de mediaan van aanbieders.

slice
general
input_share
3
output_share
1
price_sources
modelsdev, litellm
unit
1m_tokens

Op je eigen hardware

Lokaal: alleen open gewichten, de beste kwantisatie die in een opstelling past, de score geschaald naar generatiesnelheid.

slice
general
context
8.192
speed_ref
20
low_penalty
0,60
  • GPU 12 GB
  • GPU 24 GB
  • Mac 64 GB
  • 128 GB unified memory
  • CPU, 32 GB RAM

Data, licentie en archief

De index (onze cijfers en opbouw) valt onder CC BY 4.0: ‘fedi-index by fedi.software’ met een link. De onderdelen behouden de licenties van hun bronnen, vermeld in sources[] van de JSON.

Op de 1e van elke maand wordt een momentopname bevroren die nooit meer verandert; een nieuwe methodologieversie start een nieuwe reeks.

Maandelijkse JSON: 2026-10

Wijzigingslog

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.