Zum Inhalt springen
fedi.software

Methodik des fedi-index

Quellen, Lizenzen, Gewichte und Formeln des Index – direkt aus derselben Konfiguration, mit der gerechnet wird.

Methodik v1 · Live-Daten für 2026-10 (täglich neu berechnet) · Verlauf · JSON

  • In den Index gehen nur Quellen mit ausdrücklich offener Lizenz ein (CC BY, MIT, Apache); Quellen, die noch auf Erlaubnis warten, bleiben deaktiviert.
  • Unabhängige Läufe zählen; Selbstangaben der Hersteller werden gekennzeichnet angezeigt und erhalten kein Gewicht.
  • Eine Quellenfamilie ist eine Stimme: korrelierte Kategorien derselben Abstimmenden summieren sich nicht.
  • Jeder Wert hat eine öffentliche Aufschlüsselung: Komponente, Quelle, Wert, Gewicht und Datum.
  • Unsicherheit ist sichtbar: ein Wert kommt mit seinem Intervall, wenig Daten bedeuten „vorläufig“.

Quellen und Lizenzen

Quelle Familie Lizenz Im Index
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (menschliche Stimmen) CC BY 4.0 ja
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (Benchmarks) CC BY 4.0 ja
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (Agenten) MIT ja
LiveBench LiveBench — wartet auf Erlaubnis
Terminal-Bench Terminal-Bench — wartet auf Erlaubnis
SWE-rebench SWE-rebench — wartet auf Erlaubnis
Toolathlon Toolathlon — wartet auf Erlaubnis
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT ja
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT ja
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — ja

Bereiche und Gewichte

Allgemein

Arena (menschliche Stimmen) Anteil 50 %

  • text/overall text/overall2
  • text/hard_prompts text/hard_prompts2
  • text/expert text/expert1
  • text/instruction_following text/instruction_following1
  • text/multi_turn text/multi_turn0,50
  • text/longer_query text/longer_query0,50

Epoch AI (Benchmarks) Anteil 50 %

  • Epoch Capabilities Index eci3
  • GPQA Diamond gpqa_diamond0,50
  • SimpleQA Verified simpleqa_verified0,50

Code

Arena (menschliche Stimmen) Anteil 60 %

  • text/coding text/coding1,5
  • webdev/overall webdev/overall1,5

Epoch AI (Benchmarks) Anteil 40 %

  • SWE-bench Verified swe_bench_verified1

Agenten

Arena (menschliche Stimmen) Anteil 60 %

  • agent/overall agent/overall1

τ²-bench (Agenten) Anteil 40 %

  • τ-Knowledge banking tau2/banking_knowledge1,5
  • τ²-bench retail tau2/retail1
  • τ²-bench airline tau2/airline1
  • τ²-bench telecom tau2/telecom1

Mathematik

Arena (menschliche Stimmen) Anteil 50 %

  • text/math text/math1

Epoch AI (Benchmarks) Anteil 50 %

  • FrontierMath Tiers 1–3 frontiermath_t1_32
  • FrontierMath Tier 4 frontiermath_t41

Vision vorläufig

Arena (menschliche Stimmen) Anteil 100 %

  • vision/overall vision/overall2
  • vision/ocr vision/ocr0,50
  • vision/diagram vision/diagram0,50

Suche vorläufig

Arena (menschliche Stimmen) Anteil 100 %

  • search/overall search/overall1

Schreiben vorläufig

Arena (menschliche Stimmen) Anteil 100 %

  • text/creative_writing text/creative_writing2
  • text/longer_query text/longer_query1

Sprachen vorläufig

Arena-Stimmen in jeder Sprache; ein Bereich wird auf der Website-Version in dieser Sprache angezeigt.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

Benchmarks und ihr Alter

Komponente Version veröffentlicht
Epoch Capabilities Index eci live (keine Alterung)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

Eine ältere Benchmark-Version erhält weniger Gewicht (Kontamination, Sättigung): das Gewicht halbiert sich alle decay_half_life Monate, bis hinunter zu decay_min.

Formeln

Jede Komponente wird per linearem Equating über die von beiden gemessenen Modelle auf die Arena-Skala übertragen (Anker A = Arena text overall). Die Parameter sind auf dem Referenz-Snapshot der Methodikversion fixiert, sodass Monate vergleichbar bleiben.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

Innerhalb eines Bereichs werden die Komponenten mit ihren Gewichten, ihrer Zuverlässigkeit (τ) und dem Benchmark-Alter gemittelt; ein Modell mit wenig Daten wird zum Prior gezogen. Parameter:

anchor
arena:text/overall
total_weight
8
tau
15
w0
0,50
prior_pct
25
min_anchors
8
min_votes
300
min_confidence
0,90
decay_half_life
18
decay_min
0,25
outlier_sigma
3
outlier_factor
0,50
population_months
18
jump_sigma
3

Tier = das schlechtere aus Tier nach Perzentil und Tier nach Konfidenzintervall; ein Modell mit einer Quellenfamilie erhält höchstens A.

Tier = das schlechtere aus Tier nach Perzentil und Tier nach Konfidenzintervall; ein Modell mit einer Quellenfamilie erhält höchstens A.

provisional_max
A

S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25

Tier nach Konfidenzintervall (obere Rangschranke / Modelle): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%

Preis-Leistung: Qualität für den Preis

Preis-Leistung ist der Abstand über der Regressionslinie der Qualität auf log₂ des Preises; der Preis ist der Median der Anbieter.

slice
general
input_share
3
output_share
1
price_sources
modelsdev, litellm
unit
1m_tokens

Auf deiner Hardware

Lokal: nur offene Gewichte, die beste Quantisierung, die in ein Setup passt, der Wert skaliert nach Generierungsgeschwindigkeit.

slice
general
context
8.192
speed_ref
20
low_penalty
0,60
  • GPU 12 GB
  • GPU 24 GB
  • Mac 64 GB
  • 128 GB Unified Memory
  • CPU, 32 GB RAM

Daten, Lizenz und Archiv

Der Index (unsere Zahlen und Aufschlüsselungen) steht unter CC BY 4.0: „fedi-index by fedi.software“ mit Link. Die Komponenten behalten die Lizenzen ihrer Quellen, aufgeführt in sources[] des JSON.

Am 1. jedes Monats wird ein Snapshot eingefroren und nie mehr geändert; eine neue Methodikversion beginnt eine neue Reihe.

Monatliches JSON: 2026-10

Änderungsprotokoll

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.