Aller au contenu
fedi.software

Méthodologie du fedi-index

Sources, licences, pondérations et formules de l'index — générées à partir de la configuration même qu'utilise le calcul.

Méthodologie v1 · Données en direct pour 2026-10 (recalculées chaque jour) · Historique · JSON

  • Seules les sources sous licence ouverte explicite (CC BY, MIT, Apache) entrent dans l'index ; celles qui attendent encore une autorisation restent désactivées.
  • Les exécutions indépendantes comptent ; les chiffres déclarés par les éditeurs sont affichés avec une mention et n'ont aucun poids.
  • Une famille de sources compte pour une voix : les catégories corrélées des mêmes votants ne s'additionnent pas.
  • Chaque score a une décomposition publique : composante, source, valeur, poids et date.
  • L'incertitude est visible : chaque score est accompagné de son intervalle, et peu de données signifie « provisoire ».

Sources et licences

Source Famille Licence Dans l'index
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (votes humains) CC BY 4.0 oui
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (benchmarks) CC BY 4.0 oui
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (agents) MIT oui
LiveBench LiveBench — en attente d'autorisation
Terminal-Bench Terminal-Bench — en attente d'autorisation
SWE-rebench SWE-rebench — en attente d'autorisation
Toolathlon Toolathlon — en attente d'autorisation
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT oui
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT oui
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — oui

Catégories et pondérations

Général

Arena (votes humains) part 50 %

  • text/overall text/overall2
  • text/hard_prompts text/hard_prompts2
  • text/expert text/expert1
  • text/instruction_following text/instruction_following1
  • text/multi_turn text/multi_turn0,50
  • text/longer_query text/longer_query0,50

Epoch AI (benchmarks) part 50 %

  • Epoch Capabilities Index eci3
  • GPQA Diamond gpqa_diamond0,50
  • SimpleQA Verified simpleqa_verified0,50

Code

Arena (votes humains) part 60 %

  • text/coding text/coding1,5
  • webdev/overall webdev/overall1,5

Epoch AI (benchmarks) part 40 %

  • SWE-bench Verified swe_bench_verified1

Agents

Arena (votes humains) part 60 %

  • agent/overall agent/overall1

τ²-bench (agents) part 40 %

  • τ-Knowledge banking tau2/banking_knowledge1,5
  • τ²-bench retail tau2/retail1
  • τ²-bench airline tau2/airline1
  • τ²-bench telecom tau2/telecom1

Maths

Arena (votes humains) part 50 %

  • text/math text/math1

Epoch AI (benchmarks) part 50 %

  • FrontierMath Tiers 1–3 frontiermath_t1_32
  • FrontierMath Tier 4 frontiermath_t41

Vision provisoire

Arena (votes humains) part 100 %

  • vision/overall vision/overall2
  • vision/ocr vision/ocr0,50
  • vision/diagram vision/diagram0,50

Recherche provisoire

Arena (votes humains) part 100 %

  • search/overall search/overall1

Écriture provisoire

Arena (votes humains) part 100 %

  • text/creative_writing text/creative_writing2
  • text/longer_query text/longer_query1

Langues provisoire

Votes Arena dans chaque langue ; la catégorie est affichée sur la version du site dans cette langue.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

Benchmarks et leur ancienneté

Composante Version publiée
Epoch Capabilities Index eci en continu (sans dépréciation)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

Une version plus ancienne d'un benchmark reçoit moins de poids (contamination, saturation) : le poids est divisé par deux tous les decay_half_life mois, jusqu'à decay_min.

Formules

Chaque composante est ramenée à l'échelle Arena par égalisation linéaire sur les modèles mesurés par les deux (ancre A = Arena text overall). Les paramètres sont fixés sur l'instantané de référence de la version de la méthodologie, ce qui garde les mois comparables.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

Au sein d'une catégorie, les composantes sont moyennées selon leurs poids, leur fiabilité (τ) et l'âge du benchmark ; un modèle peu mesuré est ramené vers le prior. Paramètres :

anchor
arena:text/overall
total_weight
8
tau
15
w0
0,50
prior_pct
25
min_anchors
8
min_votes
300
min_confidence
0,90
decay_half_life
18
decay_min
0,25
outlier_sigma
3
outlier_factor
0,50
population_months
18
jump_sigma
3

Niveau = le moins bon entre le niveau par percentile et le niveau par intervalle de confiance ; un modèle avec une seule famille de sources obtient au plus A.

Niveau = le moins bon entre le niveau par percentile et le niveau par intervalle de confiance ; un modèle avec une seule famille de sources obtient au plus A.

provisional_max
A

S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25

Niveau par intervalle de confiance (borne supérieure du rang / modèles): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%

Rapport qualité-prix

Le rapport qualité-prix est l'écart au-dessus de la droite de régression de la qualité sur le log₂ du prix ; le prix est la médiane des fournisseurs.

slice
general
input_share
3
output_share
1
price_sources
modelsdev, litellm
unit
1m_tokens

Sur votre matériel

Local : uniquement des poids ouverts, la meilleure quantification qui tient dans une configuration, le score ajusté selon la vitesse de génération.

slice
general
context
8 192
speed_ref
20
low_penalty
0,60
  • GPU 12 Go
  • GPU 24 Go
  • Mac 64 Go
  • 128 Go de mémoire unifiée
  • CPU, 32 Go de RAM

Données, licence et archives

L'index (nos chiffres et décompositions) est sous CC BY 4.0 : « fedi-index by fedi.software » avec un lien. Les composantes conservent les licences de leurs sources, listées dans sources[] du JSON.

Un instantané est figé le 1er de chaque mois et ne change plus ; une nouvelle version de la méthodologie ouvre une nouvelle série.

JSON mensuel: 2026-10

Journal des modifications

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.