Vai al contenuto
fedi.software

Metodologia del fedi-index

Fonti, licenze, pesi e formule dell'indice — generati dalla stessa configurazione usata per il calcolo.

Metodologia v1 · Dati in tempo reale di 2026-10 (ricalcolati ogni giorno) · Storico · JSON

  • Nell'indice entrano solo fonti con licenza aperta esplicita (CC BY, MIT, Apache); le fonti ancora in attesa di autorizzazione restano disattivate.
  • Contano le esecuzioni indipendenti; i dati dichiarati dai produttori sono mostrati con un'etichetta e non ricevono peso.
  • Una famiglia di fonti vale un voto: categorie correlate degli stessi votanti non si sommano.
  • Ogni punteggio ha una scomposizione pubblica: componente, fonte, valore, peso e data.
  • L'incertezza è visibile: ogni punteggio ha il suo intervallo, pochi dati significano «provvisorio».

Fonti e licenze

Fonte Famiglia Licenza Nell'indice
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (voti umani) CC BY 4.0 sì
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (benchmark) CC BY 4.0 sì
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (agenti) MIT sì
LiveBench LiveBench — in attesa di autorizzazione
Terminal-Bench Terminal-Bench — in attesa di autorizzazione
SWE-rebench SWE-rebench — in attesa di autorizzazione
Toolathlon Toolathlon — in attesa di autorizzazione
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT sì
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT sì
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — sì

Categorie e pesi

Generale

Arena (voti umani) quota 50%

  • text/overall text/overall2
  • text/hard_prompts text/hard_prompts2
  • text/expert text/expert1
  • text/instruction_following text/instruction_following1
  • text/multi_turn text/multi_turn0,50
  • text/longer_query text/longer_query0,50

Epoch AI (benchmark) quota 50%

  • Epoch Capabilities Index eci3
  • GPQA Diamond gpqa_diamond0,50
  • SimpleQA Verified simpleqa_verified0,50

Codice

Arena (voti umani) quota 60%

  • text/coding text/coding1,5
  • webdev/overall webdev/overall1,5

Epoch AI (benchmark) quota 40%

  • SWE-bench Verified swe_bench_verified1

Agenti

Arena (voti umani) quota 60%

  • agent/overall agent/overall1

τ²-bench (agenti) quota 40%

  • τ-Knowledge banking tau2/banking_knowledge1,5
  • τ²-bench retail tau2/retail1
  • τ²-bench airline tau2/airline1
  • τ²-bench telecom tau2/telecom1

Matematica

Arena (voti umani) quota 50%

  • text/math text/math1

Epoch AI (benchmark) quota 50%

  • FrontierMath Tiers 1–3 frontiermath_t1_32
  • FrontierMath Tier 4 frontiermath_t41

Visione provvisorio

Arena (voti umani) quota 100%

  • vision/overall vision/overall2
  • vision/ocr vision/ocr0,50
  • vision/diagram vision/diagram0,50

Ricerca provvisorio

Arena (voti umani) quota 100%

  • search/overall search/overall1

Scrittura provvisorio

Arena (voti umani) quota 100%

  • text/creative_writing text/creative_writing2
  • text/longer_query text/longer_query1

Lingue provvisorio

Voti Arena in ciascuna lingua; la categoria è mostrata nella versione del sito in quella lingua.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

Benchmark e loro età

Componente Versione rilasciata
Epoch Capabilities Index eci in tempo reale (senza obsolescenza)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

Una versione più vecchia del benchmark riceve meno peso (contaminazione, saturazione): il peso si dimezza ogni decay_half_life mesi, fino a decay_min.

Formule

Ogni componente è riportata sulla scala Arena tramite equating lineare sui modelli misurati da entrambe (ancora A = Arena text overall). I parametri sono fissati sullo snapshot di riferimento della versione della metodologia, così i mesi restano confrontabili.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

All'interno di una categoria le componenti sono mediate con i loro pesi, l'affidabilità (τ) e l'età del benchmark; un modello con pochi dati viene avvicinato al prior. Parametri:

anchor
arena:text/overall
total_weight
8
tau
15
w0
0,50
prior_pct
25
min_anchors
8
min_votes
300
min_confidence
0,90
decay_half_life
18
decay_min
0,25
outlier_sigma
3
outlier_factor
0,50
population_months
18
jump_sigma
3

Tier = il peggiore tra il tier per percentile e il tier per intervallo di confidenza; un modello con una sola famiglia di fonti ottiene al massimo A.

Tier = il peggiore tra il tier per percentile e il tier per intervallo di confidenza; un modello con una sola famiglia di fonti ottiene al massimo A.

provisional_max
A

S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25

Tier per intervallo di confidenza (limite superiore della posizione / modelli): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%

Qualità-prezzo: quanto vale ciò che paghi

Il rapporto qualità-prezzo è la distanza sopra la retta di regressione della qualità sul log₂ del prezzo; il prezzo è la mediana dei provider.

slice
general
input_share
3
output_share
1
price_sources
modelsdev, litellm
unit
1m_tokens

Sul tuo hardware

Locale: solo pesi aperti, la migliore quantizzazione che entra in una configurazione, il punteggio scalato in base alla velocità di generazione.

slice
general
context
8.192
speed_ref
20
low_penalty
0,60
  • GPU 12 GB
  • GPU 24 GB
  • Mac 64 GB
  • 128 GB di memoria unificata
  • CPU, 32 GB di RAM

Dati, licenza e archivio

L'indice (i nostri numeri e le scomposizioni) è CC BY 4.0: «fedi-index by fedi.software» con un link. Le componenti mantengono le licenze delle rispettive fonti, elencate in sources[] del JSON.

Il 1° di ogni mese viene congelato uno snapshot che non cambia più; una nuova versione della metodologia avvia una nuova serie.

JSON mensile: 2026-10

Registro delle modifiche

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.