Siirry sisältöön
fedi.software

fedi-index-menetelmä

Indeksin lähteet, lisenssit, painot ja kaavat — muodostettu samasta konfiguraatiosta, jota laskenta käyttää.

Menetelmä v1 · Ajantasainen data: 2026-10 (lasketaan päivittäin) · Historia · JSON

  • Indeksiin otetaan vain lähteet, joilla on nimenomainen avoin lisenssi (CC BY, MIT, Apache); lupaa odottavat lähteet pysyvät pois päältä.
  • Riippumattomat ajot lasketaan; valmistajien omat tulokset näytetään merkinnällä eikä niille anneta painoa.
  • Yksi lähdeperhe on yksi ääni: samojen äänestäjien korreloivia kategorioita ei lasketa yhteen.
  • Jokaisella pistemäärällä on julkinen erittely: komponentti, lähde, arvo, paino ja päivämäärä.
  • Epävarmuus näkyy: pistemäärä esitetään välinsä kanssa, vähäinen data tarkoittaa ”alustava”.

Lähteet ja lisenssit

Lähde Perhe Lisenssi Indeksissä
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (ihmisten äänet) CC BY 4.0 kyllä
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (vertailutestit) CC BY 4.0 kyllä
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (agentit) MIT kyllä
LiveBench LiveBench — odottaa lupaa
Terminal-Bench Terminal-Bench — odottaa lupaa
SWE-rebench SWE-rebench — odottaa lupaa
Toolathlon Toolathlon — odottaa lupaa
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT kyllä
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT kyllä
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — kyllä

Osa-alueet ja painot

Yleinen

Arena (ihmisten äänet) osuus 50%

  • text/overall text/overall2
  • text/hard_prompts text/hard_prompts2
  • text/expert text/expert1
  • text/instruction_following text/instruction_following1
  • text/multi_turn text/multi_turn0,50
  • text/longer_query text/longer_query0,50

Epoch AI (vertailutestit) osuus 50%

  • Epoch Capabilities Index eci3
  • GPQA Diamond gpqa_diamond0,50
  • SimpleQA Verified simpleqa_verified0,50

Koodaus

Arena (ihmisten äänet) osuus 60%

  • text/coding text/coding1,5
  • webdev/overall webdev/overall1,5

Epoch AI (vertailutestit) osuus 40%

  • SWE-bench Verified swe_bench_verified1

Agentit

Arena (ihmisten äänet) osuus 60%

  • agent/overall agent/overall1

τ²-bench (agentit) osuus 40%

  • τ-Knowledge banking tau2/banking_knowledge1,5
  • τ²-bench retail tau2/retail1
  • τ²-bench airline tau2/airline1
  • τ²-bench telecom tau2/telecom1

Matematiikka

Arena (ihmisten äänet) osuus 50%

  • text/math text/math1

Epoch AI (vertailutestit) osuus 50%

  • FrontierMath Tiers 1–3 frontiermath_t1_32
  • FrontierMath Tier 4 frontiermath_t41

Kuvat alustava

Arena (ihmisten äänet) osuus 100%

  • vision/overall vision/overall2
  • vision/ocr vision/ocr0,50
  • vision/diagram vision/diagram0,50

Haku alustava

Arena (ihmisten äänet) osuus 100%

  • search/overall search/overall1

Kirjoittaminen alustava

Arena (ihmisten äänet) osuus 100%

  • text/creative_writing text/creative_writing2
  • text/longer_query text/longer_query1

Kielet alustava

Arena-äänet kullakin kielellä; osa-alue näytetään sivuston kyseisenkielisessä versiossa.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

Vertailutestit ja niiden ikä

Komponentti Versio julkaistu
Epoch Capabilities Index eci ajantasainen (ei vanhenemista)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

Vanhempi vertailutestiversio saa vähemmän painoa (kontaminaatio, kyllääntyminen): paino puolittuu decay_half_life kuukauden välein, alarajana decay_min.

Kaavat

Jokainen komponentti siirretään Arenan asteikolle lineaarisella yhtäsuuruistamisella niiden mallien perusteella, jotka molemmat ovat mitanneet (ankkuri A = Arena text overall). Parametrit kiinnitetään menetelmäversion vertailutilannekuvaan, joten kuukaudet pysyvät vertailukelpoisina.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

Osa-alueen sisällä komponenteista lasketaan keskiarvo niiden painojen, luotettavuuden (τ) ja vertailutestin iän mukaan; vähän dataa omaava malli vedetään kohti prioria. Parametrit:

anchor
arena:text/overall
total_weight
8
tau
15
w0
0,50
prior_pct
25
min_anchors
8
min_votes
300
min_confidence
0,90
decay_half_life
18
decay_min
0,25
outlier_sigma
3
outlier_factor
0,50
population_months
18
jump_sigma
3

Taso = huonompi persentiilin mukaisesta tasosta ja luottamusvälin mukaisesta tasosta; yhden lähdeperheen malli saa enintään A:n.

Taso = huonompi persentiilin mukaisesta tasosta ja luottamusvälin mukaisesta tasosta; yhden lähdeperheen malli saa enintään A:n.

provisional_max
A

S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25

Taso luottamusvälin mukaan (sijoituksen yläraja / mallit): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%

Hinta-laatu: laatua rahalle

Hinta-laatu on etäisyys laadun regressiosuoran yläpuolella suhteessa hinnan log₂-arvoon; hinta on palveluntarjoajien mediaani.

slice
general
input_share
3
output_share
1
price_sources
modelsdev, litellm
unit
1m_tokens

Omalla laitteistollasi

Paikallinen: vain avoimet painot, paras kokoonpanoon mahtuva kvantisointi, pistemäärä skaalattuna generointinopeudella.

slice
general
context
8 192
speed_ref
20
low_penalty
0,60
  • GPU 12 Gt
  • GPU 24 Gt
  • Mac 64 Gt
  • 128 Gt yhtenäistä muistia
  • CPU, 32 Gt RAM

Data, lisenssi ja arkisto

Indeksi (omat lukumme ja erittelymme) on CC BY 4.0: ”fedi-index by fedi.software” ja linkki. Komponenteilla on lähteidensä lisenssit, jotka on lueteltu JSON:n kohdassa sources[].

Tilannekuva jäädytetään jokaisen kuun 1. päivänä eikä se muutu koskaan; uusi menetelmäversio aloittaa uuden sarjan.

Kuukausittainen JSON: 2026-10

Muutosloki

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.