Salt la conținut
fedi.software

Metodologia fedi-index

Sursele, licențele, ponderile și formulele indexului — generate din aceeași configurație pe care o folosește calculul.

Metodologie v1 · Date live pentru 2026-10 (recalculate zilnic) · Istoric · JSON

  • În index intră doar surse cu licență deschisă explicită (CC BY, MIT, Apache); sursele care încă așteaptă permisiunea rămân dezactivate.
  • Contează rulările independente; declarațiile producătorilor sunt afișate cu etichetă și nu primesc pondere.
  • O familie de surse este o singură voce: categoriile corelate ale acelorași votanți nu se adună.
  • Fiecare scor are o descompunere publică: componentă, sursă, valoare, pondere și dată.
  • Incertitudinea este vizibilă: scorul vine cu intervalul său, puține date înseamnă „provizoriu”.

Surse și licențe

Sursă Familie Licență În index
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (voturi ale oamenilor) CC BY 4.0 da
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (benchmarkuri) CC BY 4.0 da
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (agenți) MIT da
LiveBench LiveBench — așteaptă permisiunea
Terminal-Bench Terminal-Bench — așteaptă permisiunea
SWE-rebench SWE-rebench — așteaptă permisiunea
Toolathlon Toolathlon — așteaptă permisiunea
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT da
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT da
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — da

Secțiuni și ponderi

General

Arena (voturi ale oamenilor) cotă 50%

  • text/overall text/overall2
  • text/hard_prompts text/hard_prompts2
  • text/expert text/expert1
  • text/instruction_following text/instruction_following1
  • text/multi_turn text/multi_turn0,50
  • text/longer_query text/longer_query0,50

Epoch AI (benchmarkuri) cotă 50%

  • Epoch Capabilities Index eci3
  • GPQA Diamond gpqa_diamond0,50
  • SimpleQA Verified simpleqa_verified0,50

Programare

Arena (voturi ale oamenilor) cotă 60%

  • text/coding text/coding1,5
  • webdev/overall webdev/overall1,5

Epoch AI (benchmarkuri) cotă 40%

  • SWE-bench Verified swe_bench_verified1

Agenți

Arena (voturi ale oamenilor) cotă 60%

  • agent/overall agent/overall1

τ²-bench (agenți) cotă 40%

  • τ-Knowledge banking tau2/banking_knowledge1,5
  • τ²-bench retail tau2/retail1
  • τ²-bench airline tau2/airline1
  • τ²-bench telecom tau2/telecom1

Matematică

Arena (voturi ale oamenilor) cotă 50%

  • text/math text/math1

Epoch AI (benchmarkuri) cotă 50%

  • FrontierMath Tiers 1–3 frontiermath_t1_32
  • FrontierMath Tier 4 frontiermath_t41

Imagine provizoriu

Arena (voturi ale oamenilor) cotă 100%

  • vision/overall vision/overall2
  • vision/ocr vision/ocr0,50
  • vision/diagram vision/diagram0,50

Căutare provizoriu

Arena (voturi ale oamenilor) cotă 100%

  • search/overall search/overall1

Scriere provizoriu

Arena (voturi ale oamenilor) cotă 100%

  • text/creative_writing text/creative_writing2
  • text/longer_query text/longer_query1

Limbi provizoriu

Voturi Arena în fiecare limbă; secțiunea este afișată pe versiunea site-ului în acea limbă.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

Benchmarkuri și vechimea lor

Componentă Lansarea versiunii
Epoch Capabilities Index eci live (fără atenuare)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

O versiune mai veche a unui benchmark primește pondere mai mică (contaminare, saturație): ponderea se înjumătățește la fiecare decay_half_life luni, până la decay_min.

Formule

Fiecare componentă este adusă la scara Arena prin echivalare liniară pe modelele măsurate de ambele (ancora A = Arena text overall). Parametrii sunt fixați pe instantaneul de referință al versiunii de metodologie, astfel încât lunile rămân comparabile.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

În cadrul unei secțiuni componentele sunt mediate cu ponderile lor, fiabilitatea (τ) și vechimea benchmarkului; un model cu puține date este tras spre prior. Parametri:

anchor
arena:text/overall
total_weight
8
tau
15
w0
0,50
prior_pct
25
min_anchors
8
min_votes
300
min_confidence
0,90
decay_half_life
18
decay_min
0,25
outlier_sigma
3
outlier_factor
0,50
population_months
18
jump_sigma
3

Nivel = cel mai slab dintre nivelul după percentilă și nivelul după intervalul de încredere; un model cu o singură familie de surse primește cel mult A.

Nivel = cel mai slab dintre nivelul după percentilă și nivelul după intervalul de încredere; un model cu o singură familie de surse primește cel mult A.

provisional_max
A

S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25

Nivel după intervalul de încredere (limita superioară a locului / modele): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%

Raport calitate-preț: calitate pentru bani

Raportul calitate-preț este distanța deasupra dreptei de regresie a calității pe log₂ al prețului; prețul este mediana furnizorilor.

slice
general
input_share
3
output_share
1
price_sources
modelsdev, litellm
unit
1m_tokens

Pe hardware-ul tău

Local: doar ponderi deschise, cea mai bună cuantizare care încape într-o configurație, scorul scalat după viteza de generare.

slice
general
context
8.192
speed_ref
20
low_penalty
0,60
  • GPU 12 GB
  • GPU 24 GB
  • Mac 64 GB
  • 128 GB memorie unificată
  • CPU, 32 GB RAM

Date, licență și arhivă

Indexul (cifrele și descompunerile noastre) este sub CC BY 4.0: „fedi-index by fedi.software” cu link. Componentele păstrează licențele surselor lor, listate în sources[] din JSON.

Pe 1 ale fiecărei luni se îngheață un instantaneu care nu se mai schimbă niciodată; o nouă versiune de metodologie pornește o nouă serie.

JSON lunar: 2026-10

Jurnal de modificări

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.