Ir para o conteúdo
fedi.software

Metodologia do fedi-index

Fontes, licenças, pesos e fórmulas do índice — gerados a partir da mesma configuração usada no cálculo.

Metodologia v1 · Dados ao vivo de 2026-10 (recalculados diariamente) · Histórico · JSON

  • Só entram no índice fontes com licença aberta explícita (CC BY, MIT, Apache); fontes que ainda aguardam permissão ficam desativadas.
  • Execuções independentes contam; dados informados pelos próprios fabricantes aparecem com um rótulo e não recebem peso.
  • Uma família de fontes é um único voto: categorias correlacionadas dos mesmos votantes não se somam.
  • Toda pontuação tem uma decomposição pública: componente, fonte, valor, peso e data.
  • A incerteza é visível: cada pontuação vem com seu intervalo, e poucos dados significam “provisório”.

Fontes e licenças

Fonte Família Licença No índice
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (votos humanos) CC BY 4.0 sim
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (benchmarks) CC BY 4.0 sim
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (agentes) MIT sim
LiveBench LiveBench — aguardando permissão
Terminal-Bench Terminal-Bench — aguardando permissão
SWE-rebench SWE-rebench — aguardando permissão
Toolathlon Toolathlon — aguardando permissão
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT sim
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT sim
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — sim

Categorias e pesos

Geral

Arena (votos humanos) participação 50%

  • text/overall text/overall2
  • text/hard_prompts text/hard_prompts2
  • text/expert text/expert1
  • text/instruction_following text/instruction_following1
  • text/multi_turn text/multi_turn0,50
  • text/longer_query text/longer_query0,50

Epoch AI (benchmarks) participação 50%

  • Epoch Capabilities Index eci3
  • GPQA Diamond gpqa_diamond0,50
  • SimpleQA Verified simpleqa_verified0,50

Código

Arena (votos humanos) participação 60%

  • text/coding text/coding1,5
  • webdev/overall webdev/overall1,5

Epoch AI (benchmarks) participação 40%

  • SWE-bench Verified swe_bench_verified1

Agentes

Arena (votos humanos) participação 60%

  • agent/overall agent/overall1

τ²-bench (agentes) participação 40%

  • τ-Knowledge banking tau2/banking_knowledge1,5
  • τ²-bench retail tau2/retail1
  • τ²-bench airline tau2/airline1
  • τ²-bench telecom tau2/telecom1

Matemática

Arena (votos humanos) participação 50%

  • text/math text/math1

Epoch AI (benchmarks) participação 50%

  • FrontierMath Tiers 1–3 frontiermath_t1_32
  • FrontierMath Tier 4 frontiermath_t41

Visão provisório

Arena (votos humanos) participação 100%

  • vision/overall vision/overall2
  • vision/ocr vision/ocr0,50
  • vision/diagram vision/diagram0,50

Busca provisório

Arena (votos humanos) participação 100%

  • search/overall search/overall1

Escrita provisório

Arena (votos humanos) participação 100%

  • text/creative_writing text/creative_writing2
  • text/longer_query text/longer_query1

Idiomas provisório

Votos da Arena em cada idioma; a categoria aparece na versão do site nesse idioma.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

Benchmarks e sua idade

Componente Versão lançada
Epoch Capabilities Index eci ao vivo (sem defasagem)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

Uma versão mais antiga do benchmark recebe menos peso (contaminação, saturação): o peso cai pela metade a cada decay_half_life meses, até decay_min.

Fórmulas

Cada componente é levado à escala da Arena por equalização linear sobre os modelos medidos por ambos (âncora A = Arena text overall). Os parâmetros são fixados no snapshot de referência da versão da metodologia, então os meses continuam comparáveis.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

Dentro de uma categoria, os componentes são combinados na média com seus pesos, confiabilidade (τ) e a idade do benchmark; um modelo com poucos dados é puxado para o prior. Parâmetros:

anchor
arena:text/overall
total_weight
8
tau
15
w0
0,50
prior_pct
25
min_anchors
8
min_votes
300
min_confidence
0,90
decay_half_life
18
decay_min
0,25
outlier_sigma
3
outlier_factor
0,50
population_months
18
jump_sigma
3

Tier = o pior entre o tier por percentil e o tier pelo intervalo de confiança; um modelo com uma única família de fontes recebe no máximo A.

Tier = o pior entre o tier por percentil e o tier pelo intervalo de confiança; um modelo com uma única família de fontes recebe no máximo A.

provisional_max
A

S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25

Tier pelo intervalo de confiança (limite superior da posição / modelos): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%

Custo-benefício: qualidade pelo preço

Custo-benefício é a distância acima da linha de regressão da qualidade sobre o log₂ do preço; o preço é a mediana dos provedores.

slice
general
input_share
3
output_share
1
price_sources
modelsdev, litellm
unit
1m_tokens

No seu hardware

Local: apenas pesos abertos, a melhor quantização que cabe em uma configuração, a pontuação ajustada pela velocidade de geração.

slice
general
context
8.192
speed_ref
20
low_penalty
0,60
  • GPU 12 GB
  • GPU 24 GB
  • Mac 64 GB
  • 128 GB de memória unificada
  • CPU, 32 GB de RAM

Dados, licença e arquivo

O índice (nossos números e decomposições) é CC BY 4.0: “fedi-index by fedi.software” com link. Os componentes mantêm as licenças de suas fontes, listadas em sources[] do JSON.

Um snapshot é congelado no dia 1º de cada mês e nunca muda; uma nova versão da metodologia inicia uma nova série.

JSON mensal: 2026-10

Registro de alterações

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.