Ir al contenido
fedi.software

Metodología de fedi-index

Fuentes, licencias, pesos y fórmulas del índice, generados a partir de la misma configuración que usa el cálculo.

Metodología v1 · Datos en vivo de 2026-10 (se recalculan a diario) · Historial · JSON

  • Solo entran en el índice fuentes con una licencia abierta explícita (CC BY, MIT, Apache); las que aún esperan permiso permanecen desactivadas.
  • Cuentan las ejecuciones independientes; los datos declarados por los fabricantes se muestran con una etiqueta y no reciben peso.
  • Una familia de fuentes es un solo voto: las categorías correlacionadas de los mismos votantes no se suman.
  • Cada puntuación tiene un desglose público: componente, fuente, valor, peso y fecha.
  • La incertidumbre es visible: cada puntuación viene con su intervalo y, con pocos datos, se marca como «provisional».

Fuentes y licencias

Fuente Familia Licencia En el índice
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (votos humanos) CC BY 4.0 sí
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (benchmarks) CC BY 4.0 sí
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (agentes) MIT sí
LiveBench LiveBench — esperando permiso
Terminal-Bench Terminal-Bench — esperando permiso
SWE-rebench SWE-rebench — esperando permiso
Toolathlon Toolathlon — esperando permiso
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT sí
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT sí
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — sí

Categorías y pesos

General

Arena (votos humanos) cuota 50 %

  • text/overall text/overall2
  • text/hard_prompts text/hard_prompts2
  • text/expert text/expert1
  • text/instruction_following text/instruction_following1
  • text/multi_turn text/multi_turn0,50
  • text/longer_query text/longer_query0,50

Epoch AI (benchmarks) cuota 50 %

  • Epoch Capabilities Index eci3
  • GPQA Diamond gpqa_diamond0,50
  • SimpleQA Verified simpleqa_verified0,50

Código

Arena (votos humanos) cuota 60 %

  • text/coding text/coding1,5
  • webdev/overall webdev/overall1,5

Epoch AI (benchmarks) cuota 40 %

  • SWE-bench Verified swe_bench_verified1

Agentes

Arena (votos humanos) cuota 60 %

  • agent/overall agent/overall1

τ²-bench (agentes) cuota 40 %

  • τ-Knowledge banking tau2/banking_knowledge1,5
  • τ²-bench retail tau2/retail1
  • τ²-bench airline tau2/airline1
  • τ²-bench telecom tau2/telecom1

Matemáticas

Arena (votos humanos) cuota 50 %

  • text/math text/math1

Epoch AI (benchmarks) cuota 50 %

  • FrontierMath Tiers 1–3 frontiermath_t1_32
  • FrontierMath Tier 4 frontiermath_t41

Visión provisional

Arena (votos humanos) cuota 100 %

  • vision/overall vision/overall2
  • vision/ocr vision/ocr0,50
  • vision/diagram vision/diagram0,50

Búsqueda provisional

Arena (votos humanos) cuota 100 %

  • search/overall search/overall1

Escritura provisional

Arena (votos humanos) cuota 100 %

  • text/creative_writing text/creative_writing2
  • text/longer_query text/longer_query1

Idiomas provisional

Votos de Arena en cada idioma; la categoría se muestra en la versión del sitio en ese idioma.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

Benchmarks y su antigüedad

Componente Versión publicada
Epoch Capabilities Index eci en vivo (sin envejecimiento)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

Una versión más antigua de un benchmark recibe menos peso (contaminación, saturación): el peso se reduce a la mitad cada decay_half_life meses, hasta decay_min.

Fórmulas

Cada componente se traslada a la escala de Arena mediante equiparación lineal sobre los modelos medidos por ambos (ancla A = Arena text overall). Los parámetros se fijan en la instantánea de referencia de la versión de la metodología, por lo que los meses siguen siendo comparables.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

Dentro de una categoría, los componentes se promedian según sus pesos, su fiabilidad (τ) y la antigüedad del benchmark; un modelo con pocos datos se acerca al prior. Parámetros:

anchor
arena:text/overall
total_weight
8
tau
15
w0
0,50
prior_pct
25
min_anchors
8
min_votes
300
min_confidence
0,90
decay_half_life
18
decay_min
0,25
outlier_sigma
3
outlier_factor
0,50
population_months
18
jump_sigma
3

Nivel = el peor entre el nivel por percentil y el nivel por intervalo de confianza; un modelo con una sola familia de fuentes obtiene como máximo A.

Nivel = el peor entre el nivel por percentil y el nivel por intervalo de confianza; un modelo con una sola familia de fuentes obtiene como máximo A.

provisional_max
A

S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25

Nivel por intervalo de confianza (límite superior del puesto / modelos): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%

Relación calidad-precio

La relación calidad-precio es la distancia por encima de la recta de regresión de la calidad sobre el log₂ del precio; el precio es la mediana de proveedores.

slice
general
input_share
3
output_share
1
price_sources
modelsdev, litellm
unit
1m_tokens

En tu hardware

Local: solo pesos abiertos, la mejor cuantización que cabe en un equipo y la puntuación ajustada por la velocidad de generación.

slice
general
context
8.192
speed_ref
20
low_penalty
0,60
  • GPU 12 GB
  • GPU 24 GB
  • Mac 64 GB
  • 128 GB de memoria unificada
  • CPU, 32 GB de RAM

Datos, licencia y archivo

El índice (nuestras cifras y desgloses) es CC BY 4.0: «fedi-index by fedi.software» con un enlace. Los componentes conservan las licencias de sus fuentes, indicadas en sources[] del JSON.

El día 1 de cada mes se congela una instantánea que ya no cambia; una nueva versión de la metodología inicia una nueva serie.

JSON mensual: 2026-10

Registro de cambios

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.