Langsung ke konten
fedi.software

Metodologi fedi-index

Sumber, lisensi, bobot, dan rumus indeks — ditampilkan dari konfigurasi yang sama dengan yang dipakai untuk perhitungan.

Metodologi v1 · Data langsung 2026-10 (dihitung ulang setiap hari) · Riwayat · JSON

  • Hanya sumber dengan lisensi terbuka yang eksplisit (CC BY, MIT, Apache) yang masuk indeks; sumber yang masih menunggu izin tetap dinonaktifkan.
  • Hanya hasil independen yang dihitung; klaim vendor ditampilkan dengan label dan tidak diberi bobot.
  • Satu keluarga sumber = satu suara: kategori yang saling berkorelasi dari pemilih yang sama tidak dijumlahkan.
  • Setiap skor punya rincian publik: komponen, sumber, nilai, bobot, dan tanggal.
  • Ketidakpastian terlihat: skor disertai intervalnya, data sedikit berarti “sementara”.

Sumber dan lisensi

Sumber Keluarga Lisensi Dalam indeks
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (suara manusia) CC BY 4.0 ya
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (benchmark) CC BY 4.0 ya
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (agen) MIT ya
LiveBench LiveBench — menunggu izin
Terminal-Bench Terminal-Bench — menunggu izin
SWE-rebench SWE-rebench — menunggu izin
Toolathlon Toolathlon — menunggu izin
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT ya
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT ya
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — ya

Kategori dan bobot

Umum

Arena (suara manusia) porsi 50%

  • text/overall text/overall2
  • text/hard_prompts text/hard_prompts2
  • text/expert text/expert1
  • text/instruction_following text/instruction_following1
  • text/multi_turn text/multi_turn0,50
  • text/longer_query text/longer_query0,50

Epoch AI (benchmark) porsi 50%

  • Epoch Capabilities Index eci3
  • GPQA Diamond gpqa_diamond0,50
  • SimpleQA Verified simpleqa_verified0,50

Coding

Arena (suara manusia) porsi 60%

  • text/coding text/coding1,5
  • webdev/overall webdev/overall1,5

Epoch AI (benchmark) porsi 40%

  • SWE-bench Verified swe_bench_verified1

Agen

Arena (suara manusia) porsi 60%

  • agent/overall agent/overall1

τ²-bench (agen) porsi 40%

  • τ-Knowledge banking tau2/banking_knowledge1,5
  • τ²-bench retail tau2/retail1
  • τ²-bench airline tau2/airline1
  • τ²-bench telecom tau2/telecom1

Matematika

Arena (suara manusia) porsi 50%

  • text/math text/math1

Epoch AI (benchmark) porsi 50%

  • FrontierMath Tiers 1–3 frontiermath_t1_32
  • FrontierMath Tier 4 frontiermath_t41

Vision sementara

Arena (suara manusia) porsi 100%

  • vision/overall vision/overall2
  • vision/ocr vision/ocr0,50
  • vision/diagram vision/diagram0,50

Pencarian sementara

Arena (suara manusia) porsi 100%

  • search/overall search/overall1

Menulis sementara

Arena (suara manusia) porsi 100%

  • text/creative_writing text/creative_writing2
  • text/longer_query text/longer_query1

Bahasa sementara

Suara Arena di setiap bahasa; kategori ditampilkan di versi situs dalam bahasa tersebut.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

Benchmark dan usianya

Komponen Versi dirilis
Epoch Capabilities Index eci langsung (tanpa peluruhan)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

Versi benchmark yang lebih lama mendapat bobot lebih kecil (kontaminasi, saturasi): bobot berkurang setengah setiap decay_half_life bulan, minimal decay_min.

Rumus

Setiap komponen dipindahkan ke skala Arena dengan penyetaraan linear berdasarkan model yang diukur oleh keduanya (jangkar A = Arena text overall). Parameternya ditetapkan pada snapshot referensi versi metodologi, sehingga antarbulan tetap dapat dibandingkan.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

Di dalam kategori, komponen dirata-rata dengan bobot, keandalan (τ), dan usia benchmark; model dengan sedikit data ditarik ke nilai prior. Parameter:

anchor
arena:text/overall
total_weight
8
tau
15
w0
0,50
prior_pct
25
min_anchors
8
min_votes
300
min_confidence
0,90
decay_half_life
18
decay_min
0,25
outlier_sigma
3
outlier_factor
0,50
population_months
18
jump_sigma
3

Tier = yang lebih buruk antara tier berdasarkan persentil dan tier berdasarkan interval kepercayaan; model dengan satu keluarga sumber paling tinggi A.

Tier = yang lebih buruk antara tier berdasarkan persentil dan tier berdasarkan interval kepercayaan; model dengan satu keluarga sumber paling tinggi A.

provisional_max
A

S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25

Tier berdasarkan interval kepercayaan (batas atas peringkat / jumlah model): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%

Nilai: kualitas sebanding harga

Nilai adalah jarak di atas garis regresi kualitas terhadap log₂ harga; harga adalah median penyedia.

slice
general
input_share
3
output_share
1
price_sources
modelsdev, litellm
unit
1m_tokens

Di perangkat Anda

Lokal: hanya bobot terbuka, kuantisasi terbaik yang muat di perangkat, skor disesuaikan dengan kecepatan generasi.

slice
general
context
8.192
speed_ref
20
low_penalty
0,60
  • GPU 12 GB
  • GPU 24 GB
  • Mac 64 GB
  • Memori terpadu 128 GB
  • CPU, RAM 32 GB

Data, lisensi, dan arsip

Indeks (angka dan rincian kami) berlisensi CC BY 4.0: “fedi-index by fedi.software” beserta tautan. Komponen tetap memakai lisensi sumbernya, tercantum di sources[] pada JSON.

Snapshot dibekukan setiap tanggal 1 tiap bulan dan tidak pernah berubah; versi metodologi baru memulai seri baru.

JSON bulanan: 2026-10

Catatan perubahan

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.