Μεθοδολογία του fedi-index
Πηγές, άδειες, βάρη και τύποι του δείκτη — παράγονται από την ίδια διαμόρφωση που χρησιμοποιεί ο υπολογισμός.
Μεθοδολογία v1 · Ζωντανά δεδομένα για 2026-10 (επανυπολογίζονται καθημερινά) · Ιστορικό · JSON
- Στον δείκτη μπαίνουν μόνο πηγές με ρητή ανοιχτή άδεια (CC BY, MIT, Apache)· οι πηγές που περιμένουν άδεια μένουν απενεργοποιημένες.
- Μετρούν οι ανεξάρτητες εκτελέσεις· οι δηλώσεις των κατασκευαστών εμφανίζονται με ετικέτα και δεν έχουν βάρος.
- Μία οικογένεια πηγών είναι μία φωνή: συσχετισμένες κατηγορίες των ίδιων ψηφοφόρων δεν αθροίζονται.
- Κάθε βαθμολογία έχει δημόσια ανάλυση: συνιστώσα, πηγή, τιμή, βάρος και ημερομηνία.
- Η αβεβαιότητα είναι ορατή: η βαθμολογία συνοδεύεται από το διάστημά της, λίγα δεδομένα σημαίνουν «προσωρινό».
Πηγές και άδειες
| Πηγή | Οικογένεια | Άδεια | Στον δείκτη |
|---|---|---|---|
| LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. | Arena (ψήφοι ανθρώπων) | CC BY 4.0 | ναι |
| Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. | Epoch AI (benchmark) | CC BY 4.0 | ναι |
| τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. | τ²-bench (πράκτορες) | MIT | ναι |
| LiveBench | LiveBench | — | αναμονή άδειας |
| Terminal-Bench | Terminal-Bench | — | αναμονή άδειας |
| SWE-rebench | SWE-rebench | — | αναμονή άδειας |
| Toolathlon | Toolathlon | — | αναμονή άδειας |
| models.dev Pricing: models.dev, MIT License, © 2025 models.dev. | modelsdev | MIT | ναι |
| LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. | litellm | MIT | ναι |
| Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. | hf | — | ναι |
Ενότητες και βάρη
Γενικά
Arena (ψήφοι ανθρώπων) μερίδιο 50%
- text/overall
text/overall2 - text/hard_prompts
text/hard_prompts2 - text/expert
text/expert1 - text/instruction_following
text/instruction_following1 - text/multi_turn
text/multi_turn0,50 - text/longer_query
text/longer_query0,50
Epoch AI (benchmark) μερίδιο 50%
- Epoch Capabilities Index
eci3 - GPQA Diamond
gpqa_diamond0,50 - SimpleQA Verified
simpleqa_verified0,50
Προγραμματισμός
Arena (ψήφοι ανθρώπων) μερίδιο 60%
- text/coding
text/coding1,5 - webdev/overall
webdev/overall1,5
Epoch AI (benchmark) μερίδιο 40%
- SWE-bench Verified
swe_bench_verified1
Πράκτορες
Arena (ψήφοι ανθρώπων) μερίδιο 60%
- agent/overall
agent/overall1
τ²-bench (πράκτορες) μερίδιο 40%
- τ-Knowledge banking
tau2/banking_knowledge1,5 - τ²-bench retail
tau2/retail1 - τ²-bench airline
tau2/airline1 - τ²-bench telecom
tau2/telecom1
Μαθηματικά
Arena (ψήφοι ανθρώπων) μερίδιο 50%
- text/math
text/math1
Epoch AI (benchmark) μερίδιο 50%
- FrontierMath Tiers 1–3
frontiermath_t1_32 - FrontierMath Tier 4
frontiermath_t41
Όραση προσωρινό
Arena (ψήφοι ανθρώπων) μερίδιο 100%
- vision/overall
vision/overall2 - vision/ocr
vision/ocr0,50 - vision/diagram
vision/diagram0,50
Αναζήτηση προσωρινό
Arena (ψήφοι ανθρώπων) μερίδιο 100%
- search/overall
search/overall1
Γραφή προσωρινό
Arena (ψήφοι ανθρώπων) μερίδιο 100%
- text/creative_writing
text/creative_writing2 - text/longer_query
text/longer_query1
Γλώσσες προσωρινό
Ψήφοι Arena σε κάθε γλώσσα· η ενότητα εμφανίζεται στην έκδοση του ιστότοπου σε αυτή τη γλώσσα.
English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish
Benchmark και η ηλικία τους
| Συνιστώσα | Κυκλοφορία έκδοσης |
|---|---|
Epoch Capabilities Index eci |
ζωντανό (χωρίς απόσβεση) |
GPQA Diamond gpqa_diamond |
2023-11-20 |
SimpleQA Verified simpleqa_verified |
2025-09-09 |
FrontierMath Tiers 1–3 frontiermath_t1_3 |
2026-06-12 |
FrontierMath Tier 4 frontiermath_t4 |
2026-06-12 |
SWE-bench Verified swe_bench_verified |
2024-08-13 |
τ²-bench retail tau2/retail |
2024-06-17 |
τ²-bench airline tau2/airline |
2024-06-17 |
τ²-bench telecom tau2/telecom |
2025-06-09 |
τ-Knowledge banking tau2/banking_knowledge |
2026-03-04 |
Μια παλαιότερη έκδοση benchmark παίρνει λιγότερο βάρος (μόλυνση, κορεσμός): το βάρος υποδιπλασιάζεται κάθε decay_half_life μήνες, έως το decay_min.
Τύποι
Κάθε συνιστώσα μεταφέρεται στην κλίμακα Arena με γραμμική εξίσωση στα μοντέλα που μετρήθηκαν και από τα δύο (άγκυρα A = Arena text overall). Οι παράμετροι καθορίζονται στο στιγμιότυπο αναφοράς της έκδοσης μεθοδολογίας, ώστε οι μήνες να παραμένουν συγκρίσιμοι.
x_eq = μ_A + (x − μ_c) · σ_A / σ_c se_eq = se · σ_A / σ_c w_c = 8 · family_share[f] · base_w[c] / Σ base_w(f, present) rel_c = τ² / (τ² + se_eq²) w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1) Q = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0) SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)
Μέσα σε μια ενότητα οι συνιστώσες σταθμίζονται με τα βάρη τους, την αξιοπιστία (τ) και την ηλικία του benchmark· ένα μοντέλο με λίγα δεδομένα έλκεται προς το prior. Παράμετροι:
anchor- arena:text/overall
total_weight- 8
tau- 15
w0- 0,50
prior_pct- 25
min_anchors- 8
min_votes- 300
min_confidence- 0,90
decay_half_life- 18
decay_min- 0,25
outlier_sigma- 3
outlier_factor- 0,50
population_months- 18
jump_sigma- 3
Βαθμίδα = η χειρότερη ανάμεσα στη βαθμίδα κατά εκατοστημόριο και τη βαθμίδα κατά διάστημα εμπιστοσύνης· μοντέλο με μία οικογένεια πηγών παίρνει το πολύ A.
Βαθμίδα = η χειρότερη ανάμεσα στη βαθμίδα κατά εκατοστημόριο και τη βαθμίδα κατά διάστημα εμπιστοσύνης· μοντέλο με μία οικογένεια πηγών παίρνει το πολύ A.
provisional_max- A
S ≥ p95A ≥ p80B ≥ p50C ≥ p25 D < p25
Βαθμίδα κατά διάστημα εμπιστοσύνης (άνω όριο της θέσης / μοντέλα): S ≤ 10% · A ≤ 30% · B ≤ 60% · C ≤ 85%
Σχέση τιμής-απόδοσης: ποιότητα για την τιμή
Η σχέση τιμής-απόδοσης είναι η απόσταση πάνω από τη γραμμή παλινδρόμησης της ποιότητας ως προς τον log₂ της τιμής· η τιμή είναι η διάμεσος των παρόχων.
slice- general
input_share- 3
output_share- 1
price_sources- modelsdev, litellm
unit- 1m_tokens
Στο δικό σας υλικό
Τοπικά: μόνο ανοιχτά βάρη, η καλύτερη κβαντοποίηση που χωρά σε μια διάταξη, η βαθμολογία κλιμακωμένη με την ταχύτητα παραγωγής.
slice- general
context- 8.192
speed_ref- 20
low_penalty- 0,60
- GPU 12 GB
- GPU 24 GB
- Mac 64 GB
- 128 GB ενοποιημένης μνήμης
- CPU, 32 GB RAM
Δεδομένα, άδεια και αρχείο
Ο δείκτης (οι αριθμοί και οι αναλύσεις μας) διατίθεται με CC BY 4.0: «fedi-index by fedi.software» με σύνδεσμο. Οι συνιστώσες διατηρούν τις άδειες των πηγών τους, που αναφέρονται στο sources[] του JSON.
Την 1η κάθε μήνα παγώνει ένα στιγμιότυπο που δεν αλλάζει ποτέ· μια νέα έκδοση μεθοδολογίας ξεκινά νέα σειρά.
Μηνιαίο JSON: 2026-10
Αρχείο αλλαγών
- v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
- v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.