منهجية fedi-index
مصادر المؤشر وتراخيصه وأوزانه ومعادلاته — معروضة من الإعدادات نفسها التي يعتمد عليها الحساب.
المنهجية v1 · بيانات مباشرة لشهر 2026-10 (يُعاد حسابها يوميًا) · السجل · JSON
- لا يدخل المؤشر إلا المصادر ذات الترخيص المفتوح الصريح (CC BY وMIT وApache)؛ وتبقى المصادر التي تنتظر الإذن معطّلة.
- تُحتسب النتائج المستقلة فقط؛ وتُعرض تصريحات المطوّرين مع وسم دون أن تُمنح وزنًا.
- عائلة المصادر الواحدة صوت واحد: الفئات المترابطة من المصوّتين أنفسهم لا تُجمع.
- لكل درجة تفصيل علني: المكوّن والمصدر والقيمة والوزن والتاريخ.
- عدم اليقين ظاهر: تأتي الدرجة مع فاصلها، وقلة البيانات تعني «مبدئي».
المصادر والتراخيص
| المصدر | العائلة | الترخيص | ضمن المؤشر |
|---|---|---|---|
| LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. | Arena (أصوات البشر) | CC BY 4.0 | نعم |
| Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. | Epoch AI (اختبارات معيارية) | CC BY 4.0 | نعم |
| τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. | τ²-bench (وكلاء) | MIT | نعم |
| LiveBench | LiveBench | — | بانتظار الإذن |
| Terminal-Bench | Terminal-Bench | — | بانتظار الإذن |
| SWE-rebench | SWE-rebench | — | بانتظار الإذن |
| Toolathlon | Toolathlon | — | بانتظار الإذن |
| models.dev Pricing: models.dev, MIT License, © 2025 models.dev. | modelsdev | MIT | نعم |
| LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. | litellm | MIT | نعم |
| Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. | hf | — | نعم |
الفئات والأوزان
عام
Arena (أصوات البشر) الحصة ٥٠%
- text/overall
text/overall٢ - text/hard_prompts
text/hard_prompts٢ - text/expert
text/expert١ - text/instruction_following
text/instruction_following١ - text/multi_turn
text/multi_turn٠٫٥٠ - text/longer_query
text/longer_query٠٫٥٠
Epoch AI (اختبارات معيارية) الحصة ٥٠%
- Epoch Capabilities Index
eci٣ - GPQA Diamond
gpqa_diamond٠٫٥٠ - SimpleQA Verified
simpleqa_verified٠٫٥٠
البرمجة
Arena (أصوات البشر) الحصة ٦٠%
- text/coding
text/coding١٫٥ - webdev/overall
webdev/overall١٫٥
Epoch AI (اختبارات معيارية) الحصة ٤٠%
- SWE-bench Verified
swe_bench_verified١
الوكلاء
Arena (أصوات البشر) الحصة ٦٠%
- agent/overall
agent/overall١
τ²-bench (وكلاء) الحصة ٤٠%
- τ-Knowledge banking
tau2/banking_knowledge١٫٥ - τ²-bench retail
tau2/retail١ - τ²-bench airline
tau2/airline١ - τ²-bench telecom
tau2/telecom١
الرياضيات
Arena (أصوات البشر) الحصة ٥٠%
- text/math
text/math١
Epoch AI (اختبارات معيارية) الحصة ٥٠%
- FrontierMath Tiers 1–3
frontiermath_t1_3٢ - FrontierMath Tier 4
frontiermath_t4١
الرؤية مبدئي
Arena (أصوات البشر) الحصة ١٠٠%
- vision/overall
vision/overall٢ - vision/ocr
vision/ocr٠٫٥٠ - vision/diagram
vision/diagram٠٫٥٠
البحث مبدئي
Arena (أصوات البشر) الحصة ١٠٠%
- search/overall
search/overall١
الكتابة مبدئي
Arena (أصوات البشر) الحصة ١٠٠%
- text/creative_writing
text/creative_writing٢ - text/longer_query
text/longer_query١
اللغات مبدئي
أصوات Arena بكل لغة؛ وتُعرض الفئة في نسخة الموقع بتلك اللغة.
English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish
الاختبارات المعيارية وأعمارها
| المكوّن | تاريخ صدور الإصدار |
|---|---|
Epoch Capabilities Index eci |
مباشر (بلا تقادم) |
GPQA Diamond gpqa_diamond |
2023-11-20 |
SimpleQA Verified simpleqa_verified |
2025-09-09 |
FrontierMath Tiers 1–3 frontiermath_t1_3 |
2026-06-12 |
FrontierMath Tier 4 frontiermath_t4 |
2026-06-12 |
SWE-bench Verified swe_bench_verified |
2024-08-13 |
τ²-bench retail tau2/retail |
2024-06-17 |
τ²-bench airline tau2/airline |
2024-06-17 |
τ²-bench telecom tau2/telecom |
2025-06-09 |
τ-Knowledge banking tau2/banking_knowledge |
2026-03-04 |
يحصل الإصدار الأقدم من الاختبار المعياري على وزن أقل (تسرّب إلى بيانات التدريب، تشبّع): ينخفض الوزن إلى النصف كل decay_half_life شهرًا، بحد أدنى decay_min.
المعادلات
يُنقل كل مكوّن إلى مقياس Arena بمعادلة خطية على النماذج التي قاسها الطرفان (المرساة A = Arena text overall). وتُثبَّت المعاملات على اللقطة المرجعية لإصدار المنهجية، لتبقى الأشهر قابلة للمقارنة.
x_eq = μ_A + (x − μ_c) · σ_A / σ_c se_eq = se · σ_A / σ_c w_c = 8 · family_share[f] · base_w[c] / Σ base_w(f, present) rel_c = τ² / (τ² + se_eq²) w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1) Q = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0) SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)
داخل الفئة، يُحسب متوسط المكوّنات بأوزانها وموثوقيتها (τ) وعمر الاختبار المعياري؛ ويُقرَّب النموذج قليل البيانات من القيمة المسبقة. المعاملات:
anchor- arena:text/overall
total_weight- ٨
tau- ١٥
w0- ٠٫٥٠
prior_pct- ٢٥
min_anchors- ٨
min_votes- ٣٠٠
min_confidence- ٠٫٩٠
decay_half_life- ١٨
decay_min- ٠٫٢٥
outlier_sigma- ٣
outlier_factor- ٠٫٥٠
population_months- ١٨
jump_sigma- ٣
المستوى = الأسوأ بين المستوى حسب المئين والمستوى حسب فاصل الثقة؛ والنموذج ذو عائلة المصادر الواحدة يحصل على A كحد أقصى.
المستوى = الأسوأ بين المستوى حسب المئين والمستوى حسب فاصل الثقة؛ والنموذج ذو عائلة المصادر الواحدة يحصل على A كحد أقصى.
provisional_max- A
S ≥ p٩٥A ≥ p٨٠B ≥ p٥٠C ≥ p٢٥ D < p٢٥
المستوى حسب فاصل الثقة (الحد الأعلى للترتيب / عدد النماذج): S ≤ ١٠% · A ≤ ٣٠% · B ≤ ٦٠% · C ≤ ٨٥%
القيمة: الجودة مقابل السعر
القيمة هي المسافة فوق خط انحدار الجودة على log₂ للسعر؛ والسعر هو وسيط المزوّدين.
slice- general
input_share- ٣
output_share- ١
price_sources- modelsdev, litellm
unit- 1m_tokens
على جهازك
محليًا: الأوزان المفتوحة فقط، وأفضل تكميم يتسع للجهاز، والدرجة معدّلة حسب سرعة التوليد.
slice- general
context- ٨٬١٩٢
speed_ref- ٢٠
low_penalty- ٠٫٦٠
- GPU 12 GB
- GPU 24 GB
- Mac 64 GB
- ذاكرة موحّدة 128 GB
- CPU، 32 GB RAM
البيانات والترخيص والأرشيف
المؤشر (أرقامنا وتفصيلاتنا) بترخيص CC BY 4.0: «fedi-index by fedi.software» مع رابط. وتحتفظ المكوّنات بتراخيص مصادرها، المدرجة في sources[] ضمن JSON.
تُجمَّد لقطة في اليوم الأول من كل شهر ولا تتغير أبدًا؛ ويبدأ إصدار المنهجية الجديد سلسلة جديدة.
JSON الشهري: 2026-10
سجل التغييرات
- v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
- v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.