انتقل إلى المحتوى
fedi.software

منهجية fedi-index

مصادر المؤشر وتراخيصه وأوزانه ومعادلاته — معروضة من الإعدادات نفسها التي يعتمد عليها الحساب.

المنهجية v1 · بيانات مباشرة لشهر 2026-10 (يُعاد حسابها يوميًا) · السجل · JSON

  • لا يدخل المؤشر إلا المصادر ذات الترخيص المفتوح الصريح (CC BY وMIT وApache)؛ وتبقى المصادر التي تنتظر الإذن معطّلة.
  • تُحتسب النتائج المستقلة فقط؛ وتُعرض تصريحات المطوّرين مع وسم دون أن تُمنح وزنًا.
  • عائلة المصادر الواحدة صوت واحد: الفئات المترابطة من المصوّتين أنفسهم لا تُجمع.
  • لكل درجة تفصيل علني: المكوّن والمصدر والقيمة والوزن والتاريخ.
  • عدم اليقين ظاهر: تأتي الدرجة مع فاصلها، وقلة البيانات تعني «مبدئي».

المصادر والتراخيص

المصدر العائلة الترخيص ضمن المؤشر
LMArena Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (equated, weighted, aggregated). Not endorsed by LMArena. Arena (أصوات البشر) CC BY 4.0 نعم
Epoch AI Epoch AI, 'Capabilities & benchmarking'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks'. CC BY. ECI by Epoch AI; Epoch-run results only. Modified by fedi.software. Epoch AI (اختبارات معيارية) CC BY 4.0 نعم
τ²-bench (Sierra) τ²-bench leaderboard, © Sierra Research, MIT License (Yao et al. 2024, arXiv:2406.12045; Barres et al. 2025, arXiv:2506.07982). Sierra-run text submissions only. τ²-bench (وكلاء) MIT نعم
LiveBench LiveBench — بانتظار الإذن
Terminal-Bench Terminal-Bench — بانتظار الإذن
SWE-rebench SWE-rebench — بانتظار الإذن
Toolathlon Toolathlon — بانتظار الإذن
models.dev Pricing: models.dev, MIT License, © 2025 models.dev. modelsdev MIT نعم
LiteLLM Pricing: LiteLLM model_prices_and_context_window.json, MIT License, © 2023 Berri AI. litellm MIT نعم
Hugging Face Downloads (30 days): Hugging Face Hub, as of the snapshot date. hf — نعم

الفئات والأوزان

عام

Arena (أصوات البشر) الحصة ٥٠%

  • text/overall text/overall٢
  • text/hard_prompts text/hard_prompts٢
  • text/expert text/expert١
  • text/instruction_following text/instruction_following١
  • text/multi_turn text/multi_turn٠٫٥٠
  • text/longer_query text/longer_query٠٫٥٠

Epoch AI (اختبارات معيارية) الحصة ٥٠%

  • Epoch Capabilities Index eci٣
  • GPQA Diamond gpqa_diamond٠٫٥٠
  • SimpleQA Verified simpleqa_verified٠٫٥٠

البرمجة

Arena (أصوات البشر) الحصة ٦٠%

  • text/coding text/coding١٫٥
  • webdev/overall webdev/overall١٫٥

Epoch AI (اختبارات معيارية) الحصة ٤٠%

  • SWE-bench Verified swe_bench_verified١

الوكلاء

Arena (أصوات البشر) الحصة ٦٠%

  • agent/overall agent/overall١

τ²-bench (وكلاء) الحصة ٤٠%

  • τ-Knowledge banking tau2/banking_knowledge١٫٥
  • τ²-bench retail tau2/retail١
  • τ²-bench airline tau2/airline١
  • τ²-bench telecom tau2/telecom١

الرياضيات

Arena (أصوات البشر) الحصة ٥٠%

  • text/math text/math١

Epoch AI (اختبارات معيارية) الحصة ٥٠%

  • FrontierMath Tiers 1–3 frontiermath_t1_3٢
  • FrontierMath Tier 4 frontiermath_t4١

الرؤية مبدئي

Arena (أصوات البشر) الحصة ١٠٠%

  • vision/overall vision/overall٢
  • vision/ocr vision/ocr٠٫٥٠
  • vision/diagram vision/diagram٠٫٥٠

البحث مبدئي

Arena (أصوات البشر) الحصة ١٠٠%

  • search/overall search/overall١

الكتابة مبدئي

Arena (أصوات البشر) الحصة ١٠٠%

  • text/creative_writing text/creative_writing٢
  • text/longer_query text/longer_query١

اللغات مبدئي

أصوات Arena بكل لغة؛ وتُعرض الفئة في نسخة الموقع بتلك اللغة.

English — text/english · Русский — text/russian · Deutsch — text/german · Español — text/spanish · Français — text/french · 日本語 — text/japanese · 한국어 — text/korean · 繁體中文 — text/chinese · Polski — text/polish

الاختبارات المعيارية وأعمارها

المكوّن تاريخ صدور الإصدار
Epoch Capabilities Index eci مباشر (بلا تقادم)
GPQA Diamond gpqa_diamond 2023-11-20
SimpleQA Verified simpleqa_verified 2025-09-09
FrontierMath Tiers 1–3 frontiermath_t1_3 2026-06-12
FrontierMath Tier 4 frontiermath_t4 2026-06-12
SWE-bench Verified swe_bench_verified 2024-08-13
τ²-bench retail tau2/retail 2024-06-17
τ²-bench airline tau2/airline 2024-06-17
τ²-bench telecom tau2/telecom 2025-06-09
τ-Knowledge banking tau2/banking_knowledge 2026-03-04

يحصل الإصدار الأقدم من الاختبار المعياري على وزن أقل (تسرّب إلى بيانات التدريب، تشبّع): ينخفض الوزن إلى النصف كل decay_half_life شهرًا، بحد أدنى decay_min.

المعادلات

يُنقل كل مكوّن إلى مقياس Arena بمعادلة خطية على النماذج التي قاسها الطرفان (المرساة A = Arena text overall). وتُثبَّت المعاملات على اللقطة المرجعية لإصدار المنهجية، لتبقى الأشهر قابلة للمقارنة.

x_eq  = μ_A + (x − μ_c) · σ_A / σ_c          se_eq = se · σ_A / σ_c
w_c   = 8 · family_share[f] · base_w[c] / Σ base_w(f, present)
rel_c = τ² / (τ² + se_eq²)
w_eff = w_c · rel_c · decay_c · (self_report ? 0 : 1)
Q     = (Σ w_eff · x_eq + w0 · prior) / (Σ w_eff + w0)
SE(Q) = √Σ (w_eff · se_eq)² / (Σ w_eff + w0)

داخل الفئة، يُحسب متوسط المكوّنات بأوزانها وموثوقيتها (τ) وعمر الاختبار المعياري؛ ويُقرَّب النموذج قليل البيانات من القيمة المسبقة. المعاملات:

anchor
arena:text/overall
total_weight
٨
tau
١٥
w0
٠٫٥٠
prior_pct
٢٥
min_anchors
٨
min_votes
٣٠٠
min_confidence
٠٫٩٠
decay_half_life
١٨
decay_min
٠٫٢٥
outlier_sigma
٣
outlier_factor
٠٫٥٠
population_months
١٨
jump_sigma
٣

المستوى = الأسوأ بين المستوى حسب المئين والمستوى حسب فاصل الثقة؛ والنموذج ذو عائلة المصادر الواحدة يحصل على A كحد أقصى.

المستوى = الأسوأ بين المستوى حسب المئين والمستوى حسب فاصل الثقة؛ والنموذج ذو عائلة المصادر الواحدة يحصل على A كحد أقصى.

provisional_max
A

S ≥ p٩٥A ≥ p٨٠B ≥ p٥٠C ≥ p٢٥ D < p٢٥

المستوى حسب فاصل الثقة (الحد الأعلى للترتيب / عدد النماذج): S ≤ ١٠% · A ≤ ٣٠% · B ≤ ٦٠% · C ≤ ٨٥%

القيمة: الجودة مقابل السعر

القيمة هي المسافة فوق خط انحدار الجودة على log₂ للسعر؛ والسعر هو وسيط المزوّدين.

slice
general
input_share
٣
output_share
١
price_sources
modelsdev, litellm
unit
1m_tokens

على جهازك

محليًا: الأوزان المفتوحة فقط، وأفضل تكميم يتسع للجهاز، والدرجة معدّلة حسب سرعة التوليد.

slice
general
context
٨٬١٩٢
speed_ref
٢٠
low_penalty
٠٫٦٠
  • GPU 12 GB
  • GPU 24 GB
  • Mac 64 GB
  • ذاكرة موحّدة 128 GB
  • CPU، 32 GB RAM

البيانات والترخيص والأرشيف

المؤشر (أرقامنا وتفصيلاتنا) بترخيص CC BY 4.0: «fedi-index by fedi.software» مع رابط. وتحتفظ المكوّنات بتراخيص مصادرها، المدرجة في sources[] ضمن JSON.

تُجمَّد لقطة في اليوم الأول من كل شهر ولا تتغير أبدًا؛ ويبدأ إصدار المنهجية الجديد سلسلة جديدة.

JSON الشهري: 2026-10

سجل التغييرات

  • v1 2026-10-01 First version: LMArena + Epoch AI + τ²-bench, linear equating to Arena text Elo with parameters fixed on the reference snapshot, family shares, sub-scores arena / bench, value = residual of the price regression + Pareto, local = Fit on 5 stacks.
  • v1.1 2026-10-01 Local quant floor: the quant is picked like local-fit (Q3 floor; below it only when nothing of Q3+ fits — "strong compression", ×0.6, ranked after every Q3+ model). Local only; the v1 scale and the published 2026-10 snapshot are unchanged.