انتقل إلى المحتوى
fedi.software

أي نموذج مفتوح يناسب جهازك — 2026

نماذج الأوزان المفتوحة مقابل بطاقات الرسوميات والحواسيب الشائعة: التكميم الموصى به (الأكبر حتى Q8 الذي ما زال يعطي 10 رموز في الثانية أو أكثر، وإلا فمن فئة Q4؛ وما دون Q3 فقط عندما لا يتسع غيره)، ومكان التشغيل (ذاكرة الرسوميات أو الذاكرة الموحدة أو التفريغ إلى الذاكرة العشوائية)، وسرعة التوليد التقريبية.

النموذج المعاملات
Qwen2.5 3B Instruct HF 3.1B Q8_0≈٨٤ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٦٧ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٢١٨ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٢٣٥ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤١٧ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤١٧ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٦٨ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٣٦ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١١٥ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١١١ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٦٧ tok/s يتسع في الذاكرة الموحدة Q8_0≈٥٢ tok/s يتسع في الذاكرة الموحدة Q8_0≈٥٦ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٥٫٠ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈٣٤ tok/s يتسع في ذاكرة RAM (المعالج)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈٧٤ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٥٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٩٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٢٠٧ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٣٦٨ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٣٦٨ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٤٨ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٢٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٠١ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٩٨ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٤٧ tok/s يتسع في الذاكرة الموحدة Q8_0≈٤٦ tok/s يتسع في الذاكرة الموحدة Q8_0≈٤٩ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٤٫٣ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈٣٢ tok/s يتسع في ذاكرة RAM (المعالج)
Gemma 3 4B HF 4.3B Q8_0≈٦٧ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٥٤ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٧٥ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٨٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٣٣٥ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٣٣٥ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٣٥ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٠٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٩٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٨٩ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٣٤ tok/s يتسع في الذاكرة الموحدة Q8_0≈٤٢ tok/s يتسع في الذاكرة الموحدة Q8_0≈٤٥ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٣٫٨ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈٣١ tok/s يتسع في ذاكرة RAM (المعالج)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈٣٧ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈٢٩ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈٩٥ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈١٠٣ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈١٨٢ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈١٨٢ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈٧٣ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈٥٩ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈٥٠ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈٤٩ tok/s يتسع في الذاكرة الموحدة UD-Q6_K_XL≈٧٣ tok/s يتسع في الذاكرة الموحدة UD-Q6_K_XL≈٢٣ tok/s يتسع في الذاكرة الموحدة UD-Q6_K_XL≈٢٤ tok/s يتسع في الذاكرة الموحدة UD-Q6_K_XL≈١٠٫٣ tok/s يتسع في ذاكرة RAM (المعالج) UD-Q6_K_XL≈٢٣ tok/s يتسع في ذاكرة RAM (المعالج)
Qwen3 8B HF 8.2B Q8_0≈٣١ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٢٥ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٨٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٨٧ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٥٤ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٥٤ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٦٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٥٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤١ tok/s يتسع في الذاكرة الموحدة Q8_0≈٦٢ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٩٫٢ tok/s يتسع في الذاكرة الموحدة Q8_0≈٢١ tok/s يتسع في الذاكرة الموحدة UD-Q6_K_XL≈١٠٫٢ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈٢١ tok/s يتسع في ذاكرة RAM (المعالج)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈٣٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٧٫٨ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٥٨ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٦٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١١١ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١١١ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤٤ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٣٦ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٣٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٣٠ tok/s يتسع في الذاكرة الموحدة Q8_0≈٤٤ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٣٫٨ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٤٫٨ tok/s يتسع في الذاكرة الموحدة Q4_1≈١٠٫٢ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈١٧٫١ tok/s يتسع في ذاكرة RAM (المعالج)
Qwen3 14B HF 14.8B Q4_K_M≈٣٠ tok/s يتسع في ذاكرة الرسوميات Q6_K≈١٨٫٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤٦ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٨٨ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٨٨ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٣٥ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٢٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٢٤ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٢٣ tok/s يتسع في الذاكرة الموحدة Q8_0≈٣٥ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٠٫٩ tok/s يتسع في الذاكرة الموحدة Q8_0≈١١٫٧ tok/s يتسع في الذاكرة الموحدة UD-Q3_K_XL≈١٠٫١ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈١٤٫٦ tok/s يتسع في ذاكرة RAM (المعالج)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈٥٣ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية MXFP4≈٥٥ tok/s يتسع في ذاكرة الرسوميات MXFP4١٦٢ tok/sمقاس يتسع في ذاكرة الرسوميات MXFP4≈١٩٤ tok/s يتسع في ذاكرة الرسوميات MXFP4≈٣٤٤ tok/s يتسع في ذاكرة الرسوميات MXFP4≈٣٤٤ tok/s يتسع في ذاكرة الرسوميات MXFP4≈١٣٨ tok/s يتسع في ذاكرة الرسوميات MXFP4≈١١٢ tok/s يتسع في ذاكرة الرسوميات MXFP4≈٩٥ tok/s يتسع في ذاكرة الرسوميات MXFP4≈٨٠ tok/s يتسع في الذاكرة الموحدة MXFP4١١٦ tok/sمقاس يتسع في الذاكرة الموحدة MXFP4≈٥٩ tok/s يتسع في الذاكرة الموحدة MXFP4≈٦٢ tok/s يتسع في الذاكرة الموحدة MXFP4≈١٧٫٢ tok/s يتسع في ذاكرة RAM (المعالج) MXFP4≈٣٩ tok/s يتسع في ذاكرة RAM (المعالج)
Mistral Small 3.2 24B HF 24B Q3_K_M≈١٠٫٢ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q3_K_XL≈١٨٫٤ tok/s يتسع في ذاكرة الرسوميات Q6_K≈٣٧ tok/s يتسع في ذاكرة الرسوميات Q6_K≈٤٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٥٦ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٥٦ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٢٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٨٫٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٥٫٣ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٤٫٩ tok/s يتسع في الذاكرة الموحدة Q8_0≈٢٢ tok/s يتسع في الذاكرة الموحدة Q5_K_M≈١٠٫٣ tok/s يتسع في الذاكرة الموحدة Q5_K_M≈١١٫٠ tok/s يتسع في الذاكرة الموحدة Q4_K_M≈٦٫٩ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈١٠٫٣ tok/s يتسع في ذاكرة RAM (المعالج)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈١٤٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q3_K_M≈٥٦ tok/s يتسع في ذاكرة الرسوميات UD-Q5_K_S≈١٢٩ tok/s يتسع في ذاكرة الرسوميات UD-Q5_K_S≈١٣٩ tok/s يتسع في ذاكرة الرسوميات UD-Q8_K_XL≈١٧٣ tok/s يتسع في ذاكرة الرسوميات UD-Q8_K_XL≈١٧٣ tok/s يتسع في ذاكرة الرسوميات UD-Q8_K_XL≈٧٠ tok/s يتسع في ذاكرة الرسوميات UD-Q8_K_XL≈٥٧ tok/s يتسع في ذاكرة الرسوميات UD-Q8_K_XL≈٤٨ tok/s يتسع في ذاكرة الرسوميات UD-Q8_K_XL≈٤٠ tok/s يتسع في الذاكرة الموحدة UD-Q8_K_XL≈٦٠ tok/s يتسع في الذاكرة الموحدة UD-Q8_K_XL≈٢٩ tok/s يتسع في الذاكرة الموحدة UD-Q8_K_XL≈٣١ tok/s يتسع في الذاكرة الموحدة UD-Q8_K_XL≈١٣٫٧ tok/s يتسع في ذاكرة RAM (المعالج) UD-Q8_K_XL≈٣١ tok/s يتسع في ذاكرة RAM (المعالج)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈١٢٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q3_K_S≈١٨٫١ tok/s يتسع في ذاكرة الرسوميات UD-Q5_K_XL≈٣٨ tok/s يتسع في ذاكرة الرسوميات UD-Q5_K_XL≈٤١ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈٥٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٩٫٧ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٦٫٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٣٫٥ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٣٫١ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٩٫٦ tok/s يتسع في الذاكرة الموحدة Q4_1≈١٠٫١ tok/s يتسع في الذاكرة الموحدة Q4_1≈١٠٫٨ tok/s يتسع في الذاكرة الموحدة Q4_K_M≈٦٫٣ tok/s يتسع في ذاكرة RAM (المعالج) UD-Q6_K_XL≈١٠٫٨ tok/s يتسع في ذاكرة RAM (المعالج)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈١٦٫٤ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q3_K_S≈٦٦ tok/s يتسع في ذاكرة الرسوميات Q4_K_M١٥٤ tok/sمقاس يتسع في ذاكرة الرسوميات Q5_K_S≈١٥٨ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈٢٣٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٩٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٧٧ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٦٣ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٥٣ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤٥ tok/s يتسع في الذاكرة الموحدة Q8_0≈٦٧ tok/s يتسع في الذاكرة الموحدة Q8_0≈٣٣ tok/s يتسع في الذاكرة الموحدة Q8_0≈٣٥ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٤٫٣ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈٣٢ tok/s يتسع في ذاكرة RAM (المعالج)
Gemma 4 31B HF 31.3B Q4_K_M≈٣٫٨ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q3_K_S≈١٠٫٤ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q4_1≈٣٧ tok/s يتسع في ذاكرة الرسوميات Q4_1≈٤٠ tok/s يتسع في ذاكرة الرسوميات Q6_K≈٥٥ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤٣ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٧٫١ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٣٫٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١١٫٧ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١١٫٣ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٧٫٠ tok/s يتسع في الذاكرة الموحدة IQ4_XS≈١٠٫٣ tok/s يتسع في الذاكرة الموحدة Q4_K_S≈١٠٫٣ tok/s يتسع في الذاكرة الموحدة Q4_K_M≈٥٫٧ tok/s يتسع في ذاكرة RAM (المعالج) Q6_K≈١٠٫١ tok/s يتسع في ذاكرة RAM (المعالج)
Qwen3 32B HF 32.8B Q4_K_M≈٣٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-IQ3_XXS≈١٤٫١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q4_K_XL≈٣٥ tok/s يتسع في ذاكرة الرسوميات UD-Q4_K_XL≈٣٨ tok/s يتسع في ذاكرة الرسوميات Q6_K≈٥١ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٦٫٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٣٫٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١١٫٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٠٫٦ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٦٫٠ tok/s يتسع في الذاكرة الموحدة UD-Q3_K_XL≈١٠٫٣ tok/s يتسع في الذاكرة الموحدة IQ4_XS≈١٠٫٢ tok/s يتسع في الذاكرة الموحدة Q4_K_M≈٥٫٤ tok/s يتسع في ذاكرة RAM (المعالج) Q5_K_M≈١٠٫٨ tok/s يتسع في ذاكرة RAM (المعالج)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈١٧٫٩ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q8_0≈١٨٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q4_K_S≈١٩١ tok/s يتسع في ذاكرة الرسوميات Q4_K_S≈٢٠٥ tok/s يتسع في ذاكرة الرسوميات Q6_K≈٢٧٤ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٢٢٠ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٨٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٧٢ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٦١ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٥١ tok/s يتسع في الذاكرة الموحدة Q8_0≈٧٧ tok/s يتسع في الذاكرة الموحدة Q8_0≈٣٧ tok/s يتسع في الذاكرة الموحدة Q8_0≈٤٠ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٥٫٠ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈٣٤ tok/s يتسع في ذاكرة RAM (المعالج)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈١٫٣ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q4_K_M≈١٫٤ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q4_K_M≈٢٫٠ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q4_K_M≈٢٫٠ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-IQ3_XXS≈٤٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈١٨٫٨ tok/s يتسع في ذاكرة الرسوميات Q4_K_M١٦٫٣ tok/sمقاس يتسع في ذاكرة الرسوميات Q4_1≈١٠٫٣ tok/s يتسع في ذاكرة الرسوميات IQ4_XS≈١٠٫٠ tok/s يتسع في ذاكرة الرسوميات UD-Q3_K_XL≈١٠٫٦ tok/s يتسع في الذاكرة الموحدة Q5_K_M≈١١٫٢ tok/s يتسع في الذاكرة الموحدة Q4_K_M≈٤٫١ tok/s يتسع في الذاكرة الموحدة Q4_K_M≈٤٫٤ tok/s يتسع في الذاكرة الموحدة Q4_K_M≈٢٫٩ tok/s يتسع في ذاكرة RAM (المعالج) Q4_K_M≈٦٫٦ tok/s يتسع في ذاكرة RAM (المعالج)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈٢٤ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q6_K≈٢١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q6_K_XL≈٢٦ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q6_K_XL≈٢٦ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q6_K_XL≈٣١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q8_0≈٢١٣ tok/s يتسع في ذاكرة الرسوميات Q4_K_S≈١٤٥ tok/s يتسع في ذاكرة الرسوميات UD-Q6_K_XL≈٨٤ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٥٩ tok/s يتسع في ذاكرة الرسوميات Q8_0≈٤٩ tok/s يتسع في الذاكرة الموحدة Q8_0≈٧٤ tok/s يتسع في الذاكرة الموحدة Q8_0≈٣٦ tok/s يتسع في الذاكرة الموحدة Q8_0≈٣٩ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٤٫٨ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈٣٣ tok/s يتسع في ذاكرة RAM (المعالج)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈٥٫٣ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q4_K_S≈٥٫١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q4_K_M≈٥٫٦ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q4_K_M≈٥٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q3_K_M≈١٠٫٢ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q5_K_M≈٥٥ tok/s يتسع في ذاكرة الرسوميات Q4_0≈١٠٫٠ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q4_K_XL≈٢٢ tok/s يتسع في ذاكرة الرسوميات Q5_K_M≈١٥٫٢ tok/s يتسع في ذاكرة الرسوميات Q5_K_M≈١٢٫٨ tok/s يتسع في الذاكرة الموحدة Q8_0≈١٣٫٩ tok/s يتسع في الذاكرة الموحدة Q4_K_M≈١٠٫٦ tok/s يتسع في الذاكرة الموحدة Q5_K_M≈١٠٫٠ tok/s يتسع في الذاكرة الموحدة Q4_K_M≈٨٫٠ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈١٣٫١ tok/s يتسع في ذاكرة RAM (المعالج)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈١٩٫١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية MXFP4≈١٩٫٦ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية MXFP4٢٦–٢٨ tok/sمقاس يعمل مع التفريغ إلى الذاكرة العشوائية MXFP4≈٢٥ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية MXFP4≈٣١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية MXFP4≈٢٥٨ tok/s يتسع في ذاكرة الرسوميات MXFP4≈٣٦ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية MXFP4٤١–٧٣ tok/sمقاس يتسع في ذاكرة الرسوميات MXFP4≈٧١ tok/s يتسع في ذاكرة الرسوميات MXFP4≈٦٠ tok/s يتسع في الذاكرة الموحدة MXFP4≈٩٠ tok/s يتسع في الذاكرة الموحدة MXFP4٥٠ tok/sمقاس يتسع في الذاكرة الموحدة MXFP4٦١ tok/sمقاس يتسع في الذاكرة الموحدة MXFP4≈١٥٫٨ tok/s يتسع في ذاكرة RAM (المعالج) MXFP4≈٣٦ tok/s يتسع في ذاكرة RAM (المعالج)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈١٠٫٥ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-IQ4_NL≈١٠٫٨ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q4_K_S≈١١٫١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية Q4_K_S≈١١٫٢ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q4_K_XL≈١١٫٩ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q5_K_XL≈٩٧ tok/s يتسع في ذاكرة الرسوميات UD-IQ3_XXS≈٧٦ tok/s يتسع في ذاكرة الرسوميات UD-IQ4_NL≈٤٦ tok/s يتسع في ذاكرة الرسوميات UD-Q5_K_XL≈٢٧ tok/s يتسع في ذاكرة الرسوميات UD-Q5_K_XL≈٢٣ tok/s يتسع في الذاكرة الموحدة Q8_0≈٢٤ tok/s يتسع في الذاكرة الموحدة Q6_K≈١٥٫١ tok/s يتسع في الذاكرة الموحدة Q6_K≈١٦٫١ tok/s يتسع في الذاكرة الموحدة UD-Q5_K_XL≈١٠٫٤ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈١٩٫٣ tok/s يتسع في ذاكرة RAM (المعالج)
Qwen3 235B A22B HFMoE 235B / 22B ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع UD-Q4_K_XL≈١٠٫٨ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q2_K_XL≈٨٫٠ tok/sضغط شديد يعمل مع التفريغ إلى الذاكرة العشوائية Q3_K_M≈٦٫١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q3_K_XL≈١١٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-Q2_K_XL≈١٩٫٤ tok/sضغط شديد يتسع في الذاكرة الموحدة Q8_0≈١٠٫٨ tok/s يتسع في الذاكرة الموحدة UD-Q3_K_XL≈١٢٫٢ tok/s يتسع في الذاكرة الموحدة UD-Q3_K_XL≈١٣٫٠ tok/s يتسع في الذاكرة الموحدة Q4_K_M≈٧٫٢ tok/s يتسع في ذاكرة RAM (المعالج) Q8_0≈١٠٫٩ tok/s يتسع في ذاكرة RAM (المعالج)
GLM 4.7 HFMoE 358B / 39.2B ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع UD-IQ3_XXS≈٧٫٣ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-IQ1_S≈٥٫٦ tok/sضغط شديد يعمل مع التفريغ إلى الذاكرة العشوائية UD-IQ2_XXS≈٤٫٧ tok/sضغط شديد يعمل مع التفريغ إلى الذاكرة العشوائية UD-IQ3_XXS≈٣٫٥ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية UD-TQ1_0≈١٦٫٢ tok/sضغط شديد يتسع في الذاكرة الموحدة Q4_1≈١٠٫٠ tok/s يتسع في الذاكرة الموحدة UD-IQ1_M≈٩٫٦ tok/sضغط شديد يتسع في الذاكرة الموحدة UD-IQ1_M≈١٠٫٣ tok/sضغط شديد يتسع في الذاكرة الموحدة Q4_K_M≈٤٫٧ tok/s يتسع في ذاكرة RAM (المعالج) Q4_1≈١٠٫٢ tok/s يتسع في ذاكرة RAM (المعالج)
DeepSeek R1 HFMoE 684B / 37B ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع UD-IQ1_S≈١٦٫٩ tok/sضغط شديد يعمل مع التفريغ إلى الذاكرة العشوائية ✕ لا يتسع ✕ لا يتسع UD-IQ1_S≈٨٫٠ tok/sضغط شديد يعمل مع التفريغ إلى الذاكرة العشوائية ✕ لا يتسع Q3_K_M≈١٤٫٩ tok/s يتسع في الذاكرة الموحدة ✕ لا يتسع ✕ لا يتسع Q4_K_M≈٥٫٢ tok/s يتسع في ذاكرة RAM (المعالج) Q3_K_M≈١٣٫٩ tok/s يتسع في ذاكرة RAM (المعالج)
Kimi K2.5 HFMoE 1,027B / 32B ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع ✕ لا يتسع UD-Q2_K_XL≈٢٢ tok/sضغط شديد يتسع في الذاكرة الموحدة ✕ لا يتسع ✕ لا يتسع Q3_K_S≈٧٫٢ tok/s يتسع في ذاكرة RAM (المعالج) UD-IQ2_XXS≈١٩٫٧ tok/sضغط شديد يتسع في ذاكرة RAM (المعالج)

ما الذي يُتاح عند كل حجم ذاكرة (السياق ٨K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B ضغط شديد: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B ضغط شديد: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B ضغط شديد: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B ضغط شديد: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B ضغط شديد: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b ضغط شديد: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 ضغط شديد: DeepSeek R1
  9. 256 GB ضغط شديد: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ تقديرات لسياق 8K: الأوزان + KV cache + الحمل التشغيلي مقابل الذاكرة؛ والسرعة من عرض نطاق الذاكرة. الأرقام الفعلية تعتمد على بيئة التشغيل والإعدادات.

تاريخ التحديث · المصادر: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

تضمين في موقعك

الصق هذا الكود حيث يجب أن يظهر الإنفوغرافيك: يتحدّث تلقائيًا. الاستخدام مجاني — أبقِ رابط الإسناد.

JSON بياناتنا: CC BY 4.0 مع رابط إلى المصدر؛ وتحتفظ بيانات الجهات الأخرى برخصة مصدرها.

بنية المصفوفة

في الصفوف نماذج معروفة ذات أوزان مفتوحة، من نحو 3B إلى 1T معامل. وفي الأعمدة بطاقات رسومية، وأجهزة بعدة معالجات رسومية، وأجهزة Apple وAMD بذاكرة موحّدة، وخوادم تشغّل النموذج على المعالج. تذكر كل خلية مستوى التكميم المقترح وسرعة توليد تقريبية بالرموز في الثانية، ولونها يبيّن مكان النموذج: ذاكرة الرسوميات (VRAM)، أو الذاكرة الموحّدة، أو ذاكرة الخادم، أو التفريغ إلى RAM، أو أنه لا يتسع.

من أين تأتي الذاكرة المطلوبة

  • الأوزان: عدد المعاملات مضروبا في عدد البتات لكل وزن، أو الحجم الفعلي لملف التكميم على Hugging Face إن وُجد.
  • ذاكرة KV: الذاكرة التي تحفظ المحادثة. تفترض المصفوفة سياقا من 8192 رمزا، ومع السياق الطويل قد يتجاوز هذا الجزء حجم نموذج صغير.
  • الحمل الإضافي: نحو 1.5 GB لبيئة التشغيل والمخازن المؤقتة، ويضاف إليها مُسقط الصور في نماذج VLM.

إذا تجاوز المجموع ذاكرة VRAM لكنه اتسع مع ذاكرة النظام، تعرض الخلية التفريغ: النموذج يعمل، لكن ببطء أكبر.

كيف تُقدَّر السرعة

السرعة تساوي عرض نطاق الذاكرة مقسوما على البايتات المقروءة لكل رمز. نموذج MoE لا يقرأ إلا معاملاته النشطة، ولهذا قد يكتب نموذج MoE كبير أسرع من نموذج كثيف أصغر منه. القيم المعلّمة بـ ≈ تقديرات معايَرة على تشغيلات مقيسة وتبقى في حدود ±35% منها، والخلية التي لها قياس فعلي تعرضه مع رابط إلى مصدره.

كيف نختار التكميم

نصعد في عدد البتات حتى Q8_0 ما دامت السرعة لا تقل عن 10 رموز في الثانية، وإلا نقترح ملفا من فئة Q4 مثل Q4_K_M. لا نقترح BF16 أبدا، فهو يضاعف الذاكرة مقابل فرق بالكاد يُلاحظ. ولا ننزل تحت Q3 إلا إذا لم يتسع شيء أكبر، وعندها تنبّه الخلية إلى «ضغط شديد».

جهازك أنت وحدود التقدير

تحت المصفوفة «الحاسبة: هل سيتسع؟»، تُدخل فيها النموذج والتكميم وطول السياق والعتاد، أو ببساطة ذاكرة الرسوميات وRAM وعرض النطاق لديك، فترسم الأوزان وKV والحمل الإضافي شريطا واحدا مقابل السعة. وتحتها سلّم يبيّن ما يصبح ممكنا عند 8 و12 و16 و24 و48 و96 و128 GB.

التقدير يشمل التوليد فقط، لا وقت قراءة سؤال طويل، والتعريفات وإصدار بيئة التشغيل والإعدادات تحرّك النتيجة صعودا أو هبوطا. ملفات GGUF تعمل في llama.cpp وLM Studio وOllama وJan، انظر تطبيقات الذكاء الاصطناعي المحلية. النماذج بدون مرشحات أمان مخفية خلف مفتاح. وللأجهزة الكاملة انتقل إلى تجميعات الحاسوب.