أي نموذج مفتوح يناسب جهازك — 2026
نماذج الأوزان المفتوحة مقابل بطاقات الرسوميات والحواسيب الشائعة: التكميم الموصى به (الأكبر حتى Q8 الذي ما زال يعطي 10 رموز في الثانية أو أكثر، وإلا فمن فئة Q4؛ وما دون Q3 فقط عندما لا يتسع غيره)، ومكان التشغيل (ذاكرة الرسوميات أو الذاكرة الموحدة أو التفريغ إلى الذاكرة العشوائية)، وسرعة التوليد التقريبية.
| النموذج | المعاملات | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈٨٤ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٦٧ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٢١٨ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٢٣٥ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤١٧ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤١٧ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٦٨ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٣٦ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١١٥ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١١١ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٦٧ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٥٢ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٥٦ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٥٫٠ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈٣٤ tok/s يتسع في ذاكرة RAM (المعالج) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈٧٤ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٥٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٩٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٢٠٧ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٣٦٨ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٣٦٨ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٤٨ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٢٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٠١ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٩٨ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٤٧ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٤٦ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٤٩ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٤٫٣ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈٣٢ tok/s يتسع في ذاكرة RAM (المعالج) |
| Gemma 3 4B HF | 4.3B | Q8_0≈٦٧ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٥٤ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٧٥ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٨٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٣٣٥ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٣٣٥ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٣٥ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٠٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٩٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٨٩ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٣٤ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٤٢ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٤٥ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٣٫٨ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈٣١ tok/s يتسع في ذاكرة RAM (المعالج) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈٣٧ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈٢٩ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈٩٥ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈١٠٣ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈١٨٢ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈١٨٢ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈٧٣ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈٥٩ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈٥٠ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈٤٩ tok/s يتسع في الذاكرة الموحدة | UD-Q6_K_XL≈٧٣ tok/s يتسع في الذاكرة الموحدة | UD-Q6_K_XL≈٢٣ tok/s يتسع في الذاكرة الموحدة | UD-Q6_K_XL≈٢٤ tok/s يتسع في الذاكرة الموحدة | UD-Q6_K_XL≈١٠٫٣ tok/s يتسع في ذاكرة RAM (المعالج) | UD-Q6_K_XL≈٢٣ tok/s يتسع في ذاكرة RAM (المعالج) |
| Qwen3 8B HF | 8.2B | Q8_0≈٣١ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٢٥ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٨٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٨٧ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٥٤ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٥٤ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٦٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٥٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤١ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٦٢ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٩٫٢ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٢١ tok/s يتسع في الذاكرة الموحدة | UD-Q6_K_XL≈١٠٫٢ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈٢١ tok/s يتسع في ذاكرة RAM (المعالج) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈٣٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٧٫٨ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٥٨ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٦٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١١١ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١١١ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤٤ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٣٦ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٣٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٣٠ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٤٤ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٣٫٨ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٤٫٨ tok/s يتسع في الذاكرة الموحدة | Q4_1≈١٠٫٢ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈١٧٫١ tok/s يتسع في ذاكرة RAM (المعالج) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈٣٠ tok/s يتسع في ذاكرة الرسوميات | Q6_K≈١٨٫٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤٦ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٨٨ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٨٨ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٣٥ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٢٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٢٤ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٢٣ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٣٥ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٠٫٩ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١١٫٧ tok/s يتسع في الذاكرة الموحدة | UD-Q3_K_XL≈١٠٫١ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈١٤٫٦ tok/s يتسع في ذاكرة RAM (المعالج) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈٥٣ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | MXFP4≈٥٥ tok/s يتسع في ذاكرة الرسوميات | MXFP4١٦٢ tok/sمقاس يتسع في ذاكرة الرسوميات | MXFP4≈١٩٤ tok/s يتسع في ذاكرة الرسوميات | MXFP4≈٣٤٤ tok/s يتسع في ذاكرة الرسوميات | MXFP4≈٣٤٤ tok/s يتسع في ذاكرة الرسوميات | MXFP4≈١٣٨ tok/s يتسع في ذاكرة الرسوميات | MXFP4≈١١٢ tok/s يتسع في ذاكرة الرسوميات | MXFP4≈٩٥ tok/s يتسع في ذاكرة الرسوميات | MXFP4≈٨٠ tok/s يتسع في الذاكرة الموحدة | MXFP4١١٦ tok/sمقاس يتسع في الذاكرة الموحدة | MXFP4≈٥٩ tok/s يتسع في الذاكرة الموحدة | MXFP4≈٦٢ tok/s يتسع في الذاكرة الموحدة | MXFP4≈١٧٫٢ tok/s يتسع في ذاكرة RAM (المعالج) | MXFP4≈٣٩ tok/s يتسع في ذاكرة RAM (المعالج) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈١٠٫٢ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q3_K_XL≈١٨٫٤ tok/s يتسع في ذاكرة الرسوميات | Q6_K≈٣٧ tok/s يتسع في ذاكرة الرسوميات | Q6_K≈٤٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٥٦ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٥٦ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٢٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٨٫٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٥٫٣ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٤٫٩ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٢٢ tok/s يتسع في الذاكرة الموحدة | Q5_K_M≈١٠٫٣ tok/s يتسع في الذاكرة الموحدة | Q5_K_M≈١١٫٠ tok/s يتسع في الذاكرة الموحدة | Q4_K_M≈٦٫٩ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈١٠٫٣ tok/s يتسع في ذاكرة RAM (المعالج) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈١٤٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q3_K_M≈٥٦ tok/s يتسع في ذاكرة الرسوميات | UD-Q5_K_S≈١٢٩ tok/s يتسع في ذاكرة الرسوميات | UD-Q5_K_S≈١٣٩ tok/s يتسع في ذاكرة الرسوميات | UD-Q8_K_XL≈١٧٣ tok/s يتسع في ذاكرة الرسوميات | UD-Q8_K_XL≈١٧٣ tok/s يتسع في ذاكرة الرسوميات | UD-Q8_K_XL≈٧٠ tok/s يتسع في ذاكرة الرسوميات | UD-Q8_K_XL≈٥٧ tok/s يتسع في ذاكرة الرسوميات | UD-Q8_K_XL≈٤٨ tok/s يتسع في ذاكرة الرسوميات | UD-Q8_K_XL≈٤٠ tok/s يتسع في الذاكرة الموحدة | UD-Q8_K_XL≈٦٠ tok/s يتسع في الذاكرة الموحدة | UD-Q8_K_XL≈٢٩ tok/s يتسع في الذاكرة الموحدة | UD-Q8_K_XL≈٣١ tok/s يتسع في الذاكرة الموحدة | UD-Q8_K_XL≈١٣٫٧ tok/s يتسع في ذاكرة RAM (المعالج) | UD-Q8_K_XL≈٣١ tok/s يتسع في ذاكرة RAM (المعالج) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈١٢٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q3_K_S≈١٨٫١ tok/s يتسع في ذاكرة الرسوميات | UD-Q5_K_XL≈٣٨ tok/s يتسع في ذاكرة الرسوميات | UD-Q5_K_XL≈٤١ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈٥٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٩٫٧ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٦٫٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٣٫٥ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٣٫١ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٩٫٦ tok/s يتسع في الذاكرة الموحدة | Q4_1≈١٠٫١ tok/s يتسع في الذاكرة الموحدة | Q4_1≈١٠٫٨ tok/s يتسع في الذاكرة الموحدة | Q4_K_M≈٦٫٣ tok/s يتسع في ذاكرة RAM (المعالج) | UD-Q6_K_XL≈١٠٫٨ tok/s يتسع في ذاكرة RAM (المعالج) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈١٦٫٤ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q3_K_S≈٦٦ tok/s يتسع في ذاكرة الرسوميات | Q4_K_M١٥٤ tok/sمقاس يتسع في ذاكرة الرسوميات | Q5_K_S≈١٥٨ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈٢٣٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٩٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٧٧ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٦٣ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٥٣ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤٥ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٦٧ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٣٣ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٣٥ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٤٫٣ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈٣٢ tok/s يتسع في ذاكرة RAM (المعالج) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈٣٫٨ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q3_K_S≈١٠٫٤ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q4_1≈٣٧ tok/s يتسع في ذاكرة الرسوميات | Q4_1≈٤٠ tok/s يتسع في ذاكرة الرسوميات | Q6_K≈٥٥ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤٣ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٧٫١ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٣٫٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١١٫٧ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١١٫٣ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٧٫٠ tok/s يتسع في الذاكرة الموحدة | IQ4_XS≈١٠٫٣ tok/s يتسع في الذاكرة الموحدة | Q4_K_S≈١٠٫٣ tok/s يتسع في الذاكرة الموحدة | Q4_K_M≈٥٫٧ tok/s يتسع في ذاكرة RAM (المعالج) | Q6_K≈١٠٫١ tok/s يتسع في ذاكرة RAM (المعالج) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈٣٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-IQ3_XXS≈١٤٫١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q4_K_XL≈٣٥ tok/s يتسع في ذاكرة الرسوميات | UD-Q4_K_XL≈٣٨ tok/s يتسع في ذاكرة الرسوميات | Q6_K≈٥١ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٦٫٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٣٫٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١١٫٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٠٫٦ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٦٫٠ tok/s يتسع في الذاكرة الموحدة | UD-Q3_K_XL≈١٠٫٣ tok/s يتسع في الذاكرة الموحدة | IQ4_XS≈١٠٫٢ tok/s يتسع في الذاكرة الموحدة | Q4_K_M≈٥٫٤ tok/s يتسع في ذاكرة RAM (المعالج) | Q5_K_M≈١٠٫٨ tok/s يتسع في ذاكرة RAM (المعالج) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈١٧٫٩ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q8_0≈١٨٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q4_K_S≈١٩١ tok/s يتسع في ذاكرة الرسوميات | Q4_K_S≈٢٠٥ tok/s يتسع في ذاكرة الرسوميات | Q6_K≈٢٧٤ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٢٢٠ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٨٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٧٢ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٦١ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٥١ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٧٧ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٣٧ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٤٠ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٥٫٠ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈٣٤ tok/s يتسع في ذاكرة RAM (المعالج) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈١٫٣ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q4_K_M≈١٫٤ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q4_K_M≈٢٫٠ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q4_K_M≈٢٫٠ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-IQ3_XXS≈٤٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈١٨٫٨ tok/s يتسع في ذاكرة الرسوميات | Q4_K_M١٦٫٣ tok/sمقاس يتسع في ذاكرة الرسوميات | Q4_1≈١٠٫٣ tok/s يتسع في ذاكرة الرسوميات | IQ4_XS≈١٠٫٠ tok/s يتسع في ذاكرة الرسوميات | UD-Q3_K_XL≈١٠٫٦ tok/s يتسع في الذاكرة الموحدة | Q5_K_M≈١١٫٢ tok/s يتسع في الذاكرة الموحدة | Q4_K_M≈٤٫١ tok/s يتسع في الذاكرة الموحدة | Q4_K_M≈٤٫٤ tok/s يتسع في الذاكرة الموحدة | Q4_K_M≈٢٫٩ tok/s يتسع في ذاكرة RAM (المعالج) | Q4_K_M≈٦٫٦ tok/s يتسع في ذاكرة RAM (المعالج) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈٢٤ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q6_K≈٢١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q6_K_XL≈٢٦ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q6_K_XL≈٢٦ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q6_K_XL≈٣١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q8_0≈٢١٣ tok/s يتسع في ذاكرة الرسوميات | Q4_K_S≈١٤٥ tok/s يتسع في ذاكرة الرسوميات | UD-Q6_K_XL≈٨٤ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٥٩ tok/s يتسع في ذاكرة الرسوميات | Q8_0≈٤٩ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٧٤ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٣٦ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٣٩ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٤٫٨ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈٣٣ tok/s يتسع في ذاكرة RAM (المعالج) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈٥٫٣ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q4_K_S≈٥٫١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q4_K_M≈٥٫٦ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q4_K_M≈٥٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q3_K_M≈١٠٫٢ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q5_K_M≈٥٥ tok/s يتسع في ذاكرة الرسوميات | Q4_0≈١٠٫٠ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q4_K_XL≈٢٢ tok/s يتسع في ذاكرة الرسوميات | Q5_K_M≈١٥٫٢ tok/s يتسع في ذاكرة الرسوميات | Q5_K_M≈١٢٫٨ tok/s يتسع في الذاكرة الموحدة | Q8_0≈١٣٫٩ tok/s يتسع في الذاكرة الموحدة | Q4_K_M≈١٠٫٦ tok/s يتسع في الذاكرة الموحدة | Q5_K_M≈١٠٫٠ tok/s يتسع في الذاكرة الموحدة | Q4_K_M≈٨٫٠ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈١٣٫١ tok/s يتسع في ذاكرة RAM (المعالج) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈١٩٫١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | MXFP4≈١٩٫٦ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | MXFP4٢٦–٢٨ tok/sمقاس يعمل مع التفريغ إلى الذاكرة العشوائية | MXFP4≈٢٥ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | MXFP4≈٣١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | MXFP4≈٢٥٨ tok/s يتسع في ذاكرة الرسوميات | MXFP4≈٣٦ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | MXFP4٤١–٧٣ tok/sمقاس يتسع في ذاكرة الرسوميات | MXFP4≈٧١ tok/s يتسع في ذاكرة الرسوميات | MXFP4≈٦٠ tok/s يتسع في الذاكرة الموحدة | MXFP4≈٩٠ tok/s يتسع في الذاكرة الموحدة | MXFP4٥٠ tok/sمقاس يتسع في الذاكرة الموحدة | MXFP4٦١ tok/sمقاس يتسع في الذاكرة الموحدة | MXFP4≈١٥٫٨ tok/s يتسع في ذاكرة RAM (المعالج) | MXFP4≈٣٦ tok/s يتسع في ذاكرة RAM (المعالج) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈١٠٫٥ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-IQ4_NL≈١٠٫٨ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q4_K_S≈١١٫١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | Q4_K_S≈١١٫٢ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q4_K_XL≈١١٫٩ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q5_K_XL≈٩٧ tok/s يتسع في ذاكرة الرسوميات | UD-IQ3_XXS≈٧٦ tok/s يتسع في ذاكرة الرسوميات | UD-IQ4_NL≈٤٦ tok/s يتسع في ذاكرة الرسوميات | UD-Q5_K_XL≈٢٧ tok/s يتسع في ذاكرة الرسوميات | UD-Q5_K_XL≈٢٣ tok/s يتسع في الذاكرة الموحدة | Q8_0≈٢٤ tok/s يتسع في الذاكرة الموحدة | Q6_K≈١٥٫١ tok/s يتسع في الذاكرة الموحدة | Q6_K≈١٦٫١ tok/s يتسع في الذاكرة الموحدة | UD-Q5_K_XL≈١٠٫٤ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈١٩٫٣ tok/s يتسع في ذاكرة RAM (المعالج) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | UD-Q4_K_XL≈١٠٫٨ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q2_K_XL≈٨٫٠ tok/sضغط شديد يعمل مع التفريغ إلى الذاكرة العشوائية | Q3_K_M≈٦٫١ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q3_K_XL≈١١٫٧ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-Q2_K_XL≈١٩٫٤ tok/sضغط شديد يتسع في الذاكرة الموحدة | Q8_0≈١٠٫٨ tok/s يتسع في الذاكرة الموحدة | UD-Q3_K_XL≈١٢٫٢ tok/s يتسع في الذاكرة الموحدة | UD-Q3_K_XL≈١٣٫٠ tok/s يتسع في الذاكرة الموحدة | Q4_K_M≈٧٫٢ tok/s يتسع في ذاكرة RAM (المعالج) | Q8_0≈١٠٫٩ tok/s يتسع في ذاكرة RAM (المعالج) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | UD-IQ3_XXS≈٧٫٣ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-IQ1_S≈٥٫٦ tok/sضغط شديد يعمل مع التفريغ إلى الذاكرة العشوائية | UD-IQ2_XXS≈٤٫٧ tok/sضغط شديد يعمل مع التفريغ إلى الذاكرة العشوائية | UD-IQ3_XXS≈٣٫٥ tok/s يعمل مع التفريغ إلى الذاكرة العشوائية | UD-TQ1_0≈١٦٫٢ tok/sضغط شديد يتسع في الذاكرة الموحدة | Q4_1≈١٠٫٠ tok/s يتسع في الذاكرة الموحدة | UD-IQ1_M≈٩٫٦ tok/sضغط شديد يتسع في الذاكرة الموحدة | UD-IQ1_M≈١٠٫٣ tok/sضغط شديد يتسع في الذاكرة الموحدة | Q4_K_M≈٤٫٧ tok/s يتسع في ذاكرة RAM (المعالج) | Q4_1≈١٠٫٢ tok/s يتسع في ذاكرة RAM (المعالج) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | UD-IQ1_S≈١٦٫٩ tok/sضغط شديد يعمل مع التفريغ إلى الذاكرة العشوائية | ✕ لا يتسع | ✕ لا يتسع | UD-IQ1_S≈٨٫٠ tok/sضغط شديد يعمل مع التفريغ إلى الذاكرة العشوائية | ✕ لا يتسع | Q3_K_M≈١٤٫٩ tok/s يتسع في الذاكرة الموحدة | ✕ لا يتسع | ✕ لا يتسع | Q4_K_M≈٥٫٢ tok/s يتسع في ذاكرة RAM (المعالج) | Q3_K_M≈١٣٫٩ tok/s يتسع في ذاكرة RAM (المعالج) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | ✕ لا يتسع | UD-Q2_K_XL≈٢٢ tok/sضغط شديد يتسع في الذاكرة الموحدة | ✕ لا يتسع | ✕ لا يتسع | Q3_K_S≈٧٫٢ tok/s يتسع في ذاكرة RAM (المعالج) | UD-IQ2_XXS≈١٩٫٧ tok/sضغط شديد يتسع في ذاكرة RAM (المعالج) |
الحاسبة: هل سيتسع؟
ما الذي يُتاح عند كل حجم ذاكرة (السياق ٨K)
- 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B ضغط شديد: Gemma 3 12B · Qwen3 14B
- 12 GB Gemma 3 12B · Qwen3 14B ضغط شديد: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B ضغط شديد: Gemma 4 31B · Qwen3.5 35B A3B
- 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B ضغط شديد: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B ضغط شديد: GLM 4.5 Air
- 96 GB GLM 4.5 Air · gpt-oss-120b ضغط شديد: Qwen3 235B A22B · GLM 4.7
- 128 GB Qwen3 235B A22B
- 192 GB GLM 4.7 ضغط شديد: DeepSeek R1
- 256 GB ضغط شديد: Kimi K2.5
- 512 GB DeepSeek R1 · Kimi K2.5
≈ تقديرات لسياق 8K: الأوزان + KV cache + الحمل التشغيلي مقابل الذاكرة؛ والسرعة من عرض نطاق الذاكرة. الأرقام الفعلية تعتمد على بيئة التشغيل والإعدادات.
تاريخ التحديث · المصادر: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
تضمين في موقعك
الصق هذا الكود حيث يجب أن يظهر الإنفوغرافيك: يتحدّث تلقائيًا. الاستخدام مجاني — أبقِ رابط الإسناد.
بنية المصفوفة
في الصفوف نماذج معروفة ذات أوزان مفتوحة، من نحو 3B إلى 1T معامل. وفي الأعمدة بطاقات رسومية، وأجهزة بعدة معالجات رسومية، وأجهزة Apple وAMD بذاكرة موحّدة، وخوادم تشغّل النموذج على المعالج. تذكر كل خلية مستوى التكميم المقترح وسرعة توليد تقريبية بالرموز في الثانية، ولونها يبيّن مكان النموذج: ذاكرة الرسوميات (VRAM)، أو الذاكرة الموحّدة، أو ذاكرة الخادم، أو التفريغ إلى RAM، أو أنه لا يتسع.
من أين تأتي الذاكرة المطلوبة
- الأوزان: عدد المعاملات مضروبا في عدد البتات لكل وزن، أو الحجم الفعلي لملف التكميم على Hugging Face إن وُجد.
- ذاكرة KV: الذاكرة التي تحفظ المحادثة. تفترض المصفوفة سياقا من 8192 رمزا، ومع السياق الطويل قد يتجاوز هذا الجزء حجم نموذج صغير.
- الحمل الإضافي: نحو 1.5 GB لبيئة التشغيل والمخازن المؤقتة، ويضاف إليها مُسقط الصور في نماذج VLM.
إذا تجاوز المجموع ذاكرة VRAM لكنه اتسع مع ذاكرة النظام، تعرض الخلية التفريغ: النموذج يعمل، لكن ببطء أكبر.
كيف تُقدَّر السرعة
السرعة تساوي عرض نطاق الذاكرة مقسوما على البايتات المقروءة لكل رمز. نموذج MoE لا يقرأ إلا معاملاته النشطة، ولهذا قد يكتب نموذج MoE كبير أسرع من نموذج كثيف أصغر منه. القيم المعلّمة بـ ≈ تقديرات معايَرة على تشغيلات مقيسة وتبقى في حدود ±35% منها، والخلية التي لها قياس فعلي تعرضه مع رابط إلى مصدره.
كيف نختار التكميم
نصعد في عدد البتات حتى Q8_0 ما دامت السرعة لا تقل عن 10 رموز في الثانية، وإلا نقترح ملفا من فئة Q4 مثل Q4_K_M. لا نقترح BF16 أبدا، فهو يضاعف الذاكرة مقابل فرق بالكاد يُلاحظ. ولا ننزل تحت Q3 إلا إذا لم يتسع شيء أكبر، وعندها تنبّه الخلية إلى «ضغط شديد».
جهازك أنت وحدود التقدير
تحت المصفوفة «الحاسبة: هل سيتسع؟»، تُدخل فيها النموذج والتكميم وطول السياق والعتاد، أو ببساطة ذاكرة الرسوميات وRAM وعرض النطاق لديك، فترسم الأوزان وKV والحمل الإضافي شريطا واحدا مقابل السعة. وتحتها سلّم يبيّن ما يصبح ممكنا عند 8 و12 و16 و24 و48 و96 و128 GB.
التقدير يشمل التوليد فقط، لا وقت قراءة سؤال طويل، والتعريفات وإصدار بيئة التشغيل والإعدادات تحرّك النتيجة صعودا أو هبوطا. ملفات GGUF تعمل في llama.cpp وLM Studio وOllama وJan، انظر تطبيقات الذكاء الاصطناعي المحلية. النماذج بدون مرشحات أمان مخفية خلف مفتاح. وللأجهزة الكاملة انتقل إلى تجميعات الحاسوب.