تجميعات حاسوب لنماذج الذكاء الاصطناعي المحلية، من 20B إلى 120B — 2026
من بطاقة رسوميات واحدة بسعة 16 GB إلى ثلاث RTX 3090 وخادم EPYC وأجهزة بذاكرة موحّدة: ما يشغّله كل تجميع وبأي سرعة، مع مصدر كل قياس.
-
One 16 GB GPU
- الميزانية
- اقتصادية
- ذاكرة الرسوميات
- ≈١٦ GB
- الذاكرة العشوائية
- ≈٣٢ GB
- المكوّنات
- GPU: RTX 5060 Ti 16 GB / RTX 4060 Ti 16 GB
- CPU: any 6–8-core desktop CPU
- اللوحة الأم: any ATX/mATX with a PCIe x16 slot
- الذاكرة العشوائية: 32 GB DDR4/DDR5
- مزوّد الطاقة: 550–650 W
- PCIe: 1× x16 (x8 electrical is enough)
- ما تشغّله
- gpt-oss-20b MXFP4 (RTX 5060 Ti 16 GB) MXFP4 ١١٢ tok/s [مقاس]
- Qwen3-30B-A3B Q4_K_M, experts partly in RAM Q4_K_M [≈ تقدير من عرض نطاق الذاكرة]
- ملاحظات
- gpt-oss-20b (≈12 GB) fits entirely in VRAM with room for a long context. Qwen3-30B-A3B Q4_K_M (≈18.6 GB) does not fit: a few expert layers go to system RAM with --n-cpu-moe, still usable because only ~3B parameters are active. Measured on an RTX 5060 Ti 16 GB (llama-bench tg128).
-
One RTX 3090 24 GB (used)
- الميزانية
- اقتصادية
- ذاكرة الرسوميات
- ≈٢٤ GB
- الذاكرة العشوائية
- ≈٦٤ GB
- المكوّنات
- GPU: RTX 3090 24 GB
- CPU: any 6–8-core desktop CPU
- اللوحة الأم: any ATX with a PCIe x16 slot
- الذاكرة العشوائية: 32–64 GB DDR4/DDR5
- مزوّد الطاقة: 750–850 W
- PCIe: 1× x16
- ما تشغّله
- gpt-oss-20b MXFP4 MXFP4 ١٦٢ tok/s [مقاس]
- Qwen3-30B-A3B Q4_K Q4_K_M ١٥٤ tok/s @4k [مقاس]
- Gemma 3 27B Q4_K_M Q4_K_M ≈٣١–٤٢ tok/s [≈ تقدير من عرض نطاق الذاكرة]
- ملاحظات
- The cheapest way to 24 GB of fast VRAM. Small MoE models fly; dense ~27–32B models fit at Q4 with a moderate context. The Gemma 3 27B figure is our estimate: 936 GB/s × 55–75 % efficiency ÷ 16.5 GB of weights.
-
12–24 GB GPU + 64–128 GB RAM (MoE offload)
- الميزانية
- اقتصادية
- ذاكرة الرسوميات
- ≈٢٤ GB
- الذاكرة العشوائية
- ≈٦٤ GB
- المكوّنات
- GPU: RTX 3090 24 GB / RTX 4070 12 GB / RTX 3080 Ti 12 GB
- CPU: Core i5-12600K / Core Ultra 7 265K class
- اللوحة الأم: desktop board, both memory channels populated
- الذاكرة العشوائية: 64–128 GB DDR5 (XMP/EXPO on) or DDR4-3600
- مزوّد الطاقة: 750–850 W
- PCIe: 1× x16
- ما تشغّله
- gpt-oss-120b MXFP4 — RTX 3090 + 64 GB DDR5-5200, --n-cpu-moe 24–26 MXFP4 ٢٦–٢٨ tok/s [مقاس]
- gpt-oss-120b MXFP4 — RTX 4070 12 GB + 64 GB DDR5 MXFP4 ٢٥–٢٨ tok/s [مقاس]
- gpt-oss-120b MXFP4 — RTX 3080 Ti 12 GB + 128 GB DDR4-3600, --n-cpu-moe 36 MXFP4 ١٨٫٠–٢٢ tok/s [مقاس]
- ملاحظات
- llama.cpp --n-cpu-moe N keeps attention and the shared layers on the GPU and moves the experts of N layers to system RAM. Works well only for MoE models; RAM speed matters — the 4070 build ran at 10–11 tok/s until XMP was turned on.
-
Two RTX 3090 (48 GB)
- الميزانية
- متوسطة
- ذاكرة الرسوميات
- ≈٤٨ GB
- الذاكرة العشوائية
- ≈٦٤ GB
- المكوّنات
- GPU: 2× RTX 3090 24 GB
- CPU: desktop CPU with x8/x8 bifurcation, or HEDT
- اللوحة الأم: two x16-size slots spaced for 3-slot cards (x8/x8)
- الذاكرة العشوائية: 64 GB
- مزوّد الطاقة: 1000–1200 W
- PCIe: 2× x8 PCIe 4.0; NVLink optional
- ما تشغّله
- Llama 3 70B Q4_K_M (same size as Llama 3.3 70B) Q4_K_M ١٦٫٣ tok/s [مقاس]
- ملاحظات
- 48 GB holds a dense 70B model at Q4_K_M (≈42.5 GB) with a short-to-medium context. llama.cpp splits the layers between the cards and runs them one after another, so speed is that of one 3090 reading the whole model; NVLink and x8 lanes barely matter here (they do for vLLM tensor parallel).
-
Used EPYC server, 8-channel DDR4 (CPU only)
- الميزانية
- متوسطة
- ذاكرة الرسوميات
- ≈٠ GB
- الذاكرة العشوائية
- ≈٥١٢ GB
- السعر
- ٢٬٠٠٠ US$
- المكوّنات
- CPU: AMD EPYC 7002/7003 (Rome/Milan), e.g. EPYC 7702
- اللوحة الأم: ASRock Rack ROMED8-2T / Supermicro H12SSL-i / Gigabyte MZ32-AR0
- الذاكرة العشوائية: 256–512 GB DDR4-3200 RDIMM, all 8 channels populated
- مزوّد الطاقة: 750–1000 W
- PCIe: 5–7× x16 PCIe 4.0 — room to add GPUs later
- ما تشغّله
- DeepSeek R1 671B Q4 — EPYC 7702 + 512 GB DDR4-2400, MZ32-AR0 Q4 ٣٫٥–٤٫٢ tok/s [مقاس]
- gpt-oss-120b MXFP4 MXFP4 ≈١٢٫٠–١٦٫٠ tok/s [≈ تقدير من عرض نطاق الذاكرة]
- ملاحظات
- Huge memory for little money: 8 channels of DDR4-3200 give 204.8 GB/s per socket. Only MoE models are practical — speed follows the active parameters. Fill every channel; a second socket adds NUMA trouble and little speed in llama.cpp (--numa distribute). The gpt-oss-120b figure is an estimate scaled by memory bandwidth from a DDR5 EPYC run. The source build cost about $2000 (prices of January 2025).
-
AMD Strix Halo mini-PC, 128 GB
- الميزانية
- متوسطة
- ذاكرة الرسوميات
- ≈٩٦ GB
- الذاكرة العشوائية
- ≈١٢٨ GB
- المكوّنات
- GPU: Radeon 8060S (integrated)
- CPU: AMD Ryzen AI Max+ 395
- اللوحة الأم: Framework Desktop / other Strix Halo mini-PCs
- الذاكرة العشوائية: 128 GB LPDDR5X-8000 unified (≈96 GB+ usable as VRAM)
- مزوّد الطاقة: built-in
- ما تشغّله
- gpt-oss-120b MXFP4 (ROCm) MXFP4 ٥٠ tok/s [مقاس]
- ملاحظات
- Quiet, ~120 W, the whole model in unified memory. Bandwidth (256 GB/s) is about a quarter of a 3090, so dense 70B models are slow; large MoE models with few active parameters are its sweet spot.
-
Three RTX 3090 (72 GB)
- الميزانية
- عالية الأداء
- ذاكرة الرسوميات
- ≈٧٢ GB
- الذاكرة العشوائية
- ≈٦٤ GB
- المكوّنات
- GPU: 3× RTX 3090 24 GB
- CPU: AMD EPYC 7002/7003 or Threadripper (enough PCIe lanes)
- اللوحة الأم: ASRock Rack ROMED8-2T / Supermicro H12SSL-i, risers for 3-slot cards
- الذاكرة العشوائية: 64–128 GB
- مزوّد الطاقة: 1200–1600 W (or two PSUs)
- PCIe: 3× x8–x16 PCIe 4.0
- ما تشغّله
- gpt-oss-120b MXFP4, all in VRAM MXFP4 ٤١–٧٣ tok/s @12.8k→93.7k [مقاس]
- ملاحظات
- gpt-oss-120b (≈65 GB) fits fully in 72 GB of VRAM with a long context: 73 tok/s at 12.8k tokens of context, 41 tok/s at 93.7k. The measured machine was rented, so the platform here is our suggestion: a server board gives every card enough lanes. Three 350 W cards need a big PSU; many owners power-limit them.
-
NVIDIA DGX Spark, 128 GB
- الميزانية
- عالية الأداء
- ذاكرة الرسوميات
- ≈١٢٨ GB
- الذاكرة العشوائية
- ≈١٢٨ GB
- السعر
- ٣٬٩٩٩ US$
- المكوّنات
- GPU: NVIDIA GB10 (integrated Blackwell)
- CPU: Arm CPU of the GB10
- اللوحة الأم: NVIDIA DGX Spark
- الذاكرة العشوائية: 128 GB LPDDR5X unified
- مزوّد الطاقة: built-in
- ما تشغّله
- gpt-oss-120b MXFP4 MXFP4 ٦١ tok/s [مقاس]
- ملاحظات
- A CUDA box with 128 GB of unified memory at 273 GB/s: the same speed class as Strix Halo, with the NVIDIA software stack. Early llama.cpp builds gave ~35 tok/s on gpt-oss-120b; the figure is after the November 2025 update (llama-bench tg128).
-
Mac Studio, M2/M3 Ultra
- الميزانية
- عالية الأداء
- ذاكرة الرسوميات
- ≈١٩٢ GB
- الذاكرة العشوائية
- ≈١٩٢ GB
- المكوّنات
- GPU: Apple M2 Ultra 76-core / M3 Ultra 80-core GPU
- CPU: Apple M2 Ultra / M3 Ultra
- اللوحة الأم: Mac Studio
- الذاكرة العشوائية: 192–512 GB unified (800–819 GB/s)
- مزوّد الطاقة: built-in
- ما تشغّله
- gpt-oss-120b MXFP4 — M2 Ultra 192 GB MXFP4 ٨٠ tok/s [مقاس]
- gpt-oss-20b MXFP4 — M3 Ultra 512 GB MXFP4 ١١٦ tok/s [مقاس]
- ملاحظات
- The simplest way to run the biggest models at home: the M3 Ultra goes up to 512 GB of unified memory, enough for DeepSeek-class MoE models at 4 bits. Prompt processing is much slower than on NVIDIA GPUs. For very large models raise the GPU memory limit with sysctl iogpu.wired_limit_mb.
السرعات المقاسة مرتبطة بمصدرها؛ ≈ تعني تقديرًا من عرض نطاق الذاكرة. الأسعار تقريبية.
تاريخ التحديث · المصادر: github.com , www.hardware-corner.net , carteakey.dev , github.crookster.org , hardware-corner.net , digitalspaceport.com , quozul.dev
تضمين في موقعك
الصق هذا الكود حيث يجب أن يظهر الإنفوغرافيك: يتحدّث تلقائيًا. الاستخدام مجاني — أبقِ رابط الإسناد.
ثلاث فئات للميزانية
تجمع البطاقات حواسيب كاملة للنماذج المحلية بحسب الميزانية. الفئة «اقتصادية» تبدأ ببطاقة رسومية واحدة بسعة 16 GB، وبطاقة RTX 3090 مستعملة، ومعالج رسومي مع ذاكرة RAM وفيرة لتفريغ MoE. والفئة «متوسطة» تضيف بطاقتي RTX 3090، وخادم EPYC مستعملا بذاكرة DDR4 من 8 قنوات، وحاسوبا صغيرا AMD Strix Halo. أما الفئة «عالية الأداء» فتضم ثلاث بطاقات RTX 3090 وNVIDIA DGX Spark وMac Studio بمعالج M2/M3 Ultra. وفي كل بطاقة: ذاكرة الرسوميات وRAM والسعر التقريبي والمكوّنات حتى مزوّد الطاقة ومسارات PCIe، والنماذج التي يشغّلها الجهاز وسرعتها.
قياس أم تقدير؟
السرعة دون علامة مقيسة: ترتبط بمصدرها، وغالبا ما يكون موضوع اختبارات لـ llama.cpp أو تقريرا منشورا، وتعرض تاريخه. والقيمة المعلّمة بـ ≈ تقديرنا انطلاقا من عرض نطاق الذاكرة. كل قياس يخص إصدار بيئة التشغيل وإعداداته، لذلك قد تأتي النتيجة على جهازك أعلى أو أدنى قليلا.
الاختيار خطوة بخطوة
- حجم النماذج أولا. حدّد النماذج التي تريد تشغيلها، فهي التي تحدد الذاكرة. ما يحتاجه كل حجم موضّح في رسم ملاءمة العتاد.
- ثم السرعة. سرعة التوليد تتبع عرض نطاق الذاكرة. البطاقات الرسومية سريعة ما دام النموذج يتسع في ذاكرتها، وأجهزة الذاكرة الموحّدة (Mac وStrix Halo وDGX Spark) تتسع لنماذج أكبر لكنها تولّد ببطء أكبر.
- ثم بنية النموذج. خوادم المعالجات تستضيف نماذج MoE ضخمة بتكلفة قليلة، لكن MoE وحده عملي هناك، لأن كل رمز يقرأ المعاملات النشطة فقط.
- وأخيرا الضجيج والاستهلاك والسعر. عدة بطاقات 3090 صاخبة وتحتاج مزوّد طاقة قويا، والحاسوب الصغير أو Mac هادئ لكنه أبطأ لكل رمز.
خطآن شائعان
زيادة البطاقات لا تعني زيادة السرعة. في llama.cpp تُوزَّع الطبقات على المعالجات الرسومية وتعمل واحدة بعد أخرى، فالبطاقة الثانية أو الثالثة من RTX 3090 تسمح بتحميل نموذج أكبر بينما تبقى السرعة قريبة من سرعة بطاقة واحدة. والخطأ الثاني يخص تفريغ MoE: الخيار --n-cpu-moe يبقي الطبقات المشتركة على المعالج الرسومي وينقل الخبراء (experts) إلى ذاكرة النظام، وهذا ينجح مع نماذج MoE فقط، وسرعة RAM مهمة هنا.
الأسعار تقريبية وتتغير بسرعة، خاصة للبطاقات المستعملة. ولتشغيل نموذج تحتاج أيضا إلى تطبيق، انظر تطبيقات الذكاء الاصطناعي المحلية، وإلى ملف بالتكميم المناسب كما يشرح أنواع النماذج.