Configurații de PC pentru modele de IA locale, de la 20B la 120B — 2026
De la o singură placă video de 16 GB la trei RTX 3090, un server EPYC și calculatoare cu memorie unificată: ce rulează fiecare configurație și cât de repede, cu sursa fiecărei măsurători.
-
One 16 GB GPU
- Buget
- Economică
- Memorie video
- ≈16 GB
- RAM
- ≈32 GB
- Componente
- GPU: RTX 5060 Ti 16 GB / RTX 4060 Ti 16 GB
- CPU: any 6–8-core desktop CPU
- Placă de bază: any ATX/mATX with a PCIe x16 slot
- RAM: 32 GB DDR4/DDR5
- Sursă de alimentare: 550–650 W
- PCIe: 1× x16 (x8 electrical is enough)
- Rulează
- gpt-oss-20b MXFP4 (RTX 5060 Ti 16 GB) MXFP4 112 tok/s [măsurat]
- Qwen3-30B-A3B Q4_K_M, experts partly in RAM Q4_K_M [≈ estimare din lățimea de bandă a memoriei]
- Observații
- gpt-oss-20b (≈12 GB) fits entirely in VRAM with room for a long context. Qwen3-30B-A3B Q4_K_M (≈18.6 GB) does not fit: a few expert layers go to system RAM with --n-cpu-moe, still usable because only ~3B parameters are active. Measured on an RTX 5060 Ti 16 GB (llama-bench tg128).
-
One RTX 3090 24 GB (used)
- Buget
- Economică
- Memorie video
- ≈24 GB
- RAM
- ≈64 GB
- Componente
- GPU: RTX 3090 24 GB
- CPU: any 6–8-core desktop CPU
- Placă de bază: any ATX with a PCIe x16 slot
- RAM: 32–64 GB DDR4/DDR5
- Sursă de alimentare: 750–850 W
- PCIe: 1× x16
- Rulează
- gpt-oss-20b MXFP4 MXFP4 162 tok/s [măsurat]
- Qwen3-30B-A3B Q4_K Q4_K_M 154 tok/s @4k [măsurat]
- Gemma 3 27B Q4_K_M Q4_K_M ≈31–42 tok/s [≈ estimare din lățimea de bandă a memoriei]
- Observații
- The cheapest way to 24 GB of fast VRAM. Small MoE models fly; dense ~27–32B models fit at Q4 with a moderate context. The Gemma 3 27B figure is our estimate: 936 GB/s × 55–75 % efficiency ÷ 16.5 GB of weights.
-
12–24 GB GPU + 64–128 GB RAM (MoE offload)
- Buget
- Economică
- Memorie video
- ≈24 GB
- RAM
- ≈64 GB
- Componente
- GPU: RTX 3090 24 GB / RTX 4070 12 GB / RTX 3080 Ti 12 GB
- CPU: Core i5-12600K / Core Ultra 7 265K class
- Placă de bază: desktop board, both memory channels populated
- RAM: 64–128 GB DDR5 (XMP/EXPO on) or DDR4-3600
- Sursă de alimentare: 750–850 W
- PCIe: 1× x16
- Rulează
- gpt-oss-120b MXFP4 — RTX 3090 + 64 GB DDR5-5200, --n-cpu-moe 24–26 MXFP4 26–28 tok/s [măsurat]
- gpt-oss-120b MXFP4 — RTX 4070 12 GB + 64 GB DDR5 MXFP4 25–28 tok/s [măsurat]
- gpt-oss-120b MXFP4 — RTX 3080 Ti 12 GB + 128 GB DDR4-3600, --n-cpu-moe 36 MXFP4 18,0–22 tok/s [măsurat]
- Observații
- llama.cpp --n-cpu-moe N keeps attention and the shared layers on the GPU and moves the experts of N layers to system RAM. Works well only for MoE models; RAM speed matters — the 4070 build ran at 10–11 tok/s until XMP was turned on.
-
Two RTX 3090 (48 GB)
- Buget
- Gama medie
- Memorie video
- ≈48 GB
- RAM
- ≈64 GB
- Componente
- GPU: 2× RTX 3090 24 GB
- CPU: desktop CPU with x8/x8 bifurcation, or HEDT
- Placă de bază: two x16-size slots spaced for 3-slot cards (x8/x8)
- RAM: 64 GB
- Sursă de alimentare: 1000–1200 W
- PCIe: 2× x8 PCIe 4.0; NVLink optional
- Rulează
- Llama 3 70B Q4_K_M (same size as Llama 3.3 70B) Q4_K_M 16,3 tok/s [măsurat]
- Observații
- 48 GB holds a dense 70B model at Q4_K_M (≈42.5 GB) with a short-to-medium context. llama.cpp splits the layers between the cards and runs them one after another, so speed is that of one 3090 reading the whole model; NVLink and x8 lanes barely matter here (they do for vLLM tensor parallel).
-
Used EPYC server, 8-channel DDR4 (CPU only)
- Buget
- Gama medie
- Memorie video
- ≈0 GB
- RAM
- ≈512 GB
- Preț
- 2.000 USD
- Componente
- CPU: AMD EPYC 7002/7003 (Rome/Milan), e.g. EPYC 7702
- Placă de bază: ASRock Rack ROMED8-2T / Supermicro H12SSL-i / Gigabyte MZ32-AR0
- RAM: 256–512 GB DDR4-3200 RDIMM, all 8 channels populated
- Sursă de alimentare: 750–1000 W
- PCIe: 5–7× x16 PCIe 4.0 — room to add GPUs later
- Rulează
- DeepSeek R1 671B Q4 — EPYC 7702 + 512 GB DDR4-2400, MZ32-AR0 Q4 3,5–4,2 tok/s [măsurat]
- gpt-oss-120b MXFP4 MXFP4 ≈12,0–16,0 tok/s [≈ estimare din lățimea de bandă a memoriei]
- Observații
- Huge memory for little money: 8 channels of DDR4-3200 give 204.8 GB/s per socket. Only MoE models are practical — speed follows the active parameters. Fill every channel; a second socket adds NUMA trouble and little speed in llama.cpp (--numa distribute). The gpt-oss-120b figure is an estimate scaled by memory bandwidth from a DDR5 EPYC run. The source build cost about $2000 (prices of January 2025).
-
AMD Strix Halo mini-PC, 128 GB
- Buget
- Gama medie
- Memorie video
- ≈96 GB
- RAM
- ≈128 GB
- Componente
- GPU: Radeon 8060S (integrated)
- CPU: AMD Ryzen AI Max+ 395
- Placă de bază: Framework Desktop / other Strix Halo mini-PCs
- RAM: 128 GB LPDDR5X-8000 unified (≈96 GB+ usable as VRAM)
- Sursă de alimentare: built-in
- Rulează
- gpt-oss-120b MXFP4 (ROCm) MXFP4 50 tok/s [măsurat]
- Observații
- Quiet, ~120 W, the whole model in unified memory. Bandwidth (256 GB/s) is about a quarter of a 3090, so dense 70B models are slow; large MoE models with few active parameters are its sweet spot.
-
Three RTX 3090 (72 GB)
- Buget
- Gama înaltă
- Memorie video
- ≈72 GB
- RAM
- ≈64 GB
- Componente
- GPU: 3× RTX 3090 24 GB
- CPU: AMD EPYC 7002/7003 or Threadripper (enough PCIe lanes)
- Placă de bază: ASRock Rack ROMED8-2T / Supermicro H12SSL-i, risers for 3-slot cards
- RAM: 64–128 GB
- Sursă de alimentare: 1200–1600 W (or two PSUs)
- PCIe: 3× x8–x16 PCIe 4.0
- Rulează
- gpt-oss-120b MXFP4, all in VRAM MXFP4 41–73 tok/s @12.8k→93.7k [măsurat]
- Observații
- gpt-oss-120b (≈65 GB) fits fully in 72 GB of VRAM with a long context: 73 tok/s at 12.8k tokens of context, 41 tok/s at 93.7k. The measured machine was rented, so the platform here is our suggestion: a server board gives every card enough lanes. Three 350 W cards need a big PSU; many owners power-limit them.
-
NVIDIA DGX Spark, 128 GB
- Buget
- Gama înaltă
- Memorie video
- ≈128 GB
- RAM
- ≈128 GB
- Preț
- 3.999 USD
- Componente
- GPU: NVIDIA GB10 (integrated Blackwell)
- CPU: Arm CPU of the GB10
- Placă de bază: NVIDIA DGX Spark
- RAM: 128 GB LPDDR5X unified
- Sursă de alimentare: built-in
- Rulează
- gpt-oss-120b MXFP4 MXFP4 61 tok/s [măsurat]
- Observații
- A CUDA box with 128 GB of unified memory at 273 GB/s: the same speed class as Strix Halo, with the NVIDIA software stack. Early llama.cpp builds gave ~35 tok/s on gpt-oss-120b; the figure is after the November 2025 update (llama-bench tg128).
-
Mac Studio, M2/M3 Ultra
- Buget
- Gama înaltă
- Memorie video
- ≈192 GB
- RAM
- ≈192 GB
- Componente
- GPU: Apple M2 Ultra 76-core / M3 Ultra 80-core GPU
- CPU: Apple M2 Ultra / M3 Ultra
- Placă de bază: Mac Studio
- RAM: 192–512 GB unified (800–819 GB/s)
- Sursă de alimentare: built-in
- Rulează
- gpt-oss-120b MXFP4 — M2 Ultra 192 GB MXFP4 80 tok/s [măsurat]
- gpt-oss-20b MXFP4 — M3 Ultra 512 GB MXFP4 116 tok/s [măsurat]
- Observații
- The simplest way to run the biggest models at home: the M3 Ultra goes up to 512 GB of unified memory, enough for DeepSeek-class MoE models at 4 bits. Prompt processing is much slower than on NVIDIA GPUs. For very large models raise the GPU memory limit with sysctl iogpu.wired_limit_mb.
Vitezele măsurate trimit la sursa lor; ≈ marchează o estimare din lățimea de bandă a memoriei. Prețurile sunt aproximative.
Actualizat · Surse: github.com , www.hardware-corner.net , carteakey.dev , github.crookster.org , hardware-corner.net , digitalspaceport.com , quozul.dev
Încorporați pe site-ul dumneavoastră
Lipiți acest cod acolo unde trebuie să apară infograficul: se actualizează singur. Gratuit — păstrați linkul de atribuire.
Sisteme complete pentru AI local
Aceste fișe descriu calculatoare gândite pentru a rula acasă modele de la 20B la 120B, grupate în trei categorii de buget. „Economică” include o placă video de 16 GB, o RTX 3090 second-hand sau un GPU cu multă memorie RAM pentru descărcarea MoE. „Gama medie” reunește două RTX 3090, un server EPYC second-hand cu DDR4 pe 8 canale și un mini-PC AMD Strix Halo. „Gama înaltă” merge de la trei RTX 3090 la NVIDIA DGX Spark și Mac Studio cu M2/M3 Ultra.
Fiecare fișă trece memoria video, RAM-ul, un preț aproximativ și componentele: GPU, CPU, placă de bază, RAM, sursă de alimentare și linii PCIe. Urmează modelele pe care le rulează sistemul și viteza lor. Fiecare viteză este fie măsurată, cu link către sursă și dată, fie estimată din lățimea de bandă a memoriei și marcată cu ≈.
Ordinea în care alegeți
- Întâi dimensiunea modelelor pe care vreți să le folosiți, pentru că ea stabilește memoria.
- Apoi viteza care vă ajunge, legată de lățimea de bandă.
- Abia la final zgomotul, consumul și prețul.
Plăcile video sunt rapide cât timp modelul încape în întregime în memoria lor. Sistemele cu memorie unificată, ca Mac, Strix Halo sau DGX Spark, găzduiesc modele mai mari, dar generează mai încet. Serverele CPU primesc modele MoE uriașe pe bani puțini, însă acolo doar MoE este practic.
Două idei greșite
Mai multe plăci nu aduc automat mai multă viteză. Cu llama.cpp, straturile se împart între GPU-uri, care lucrează unul după altul: a doua sau a treia RTX 3090 vă permite să încărcați un model mai mare, dar viteza rămâne apropiată de cea a unei singure plăci. Descărcarea MoE (--n-cpu-moe), în schimb, păstrează straturile comune pe GPU și mută experții în memoria RAM a sistemului; funcționează bine, dar numai cu modele MoE, iar viteza RAM-ului contează mult.
Prețurile sunt orientative și se schimbă, mai ales la plăcile second-hand. O rulare măsurată a folosit propria versiune a mediului de execuție și propriile setări, deci rezultatul dumneavoastră poate fi diferit. Veți mai avea nevoie de un program dintre aplicațiile AI locale și de un fișier de model în cuantizarea potrivită, explicată în tipuri de modele AI.