PC-builds til lokale AI-modeller, 20B til 120B — 2026
Fra ét grafikkort på 16 GB til tre RTX 3090, en EPYC-server og maskiner med samlet hukommelse: hvad hver build kører, og hvor hurtigt, med kilden til hver måling.
-
One 16 GB GPU
- Budget
- Budget
- Grafikhukommelse
- ≈16 GB
- RAM
- ≈32 GB
- Komponenter
- GPU: RTX 5060 Ti 16 GB / RTX 4060 Ti 16 GB
- CPU: any 6–8-core desktop CPU
- Bundkort: any ATX/mATX with a PCIe x16 slot
- RAM: 32 GB DDR4/DDR5
- Strømforsyning: 550–650 W
- PCIe: 1× x16 (x8 electrical is enough)
- Kører
- gpt-oss-20b MXFP4 (RTX 5060 Ti 16 GB) MXFP4 112 tok/s [målt]
- Qwen3-30B-A3B Q4_K_M, experts partly in RAM Q4_K_M [≈ estimat ud fra hukommelsesbåndbredden]
- Noter
- gpt-oss-20b (≈12 GB) fits entirely in VRAM with room for a long context. Qwen3-30B-A3B Q4_K_M (≈18.6 GB) does not fit: a few expert layers go to system RAM with --n-cpu-moe, still usable because only ~3B parameters are active. Measured on an RTX 5060 Ti 16 GB (llama-bench tg128).
-
One RTX 3090 24 GB (used)
- Budget
- Budget
- Grafikhukommelse
- ≈24 GB
- RAM
- ≈64 GB
- Komponenter
- GPU: RTX 3090 24 GB
- CPU: any 6–8-core desktop CPU
- Bundkort: any ATX with a PCIe x16 slot
- RAM: 32–64 GB DDR4/DDR5
- Strømforsyning: 750–850 W
- PCIe: 1× x16
- Kører
- gpt-oss-20b MXFP4 MXFP4 162 tok/s [målt]
- Qwen3-30B-A3B Q4_K Q4_K_M 154 tok/s @4k [målt]
- Gemma 3 27B Q4_K_M Q4_K_M ≈31–42 tok/s [≈ estimat ud fra hukommelsesbåndbredden]
- Noter
- The cheapest way to 24 GB of fast VRAM. Small MoE models fly; dense ~27–32B models fit at Q4 with a moderate context. The Gemma 3 27B figure is our estimate: 936 GB/s × 55–75 % efficiency ÷ 16.5 GB of weights.
-
12–24 GB GPU + 64–128 GB RAM (MoE offload)
- Budget
- Budget
- Grafikhukommelse
- ≈24 GB
- RAM
- ≈64 GB
- Komponenter
- GPU: RTX 3090 24 GB / RTX 4070 12 GB / RTX 3080 Ti 12 GB
- CPU: Core i5-12600K / Core Ultra 7 265K class
- Bundkort: desktop board, both memory channels populated
- RAM: 64–128 GB DDR5 (XMP/EXPO on) or DDR4-3600
- Strømforsyning: 750–850 W
- PCIe: 1× x16
- Kører
- gpt-oss-120b MXFP4 — RTX 3090 + 64 GB DDR5-5200, --n-cpu-moe 24–26 MXFP4 26–28 tok/s [målt]
- gpt-oss-120b MXFP4 — RTX 4070 12 GB + 64 GB DDR5 MXFP4 25–28 tok/s [målt]
- gpt-oss-120b MXFP4 — RTX 3080 Ti 12 GB + 128 GB DDR4-3600, --n-cpu-moe 36 MXFP4 18,0–22 tok/s [målt]
- Noter
- llama.cpp --n-cpu-moe N keeps attention and the shared layers on the GPU and moves the experts of N layers to system RAM. Works well only for MoE models; RAM speed matters — the 4070 build ran at 10–11 tok/s until XMP was turned on.
-
Two RTX 3090 (48 GB)
- Budget
- Mellemklasse
- Grafikhukommelse
- ≈48 GB
- RAM
- ≈64 GB
- Komponenter
- GPU: 2× RTX 3090 24 GB
- CPU: desktop CPU with x8/x8 bifurcation, or HEDT
- Bundkort: two x16-size slots spaced for 3-slot cards (x8/x8)
- RAM: 64 GB
- Strømforsyning: 1000–1200 W
- PCIe: 2× x8 PCIe 4.0; NVLink optional
- Kører
- Llama 3 70B Q4_K_M (same size as Llama 3.3 70B) Q4_K_M 16,3 tok/s [målt]
- Noter
- 48 GB holds a dense 70B model at Q4_K_M (≈42.5 GB) with a short-to-medium context. llama.cpp splits the layers between the cards and runs them one after another, so speed is that of one 3090 reading the whole model; NVLink and x8 lanes barely matter here (they do for vLLM tensor parallel).
-
Used EPYC server, 8-channel DDR4 (CPU only)
- Budget
- Mellemklasse
- Grafikhukommelse
- ≈0 GB
- RAM
- ≈512 GB
- Pris
- 2.000 US$
- Komponenter
- CPU: AMD EPYC 7002/7003 (Rome/Milan), e.g. EPYC 7702
- Bundkort: ASRock Rack ROMED8-2T / Supermicro H12SSL-i / Gigabyte MZ32-AR0
- RAM: 256–512 GB DDR4-3200 RDIMM, all 8 channels populated
- Strømforsyning: 750–1000 W
- PCIe: 5–7× x16 PCIe 4.0 — room to add GPUs later
- Kører
- DeepSeek R1 671B Q4 — EPYC 7702 + 512 GB DDR4-2400, MZ32-AR0 Q4 3,5–4,2 tok/s [målt]
- gpt-oss-120b MXFP4 MXFP4 ≈12,0–16,0 tok/s [≈ estimat ud fra hukommelsesbåndbredden]
- Noter
- Huge memory for little money: 8 channels of DDR4-3200 give 204.8 GB/s per socket. Only MoE models are practical — speed follows the active parameters. Fill every channel; a second socket adds NUMA trouble and little speed in llama.cpp (--numa distribute). The gpt-oss-120b figure is an estimate scaled by memory bandwidth from a DDR5 EPYC run. The source build cost about $2000 (prices of January 2025).
-
AMD Strix Halo mini-PC, 128 GB
- Budget
- Mellemklasse
- Grafikhukommelse
- ≈96 GB
- RAM
- ≈128 GB
- Komponenter
- GPU: Radeon 8060S (integrated)
- CPU: AMD Ryzen AI Max+ 395
- Bundkort: Framework Desktop / other Strix Halo mini-PCs
- RAM: 128 GB LPDDR5X-8000 unified (≈96 GB+ usable as VRAM)
- Strømforsyning: built-in
- Kører
- gpt-oss-120b MXFP4 (ROCm) MXFP4 50 tok/s [målt]
- Noter
- Quiet, ~120 W, the whole model in unified memory. Bandwidth (256 GB/s) is about a quarter of a 3090, so dense 70B models are slow; large MoE models with few active parameters are its sweet spot.
-
Three RTX 3090 (72 GB)
- Budget
- High-end
- Grafikhukommelse
- ≈72 GB
- RAM
- ≈64 GB
- Komponenter
- GPU: 3× RTX 3090 24 GB
- CPU: AMD EPYC 7002/7003 or Threadripper (enough PCIe lanes)
- Bundkort: ASRock Rack ROMED8-2T / Supermicro H12SSL-i, risers for 3-slot cards
- RAM: 64–128 GB
- Strømforsyning: 1200–1600 W (or two PSUs)
- PCIe: 3× x8–x16 PCIe 4.0
- Kører
- gpt-oss-120b MXFP4, all in VRAM MXFP4 41–73 tok/s @12.8k→93.7k [målt]
- Noter
- gpt-oss-120b (≈65 GB) fits fully in 72 GB of VRAM with a long context: 73 tok/s at 12.8k tokens of context, 41 tok/s at 93.7k. The measured machine was rented, so the platform here is our suggestion: a server board gives every card enough lanes. Three 350 W cards need a big PSU; many owners power-limit them.
-
NVIDIA DGX Spark, 128 GB
- Budget
- High-end
- Grafikhukommelse
- ≈128 GB
- RAM
- ≈128 GB
- Pris
- 3.999 US$
- Komponenter
- GPU: NVIDIA GB10 (integrated Blackwell)
- CPU: Arm CPU of the GB10
- Bundkort: NVIDIA DGX Spark
- RAM: 128 GB LPDDR5X unified
- Strømforsyning: built-in
- Kører
- gpt-oss-120b MXFP4 MXFP4 61 tok/s [målt]
- Noter
- A CUDA box with 128 GB of unified memory at 273 GB/s: the same speed class as Strix Halo, with the NVIDIA software stack. Early llama.cpp builds gave ~35 tok/s on gpt-oss-120b; the figure is after the November 2025 update (llama-bench tg128).
-
Mac Studio, M2/M3 Ultra
- Budget
- High-end
- Grafikhukommelse
- ≈192 GB
- RAM
- ≈192 GB
- Komponenter
- GPU: Apple M2 Ultra 76-core / M3 Ultra 80-core GPU
- CPU: Apple M2 Ultra / M3 Ultra
- Bundkort: Mac Studio
- RAM: 192–512 GB unified (800–819 GB/s)
- Strømforsyning: built-in
- Kører
- gpt-oss-120b MXFP4 — M2 Ultra 192 GB MXFP4 80 tok/s [målt]
- gpt-oss-20b MXFP4 — M3 Ultra 512 GB MXFP4 116 tok/s [målt]
- Noter
- The simplest way to run the biggest models at home: the M3 Ultra goes up to 512 GB of unified memory, enough for DeepSeek-class MoE models at 4 bits. Prompt processing is much slower than on NVIDIA GPUs. For very large models raise the GPU memory limit with sysctl iogpu.wired_limit_mb.
Målte hastigheder linker til deres kilde; ≈ markerer et estimat ud fra hukommelsesbåndbredden. Priserne er omtrentlige.
Opdateret · Kilder: github.com , www.hardware-corner.net , carteakey.dev , github.crookster.org , hardware-corner.net , digitalspaceport.com , quozul.dev
Indlejr på dit website
Indsæt denne kode, hvor infografikken skal vises: den opdaterer sig selv. Gratis at bruge — behold kildelinket.
Hvilke maskiner er med?
Kortene viser færdige pc'er til lokale modeller fra 20B til 120B, delt i tre budgetgrupper. I „Budget” finder du ét grafikkort med 16 GB, ét brugt RTX 3090 eller en GPU kombineret med meget RAM til MoE-aflastning. I „Mellemklasse” ligger to RTX 3090, en brugt EPYC-server med 8-kanals DDR4 og en mini-pc med AMD Strix Halo. „High-end” rummer tre RTX 3090, NVIDIA DGX Spark og en Mac Studio med M2/M3 Ultra. Hvert kort viser grafikhukommelse, RAM, en omtrentlig pris, komponenterne helt ned til strømforsyning og PCIe-baner samt hvilke modeller maskinen kører, og hvor hurtigt.
Er hastighederne målt?
En hastighed uden tegn er målt. Den har en dato og et link til kilden, som regel en benchmarktråd for llama.cpp eller en offentlig rapport. En værdi med ≈ er vores estimat ud fra hukommelsesbåndbredden. En måling hører til en bestemt runtimeversion og bestemte indstillinger, så din egen maskine kan lande lidt over eller under.
Hvordan vælger jeg?
- Modelstørrelse. Bestem, hvilke modeller du vil køre, for det afgør hukommelsen. Hvilken åben model passer til din hardware viser, hvad hver størrelse kræver.
- Hastighed. Genereringen følger hukommelsesbåndbredden. Grafikkort er hurtige, så længe modellen kan være i deres hukommelse; maskiner med fælles hukommelse som Mac, Strix Halo og DGX Spark rummer større modeller, men genererer langsommere.
- Modellens arkitektur. CPU-servere kan holde enorme modeller for få penge, men kun MoE er praktisk dér, fordi hvert token kun læser de aktive parametre.
- Støj, strøm og pris. Flere 3090'ere larmer og kræver en kraftig strømforsyning, mens en mini-pc eller en Mac er stille, men langsommere pr. token.
Bliver det hurtigere med flere grafikkort?
Nej, ikke med llama.cpp. Lagene fordeles mellem GPU'erne og køres efter hinanden, så et ekstra RTX 3090 lader dig indlæse en større model, mens hastigheden bliver tæt på den, ét kort giver.
Hvad er MoE-aflastning?
Med --n-cpu-moe holder llama.cpp de fælles lag på GPU'en og flytter eksperterne ud i system-RAM. Det fungerer kun godt med MoE-modeller, og RAM'ens hastighed betyder meget. Priserne på kortene er omtrentlige og skifter hurtigt, især for brugte grafikkort. Programmer til at køre modellerne finder du under lokale AI-apps, og hvilken modelfil du skal vælge, forklarer typer af AI-modeller.