Naar de inhoud
fedi.software

Pc-configuraties voor lokale AI-modellen, 20B tot 120B — 2026

Van één videokaart van 16 GB tot drie RTX 3090's, een EPYC-server en machines met uniform geheugen: wat elke configuratie draait en hoe snel, met de bron van elke meting.

  • One 16 GB GPU

    Budget
    Budget
    Videogeheugen
    ≈16 GB
    RAM
    ≈32 GB
    Onderdelen
    • GPU: RTX 5060 Ti 16 GB / RTX 4060 Ti 16 GB
    • CPU: any 6–8-core desktop CPU
    • Moederbord: any ATX/mATX with a PCIe x16 slot
    • RAM: 32 GB DDR4/DDR5
    • Voeding: 550–650 W
    • PCIe: 1× x16 (x8 electrical is enough)
    Draait
    Opmerkingen
    gpt-oss-20b (≈12 GB) fits entirely in VRAM with room for a long context. Qwen3-30B-A3B Q4_K_M (≈18.6 GB) does not fit: a few expert layers go to system RAM with --n-cpu-moe, still usable because only ~3B parameters are active. Measured on an RTX 5060 Ti 16 GB (llama-bench tg128).
  • One RTX 3090 24 GB (used)

    Budget
    Budget
    Videogeheugen
    ≈24 GB
    RAM
    ≈64 GB
    Onderdelen
    • GPU: RTX 3090 24 GB
    • CPU: any 6–8-core desktop CPU
    • Moederbord: any ATX with a PCIe x16 slot
    • RAM: 32–64 GB DDR4/DDR5
    • Voeding: 750–850 W
    • PCIe: 1× x16
    Draait
    Opmerkingen
    The cheapest way to 24 GB of fast VRAM. Small MoE models fly; dense ~27–32B models fit at Q4 with a moderate context. The Gemma 3 27B figure is our estimate: 936 GB/s × 55–75 % efficiency ÷ 16.5 GB of weights.
  • 12–24 GB GPU + 64–128 GB RAM (MoE offload)

    Budget
    Budget
    Videogeheugen
    ≈24 GB
    RAM
    ≈64 GB
    Onderdelen
    • GPU: RTX 3090 24 GB / RTX 4070 12 GB / RTX 3080 Ti 12 GB
    • CPU: Core i5-12600K / Core Ultra 7 265K class
    • Moederbord: desktop board, both memory channels populated
    • RAM: 64–128 GB DDR5 (XMP/EXPO on) or DDR4-3600
    • Voeding: 750–850 W
    • PCIe: 1× x16
    Opmerkingen
    llama.cpp --n-cpu-moe N keeps attention and the shared layers on the GPU and moves the experts of N layers to system RAM. Works well only for MoE models; RAM speed matters — the 4070 build ran at 10–11 tok/s until XMP was turned on.
  • Two RTX 3090 (48 GB)

    Budget
    Middenklasse
    Videogeheugen
    ≈48 GB
    RAM
    ≈64 GB
    Onderdelen
    • GPU: 2× RTX 3090 24 GB
    • CPU: desktop CPU with x8/x8 bifurcation, or HEDT
    • Moederbord: two x16-size slots spaced for 3-slot cards (x8/x8)
    • RAM: 64 GB
    • Voeding: 1000–1200 W
    • PCIe: 2× x8 PCIe 4.0; NVLink optional
    Opmerkingen
    48 GB holds a dense 70B model at Q4_K_M (≈42.5 GB) with a short-to-medium context. llama.cpp splits the layers between the cards and runs them one after another, so speed is that of one 3090 reading the whole model; NVLink and x8 lanes barely matter here (they do for vLLM tensor parallel).
  • Used EPYC server, 8-channel DDR4 (CPU only)

    Budget
    Middenklasse
    Videogeheugen
    ≈0 GB
    RAM
    ≈512 GB
    Prijs
    US$ 2.000
    Onderdelen
    • CPU: AMD EPYC 7002/7003 (Rome/Milan), e.g. EPYC 7702
    • Moederbord: ASRock Rack ROMED8-2T / Supermicro H12SSL-i / Gigabyte MZ32-AR0
    • RAM: 256–512 GB DDR4-3200 RDIMM, all 8 channels populated
    • Voeding: 750–1000 W
    • PCIe: 5–7× x16 PCIe 4.0 — room to add GPUs later
    Draait
    Opmerkingen
    Huge memory for little money: 8 channels of DDR4-3200 give 204.8 GB/s per socket. Only MoE models are practical — speed follows the active parameters. Fill every channel; a second socket adds NUMA trouble and little speed in llama.cpp (--numa distribute). The gpt-oss-120b figure is an estimate scaled by memory bandwidth from a DDR5 EPYC run. The source build cost about $2000 (prices of January 2025).
  • AMD Strix Halo mini-PC, 128 GB

    Budget
    Middenklasse
    Videogeheugen
    ≈96 GB
    RAM
    ≈128 GB
    Onderdelen
    • GPU: Radeon 8060S (integrated)
    • CPU: AMD Ryzen AI Max+ 395
    • Moederbord: Framework Desktop / other Strix Halo mini-PCs
    • RAM: 128 GB LPDDR5X-8000 unified (≈96 GB+ usable as VRAM)
    • Voeding: built-in
    Draait
    Opmerkingen
    Quiet, ~120 W, the whole model in unified memory. Bandwidth (256 GB/s) is about a quarter of a 3090, so dense 70B models are slow; large MoE models with few active parameters are its sweet spot.
  • Three RTX 3090 (72 GB)

    Budget
    High-end
    Videogeheugen
    ≈72 GB
    RAM
    ≈64 GB
    Onderdelen
    • GPU: 3× RTX 3090 24 GB
    • CPU: AMD EPYC 7002/7003 or Threadripper (enough PCIe lanes)
    • Moederbord: ASRock Rack ROMED8-2T / Supermicro H12SSL-i, risers for 3-slot cards
    • RAM: 64–128 GB
    • Voeding: 1200–1600 W (or two PSUs)
    • PCIe: 3× x8–x16 PCIe 4.0
    Draait
    Opmerkingen
    gpt-oss-120b (≈65 GB) fits fully in 72 GB of VRAM with a long context: 73 tok/s at 12.8k tokens of context, 41 tok/s at 93.7k. The measured machine was rented, so the platform here is our suggestion: a server board gives every card enough lanes. Three 350 W cards need a big PSU; many owners power-limit them.
  • NVIDIA DGX Spark, 128 GB

    Budget
    High-end
    Videogeheugen
    ≈128 GB
    RAM
    ≈128 GB
    Prijs
    US$ 3.999
    Onderdelen
    • GPU: NVIDIA GB10 (integrated Blackwell)
    • CPU: Arm CPU of the GB10
    • Moederbord: NVIDIA DGX Spark
    • RAM: 128 GB LPDDR5X unified
    • Voeding: built-in
    Draait
    Opmerkingen
    A CUDA box with 128 GB of unified memory at 273 GB/s: the same speed class as Strix Halo, with the NVIDIA software stack. Early llama.cpp builds gave ~35 tok/s on gpt-oss-120b; the figure is after the November 2025 update (llama-bench tg128).
  • Mac Studio, M2/M3 Ultra

    Budget
    High-end
    Videogeheugen
    ≈192 GB
    RAM
    ≈192 GB
    Onderdelen
    • GPU: Apple M2 Ultra 76-core / M3 Ultra 80-core GPU
    • CPU: Apple M2 Ultra / M3 Ultra
    • Moederbord: Mac Studio
    • RAM: 192–512 GB unified (800–819 GB/s)
    • Voeding: built-in
    Opmerkingen
    The simplest way to run the biggest models at home: the M3 Ultra goes up to 512 GB of unified memory, enough for DeepSeek-class MoE models at 4 bits. Prompt processing is much slower than on NVIDIA GPUs. For very large models raise the GPU memory limit with sysctl iogpu.wired_limit_mb.

Gemeten snelheden linken naar hun bron; ≈ markeert een schatting uit de geheugenbandbreedte. Prijzen zijn bij benadering.

Bijgewerkt · Bronnen: github.com , www.hardware-corner.net , carteakey.dev , github.crookster.org , hardware-corner.net , digitalspaceport.com , quozul.dev

Insluiten op je site

Plak deze code waar de infographic moet verschijnen: hij werkt zichzelf bij. Gratis te gebruiken — behoud de bronvermelding met link.

JSON Onze data: CC BY 4.0 met een link naar de bron; data van derden behouden de licentie van hun bron.

Drie budgetgroepen

De kaarten op deze pagina zijn complete pc's voor lokale modellen van 20B tot 120B, ingedeeld naar budget.

  • Budget: één videokaart van 16 GB, één gebruikte RTX 3090, of een GPU met veel RAM voor MoE-offload.
  • Middenklasse: twee RTX 3090's, een gebruikte EPYC-server met 8-kanaals DDR4 en een mini-pc met AMD Strix Halo.
  • High-end: drie RTX 3090's, NVIDIA DGX Spark en een Mac Studio met M2/M3 Ultra.

Op elke kaart staan videogeheugen, RAM, een richtprijs en de onderdelen tot en met de voeding en het aantal PCIe-lanes, plus de modellen die erop draaien en hoe snel.

Gemeten of geschat

Een snelheid zonder teken is gemeten. Je ziet de datum en een link naar de bron, meestal een benchmarkdraad van llama.cpp of een openbaar verslag. Een waarde met ≈ is onze schatting op basis van de geheugenbandbreedte. Elke meting hoort bij een bepaalde runtimeversie en bepaalde instellingen, dus jouw machine kan er iets boven of onder uitkomen.

Welk type machine past bij jou

Begin bij de grootte van de modellen die je wilt draaien, want die bepaalt het geheugen; de grafiek welk open model past op jouw hardware laat zien hoeveel elke grootte vraagt. Daarna komt de snelheid, en die volgt de geheugenbandbreedte. Videokaarten zijn het vlotst zolang het model in hun geheugen past. Machines met gedeeld geheugen, zoals een Mac, Strix Halo of DGX Spark, kunnen grotere modellen kwijt maar genereren trager. CPU-servers houden enorme modellen voor weinig geld vast, maar daar is alleen MoE praktisch, omdat elk token dan maar de actieve parameters leest. Kijk pas als laatste naar geluid, stroomverbruik en prijs: een rij RTX 3090's maakt herrie en vraagt een zware voeding, een mini-pc of Mac is stil maar per token langzamer.

Twee misverstanden

Meer kaarten betekent niet meer snelheid. In llama.cpp worden de lagen over de GPU's verdeeld en na elkaar uitgevoerd. Een tweede of derde kaart laat je dus een groter model laden, terwijl de snelheid dicht bij die van één kaart blijft.

Het tweede misverstand gaat over MoE-offload. Met de optie --n-cpu-moe houdt llama.cpp de gedeelde lagen op de GPU en zet het de experts in het systeem-RAM. Dat werkt alleen goed bij MoE-modellen, en de snelheid van het RAM telt dan zwaar mee.

Verder lezen

Prijzen zijn bij benadering en veranderen snel, zeker bij gebruikte kaarten. Om een model te draaien heb je ook een programma nodig, zie lokale AI-apps, en een modelbestand in de juiste quantisatie; dat wordt uitgelegd bij soorten AI-modellen.