Na vsebino
fedi.software

Konfiguracije računalnikov za lokalne modele umetne inteligence, od 20B do 120B — 2026

Od ene grafične kartice s 16 GB do treh RTX 3090, strežnika EPYC in računalnikov z enotnim pomnilnikom: kaj poganja posamezna konfiguracija in kako hitro, z virom vsake meritve.

  • One 16 GB GPU

    Proračun
    Ugodna
    Grafični pomnilnik
    ≈16 GB
    RAM
    ≈32 GB
    Komponente
    • GPU: RTX 5060 Ti 16 GB / RTX 4060 Ti 16 GB
    • CPU: any 6–8-core desktop CPU
    • Matična plošča: any ATX/mATX with a PCIe x16 slot
    • RAM: 32 GB DDR4/DDR5
    • Napajalnik: 550–650 W
    • PCIe: 1× x16 (x8 electrical is enough)
    Poganja
    Opombe
    gpt-oss-20b (≈12 GB) fits entirely in VRAM with room for a long context. Qwen3-30B-A3B Q4_K_M (≈18.6 GB) does not fit: a few expert layers go to system RAM with --n-cpu-moe, still usable because only ~3B parameters are active. Measured on an RTX 5060 Ti 16 GB (llama-bench tg128).
  • One RTX 3090 24 GB (used)

    Proračun
    Ugodna
    Grafični pomnilnik
    ≈24 GB
    RAM
    ≈64 GB
    Komponente
    • GPU: RTX 3090 24 GB
    • CPU: any 6–8-core desktop CPU
    • Matična plošča: any ATX with a PCIe x16 slot
    • RAM: 32–64 GB DDR4/DDR5
    • Napajalnik: 750–850 W
    • PCIe: 1× x16
    Poganja
    Opombe
    The cheapest way to 24 GB of fast VRAM. Small MoE models fly; dense ~27–32B models fit at Q4 with a moderate context. The Gemma 3 27B figure is our estimate: 936 GB/s × 55–75 % efficiency ÷ 16.5 GB of weights.
  • 12–24 GB GPU + 64–128 GB RAM (MoE offload)

    Proračun
    Ugodna
    Grafični pomnilnik
    ≈24 GB
    RAM
    ≈64 GB
    Komponente
    • GPU: RTX 3090 24 GB / RTX 4070 12 GB / RTX 3080 Ti 12 GB
    • CPU: Core i5-12600K / Core Ultra 7 265K class
    • Matična plošča: desktop board, both memory channels populated
    • RAM: 64–128 GB DDR5 (XMP/EXPO on) or DDR4-3600
    • Napajalnik: 750–850 W
    • PCIe: 1× x16
    Opombe
    llama.cpp --n-cpu-moe N keeps attention and the shared layers on the GPU and moves the experts of N layers to system RAM. Works well only for MoE models; RAM speed matters — the 4070 build ran at 10–11 tok/s until XMP was turned on.
  • Two RTX 3090 (48 GB)

    Proračun
    Srednji razred
    Grafični pomnilnik
    ≈48 GB
    RAM
    ≈64 GB
    Komponente
    • GPU: 2× RTX 3090 24 GB
    • CPU: desktop CPU with x8/x8 bifurcation, or HEDT
    • Matična plošča: two x16-size slots spaced for 3-slot cards (x8/x8)
    • RAM: 64 GB
    • Napajalnik: 1000–1200 W
    • PCIe: 2× x8 PCIe 4.0; NVLink optional
    Opombe
    48 GB holds a dense 70B model at Q4_K_M (≈42.5 GB) with a short-to-medium context. llama.cpp splits the layers between the cards and runs them one after another, so speed is that of one 3090 reading the whole model; NVLink and x8 lanes barely matter here (they do for vLLM tensor parallel).
  • Used EPYC server, 8-channel DDR4 (CPU only)

    Proračun
    Srednji razred
    Grafični pomnilnik
    ≈0 GB
    RAM
    ≈512 GB
    Cena
    2.000 $
    Komponente
    • CPU: AMD EPYC 7002/7003 (Rome/Milan), e.g. EPYC 7702
    • Matična plošča: ASRock Rack ROMED8-2T / Supermicro H12SSL-i / Gigabyte MZ32-AR0
    • RAM: 256–512 GB DDR4-3200 RDIMM, all 8 channels populated
    • Napajalnik: 750–1000 W
    • PCIe: 5–7× x16 PCIe 4.0 — room to add GPUs later
    Poganja
    Opombe
    Huge memory for little money: 8 channels of DDR4-3200 give 204.8 GB/s per socket. Only MoE models are practical — speed follows the active parameters. Fill every channel; a second socket adds NUMA trouble and little speed in llama.cpp (--numa distribute). The gpt-oss-120b figure is an estimate scaled by memory bandwidth from a DDR5 EPYC run. The source build cost about $2000 (prices of January 2025).
  • AMD Strix Halo mini-PC, 128 GB

    Proračun
    Srednji razred
    Grafični pomnilnik
    ≈96 GB
    RAM
    ≈128 GB
    Komponente
    • GPU: Radeon 8060S (integrated)
    • CPU: AMD Ryzen AI Max+ 395
    • Matična plošča: Framework Desktop / other Strix Halo mini-PCs
    • RAM: 128 GB LPDDR5X-8000 unified (≈96 GB+ usable as VRAM)
    • Napajalnik: built-in
    Poganja
    Opombe
    Quiet, ~120 W, the whole model in unified memory. Bandwidth (256 GB/s) is about a quarter of a 3090, so dense 70B models are slow; large MoE models with few active parameters are its sweet spot.
  • Three RTX 3090 (72 GB)

    Proračun
    Zgornji razred
    Grafični pomnilnik
    ≈72 GB
    RAM
    ≈64 GB
    Komponente
    • GPU: 3× RTX 3090 24 GB
    • CPU: AMD EPYC 7002/7003 or Threadripper (enough PCIe lanes)
    • Matična plošča: ASRock Rack ROMED8-2T / Supermicro H12SSL-i, risers for 3-slot cards
    • RAM: 64–128 GB
    • Napajalnik: 1200–1600 W (or two PSUs)
    • PCIe: 3× x8–x16 PCIe 4.0
    Poganja
    Opombe
    gpt-oss-120b (≈65 GB) fits fully in 72 GB of VRAM with a long context: 73 tok/s at 12.8k tokens of context, 41 tok/s at 93.7k. The measured machine was rented, so the platform here is our suggestion: a server board gives every card enough lanes. Three 350 W cards need a big PSU; many owners power-limit them.
  • NVIDIA DGX Spark, 128 GB

    Proračun
    Zgornji razred
    Grafični pomnilnik
    ≈128 GB
    RAM
    ≈128 GB
    Cena
    3.999 $
    Komponente
    • GPU: NVIDIA GB10 (integrated Blackwell)
    • CPU: Arm CPU of the GB10
    • Matična plošča: NVIDIA DGX Spark
    • RAM: 128 GB LPDDR5X unified
    • Napajalnik: built-in
    Poganja
    Opombe
    A CUDA box with 128 GB of unified memory at 273 GB/s: the same speed class as Strix Halo, with the NVIDIA software stack. Early llama.cpp builds gave ~35 tok/s on gpt-oss-120b; the figure is after the November 2025 update (llama-bench tg128).
  • Mac Studio, M2/M3 Ultra

    Proračun
    Zgornji razred
    Grafični pomnilnik
    ≈192 GB
    RAM
    ≈192 GB
    Komponente
    • GPU: Apple M2 Ultra 76-core / M3 Ultra 80-core GPU
    • CPU: Apple M2 Ultra / M3 Ultra
    • Matična plošča: Mac Studio
    • RAM: 192–512 GB unified (800–819 GB/s)
    • Napajalnik: built-in
    Opombe
    The simplest way to run the biggest models at home: the M3 Ultra goes up to 512 GB of unified memory, enough for DeepSeek-class MoE models at 4 bits. Prompt processing is much slower than on NVIDIA GPUs. For very large models raise the GPU memory limit with sysctl iogpu.wired_limit_mb.

Izmerjene hitrosti vodijo do svojega vira; ≈ pomeni oceno iz pasovne širine pomnilnika. Cene so okvirne.

Posodobljeno · Viri: github.com , www.hardware-corner.net , carteakey.dev , github.crookster.org , hardware-corner.net , digitalspaceport.com , quozul.dev

Vdelaj na svojo stran

Prilepite to kodo tja, kjer naj se prikaže infografika: posodablja se sama. Brezplačna uporaba — ohranite povezavo do vira.

JSON Naši podatki: CC BY 4.0 s povezavo do vira; podatki tretjih oseb ohranijo licenco svojega vira.

Tri cenovne skupine

Kartice združujejo cele računalnike za lokalne modele po proračunu. Skupina »Ugodna« se začne z eno grafično kartico s 16 GB, z eno rabljeno RTX 3090 in s sestavom, kjer grafični procesor dopolnjuje veliko RAM-a za razbremenitev MoE. »Srednji razred« prinese dve RTX 3090, rabljen strežnik EPYC z 8-kanalnim DDR4 in mini računalnik AMD Strix Halo. »Zgornji razred« obsega tri RTX 3090, NVIDIA DGX Spark in Mac Studio z M2/M3 Ultra. Na vsaki kartici so grafični pomnilnik, RAM, okvirna cena, komponente vse do napajalnika in linij PCIe ter modeli, ki jih sestav poganja, s hitrostjo.

Meritev ali ocena?

Hitrost brez oznake je izmerjena: vodi do vira, navadno niti z meritvami za llama.cpp ali javnega poročila, in pokaže njegov datum. Vrednost z znakom ≈ je naša ocena iz pasovne širine pomnilnika. Meritev velja za svojo različico izvajalnega okolja in nastavitve, zato je rezultat na vašem računalniku lahko nekoliko drugačen.

Izbira korak za korakom

  1. Velikost modelov. Odločite se, katere modele želite poganjati; to določi količino pomnilnika. Koliko potrebuje posamezna velikost, pokaže infografika o strojni opremi.
  2. Hitrost. Generiranje sledi pasovni širini pomnilnika. Grafične kartice so hitre, dokler model gre v njihov pomnilnik; računalniki z enotnim pomnilnikom (Mac, Strix Halo, DGX Spark) sprejmejo večje modele, a generirajo počasneje.
  3. Arhitektura modela. Strežniki s procesorji poceni sprejmejo ogromne modele, vendar je tam praktičen samo MoE, ker vsak žeton prebere le aktivne parametre.
  4. Hrup, poraba in cena. Več kartic 3090 je glasnih in zahteva močan napajalnik; mini računalnik ali Mac je tih, a na žeton počasnejši.

Dve pogosti zmoti

Več kartic ne pomeni več hitrosti. V llama.cpp se plasti razdelijo med grafične procesorje in tečejo zaporedno, zato druga ali tretja RTX 3090 omogoči večji model, hitrost pa ostane blizu hitrosti ene kartice. Druga zmota zadeva razbremenitev MoE: možnost --n-cpu-moe obdrži skupne plasti na grafičnem procesorju, eksperte pa premakne v sistemski RAM. To dobro deluje samo pri modelih MoE, hitrost RAM-a pa pri tem šteje.

Cene so okvirne in se hitro spreminjajo, pri rabljenih karticah še posebej. Za zagon potrebujete še aplikacijo (glejte lokalne aplikacije za UI) in datoteko modela v ustrezni kvantizaciji, kar razloži stran vrste modelov.