Przejdź do treści
fedi.software

Zestawy PC do lokalnych modeli AI, od 20B do 120B — 2026

Od jednej karty graficznej 16 GB po trzy RTX 3090, serwer EPYC i komputery ze zunifikowaną pamięcią: co uruchamia każdy zestaw i jak szybko, ze źródłem każdego pomiaru.

  • One 16 GB GPU

    Budżet
    Budżetowy
    Pamięć graficzna
    ≈16 GB
    RAM
    ≈32 GB
    Podzespoły
    • GPU: RTX 5060 Ti 16 GB / RTX 4060 Ti 16 GB
    • CPU: any 6–8-core desktop CPU
    • Płyta główna: any ATX/mATX with a PCIe x16 slot
    • RAM: 32 GB DDR4/DDR5
    • Zasilacz: 550–650 W
    • PCIe: 1× x16 (x8 electrical is enough)
    Uruchamia
    Uwagi
    gpt-oss-20b (≈12 GB) fits entirely in VRAM with room for a long context. Qwen3-30B-A3B Q4_K_M (≈18.6 GB) does not fit: a few expert layers go to system RAM with --n-cpu-moe, still usable because only ~3B parameters are active. Measured on an RTX 5060 Ti 16 GB (llama-bench tg128).
  • One RTX 3090 24 GB (used)

    Budżet
    Budżetowy
    Pamięć graficzna
    ≈24 GB
    RAM
    ≈64 GB
    Podzespoły
    • GPU: RTX 3090 24 GB
    • CPU: any 6–8-core desktop CPU
    • Płyta główna: any ATX with a PCIe x16 slot
    • RAM: 32–64 GB DDR4/DDR5
    • Zasilacz: 750–850 W
    • PCIe: 1× x16
    Uruchamia
    Uwagi
    The cheapest way to 24 GB of fast VRAM. Small MoE models fly; dense ~27–32B models fit at Q4 with a moderate context. The Gemma 3 27B figure is our estimate: 936 GB/s × 55–75 % efficiency ÷ 16.5 GB of weights.
  • 12–24 GB GPU + 64–128 GB RAM (MoE offload)

    Budżet
    Budżetowy
    Pamięć graficzna
    ≈24 GB
    RAM
    ≈64 GB
    Podzespoły
    • GPU: RTX 3090 24 GB / RTX 4070 12 GB / RTX 3080 Ti 12 GB
    • CPU: Core i5-12600K / Core Ultra 7 265K class
    • Płyta główna: desktop board, both memory channels populated
    • RAM: 64–128 GB DDR5 (XMP/EXPO on) or DDR4-3600
    • Zasilacz: 750–850 W
    • PCIe: 1× x16
    Uwagi
    llama.cpp --n-cpu-moe N keeps attention and the shared layers on the GPU and moves the experts of N layers to system RAM. Works well only for MoE models; RAM speed matters — the 4070 build ran at 10–11 tok/s until XMP was turned on.
  • Two RTX 3090 (48 GB)

    Budżet
    Średnia półka
    Pamięć graficzna
    ≈48 GB
    RAM
    ≈64 GB
    Podzespoły
    • GPU: 2× RTX 3090 24 GB
    • CPU: desktop CPU with x8/x8 bifurcation, or HEDT
    • Płyta główna: two x16-size slots spaced for 3-slot cards (x8/x8)
    • RAM: 64 GB
    • Zasilacz: 1000–1200 W
    • PCIe: 2× x8 PCIe 4.0; NVLink optional
    Uwagi
    48 GB holds a dense 70B model at Q4_K_M (≈42.5 GB) with a short-to-medium context. llama.cpp splits the layers between the cards and runs them one after another, so speed is that of one 3090 reading the whole model; NVLink and x8 lanes barely matter here (they do for vLLM tensor parallel).
  • Used EPYC server, 8-channel DDR4 (CPU only)

    Budżet
    Średnia półka
    Pamięć graficzna
    ≈0 GB
    RAM
    ≈512 GB
    Cena
    2 000 USD
    Podzespoły
    • CPU: AMD EPYC 7002/7003 (Rome/Milan), e.g. EPYC 7702
    • Płyta główna: ASRock Rack ROMED8-2T / Supermicro H12SSL-i / Gigabyte MZ32-AR0
    • RAM: 256–512 GB DDR4-3200 RDIMM, all 8 channels populated
    • Zasilacz: 750–1000 W
    • PCIe: 5–7× x16 PCIe 4.0 — room to add GPUs later
    Uruchamia
    Uwagi
    Huge memory for little money: 8 channels of DDR4-3200 give 204.8 GB/s per socket. Only MoE models are practical — speed follows the active parameters. Fill every channel; a second socket adds NUMA trouble and little speed in llama.cpp (--numa distribute). The gpt-oss-120b figure is an estimate scaled by memory bandwidth from a DDR5 EPYC run. The source build cost about $2000 (prices of January 2025).
  • AMD Strix Halo mini-PC, 128 GB

    Budżet
    Średnia półka
    Pamięć graficzna
    ≈96 GB
    RAM
    ≈128 GB
    Podzespoły
    • GPU: Radeon 8060S (integrated)
    • CPU: AMD Ryzen AI Max+ 395
    • Płyta główna: Framework Desktop / other Strix Halo mini-PCs
    • RAM: 128 GB LPDDR5X-8000 unified (≈96 GB+ usable as VRAM)
    • Zasilacz: built-in
    Uruchamia
    Uwagi
    Quiet, ~120 W, the whole model in unified memory. Bandwidth (256 GB/s) is about a quarter of a 3090, so dense 70B models are slow; large MoE models with few active parameters are its sweet spot.
  • Three RTX 3090 (72 GB)

    Budżet
    Górna półka
    Pamięć graficzna
    ≈72 GB
    RAM
    ≈64 GB
    Podzespoły
    • GPU: 3× RTX 3090 24 GB
    • CPU: AMD EPYC 7002/7003 or Threadripper (enough PCIe lanes)
    • Płyta główna: ASRock Rack ROMED8-2T / Supermicro H12SSL-i, risers for 3-slot cards
    • RAM: 64–128 GB
    • Zasilacz: 1200–1600 W (or two PSUs)
    • PCIe: 3× x8–x16 PCIe 4.0
    Uruchamia
    Uwagi
    gpt-oss-120b (≈65 GB) fits fully in 72 GB of VRAM with a long context: 73 tok/s at 12.8k tokens of context, 41 tok/s at 93.7k. The measured machine was rented, so the platform here is our suggestion: a server board gives every card enough lanes. Three 350 W cards need a big PSU; many owners power-limit them.
  • NVIDIA DGX Spark, 128 GB

    Budżet
    Górna półka
    Pamięć graficzna
    ≈128 GB
    RAM
    ≈128 GB
    Cena
    3 999 USD
    Podzespoły
    • GPU: NVIDIA GB10 (integrated Blackwell)
    • CPU: Arm CPU of the GB10
    • Płyta główna: NVIDIA DGX Spark
    • RAM: 128 GB LPDDR5X unified
    • Zasilacz: built-in
    Uruchamia
    Uwagi
    A CUDA box with 128 GB of unified memory at 273 GB/s: the same speed class as Strix Halo, with the NVIDIA software stack. Early llama.cpp builds gave ~35 tok/s on gpt-oss-120b; the figure is after the November 2025 update (llama-bench tg128).
  • Mac Studio, M2/M3 Ultra

    Budżet
    Górna półka
    Pamięć graficzna
    ≈192 GB
    RAM
    ≈192 GB
    Podzespoły
    • GPU: Apple M2 Ultra 76-core / M3 Ultra 80-core GPU
    • CPU: Apple M2 Ultra / M3 Ultra
    • Płyta główna: Mac Studio
    • RAM: 192–512 GB unified (800–819 GB/s)
    • Zasilacz: built-in
    Uwagi
    The simplest way to run the biggest models at home: the M3 Ultra goes up to 512 GB of unified memory, enough for DeepSeek-class MoE models at 4 bits. Prompt processing is much slower than on NVIDIA GPUs. For very large models raise the GPU memory limit with sysctl iogpu.wired_limit_mb.

Zmierzone szybkości prowadzą do źródła; ≈ oznacza szacunek z przepustowości pamięci. Ceny są przybliżone.

Zaktualizowano · Źródła: github.com , www.hardware-corner.net , carteakey.dev , github.crookster.org , hardware-corner.net , digitalspaceport.com , quozul.dev

Osadź na swojej stronie

Wklej ten kod tam, gdzie ma się pojawić infografika: aktualizuje się sama. Użycie bezpłatne — zachowaj link do źródła.

JSON Nasze dane: CC BY 4.0 z linkiem do źródła; dane zewnętrzne zachowują licencję swojego źródła.

Trzy półki cenowe

Karty przedstawiają kompletne komputery do lokalnych modeli od 20B do 120B. Na półce „Budżetowy” jest jedna karta graficzna z 16 GB, jedna używana RTX 3090 albo GPU z dużą ilością RAM do przenoszenia MoE. „Średnia półka” to dwie RTX 3090, używany serwer EPYC z 8-kanałową pamięcią DDR4 i minikomputer z AMD Strix Halo. „Górna półka” obejmuje trzy RTX 3090, NVIDIA DGX Spark i Mac Studio z M2/M3 Ultra. Każda karta podaje pamięć graficzną, RAM, przybliżoną cenę, podzespoły aż do zasilacza i linii PCIe oraz modele, które dany zestaw uruchamia, wraz z prędkością.

Pomiar czy szacunek

Prędkość bez oznaczenia została zmierzona i ma datę oraz link do źródła, zwykle wątku z testami llama.cpp albo publicznego raportu. Wartość z ≈ to nasz szacunek na podstawie przepustowości pamięci. Pomiar dotyczy konkretnej wersji środowiska i konkretnych ustawień, więc twój komputer może wypaść trochę lepiej albo gorzej.

Jak dobrać zestaw

Zacznij od rozmiaru modeli, które chcesz uruchamiać, bo on wyznacza pamięć; wykres który otwarty model pasuje do twojego sprzętu pokazuje potrzeby każdego rozmiaru. Potem zastanów się nad szybkością, która idzie za przepustowością pamięci. Karty graficzne są szybkie, dopóki model mieści się w ich pamięci. Maszyny z pamięcią zunifikowaną, jak Mac, Strix Halo czy DGX Spark, pomieszczą większe modele, ale generują wolniej. Serwery CPU tanio trzymają ogromne modele, tyle że sensowny jest tam wyłącznie MoE, bo każdy token czyta tylko aktywne parametry. Na końcu zważ hałas, pobór prądu i cenę: kilka kart 3090 jest głośnych i wymaga mocnego zasilacza, a minikomputer czy Mac pracuje cicho, choć wolniej na token.

Dwa częste nieporozumienia

Więcej kart nie oznacza większej szybkości. W llama.cpp warstwy są dzielone między GPU i liczone po kolei, więc druga czy trzecia RTX 3090 pozwala wczytać większy model, ale prędkość zostaje blisko tej z jednej karty.

Drugie dotyczy przenoszenia MoE. Opcja --n-cpu-moe zostawia wspólne warstwy na GPU, a ekspertów przenosi do systemowego RAM. Działa to dobrze tylko z modelami MoE, a szybkość RAM ma duże znaczenie.

Ceny są przybliżone i szybko się zmieniają, zwłaszcza przy używanych kartach. Do uruchomienia modelu potrzebujesz jeszcze programu – zajrzyj do lokalnych aplikacji AI – i pliku w odpowiedniej kwantyzacji, o czym piszemy w rodzajach modeli AI.