Сборки ПК под локальные нейросети 20B–120B — 2026
От одной видеокарты на 16 ГБ до трёх RTX 3090, сервера на EPYC и компьютеров с общей памятью: что тянет каждая сборка и с какой скоростью — с источником каждого замера.
-
Одна видеокарта на 16 ГБ
- Бюджет
- Бюджетная
- Видеопамять
- ≈16 ГБ
- ОЗУ
- ≈32 ГБ
- Комплектующие
- Видеокарта: RTX 5060 Ti 16 GB / RTX 4060 Ti 16 GB
- Процессор: any 6–8-core desktop CPU
- Материнская плата: any ATX/mATX with a PCIe x16 slot
- ОЗУ: 32 GB DDR4/DDR5
- Блок питания: 550–650 W
- PCIe: 1× x16 (x8 electrical is enough)
- Что тянет
- gpt-oss-20b MXFP4 (RTX 5060 Ti 16 GB) MXFP4 112 ток/с [замер]
- Qwen3-30B-A3B Q4_K_M, experts partly in RAM Q4_K_M [≈ оценка по пропускной способности памяти]
- Примечания
- gpt-oss-20b (≈12 ГБ) целиком помещается в VRAM с запасом под длинный контекст. Qwen3-30B-A3B Q4_K_M (≈18,6 ГБ) не влезает: часть экспертов уходит в RAM через --n-cpu-moe, но работать можно — активных параметров всего ~3B. Замер — на RTX 5060 Ti 16 ГБ (llama-bench tg128).
-
Одна RTX 3090 24 ГБ (б/у)
- Бюджет
- Бюджетная
- Видеопамять
- ≈24 ГБ
- ОЗУ
- ≈64 ГБ
- Комплектующие
- Видеокарта: RTX 3090 24 GB
- Процессор: any 6–8-core desktop CPU
- Материнская плата: any ATX with a PCIe x16 slot
- ОЗУ: 32–64 GB DDR4/DDR5
- Блок питания: 750–850 W
- PCIe: 1× x16
- Что тянет
- gpt-oss-20b MXFP4 MXFP4 162 ток/с [замер]
- Qwen3-30B-A3B Q4_K Q4_K_M 154 ток/с @4k [замер]
- Gemma 3 27B Q4_K_M Q4_K_M ≈31–42 ток/с [≈ оценка по пропускной способности памяти]
- Примечания
- Самый дешёвый способ получить 24 ГБ быстрой VRAM. Небольшие MoE летают; плотные модели ~27–32B помещаются в Q4 с умеренным контекстом. Цифра для Gemma 3 27B — наша оценка: 936 ГБ/с × 55–75 % эффективности ÷ 16,5 ГБ весов.
-
GPU 12–24 ГБ + 64–128 ГБ RAM (выгрузка MoE)
- Бюджет
- Бюджетная
- Видеопамять
- ≈24 ГБ
- ОЗУ
- ≈64 ГБ
- Комплектующие
- Видеокарта: RTX 3090 24 GB / RTX 4070 12 GB / RTX 3080 Ti 12 GB
- Процессор: Core i5-12600K / Core Ultra 7 265K class
- Материнская плата: desktop board, both memory channels populated
- ОЗУ: 64–128 GB DDR5 (XMP/EXPO on) or DDR4-3600
- Блок питания: 750–850 W
- PCIe: 1× x16
- Что тянет
- gpt-oss-120b MXFP4 — RTX 3090 + 64 GB DDR5-5200, --n-cpu-moe 24–26 MXFP4 26–28 ток/с [замер]
- gpt-oss-120b MXFP4 — RTX 4070 12 GB + 64 GB DDR5 MXFP4 25–28 ток/с [замер]
- gpt-oss-120b MXFP4 — RTX 3080 Ti 12 GB + 128 GB DDR4-3600, --n-cpu-moe 36 MXFP4 18,0–22 ток/с [замер]
- Примечания
- llama.cpp --n-cpu-moe N оставляет внимание и общие слои на GPU, а экспертов N слоёв переносит в RAM. Хорошо работает только с MoE; важна скорость памяти — сборка с 4070 выдавала 10–11 ток/с, пока не включили XMP.
-
Две RTX 3090 (48 ГБ)
- Бюджет
- Средняя
- Видеопамять
- ≈48 ГБ
- ОЗУ
- ≈64 ГБ
- Комплектующие
- Видеокарта: 2× RTX 3090 24 GB
- Процессор: desktop CPU with x8/x8 bifurcation, or HEDT
- Материнская плата: two x16-size slots spaced for 3-slot cards (x8/x8)
- ОЗУ: 64 GB
- Блок питания: 1000–1200 W
- PCIe: 2× x8 PCIe 4.0; NVLink optional
- Что тянет
- Llama 3 70B Q4_K_M (same size as Llama 3.3 70B) Q4_K_M 16,3 ток/с [замер]
- Примечания
- 48 ГБ вмещают плотную 70B в Q4_K_M (≈42,5 ГБ) с коротким или средним контекстом. llama.cpp делит слои между картами и считает их по очереди, поэтому скорость — как у одной 3090, читающей всю модель; NVLink и линии x8 здесь почти не важны (важны для tensor parallel в vLLM).
-
Б/у сервер EPYC, 8 каналов DDR4 (только CPU)
- Бюджет
- Средняя
- Видеопамять
- ≈0 ГБ
- ОЗУ
- ≈512 ГБ
- Цена
- 2 000 $
- Комплектующие
- Процессор: AMD EPYC 7002/7003 (Rome/Milan), e.g. EPYC 7702
- Материнская плата: ASRock Rack ROMED8-2T / Supermicro H12SSL-i / Gigabyte MZ32-AR0
- ОЗУ: 256–512 GB DDR4-3200 RDIMM, all 8 channels populated
- Блок питания: 750–1000 W
- PCIe: 5–7× x16 PCIe 4.0 — room to add GPUs later
- Что тянет
- DeepSeek R1 671B Q4 — EPYC 7702 + 512 GB DDR4-2400, MZ32-AR0 Q4 3,5–4,2 ток/с [замер]
- gpt-oss-120b MXFP4 MXFP4 ≈12,0–16,0 ток/с [≈ оценка по пропускной способности памяти]
- Примечания
- Огромная память за небольшие деньги: 8 каналов DDR4-3200 дают 204,8 ГБ/с на сокет. Практичны только MoE — скорость идёт по активным параметрам. Заполняйте все каналы; второй сокет добавляет проблем с NUMA и мало скорости в llama.cpp (--numa distribute). Цифра для gpt-oss-120b — оценка, пересчитанная по пропускной способности памяти с замера на EPYC с DDR5. Сборка из источника стоила около $2000 (цены января 2025).
-
Мини-ПК на AMD Strix Halo, 128 ГБ
- Бюджет
- Средняя
- Видеопамять
- ≈96 ГБ
- ОЗУ
- ≈128 ГБ
- Комплектующие
- Видеокарта: Radeon 8060S (integrated)
- Процессор: AMD Ryzen AI Max+ 395
- Материнская плата: Framework Desktop / other Strix Halo mini-PCs
- ОЗУ: 128 GB LPDDR5X-8000 unified (≈96 GB+ usable as VRAM)
- Блок питания: built-in
- Что тянет
- gpt-oss-120b MXFP4 (ROCm) MXFP4 50 ток/с [замер]
- Примечания
- Тихо, ~120 Вт, вся модель в общей памяти. Пропускная способность (256 ГБ/с) — около четверти от 3090, поэтому плотные 70B медленные; его сильная сторона — большие MoE с малым числом активных параметров.
-
Три RTX 3090 (72 ГБ)
- Бюджет
- Топовая
- Видеопамять
- ≈72 ГБ
- ОЗУ
- ≈64 ГБ
- Комплектующие
- Видеокарта: 3× RTX 3090 24 GB
- Процессор: AMD EPYC 7002/7003 or Threadripper (enough PCIe lanes)
- Материнская плата: ASRock Rack ROMED8-2T / Supermicro H12SSL-i, risers for 3-slot cards
- ОЗУ: 64–128 GB
- Блок питания: 1200–1600 W (or two PSUs)
- PCIe: 3× x8–x16 PCIe 4.0
- Что тянет
- gpt-oss-120b MXFP4, all in VRAM MXFP4 41–73 ток/с @12.8k→93.7k [замер]
- Примечания
- gpt-oss-120b (≈65 ГБ) целиком помещается в 72 ГБ VRAM с длинным контекстом: 73 ток/с при контексте 12,8k, 41 ток/с при 93,7k. Замер — на арендованной машине, поэтому платформа — наша рекомендация: серверная плата даёт каждой карте достаточно линий. Трём картам по 350 Вт нужен мощный БП; многие ограничивают им лимит мощности.
-
NVIDIA DGX Spark, 128 ГБ
- Бюджет
- Топовая
- Видеопамять
- ≈128 ГБ
- ОЗУ
- ≈128 ГБ
- Цена
- 3 999 $
- Комплектующие
- Видеокарта: NVIDIA GB10 (integrated Blackwell)
- Процессор: Arm CPU of the GB10
- Материнская плата: NVIDIA DGX Spark
- ОЗУ: 128 GB LPDDR5X unified
- Блок питания: built-in
- Что тянет
- gpt-oss-120b MXFP4 MXFP4 61 ток/с [замер]
- Примечания
- Коробка с CUDA и 128 ГБ общей памяти на 273 ГБ/с: тот же класс скорости, что у Strix Halo, но со стеком NVIDIA. Ранние сборки llama.cpp давали ~35 ток/с на gpt-oss-120b; цифра — после обновления ноября 2025 (llama-bench tg128).
-
Mac Studio на M2/M3 Ultra
- Бюджет
- Топовая
- Видеопамять
- ≈192 ГБ
- ОЗУ
- ≈192 ГБ
- Комплектующие
- Видеокарта: Apple M2 Ultra 76-core / M3 Ultra 80-core GPU
- Процессор: Apple M2 Ultra / M3 Ultra
- Материнская плата: Mac Studio
- ОЗУ: 192–512 GB unified (800–819 GB/s)
- Блок питания: built-in
- Что тянет
- gpt-oss-120b MXFP4 — M2 Ultra 192 GB MXFP4 80 ток/с [замер]
- gpt-oss-20b MXFP4 — M3 Ultra 512 GB MXFP4 116 ток/с [замер]
- Примечания
- Самый простой способ запустить самые большие модели дома: у M3 Ultra до 512 ГБ общей памяти — хватает на MoE класса DeepSeek в 4 битах. Обработка промпта заметно медленнее, чем на GPU NVIDIA. Для очень больших моделей поднимите лимит памяти GPU через sysctl iogpu.wired_limit_mb.
Замеры скорости — со ссылкой на источник; ≈ — оценка по пропускной способности памяти. Цены примерные.
Обновлено · Источники: github.com , www.hardware-corner.net , carteakey.dev , github.crookster.org , hardware-corner.net , digitalspaceport.com , quozul.dev
Вставить на свой сайт
Вставьте этот код туда, где должна быть инфографика, — она будет обновляться сама. Бесплатно, при условии сохранения ссылки на источник.
Какие сборки собраны
Карточки — это готовые ПК под локальные модели, разделённые по бюджету. «Бюджетная» группа: одна видеокарта на 16 ГБ, б/у RTX 3090 и связка GPU с большим объёмом ОЗУ для выгрузки MoE. «Средняя»: две RTX 3090, б/у сервер EPYC с 8-канальной DDR4 и мини-ПК на AMD Strix Halo. «Топовая»: три RTX 3090, NVIDIA DGX Spark и Mac Studio на M2/M3 Ultra. В карточке указаны видеопамять, ОЗУ, примерная цена, комплектующие вплоть до блока питания и линий PCIe и модели, которые сборка тянет, со скоростью.
Замер или оценка
Скорость без значка ≈ измерена: у неё есть ссылка на источник — обычно ветку бенчмарков llama.cpp или открытый отчёт — и дата. Со значком ≈ — наша оценка по пропускной способности памяти. Любой замер сделан на своей версии программы и со своими настройками, так что на вашей машине цифра может оказаться чуть выше или ниже.
От чего отталкиваться при выборе
Сначала решите, какие модели хотите запускать, — это задаёт объём памяти; что нужно каждому размеру, показывает схема какая модель влезет в ваше железо. Затем подумайте о скорости: она определяется пропускной способностью памяти. Видеокарты быстрее всех, пока модель целиком помещается в их память. Компьютеры с общей памятью — Mac, Strix Halo, DGX Spark — вмещают модели крупнее, но генерируют медленнее. Серверы на CPU дёшево держат огромные модели, только практичны там одни MoE: на каждый токен читаются лишь активные параметры. И в последнюю очередь — шум, потребление и цена: несколько 3090 шумят и требуют мощного блока питания, мини-ПК и Mac тихие, но медленнее на токен.
Две частые ошибки
- Больше карт — не значит быстрее. В llama.cpp слои делятся между видеокартами и работают по очереди, поэтому вторая и третья RTX 3090 позволяют загрузить модель крупнее, а скорость остаётся близкой к одной карте.
- Выгрузка помогает не всем. Ключ --n-cpu-moe в llama.cpp оставляет общие слои на GPU, а экспертов переносит в системную память. Хорошо это работает только с MoE, и скорость ОЗУ здесь имеет значение.
Цены примерные и быстро меняются, особенно на б/у видеокарты. Кроме железа понадобится программа — см. локальные нейросети — и файл модели в подходящем кванте; как его выбрать, объясняет схема типы нейросетей.