Συνθέσεις PC για τοπικά μοντέλα ΤΝ, 20B έως 120B — 2026
Από μία κάρτα γραφικών 16 GB έως τρεις RTX 3090, έναν διακομιστή EPYC και μηχανήματα ενοποιημένης μνήμης: τι τρέχει κάθε σύνθεση και πόσο γρήγορα, με την πηγή κάθε μέτρησης.
-
One 16 GB GPU
- Budget
- Οικονομική
- Μνήμη γραφικών
- ≈16 GB
- RAM
- ≈32 GB
- Εξαρτήματα
- GPU: RTX 5060 Ti 16 GB / RTX 4060 Ti 16 GB
- CPU: any 6–8-core desktop CPU
- Μητρική: any ATX/mATX with a PCIe x16 slot
- RAM: 32 GB DDR4/DDR5
- Τροφοδοτικό: 550–650 W
- PCIe: 1× x16 (x8 electrical is enough)
- Τρέχει
- gpt-oss-20b MXFP4 (RTX 5060 Ti 16 GB) MXFP4 112 tok/s [μετρημένο]
- Qwen3-30B-A3B Q4_K_M, experts partly in RAM Q4_K_M [≈ εκτίμηση από το εύρος ζώνης της μνήμης]
- Σημειώσεις
- gpt-oss-20b (≈12 GB) fits entirely in VRAM with room for a long context. Qwen3-30B-A3B Q4_K_M (≈18.6 GB) does not fit: a few expert layers go to system RAM with --n-cpu-moe, still usable because only ~3B parameters are active. Measured on an RTX 5060 Ti 16 GB (llama-bench tg128).
-
One RTX 3090 24 GB (used)
- Budget
- Οικονομική
- Μνήμη γραφικών
- ≈24 GB
- RAM
- ≈64 GB
- Εξαρτήματα
- GPU: RTX 3090 24 GB
- CPU: any 6–8-core desktop CPU
- Μητρική: any ATX with a PCIe x16 slot
- RAM: 32–64 GB DDR4/DDR5
- Τροφοδοτικό: 750–850 W
- PCIe: 1× x16
- Τρέχει
- gpt-oss-20b MXFP4 MXFP4 162 tok/s [μετρημένο]
- Qwen3-30B-A3B Q4_K Q4_K_M 154 tok/s @4k [μετρημένο]
- Gemma 3 27B Q4_K_M Q4_K_M ≈31–42 tok/s [≈ εκτίμηση από το εύρος ζώνης της μνήμης]
- Σημειώσεις
- The cheapest way to 24 GB of fast VRAM. Small MoE models fly; dense ~27–32B models fit at Q4 with a moderate context. The Gemma 3 27B figure is our estimate: 936 GB/s × 55–75 % efficiency ÷ 16.5 GB of weights.
-
12–24 GB GPU + 64–128 GB RAM (MoE offload)
- Budget
- Οικονομική
- Μνήμη γραφικών
- ≈24 GB
- RAM
- ≈64 GB
- Εξαρτήματα
- GPU: RTX 3090 24 GB / RTX 4070 12 GB / RTX 3080 Ti 12 GB
- CPU: Core i5-12600K / Core Ultra 7 265K class
- Μητρική: desktop board, both memory channels populated
- RAM: 64–128 GB DDR5 (XMP/EXPO on) or DDR4-3600
- Τροφοδοτικό: 750–850 W
- PCIe: 1× x16
- Τρέχει
- gpt-oss-120b MXFP4 — RTX 3090 + 64 GB DDR5-5200, --n-cpu-moe 24–26 MXFP4 26–28 tok/s [μετρημένο]
- gpt-oss-120b MXFP4 — RTX 4070 12 GB + 64 GB DDR5 MXFP4 25–28 tok/s [μετρημένο]
- gpt-oss-120b MXFP4 — RTX 3080 Ti 12 GB + 128 GB DDR4-3600, --n-cpu-moe 36 MXFP4 18,0–22 tok/s [μετρημένο]
- Σημειώσεις
- llama.cpp --n-cpu-moe N keeps attention and the shared layers on the GPU and moves the experts of N layers to system RAM. Works well only for MoE models; RAM speed matters — the 4070 build ran at 10–11 tok/s until XMP was turned on.
-
Two RTX 3090 (48 GB)
- Budget
- Μεσαία
- Μνήμη γραφικών
- ≈48 GB
- RAM
- ≈64 GB
- Εξαρτήματα
- GPU: 2× RTX 3090 24 GB
- CPU: desktop CPU with x8/x8 bifurcation, or HEDT
- Μητρική: two x16-size slots spaced for 3-slot cards (x8/x8)
- RAM: 64 GB
- Τροφοδοτικό: 1000–1200 W
- PCIe: 2× x8 PCIe 4.0; NVLink optional
- Τρέχει
- Llama 3 70B Q4_K_M (same size as Llama 3.3 70B) Q4_K_M 16,3 tok/s [μετρημένο]
- Σημειώσεις
- 48 GB holds a dense 70B model at Q4_K_M (≈42.5 GB) with a short-to-medium context. llama.cpp splits the layers between the cards and runs them one after another, so speed is that of one 3090 reading the whole model; NVLink and x8 lanes barely matter here (they do for vLLM tensor parallel).
-
Used EPYC server, 8-channel DDR4 (CPU only)
- Budget
- Μεσαία
- Μνήμη γραφικών
- ≈0 GB
- RAM
- ≈512 GB
- Τιμή
- 2.000 $
- Εξαρτήματα
- CPU: AMD EPYC 7002/7003 (Rome/Milan), e.g. EPYC 7702
- Μητρική: ASRock Rack ROMED8-2T / Supermicro H12SSL-i / Gigabyte MZ32-AR0
- RAM: 256–512 GB DDR4-3200 RDIMM, all 8 channels populated
- Τροφοδοτικό: 750–1000 W
- PCIe: 5–7× x16 PCIe 4.0 — room to add GPUs later
- Τρέχει
- DeepSeek R1 671B Q4 — EPYC 7702 + 512 GB DDR4-2400, MZ32-AR0 Q4 3,5–4,2 tok/s [μετρημένο]
- gpt-oss-120b MXFP4 MXFP4 ≈12,0–16,0 tok/s [≈ εκτίμηση από το εύρος ζώνης της μνήμης]
- Σημειώσεις
- Huge memory for little money: 8 channels of DDR4-3200 give 204.8 GB/s per socket. Only MoE models are practical — speed follows the active parameters. Fill every channel; a second socket adds NUMA trouble and little speed in llama.cpp (--numa distribute). The gpt-oss-120b figure is an estimate scaled by memory bandwidth from a DDR5 EPYC run. The source build cost about $2000 (prices of January 2025).
-
AMD Strix Halo mini-PC, 128 GB
- Budget
- Μεσαία
- Μνήμη γραφικών
- ≈96 GB
- RAM
- ≈128 GB
- Εξαρτήματα
- GPU: Radeon 8060S (integrated)
- CPU: AMD Ryzen AI Max+ 395
- Μητρική: Framework Desktop / other Strix Halo mini-PCs
- RAM: 128 GB LPDDR5X-8000 unified (≈96 GB+ usable as VRAM)
- Τροφοδοτικό: built-in
- Τρέχει
- gpt-oss-120b MXFP4 (ROCm) MXFP4 50 tok/s [μετρημένο]
- Σημειώσεις
- Quiet, ~120 W, the whole model in unified memory. Bandwidth (256 GB/s) is about a quarter of a 3090, so dense 70B models are slow; large MoE models with few active parameters are its sweet spot.
-
Three RTX 3090 (72 GB)
- Budget
- Κορυφαία
- Μνήμη γραφικών
- ≈72 GB
- RAM
- ≈64 GB
- Εξαρτήματα
- GPU: 3× RTX 3090 24 GB
- CPU: AMD EPYC 7002/7003 or Threadripper (enough PCIe lanes)
- Μητρική: ASRock Rack ROMED8-2T / Supermicro H12SSL-i, risers for 3-slot cards
- RAM: 64–128 GB
- Τροφοδοτικό: 1200–1600 W (or two PSUs)
- PCIe: 3× x8–x16 PCIe 4.0
- Τρέχει
- gpt-oss-120b MXFP4, all in VRAM MXFP4 41–73 tok/s @12.8k→93.7k [μετρημένο]
- Σημειώσεις
- gpt-oss-120b (≈65 GB) fits fully in 72 GB of VRAM with a long context: 73 tok/s at 12.8k tokens of context, 41 tok/s at 93.7k. The measured machine was rented, so the platform here is our suggestion: a server board gives every card enough lanes. Three 350 W cards need a big PSU; many owners power-limit them.
-
NVIDIA DGX Spark, 128 GB
- Budget
- Κορυφαία
- Μνήμη γραφικών
- ≈128 GB
- RAM
- ≈128 GB
- Τιμή
- 3.999 $
- Εξαρτήματα
- GPU: NVIDIA GB10 (integrated Blackwell)
- CPU: Arm CPU of the GB10
- Μητρική: NVIDIA DGX Spark
- RAM: 128 GB LPDDR5X unified
- Τροφοδοτικό: built-in
- Τρέχει
- gpt-oss-120b MXFP4 MXFP4 61 tok/s [μετρημένο]
- Σημειώσεις
- A CUDA box with 128 GB of unified memory at 273 GB/s: the same speed class as Strix Halo, with the NVIDIA software stack. Early llama.cpp builds gave ~35 tok/s on gpt-oss-120b; the figure is after the November 2025 update (llama-bench tg128).
-
Mac Studio, M2/M3 Ultra
- Budget
- Κορυφαία
- Μνήμη γραφικών
- ≈192 GB
- RAM
- ≈192 GB
- Εξαρτήματα
- GPU: Apple M2 Ultra 76-core / M3 Ultra 80-core GPU
- CPU: Apple M2 Ultra / M3 Ultra
- Μητρική: Mac Studio
- RAM: 192–512 GB unified (800–819 GB/s)
- Τροφοδοτικό: built-in
- Τρέχει
- gpt-oss-120b MXFP4 — M2 Ultra 192 GB MXFP4 80 tok/s [μετρημένο]
- gpt-oss-20b MXFP4 — M3 Ultra 512 GB MXFP4 116 tok/s [μετρημένο]
- Σημειώσεις
- The simplest way to run the biggest models at home: the M3 Ultra goes up to 512 GB of unified memory, enough for DeepSeek-class MoE models at 4 bits. Prompt processing is much slower than on NVIDIA GPUs. For very large models raise the GPU memory limit with sysctl iogpu.wired_limit_mb.
Οι μετρημένες ταχύτητες παραπέμπουν στην πηγή τους· το ≈ δηλώνει εκτίμηση από το εύρος ζώνης της μνήμης. Οι τιμές είναι κατά προσέγγιση.
Ενημερώθηκε · Πηγές: github.com , www.hardware-corner.net , carteakey.dev , github.crookster.org , hardware-corner.net , digitalspaceport.com , quozul.dev
Ενσωμάτωση στον ιστότοπό σας
Επικολλήστε αυτόν τον κώδικα εκεί που πρέπει να εμφανίζεται το infographic: ενημερώνεται μόνο του. Δωρεάν χρήση — κρατήστε τον σύνδεσμο αναφοράς.
Τρεις ομάδες προϋπολογισμού
Οι κάρτες ομαδοποιούν ολοκληρωμένους υπολογιστές για τοπικά μοντέλα ανάλογα με τον προϋπολογισμό. Η «Οικονομική» ομάδα ξεκινά από μία κάρτα γραφικών 16 GB, μία μεταχειρισμένη RTX 3090 και μια GPU με άφθονη RAM για εκφόρτωση MoE. Η «Μεσαία» περιλαμβάνει δύο RTX 3090, έναν μεταχειρισμένο διακομιστή EPYC με DDR4 8 καναλιών και ένα mini-PC AMD Strix Halo. Η ακριβή ομάδα καλύπτει τρεις RTX 3090, το NVIDIA DGX Spark και ένα Mac Studio με M2/M3 Ultra. Σε κάθε κάρτα αναγράφονται μνήμη γραφικών, RAM, ενδεικτική τιμή, εξαρτήματα μέχρι το τροφοδοτικό και τις γραμμές PCIe, καθώς και ποια μοντέλα τρέχει η σύνθεση και με τι ταχύτητα.
Μέτρηση ή εκτίμηση
Μια ταχύτητα χωρίς σήμανση είναι μετρημένη: παραπέμπει στην πηγή της, συνήθως ένα νήμα benchmark του llama.cpp ή μια δημόσια αναφορά, και δείχνει την ημερομηνία της. Μια τιμή με ≈ είναι δική μας εκτίμηση από το εύρος ζώνης της μνήμης. Κάθε μέτρηση έγινε με τη δική της έκδοση runtime και ρυθμίσεις, οπότε στο δικό σας μηχάνημα το αποτέλεσμα μπορεί να διαφέρει λίγο προς τα πάνω ή προς τα κάτω.
Με ποια σειρά αποφασίζετε
Ξεκινήστε από το μέγεθος των μοντέλων που θέλετε να τρέξετε, γιατί αυτό ορίζει τη μνήμη· τι χρειάζεται κάθε μέγεθος φαίνεται στο γράφημα συμβατότητας υλικού. Έπειτα έρχεται η ταχύτητα, που ακολουθεί το εύρος ζώνης. Οι κάρτες γραφικών είναι γρήγορες όσο το μοντέλο χωρά στη μνήμη τους· τα μηχανήματα ενοποιημένης μνήμης (Mac, Strix Halo, DGX Spark) χωρούν μεγαλύτερα μοντέλα, αλλά παράγουν κείμενο πιο αργά. Οι διακομιστές με επεξεργαστές φιλοξενούν τεράστια μοντέλα φθηνά, όμως εκεί πρακτικά λειτουργεί μόνο το MoE, επειδή κάθε token διαβάζει μόνο τις ενεργές παραμέτρους. Στο τέλος ζυγίστε θόρυβο, κατανάλωση και τιμή:
- πολλές κάρτες 3090 κάνουν θόρυβο και θέλουν μεγάλο τροφοδοτικό·
- ένα mini-PC ή ένα Mac είναι αθόρυβο, αλλά πιο αργό ανά token.
Δύο λάθη που γίνονται συχνά
Περισσότερες κάρτες δεν σημαίνουν μεγαλύτερη ταχύτητα. Στο llama.cpp τα επίπεδα μοιράζονται στις GPU και εκτελούνται διαδοχικά, άρα μια δεύτερη ή τρίτη RTX 3090 σας επιτρέπει να φορτώσετε μεγαλύτερο μοντέλο, ενώ η ταχύτητα μένει κοντά σε αυτήν μίας κάρτας. Το δεύτερο λάθος αφορά την εκφόρτωση MoE: η επιλογή --n-cpu-moe κρατά τα κοινά επίπεδα στη GPU και μεταφέρει τους experts στη RAM του συστήματος. Αποδίδει μόνο με μοντέλα MoE, και η ταχύτητα της RAM μετράει.
Οι τιμές είναι ενδεικτικές και αλλάζουν γρήγορα, ιδίως στις μεταχειρισμένες κάρτες. Για να τρέξετε ένα μοντέλο χρειάζεστε επίσης εφαρμογή — δείτε τις τοπικές εφαρμογές ΤΝ — και αρχείο στη σωστή κβαντοποίηση, όπως εξηγείται στους τύπους μοντέλων ΤΝ.