Aller au contenu
fedi.software

Configurations PC pour modèles d’IA locaux, de 20B à 120B — 2026

D’une seule carte graphique de 16 Go à trois RTX 3090, un serveur EPYC et des machines à mémoire unifiée : ce que fait tourner chaque configuration et à quelle vitesse, avec la source de chaque mesure.

  • One 16 GB GPU

    Budget
    Économique
    Mémoire graphique
    ≈16 Go
    RAM
    ≈32 Go
    Composants
    • GPU: RTX 5060 Ti 16 GB / RTX 4060 Ti 16 GB
    • CPU: any 6–8-core desktop CPU
    • Carte mère: any ATX/mATX with a PCIe x16 slot
    • RAM: 32 GB DDR4/DDR5
    • Alimentation: 550–650 W
    • PCIe: 1× x16 (x8 electrical is enough)
    Fait tourner
    Remarques
    gpt-oss-20b (≈12 GB) fits entirely in VRAM with room for a long context. Qwen3-30B-A3B Q4_K_M (≈18.6 GB) does not fit: a few expert layers go to system RAM with --n-cpu-moe, still usable because only ~3B parameters are active. Measured on an RTX 5060 Ti 16 GB (llama-bench tg128).
  • One RTX 3090 24 GB (used)

    Budget
    Économique
    Mémoire graphique
    ≈24 Go
    RAM
    ≈64 Go
    Composants
    • GPU: RTX 3090 24 GB
    • CPU: any 6–8-core desktop CPU
    • Carte mère: any ATX with a PCIe x16 slot
    • RAM: 32–64 GB DDR4/DDR5
    • Alimentation: 750–850 W
    • PCIe: 1× x16
    Fait tourner
    Remarques
    The cheapest way to 24 GB of fast VRAM. Small MoE models fly; dense ~27–32B models fit at Q4 with a moderate context. The Gemma 3 27B figure is our estimate: 936 GB/s × 55–75 % efficiency ÷ 16.5 GB of weights.
  • 12–24 GB GPU + 64–128 GB RAM (MoE offload)

    Budget
    Économique
    Mémoire graphique
    ≈24 Go
    RAM
    ≈64 Go
    Composants
    • GPU: RTX 3090 24 GB / RTX 4070 12 GB / RTX 3080 Ti 12 GB
    • CPU: Core i5-12600K / Core Ultra 7 265K class
    • Carte mère: desktop board, both memory channels populated
    • RAM: 64–128 GB DDR5 (XMP/EXPO on) or DDR4-3600
    • Alimentation: 750–850 W
    • PCIe: 1× x16
    Remarques
    llama.cpp --n-cpu-moe N keeps attention and the shared layers on the GPU and moves the experts of N layers to system RAM. Works well only for MoE models; RAM speed matters — the 4070 build ran at 10–11 tok/s until XMP was turned on.
  • Two RTX 3090 (48 GB)

    Budget
    Milieu de gamme
    Mémoire graphique
    ≈48 Go
    RAM
    ≈64 Go
    Composants
    • GPU: 2× RTX 3090 24 GB
    • CPU: desktop CPU with x8/x8 bifurcation, or HEDT
    • Carte mère: two x16-size slots spaced for 3-slot cards (x8/x8)
    • RAM: 64 GB
    • Alimentation: 1000–1200 W
    • PCIe: 2× x8 PCIe 4.0; NVLink optional
    Remarques
    48 GB holds a dense 70B model at Q4_K_M (≈42.5 GB) with a short-to-medium context. llama.cpp splits the layers between the cards and runs them one after another, so speed is that of one 3090 reading the whole model; NVLink and x8 lanes barely matter here (they do for vLLM tensor parallel).
  • Used EPYC server, 8-channel DDR4 (CPU only)

    Budget
    Milieu de gamme
    Mémoire graphique
    ≈0 Go
    RAM
    ≈512 Go
    Prix
    2 000 $US
    Composants
    • CPU: AMD EPYC 7002/7003 (Rome/Milan), e.g. EPYC 7702
    • Carte mère: ASRock Rack ROMED8-2T / Supermicro H12SSL-i / Gigabyte MZ32-AR0
    • RAM: 256–512 GB DDR4-3200 RDIMM, all 8 channels populated
    • Alimentation: 750–1000 W
    • PCIe: 5–7× x16 PCIe 4.0 — room to add GPUs later
    Fait tourner
    Remarques
    Huge memory for little money: 8 channels of DDR4-3200 give 204.8 GB/s per socket. Only MoE models are practical — speed follows the active parameters. Fill every channel; a second socket adds NUMA trouble and little speed in llama.cpp (--numa distribute). The gpt-oss-120b figure is an estimate scaled by memory bandwidth from a DDR5 EPYC run. The source build cost about $2000 (prices of January 2025).
  • AMD Strix Halo mini-PC, 128 GB

    Budget
    Milieu de gamme
    Mémoire graphique
    ≈96 Go
    RAM
    ≈128 Go
    Composants
    • GPU: Radeon 8060S (integrated)
    • CPU: AMD Ryzen AI Max+ 395
    • Carte mère: Framework Desktop / other Strix Halo mini-PCs
    • RAM: 128 GB LPDDR5X-8000 unified (≈96 GB+ usable as VRAM)
    • Alimentation: built-in
    Fait tourner
    Remarques
    Quiet, ~120 W, the whole model in unified memory. Bandwidth (256 GB/s) is about a quarter of a 3090, so dense 70B models are slow; large MoE models with few active parameters are its sweet spot.
  • Three RTX 3090 (72 GB)

    Budget
    Haut de gamme
    Mémoire graphique
    ≈72 Go
    RAM
    ≈64 Go
    Composants
    • GPU: 3× RTX 3090 24 GB
    • CPU: AMD EPYC 7002/7003 or Threadripper (enough PCIe lanes)
    • Carte mère: ASRock Rack ROMED8-2T / Supermicro H12SSL-i, risers for 3-slot cards
    • RAM: 64–128 GB
    • Alimentation: 1200–1600 W (or two PSUs)
    • PCIe: 3× x8–x16 PCIe 4.0
    Fait tourner
    Remarques
    gpt-oss-120b (≈65 GB) fits fully in 72 GB of VRAM with a long context: 73 tok/s at 12.8k tokens of context, 41 tok/s at 93.7k. The measured machine was rented, so the platform here is our suggestion: a server board gives every card enough lanes. Three 350 W cards need a big PSU; many owners power-limit them.
  • NVIDIA DGX Spark, 128 GB

    Budget
    Haut de gamme
    Mémoire graphique
    ≈128 Go
    RAM
    ≈128 Go
    Prix
    3 999 $US
    Composants
    • GPU: NVIDIA GB10 (integrated Blackwell)
    • CPU: Arm CPU of the GB10
    • Carte mère: NVIDIA DGX Spark
    • RAM: 128 GB LPDDR5X unified
    • Alimentation: built-in
    Fait tourner
    Remarques
    A CUDA box with 128 GB of unified memory at 273 GB/s: the same speed class as Strix Halo, with the NVIDIA software stack. Early llama.cpp builds gave ~35 tok/s on gpt-oss-120b; the figure is after the November 2025 update (llama-bench tg128).
  • Mac Studio, M2/M3 Ultra

    Budget
    Haut de gamme
    Mémoire graphique
    ≈192 Go
    RAM
    ≈192 Go
    Composants
    • GPU: Apple M2 Ultra 76-core / M3 Ultra 80-core GPU
    • CPU: Apple M2 Ultra / M3 Ultra
    • Carte mère: Mac Studio
    • RAM: 192–512 GB unified (800–819 GB/s)
    • Alimentation: built-in
    Remarques
    The simplest way to run the biggest models at home: the M3 Ultra goes up to 512 GB of unified memory, enough for DeepSeek-class MoE models at 4 bits. Prompt processing is much slower than on NVIDIA GPUs. For very large models raise the GPU memory limit with sysctl iogpu.wired_limit_mb.

Les vitesses mesurées renvoient à leur source ; ≈ indique une estimation d’après la bande passante mémoire. Les prix sont approximatifs.

Mis à jour · Sources: github.com , www.hardware-corner.net , carteakey.dev , github.crookster.org , hardware-corner.net , digitalspaceport.com , quozul.dev

Intégrer sur votre site

Collez ce code là où l’infographie doit apparaître : elle se met à jour toute seule. Utilisation gratuite — conservez le lien d’attribution.

JSON Nos données : CC BY 4.0 avec un lien vers la source ; les données tierces gardent la licence de leur source.

Trois gammes de machines

Ces fiches décrivent des PC complets pour faire tourner des modèles de 20B à 120B chez soi. Elles sont classées en trois groupes de budget.

  • « Économique » : une carte graphique de 16 Go, une RTX 3090 d'occasion, ou un GPU accompagné de beaucoup de RAM pour le déport MoE.
  • « Milieu de gamme » : deux RTX 3090, un serveur EPYC d'occasion en DDR4 8 canaux, un mini-PC AMD Strix Halo.
  • « Haut de gamme » : trois RTX 3090, NVIDIA DGX Spark, un Mac Studio en M2/M3 Ultra.

Le contenu d'une fiche

Chaque configuration indique sa mémoire graphique, sa RAM, un prix approximatif et ses composants : GPU, CPU, carte mère, RAM, alimentation et lignes PCIe. Viennent ensuite les modèles qu'elle fait tourner et à quelle vitesse. Une vitesse est soit mesurée, avec le lien vers la source et sa date, soit estimée d'après la bande passante mémoire et marquée ≈.

Choisir dans le bon ordre

Partez de la taille des modèles que vous visez, qui fixe la mémoire, puis de la vitesse que vous jugez suffisante, qui dépend de la bande passante, et seulement à la fin du bruit, de la consommation et du prix. Les cartes graphiques vont vite tant que le modèle tient entièrement dans leur mémoire. Les machines à mémoire unifiée, Mac, Strix Halo ou DGX Spark, accueillent des modèles plus gros mais génèrent plus lentement. Les serveurs CPU logent d'énormes modèles MoE pour pas cher, mais seul le MoE y est vraiment praticable.

Deux idées reçues

Ajouter des cartes n'accélère pas forcément. Avec llama.cpp, les couches se répartissent entre les GPU qui travaillent l'un après l'autre : une deuxième ou une troisième RTX 3090 permet de charger un modèle plus gros, mais la vitesse reste proche de celle d'une seule carte. Le déport MoE (--n-cpu-moe), lui, garde les couches communes sur le GPU et envoie les experts en RAM système ; il fonctionne bien, mais seulement avec des modèles MoE, et la vitesse de la RAM pèse lourd.

Les prix sont indicatifs et bougent vite, surtout sur l'occasion. Une mesure a été faite avec sa propre version du moteur et ses réglages, votre résultat peut donc différer. Il vous faudra aussi un logiciel parmi les applications d'IA locale et un fichier de modèle bien quantifié, expliqué dans les types de modèles d'IA.