Ir al contenido
fedi.software

Configuraciones de PC para modelos de IA locales, de 20B a 120B — 2026

Desde una tarjeta gráfica de 16 GB hasta tres RTX 3090, un servidor EPYC y equipos de memoria unificada: qué ejecuta cada configuración y a qué velocidad, con la fuente de cada medición.

  • One 16 GB GPU

    Presupuesto
    Económica
    Memoria gráfica
    ≈16 GB
    RAM
    ≈32 GB
    Componentes
    • GPU: RTX 5060 Ti 16 GB / RTX 4060 Ti 16 GB
    • CPU: any 6–8-core desktop CPU
    • Placa base: any ATX/mATX with a PCIe x16 slot
    • RAM: 32 GB DDR4/DDR5
    • Fuente de alimentación: 550–650 W
    • PCIe: 1× x16 (x8 electrical is enough)
    Ejecuta
    Notas
    gpt-oss-20b (≈12 GB) fits entirely in VRAM with room for a long context. Qwen3-30B-A3B Q4_K_M (≈18.6 GB) does not fit: a few expert layers go to system RAM with --n-cpu-moe, still usable because only ~3B parameters are active. Measured on an RTX 5060 Ti 16 GB (llama-bench tg128).
  • One RTX 3090 24 GB (used)

    Presupuesto
    Económica
    Memoria gráfica
    ≈24 GB
    RAM
    ≈64 GB
    Componentes
    • GPU: RTX 3090 24 GB
    • CPU: any 6–8-core desktop CPU
    • Placa base: any ATX with a PCIe x16 slot
    • RAM: 32–64 GB DDR4/DDR5
    • Fuente de alimentación: 750–850 W
    • PCIe: 1× x16
    Ejecuta
    Notas
    The cheapest way to 24 GB of fast VRAM. Small MoE models fly; dense ~27–32B models fit at Q4 with a moderate context. The Gemma 3 27B figure is our estimate: 936 GB/s × 55–75 % efficiency ÷ 16.5 GB of weights.
  • 12–24 GB GPU + 64–128 GB RAM (MoE offload)

    Presupuesto
    Económica
    Memoria gráfica
    ≈24 GB
    RAM
    ≈64 GB
    Componentes
    • GPU: RTX 3090 24 GB / RTX 4070 12 GB / RTX 3080 Ti 12 GB
    • CPU: Core i5-12600K / Core Ultra 7 265K class
    • Placa base: desktop board, both memory channels populated
    • RAM: 64–128 GB DDR5 (XMP/EXPO on) or DDR4-3600
    • Fuente de alimentación: 750–850 W
    • PCIe: 1× x16
    Notas
    llama.cpp --n-cpu-moe N keeps attention and the shared layers on the GPU and moves the experts of N layers to system RAM. Works well only for MoE models; RAM speed matters — the 4070 build ran at 10–11 tok/s until XMP was turned on.
  • Two RTX 3090 (48 GB)

    Presupuesto
    Gama media
    Memoria gráfica
    ≈48 GB
    RAM
    ≈64 GB
    Componentes
    • GPU: 2× RTX 3090 24 GB
    • CPU: desktop CPU with x8/x8 bifurcation, or HEDT
    • Placa base: two x16-size slots spaced for 3-slot cards (x8/x8)
    • RAM: 64 GB
    • Fuente de alimentación: 1000–1200 W
    • PCIe: 2× x8 PCIe 4.0; NVLink optional
    Notas
    48 GB holds a dense 70B model at Q4_K_M (≈42.5 GB) with a short-to-medium context. llama.cpp splits the layers between the cards and runs them one after another, so speed is that of one 3090 reading the whole model; NVLink and x8 lanes barely matter here (they do for vLLM tensor parallel).
  • Used EPYC server, 8-channel DDR4 (CPU only)

    Presupuesto
    Gama media
    Memoria gráfica
    ≈0 GB
    RAM
    ≈512 GB
    Precio
    2.000 US$
    Componentes
    • CPU: AMD EPYC 7002/7003 (Rome/Milan), e.g. EPYC 7702
    • Placa base: ASRock Rack ROMED8-2T / Supermicro H12SSL-i / Gigabyte MZ32-AR0
    • RAM: 256–512 GB DDR4-3200 RDIMM, all 8 channels populated
    • Fuente de alimentación: 750–1000 W
    • PCIe: 5–7× x16 PCIe 4.0 — room to add GPUs later
    Ejecuta
    Notas
    Huge memory for little money: 8 channels of DDR4-3200 give 204.8 GB/s per socket. Only MoE models are practical — speed follows the active parameters. Fill every channel; a second socket adds NUMA trouble and little speed in llama.cpp (--numa distribute). The gpt-oss-120b figure is an estimate scaled by memory bandwidth from a DDR5 EPYC run. The source build cost about $2000 (prices of January 2025).
  • AMD Strix Halo mini-PC, 128 GB

    Presupuesto
    Gama media
    Memoria gráfica
    ≈96 GB
    RAM
    ≈128 GB
    Componentes
    • GPU: Radeon 8060S (integrated)
    • CPU: AMD Ryzen AI Max+ 395
    • Placa base: Framework Desktop / other Strix Halo mini-PCs
    • RAM: 128 GB LPDDR5X-8000 unified (≈96 GB+ usable as VRAM)
    • Fuente de alimentación: built-in
    Ejecuta
    Notas
    Quiet, ~120 W, the whole model in unified memory. Bandwidth (256 GB/s) is about a quarter of a 3090, so dense 70B models are slow; large MoE models with few active parameters are its sweet spot.
  • Three RTX 3090 (72 GB)

    Presupuesto
    Gama alta
    Memoria gráfica
    ≈72 GB
    RAM
    ≈64 GB
    Componentes
    • GPU: 3× RTX 3090 24 GB
    • CPU: AMD EPYC 7002/7003 or Threadripper (enough PCIe lanes)
    • Placa base: ASRock Rack ROMED8-2T / Supermicro H12SSL-i, risers for 3-slot cards
    • RAM: 64–128 GB
    • Fuente de alimentación: 1200–1600 W (or two PSUs)
    • PCIe: 3× x8–x16 PCIe 4.0
    Ejecuta
    Notas
    gpt-oss-120b (≈65 GB) fits fully in 72 GB of VRAM with a long context: 73 tok/s at 12.8k tokens of context, 41 tok/s at 93.7k. The measured machine was rented, so the platform here is our suggestion: a server board gives every card enough lanes. Three 350 W cards need a big PSU; many owners power-limit them.
  • NVIDIA DGX Spark, 128 GB

    Presupuesto
    Gama alta
    Memoria gráfica
    ≈128 GB
    RAM
    ≈128 GB
    Precio
    3.999 US$
    Componentes
    • GPU: NVIDIA GB10 (integrated Blackwell)
    • CPU: Arm CPU of the GB10
    • Placa base: NVIDIA DGX Spark
    • RAM: 128 GB LPDDR5X unified
    • Fuente de alimentación: built-in
    Ejecuta
    Notas
    A CUDA box with 128 GB of unified memory at 273 GB/s: the same speed class as Strix Halo, with the NVIDIA software stack. Early llama.cpp builds gave ~35 tok/s on gpt-oss-120b; the figure is after the November 2025 update (llama-bench tg128).
  • Mac Studio, M2/M3 Ultra

    Presupuesto
    Gama alta
    Memoria gráfica
    ≈192 GB
    RAM
    ≈192 GB
    Componentes
    • GPU: Apple M2 Ultra 76-core / M3 Ultra 80-core GPU
    • CPU: Apple M2 Ultra / M3 Ultra
    • Placa base: Mac Studio
    • RAM: 192–512 GB unified (800–819 GB/s)
    • Fuente de alimentación: built-in
    Notas
    The simplest way to run the biggest models at home: the M3 Ultra goes up to 512 GB of unified memory, enough for DeepSeek-class MoE models at 4 bits. Prompt processing is much slower than on NVIDIA GPUs. For very large models raise the GPU memory limit with sysctl iogpu.wired_limit_mb.

Las velocidades medidas enlazan a su fuente; ≈ indica una estimación a partir del ancho de banda de la memoria. Los precios son aproximados.

Actualizado · Fuentes: github.com , www.hardware-corner.net , carteakey.dev , github.crookster.org , hardware-corner.net , digitalspaceport.com , quozul.dev

Insertar en tu sitio

Pega este código donde deba aparecer la infografía: se actualiza sola. Uso gratuito — conserva el enlace de atribución.

JSON Nuestros datos: CC BY 4.0 con enlace a la fuente; los datos de terceros mantienen la licencia de su fuente.

Equipos completos para IA local

Estas fichas describen PC pensados para ejecutar modelos de 20B a 120B en casa, ordenados en tres grupos de presupuesto. En “Económica” hay una tarjeta gráfica de 16 GB, una RTX 3090 de segunda mano o una GPU con mucha RAM para la descarga MoE. En “Gama media” aparecen dos RTX 3090, un servidor EPYC usado con DDR4 de 8 canales y un mini-PC AMD Strix Halo. “Gama alta” va de tres RTX 3090 a NVIDIA DGX Spark y un Mac Studio con M2/M3 Ultra.

Cada ficha recoge memoria gráfica, RAM, precio aproximado y componentes: GPU, CPU, placa base, RAM, fuente de alimentación y líneas PCIe. Después indica qué modelos ejecuta y a qué velocidad. Cada velocidad está medida, con enlace a la fuente y su fecha, o estimada a partir del ancho de banda y marcada con ≈.

El orden para elegir

  • Primero, el tamaño de los modelos que quieres usar, porque fija la memoria.
  • Después, la velocidad que te basta, que depende del ancho de banda de memoria.
  • Al final, ruido, consumo y precio.

Las tarjetas gráficas van rápidas mientras el modelo quepa entero en su memoria. Los equipos de memoria unificada, como Mac, Strix Halo o DGX Spark, cargan modelos más grandes pero generan más despacio. Los servidores de CPU alojan modelos MoE enormes por poco dinero, aunque ahí solo resulta práctico el MoE.

Dos ideas equivocadas

Más tarjetas no significan más velocidad. Con llama.cpp las capas se reparten entre las GPU, que trabajan una tras otra: una segunda o tercera RTX 3090 te deja cargar un modelo mayor, pero la velocidad se mantiene cerca de la de una sola tarjeta. La descarga MoE (--n-cpu-moe), en cambio, deja las capas compartidas en la GPU y lleva los expertos a la RAM del sistema; funciona bien, pero solo con modelos MoE, y la velocidad de la RAM importa mucho.

Los precios son orientativos y cambian, sobre todo en el mercado de segunda mano. Una ejecución medida usó su propia versión del motor y sus ajustes, así que tu resultado puede variar. Además necesitarás un programa de apps de IA local y un archivo de modelo con la cuantización adecuada, explicado en tipos de modelos de IA.