Qué modelo abierto cabe en tu hardware — 2026
Modelos de pesos abiertos frente a tarjetas gráficas y ordenadores populares: la cuantización recomendada (la mayor hasta Q8 que aún da 10 o más tokens por segundo; si no, una de clase Q4; por debajo de Q3 solo cuando no cabe nada más), dónde se ejecuta (memoria gráfica, memoria unificada o descargada a la RAM) y una velocidad de generación aproximada.
| Modelo | Parámetros | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈84 tok/s Cabe en la memoria gráfica | Q8_0≈67 tok/s Cabe en la memoria gráfica | Q8_0≈218 tok/s Cabe en la memoria gráfica | Q8_0≈235 tok/s Cabe en la memoria gráfica | Q8_0≈417 tok/s Cabe en la memoria gráfica | Q8_0≈417 tok/s Cabe en la memoria gráfica | Q8_0≈168 tok/s Cabe en la memoria gráfica | Q8_0≈136 tok/s Cabe en la memoria gráfica | Q8_0≈115 tok/s Cabe en la memoria gráfica | Q8_0≈111 tok/s Cabe en la memoria unificada | Q8_0≈167 tok/s Cabe en la memoria unificada | Q8_0≈52 tok/s Cabe en la memoria unificada | Q8_0≈56 tok/s Cabe en la memoria unificada | Q8_0≈15,0 tok/s Cabe en la RAM (CPU) | Q8_0≈34 tok/s Cabe en la RAM (CPU) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈74 tok/s Cabe en la memoria gráfica | Q8_0≈59 tok/s Cabe en la memoria gráfica | Q8_0≈192 tok/s Cabe en la memoria gráfica | Q8_0≈207 tok/s Cabe en la memoria gráfica | Q8_0≈368 tok/s Cabe en la memoria gráfica | Q8_0≈368 tok/s Cabe en la memoria gráfica | Q8_0≈148 tok/s Cabe en la memoria gráfica | Q8_0≈120 tok/s Cabe en la memoria gráfica | Q8_0≈101 tok/s Cabe en la memoria gráfica | Q8_0≈98 tok/s Cabe en la memoria unificada | Q8_0≈147 tok/s Cabe en la memoria unificada | Q8_0≈46 tok/s Cabe en la memoria unificada | Q8_0≈49 tok/s Cabe en la memoria unificada | Q8_0≈14,3 tok/s Cabe en la RAM (CPU) | Q8_0≈32 tok/s Cabe en la RAM (CPU) |
| Gemma 3 4B HF | 4.3B | Q8_0≈67 tok/s Cabe en la memoria gráfica | Q8_0≈54 tok/s Cabe en la memoria gráfica | Q8_0≈175 tok/s Cabe en la memoria gráfica | Q8_0≈189 tok/s Cabe en la memoria gráfica | Q8_0≈335 tok/s Cabe en la memoria gráfica | Q8_0≈335 tok/s Cabe en la memoria gráfica | Q8_0≈135 tok/s Cabe en la memoria gráfica | Q8_0≈109 tok/s Cabe en la memoria gráfica | Q8_0≈92 tok/s Cabe en la memoria gráfica | Q8_0≈89 tok/s Cabe en la memoria unificada | Q8_0≈134 tok/s Cabe en la memoria unificada | Q8_0≈42 tok/s Cabe en la memoria unificada | Q8_0≈45 tok/s Cabe en la memoria unificada | Q8_0≈13,8 tok/s Cabe en la RAM (CPU) | Q8_0≈31 tok/s Cabe en la RAM (CPU) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈37 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈29 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈95 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈103 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈182 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈182 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈73 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈59 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈50 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈49 tok/s Cabe en la memoria unificada | UD-Q6_K_XL≈73 tok/s Cabe en la memoria unificada | UD-Q6_K_XL≈23 tok/s Cabe en la memoria unificada | UD-Q6_K_XL≈24 tok/s Cabe en la memoria unificada | UD-Q6_K_XL≈10,3 tok/s Cabe en la RAM (CPU) | UD-Q6_K_XL≈23 tok/s Cabe en la RAM (CPU) |
| Qwen3 8B HF | 8.2B | Q8_0≈31 tok/s Cabe en la memoria gráfica | Q8_0≈25 tok/s Cabe en la memoria gráfica | Q8_0≈80 tok/s Cabe en la memoria gráfica | Q8_0≈87 tok/s Cabe en la memoria gráfica | Q8_0≈154 tok/s Cabe en la memoria gráfica | Q8_0≈154 tok/s Cabe en la memoria gráfica | Q8_0≈62 tok/s Cabe en la memoria gráfica | Q8_0≈50 tok/s Cabe en la memoria gráfica | Q8_0≈42 tok/s Cabe en la memoria gráfica | Q8_0≈41 tok/s Cabe en la memoria unificada | Q8_0≈62 tok/s Cabe en la memoria unificada | Q8_0≈19,2 tok/s Cabe en la memoria unificada | Q8_0≈21 tok/s Cabe en la memoria unificada | UD-Q6_K_XL≈10,2 tok/s Cabe en la RAM (CPU) | Q8_0≈21 tok/s Cabe en la RAM (CPU) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈32 tok/s Cabe en la memoria gráfica | Q8_0≈17,8 tok/s Cabe en la memoria gráfica | Q8_0≈58 tok/s Cabe en la memoria gráfica | Q8_0≈62 tok/s Cabe en la memoria gráfica | Q8_0≈111 tok/s Cabe en la memoria gráfica | Q8_0≈111 tok/s Cabe en la memoria gráfica | Q8_0≈44 tok/s Cabe en la memoria gráfica | Q8_0≈36 tok/s Cabe en la memoria gráfica | Q8_0≈30 tok/s Cabe en la memoria gráfica | Q8_0≈30 tok/s Cabe en la memoria unificada | Q8_0≈44 tok/s Cabe en la memoria unificada | Q8_0≈13,8 tok/s Cabe en la memoria unificada | Q8_0≈14,8 tok/s Cabe en la memoria unificada | Q4_1≈10,2 tok/s Cabe en la RAM (CPU) | Q8_0≈17,1 tok/s Cabe en la RAM (CPU) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈30 tok/s Cabe en la memoria gráfica | Q6_K≈18,0 tok/s Cabe en la memoria gráfica | Q8_0≈46 tok/s Cabe en la memoria gráfica | Q8_0≈49 tok/s Cabe en la memoria gráfica | Q8_0≈88 tok/s Cabe en la memoria gráfica | Q8_0≈88 tok/s Cabe en la memoria gráfica | Q8_0≈35 tok/s Cabe en la memoria gráfica | Q8_0≈29 tok/s Cabe en la memoria gráfica | Q8_0≈24 tok/s Cabe en la memoria gráfica | Q8_0≈23 tok/s Cabe en la memoria unificada | Q8_0≈35 tok/s Cabe en la memoria unificada | Q8_0≈10,9 tok/s Cabe en la memoria unificada | Q8_0≈11,7 tok/s Cabe en la memoria unificada | UD-Q3_K_XL≈10,1 tok/s Cabe en la RAM (CPU) | Q8_0≈14,6 tok/s Cabe en la RAM (CPU) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈53 tok/s Funciona con descarga a la RAM | MXFP4≈55 tok/s Cabe en la memoria gráfica | MXFP4162 tok/smedido Cabe en la memoria gráfica | MXFP4≈194 tok/s Cabe en la memoria gráfica | MXFP4≈344 tok/s Cabe en la memoria gráfica | MXFP4≈344 tok/s Cabe en la memoria gráfica | MXFP4≈138 tok/s Cabe en la memoria gráfica | MXFP4≈112 tok/s Cabe en la memoria gráfica | MXFP4≈95 tok/s Cabe en la memoria gráfica | MXFP4≈80 tok/s Cabe en la memoria unificada | MXFP4116 tok/smedido Cabe en la memoria unificada | MXFP4≈59 tok/s Cabe en la memoria unificada | MXFP4≈62 tok/s Cabe en la memoria unificada | MXFP4≈17,2 tok/s Cabe en la RAM (CPU) | MXFP4≈39 tok/s Cabe en la RAM (CPU) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈10,2 tok/s Funciona con descarga a la RAM | UD-Q3_K_XL≈18,4 tok/s Cabe en la memoria gráfica | Q6_K≈37 tok/s Cabe en la memoria gráfica | Q6_K≈40 tok/s Cabe en la memoria gráfica | Q8_0≈56 tok/s Cabe en la memoria gráfica | Q8_0≈56 tok/s Cabe en la memoria gráfica | Q8_0≈22 tok/s Cabe en la memoria gráfica | Q8_0≈18,2 tok/s Cabe en la memoria gráfica | Q8_0≈15,3 tok/s Cabe en la memoria gráfica | Q8_0≈14,9 tok/s Cabe en la memoria unificada | Q8_0≈22 tok/s Cabe en la memoria unificada | Q5_K_M≈10,3 tok/s Cabe en la memoria unificada | Q5_K_M≈11,0 tok/s Cabe en la memoria unificada | Q4_K_M≈6,9 tok/s Cabe en la RAM (CPU) | Q8_0≈10,3 tok/s Cabe en la RAM (CPU) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈14,7 tok/s Funciona con descarga a la RAM | UD-Q3_K_M≈56 tok/s Cabe en la memoria gráfica | UD-Q5_K_S≈129 tok/s Cabe en la memoria gráfica | UD-Q5_K_S≈139 tok/s Cabe en la memoria gráfica | UD-Q8_K_XL≈173 tok/s Cabe en la memoria gráfica | UD-Q8_K_XL≈173 tok/s Cabe en la memoria gráfica | UD-Q8_K_XL≈70 tok/s Cabe en la memoria gráfica | UD-Q8_K_XL≈57 tok/s Cabe en la memoria gráfica | UD-Q8_K_XL≈48 tok/s Cabe en la memoria gráfica | UD-Q8_K_XL≈40 tok/s Cabe en la memoria unificada | UD-Q8_K_XL≈60 tok/s Cabe en la memoria unificada | UD-Q8_K_XL≈29 tok/s Cabe en la memoria unificada | UD-Q8_K_XL≈31 tok/s Cabe en la memoria unificada | UD-Q8_K_XL≈13,7 tok/s Cabe en la RAM (CPU) | UD-Q8_K_XL≈31 tok/s Cabe en la RAM (CPU) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈12,7 tok/s Funciona con descarga a la RAM | Q3_K_S≈18,1 tok/s Cabe en la memoria gráfica | UD-Q5_K_XL≈38 tok/s Cabe en la memoria gráfica | UD-Q5_K_XL≈41 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈59 tok/s Cabe en la memoria gráfica | Q8_0≈49 tok/s Cabe en la memoria gráfica | Q8_0≈19,7 tok/s Cabe en la memoria gráfica | Q8_0≈16,0 tok/s Cabe en la memoria gráfica | Q8_0≈13,5 tok/s Cabe en la memoria gráfica | Q8_0≈13,1 tok/s Cabe en la memoria unificada | Q8_0≈19,6 tok/s Cabe en la memoria unificada | Q4_1≈10,1 tok/s Cabe en la memoria unificada | Q4_1≈10,8 tok/s Cabe en la memoria unificada | Q4_K_M≈6,3 tok/s Cabe en la RAM (CPU) | UD-Q6_K_XL≈10,8 tok/s Cabe en la RAM (CPU) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈16,4 tok/s Funciona con descarga a la RAM | Q3_K_S≈66 tok/s Cabe en la memoria gráfica | Q4_K_M154 tok/smedido Cabe en la memoria gráfica | Q5_K_S≈158 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈232 tok/s Cabe en la memoria gráfica | Q8_0≈192 tok/s Cabe en la memoria gráfica | Q8_0≈77 tok/s Cabe en la memoria gráfica | Q8_0≈63 tok/s Cabe en la memoria gráfica | Q8_0≈53 tok/s Cabe en la memoria gráfica | Q8_0≈45 tok/s Cabe en la memoria unificada | Q8_0≈67 tok/s Cabe en la memoria unificada | Q8_0≈33 tok/s Cabe en la memoria unificada | Q8_0≈35 tok/s Cabe en la memoria unificada | Q8_0≈14,3 tok/s Cabe en la RAM (CPU) | Q8_0≈32 tok/s Cabe en la RAM (CPU) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈3,8 tok/s Funciona con descarga a la RAM | Q3_K_S≈10,4 tok/s Funciona con descarga a la RAM | Q4_1≈37 tok/s Cabe en la memoria gráfica | Q4_1≈40 tok/s Cabe en la memoria gráfica | Q6_K≈55 tok/s Cabe en la memoria gráfica | Q8_0≈43 tok/s Cabe en la memoria gráfica | Q8_0≈17,1 tok/s Cabe en la memoria gráfica | Q8_0≈13,9 tok/s Cabe en la memoria gráfica | Q8_0≈11,7 tok/s Cabe en la memoria gráfica | Q8_0≈11,3 tok/s Cabe en la memoria unificada | Q8_0≈17,0 tok/s Cabe en la memoria unificada | IQ4_XS≈10,3 tok/s Cabe en la memoria unificada | Q4_K_S≈10,3 tok/s Cabe en la memoria unificada | Q4_K_M≈5,7 tok/s Cabe en la RAM (CPU) | Q6_K≈10,1 tok/s Cabe en la RAM (CPU) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈3,7 tok/s Funciona con descarga a la RAM | UD-IQ3_XXS≈14,1 tok/s Funciona con descarga a la RAM | UD-Q4_K_XL≈35 tok/s Cabe en la memoria gráfica | UD-Q4_K_XL≈38 tok/s Cabe en la memoria gráfica | Q6_K≈51 tok/s Cabe en la memoria gráfica | Q8_0≈40 tok/s Cabe en la memoria gráfica | Q8_0≈16,0 tok/s Cabe en la memoria gráfica | Q8_0≈13,0 tok/s Cabe en la memoria gráfica | Q8_0≈11,0 tok/s Cabe en la memoria gráfica | Q8_0≈10,6 tok/s Cabe en la memoria unificada | Q8_0≈16,0 tok/s Cabe en la memoria unificada | UD-Q3_K_XL≈10,3 tok/s Cabe en la memoria unificada | IQ4_XS≈10,2 tok/s Cabe en la memoria unificada | Q4_K_M≈5,4 tok/s Cabe en la RAM (CPU) | Q5_K_M≈10,8 tok/s Cabe en la RAM (CPU) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈17,9 tok/s Funciona con descarga a la RAM | Q8_0≈18,7 tok/s Funciona con descarga a la RAM | Q4_K_S≈191 tok/s Cabe en la memoria gráfica | Q4_K_S≈205 tok/s Cabe en la memoria gráfica | Q6_K≈274 tok/s Cabe en la memoria gráfica | Q8_0≈220 tok/s Cabe en la memoria gráfica | Q8_0≈89 tok/s Cabe en la memoria gráfica | Q8_0≈72 tok/s Cabe en la memoria gráfica | Q8_0≈61 tok/s Cabe en la memoria gráfica | Q8_0≈51 tok/s Cabe en la memoria unificada | Q8_0≈77 tok/s Cabe en la memoria unificada | Q8_0≈37 tok/s Cabe en la memoria unificada | Q8_0≈40 tok/s Cabe en la memoria unificada | Q8_0≈15,0 tok/s Cabe en la RAM (CPU) | Q8_0≈34 tok/s Cabe en la RAM (CPU) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈1,3 tok/s Funciona con descarga a la RAM | Q4_K_M≈1,4 tok/s Funciona con descarga a la RAM | Q4_K_M≈2,0 tok/s Funciona con descarga a la RAM | Q4_K_M≈2,0 tok/s Funciona con descarga a la RAM | UD-IQ3_XXS≈49 tok/s Cabe en la memoria gráfica | Q8_0≈18,8 tok/s Cabe en la memoria gráfica | Q4_K_M16,3 tok/smedido Cabe en la memoria gráfica | Q4_1≈10,3 tok/s Cabe en la memoria gráfica | IQ4_XS≈10,0 tok/s Cabe en la memoria gráfica | UD-Q3_K_XL≈10,6 tok/s Cabe en la memoria unificada | Q5_K_M≈11,2 tok/s Cabe en la memoria unificada | Q4_K_M≈4,1 tok/s Cabe en la memoria unificada | Q4_K_M≈4,4 tok/s Cabe en la memoria unificada | Q4_K_M≈2,9 tok/s Cabe en la RAM (CPU) | Q4_K_M≈6,6 tok/s Cabe en la RAM (CPU) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈24 tok/s Funciona con descarga a la RAM | Q6_K≈21 tok/s Funciona con descarga a la RAM | UD-Q6_K_XL≈26 tok/s Funciona con descarga a la RAM | UD-Q6_K_XL≈26 tok/s Funciona con descarga a la RAM | UD-Q6_K_XL≈31 tok/s Funciona con descarga a la RAM | Q8_0≈213 tok/s Cabe en la memoria gráfica | Q4_K_S≈145 tok/s Cabe en la memoria gráfica | UD-Q6_K_XL≈84 tok/s Cabe en la memoria gráfica | Q8_0≈59 tok/s Cabe en la memoria gráfica | Q8_0≈49 tok/s Cabe en la memoria unificada | Q8_0≈74 tok/s Cabe en la memoria unificada | Q8_0≈36 tok/s Cabe en la memoria unificada | Q8_0≈39 tok/s Cabe en la memoria unificada | Q8_0≈14,8 tok/s Cabe en la RAM (CPU) | Q8_0≈33 tok/s Cabe en la RAM (CPU) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈5,3 tok/s Funciona con descarga a la RAM | Q4_K_S≈5,1 tok/s Funciona con descarga a la RAM | Q4_K_M≈5,6 tok/s Funciona con descarga a la RAM | Q4_K_M≈5,7 tok/s Funciona con descarga a la RAM | Q3_K_M≈10,2 tok/s Funciona con descarga a la RAM | Q5_K_M≈55 tok/s Cabe en la memoria gráfica | Q4_0≈10,0 tok/s Funciona con descarga a la RAM | UD-Q4_K_XL≈22 tok/s Cabe en la memoria gráfica | Q5_K_M≈15,2 tok/s Cabe en la memoria gráfica | Q5_K_M≈12,8 tok/s Cabe en la memoria unificada | Q8_0≈13,9 tok/s Cabe en la memoria unificada | Q4_K_M≈10,6 tok/s Cabe en la memoria unificada | Q5_K_M≈10,0 tok/s Cabe en la memoria unificada | Q4_K_M≈8,0 tok/s Cabe en la RAM (CPU) | Q8_0≈13,1 tok/s Cabe en la RAM (CPU) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈19,1 tok/s Funciona con descarga a la RAM | MXFP4≈19,6 tok/s Funciona con descarga a la RAM | MXFP426–28 tok/smedido Funciona con descarga a la RAM | MXFP4≈25 tok/s Funciona con descarga a la RAM | MXFP4≈31 tok/s Funciona con descarga a la RAM | MXFP4≈258 tok/s Cabe en la memoria gráfica | MXFP4≈36 tok/s Funciona con descarga a la RAM | MXFP441–73 tok/smedido Cabe en la memoria gráfica | MXFP4≈71 tok/s Cabe en la memoria gráfica | MXFP4≈60 tok/s Cabe en la memoria unificada | MXFP4≈90 tok/s Cabe en la memoria unificada | MXFP450 tok/smedido Cabe en la memoria unificada | MXFP461 tok/smedido Cabe en la memoria unificada | MXFP4≈15,8 tok/s Cabe en la RAM (CPU) | MXFP4≈36 tok/s Cabe en la RAM (CPU) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈10,5 tok/s Funciona con descarga a la RAM | UD-IQ4_NL≈10,8 tok/s Funciona con descarga a la RAM | Q4_K_S≈11,1 tok/s Funciona con descarga a la RAM | Q4_K_S≈11,2 tok/s Funciona con descarga a la RAM | UD-Q4_K_XL≈11,9 tok/s Funciona con descarga a la RAM | UD-Q5_K_XL≈97 tok/s Cabe en la memoria gráfica | UD-IQ3_XXS≈76 tok/s Cabe en la memoria gráfica | UD-IQ4_NL≈46 tok/s Cabe en la memoria gráfica | UD-Q5_K_XL≈27 tok/s Cabe en la memoria gráfica | UD-Q5_K_XL≈23 tok/s Cabe en la memoria unificada | Q8_0≈24 tok/s Cabe en la memoria unificada | Q6_K≈15,1 tok/s Cabe en la memoria unificada | Q6_K≈16,1 tok/s Cabe en la memoria unificada | UD-Q5_K_XL≈10,4 tok/s Cabe en la RAM (CPU) | Q8_0≈19,3 tok/s Cabe en la RAM (CPU) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | UD-Q4_K_XL≈10,8 tok/s Funciona con descarga a la RAM | UD-Q2_K_XL≈8,0 tok/scompresión fuerte Funciona con descarga a la RAM | Q3_K_M≈6,1 tok/s Funciona con descarga a la RAM | UD-Q3_K_XL≈11,7 tok/s Funciona con descarga a la RAM | UD-Q2_K_XL≈19,4 tok/scompresión fuerte Cabe en la memoria unificada | Q8_0≈10,8 tok/s Cabe en la memoria unificada | UD-Q3_K_XL≈12,2 tok/s Cabe en la memoria unificada | UD-Q3_K_XL≈13,0 tok/s Cabe en la memoria unificada | Q4_K_M≈7,2 tok/s Cabe en la RAM (CPU) | Q8_0≈10,9 tok/s Cabe en la RAM (CPU) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | UD-IQ3_XXS≈7,3 tok/s Funciona con descarga a la RAM | UD-IQ1_S≈5,6 tok/scompresión fuerte Funciona con descarga a la RAM | UD-IQ2_XXS≈4,7 tok/scompresión fuerte Funciona con descarga a la RAM | UD-IQ3_XXS≈3,5 tok/s Funciona con descarga a la RAM | UD-TQ1_0≈16,2 tok/scompresión fuerte Cabe en la memoria unificada | Q4_1≈10,0 tok/s Cabe en la memoria unificada | UD-IQ1_M≈9,6 tok/scompresión fuerte Cabe en la memoria unificada | UD-IQ1_M≈10,3 tok/scompresión fuerte Cabe en la memoria unificada | Q4_K_M≈4,7 tok/s Cabe en la RAM (CPU) | Q4_1≈10,2 tok/s Cabe en la RAM (CPU) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | UD-IQ1_S≈16,9 tok/scompresión fuerte Funciona con descarga a la RAM | ✕ No cabe | ✕ No cabe | UD-IQ1_S≈8,0 tok/scompresión fuerte Funciona con descarga a la RAM | ✕ No cabe | Q3_K_M≈14,9 tok/s Cabe en la memoria unificada | ✕ No cabe | ✕ No cabe | Q4_K_M≈5,2 tok/s Cabe en la RAM (CPU) | Q3_K_M≈13,9 tok/s Cabe en la RAM (CPU) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | ✕ No cabe | UD-Q2_K_XL≈22 tok/scompresión fuerte Cabe en la memoria unificada | ✕ No cabe | ✕ No cabe | Q3_K_S≈7,2 tok/s Cabe en la RAM (CPU) | UD-IQ2_XXS≈19,7 tok/scompresión fuerte Cabe en la RAM (CPU) |
Calculadora: ¿cabrá?
Qué se desbloquea con cada tamaño de memoria (contexto 8K)
- 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B compresión fuerte: Gemma 3 12B · Qwen3 14B
- 12 GB Gemma 3 12B · Qwen3 14B compresión fuerte: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B compresión fuerte: Gemma 4 31B · Qwen3.5 35B A3B
- 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B compresión fuerte: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B compresión fuerte: GLM 4.5 Air
- 96 GB GLM 4.5 Air · gpt-oss-120b compresión fuerte: Qwen3 235B A22B · GLM 4.7
- 128 GB Qwen3 235B A22B
- 192 GB GLM 4.7 compresión fuerte: DeepSeek R1
- 256 GB compresión fuerte: Kimi K2.5
- 512 GB DeepSeek R1 · Kimi K2.5
≈ estimaciones para un contexto de 8K: pesos + caché KV + sobrecarga del runtime frente a la memoria; velocidad a partir del ancho de banda de la memoria. Las cifras reales dependen del runtime y de los ajustes.
Actualizado · Fuentes: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
Insertar en tu sitio
Pega este código donde deba aparecer la infografía: se actualiza sola. Uso gratuito — conserva el enlace de atribución.
¿Qué muestra la matriz?
En las filas, modelos conocidos de pesos abiertos, desde unos 3B hasta 1T de parámetros; en las columnas, tarjetas gráficas, configuraciones con varias GPU, equipos Apple y AMD con memoria unificada y servidores de CPU. Cada celda indica la cuantización recomendada, dónde queda el modelo y una velocidad aproximada de generación en tokens por segundo. Debajo hay una calculadora y una escalera que enseña qué se abre con 8, 12, 16, 24, 48, 96 y 128 GB de memoria.
¿Cómo se calcula la memoria?
- Pesos: parámetros por bits por peso, o el tamaño real del archivo GGUF.
- Caché KV: crece con el contexto. La matriz usa 8192 tokens; en la calculadora puedes cambiarlo, y un contexto largo puede ocupar tanta VRAM como un modelo pequeño.
- Sobrecarga: alrededor de 1,5 GB para el entorno de ejecución, más el proyector de visión si es un VLM.
“Cabe en la memoria gráfica” es el caso ideal; “Funciona con descarga a la RAM” significa que parte del modelo vive en la memoria del sistema; funciona, pero más despacio.
¿De dónde sale la velocidad?
Al generar, el modelo lee sus pesos de memoria en cada token, de modo que la velocidad es, a grandes rasgos, el ancho de banda de memoria dividido entre los bytes leídos por token. En los modelos MoE solo cuentan los parámetros activos, y por eso un MoE grande puede responder antes que un modelo denso más pequeño.
¿Qué cuantización recomienda?
Hasta Q8_0, la de más bits que todavía da al menos 10 tokens por segundo; si ninguna llega, la clase Q4. Nunca BF16, y nunca por debajo de Q3 salvo que no quepa nada mayor: entonces la celda avisa con “compresión fuerte”.
¿Hasta qué punto son fiables las cifras?
El signo ≈ marca una estimación calibrada con ejecuciones medidas de llama.cpp y de informes públicos; se queda a un ±35% aproximado de ellas. El motor, los controladores y los ajustes cambian el resultado real, y la lectura de un prompt largo no se incluye, solo la generación. Las celdas medidas muestran la medición con enlace a su fuente. Los modelos sin filtros de seguridad quedan ocultos tras un interruptor. Si buscas un equipo completo, mira las configuraciones de PC para IA local.