Welk open model past op jouw hardware — 2026
Open-weightsmodellen tegenover populaire videokaarten en computers: de aanbevolen quantisatie (de grootste tot Q8 die nog 10 of meer tokens per seconde haalt, anders een van klasse Q4; onder Q3 alleen als niets anders past), waar het draait (videogeheugen, gedeeld geheugen of met offload naar RAM) en een geschatte generatiesnelheid.
| Model | Parameters | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈84 tok/s Past in het videogeheugen | Q8_0≈67 tok/s Past in het videogeheugen | Q8_0≈218 tok/s Past in het videogeheugen | Q8_0≈235 tok/s Past in het videogeheugen | Q8_0≈417 tok/s Past in het videogeheugen | Q8_0≈417 tok/s Past in het videogeheugen | Q8_0≈168 tok/s Past in het videogeheugen | Q8_0≈136 tok/s Past in het videogeheugen | Q8_0≈115 tok/s Past in het videogeheugen | Q8_0≈111 tok/s Past in het gedeelde geheugen | Q8_0≈167 tok/s Past in het gedeelde geheugen | Q8_0≈52 tok/s Past in het gedeelde geheugen | Q8_0≈56 tok/s Past in het gedeelde geheugen | Q8_0≈15,0 tok/s Past in het RAM (CPU) | Q8_0≈34 tok/s Past in het RAM (CPU) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈74 tok/s Past in het videogeheugen | Q8_0≈59 tok/s Past in het videogeheugen | Q8_0≈192 tok/s Past in het videogeheugen | Q8_0≈207 tok/s Past in het videogeheugen | Q8_0≈368 tok/s Past in het videogeheugen | Q8_0≈368 tok/s Past in het videogeheugen | Q8_0≈148 tok/s Past in het videogeheugen | Q8_0≈120 tok/s Past in het videogeheugen | Q8_0≈101 tok/s Past in het videogeheugen | Q8_0≈98 tok/s Past in het gedeelde geheugen | Q8_0≈147 tok/s Past in het gedeelde geheugen | Q8_0≈46 tok/s Past in het gedeelde geheugen | Q8_0≈49 tok/s Past in het gedeelde geheugen | Q8_0≈14,3 tok/s Past in het RAM (CPU) | Q8_0≈32 tok/s Past in het RAM (CPU) |
| Gemma 3 4B HF | 4.3B | Q8_0≈67 tok/s Past in het videogeheugen | Q8_0≈54 tok/s Past in het videogeheugen | Q8_0≈175 tok/s Past in het videogeheugen | Q8_0≈189 tok/s Past in het videogeheugen | Q8_0≈335 tok/s Past in het videogeheugen | Q8_0≈335 tok/s Past in het videogeheugen | Q8_0≈135 tok/s Past in het videogeheugen | Q8_0≈109 tok/s Past in het videogeheugen | Q8_0≈92 tok/s Past in het videogeheugen | Q8_0≈89 tok/s Past in het gedeelde geheugen | Q8_0≈134 tok/s Past in het gedeelde geheugen | Q8_0≈42 tok/s Past in het gedeelde geheugen | Q8_0≈45 tok/s Past in het gedeelde geheugen | Q8_0≈13,8 tok/s Past in het RAM (CPU) | Q8_0≈31 tok/s Past in het RAM (CPU) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈37 tok/s Past in het videogeheugen | UD-Q6_K_XL≈29 tok/s Past in het videogeheugen | UD-Q6_K_XL≈95 tok/s Past in het videogeheugen | UD-Q6_K_XL≈103 tok/s Past in het videogeheugen | UD-Q6_K_XL≈182 tok/s Past in het videogeheugen | UD-Q6_K_XL≈182 tok/s Past in het videogeheugen | UD-Q6_K_XL≈73 tok/s Past in het videogeheugen | UD-Q6_K_XL≈59 tok/s Past in het videogeheugen | UD-Q6_K_XL≈50 tok/s Past in het videogeheugen | UD-Q6_K_XL≈49 tok/s Past in het gedeelde geheugen | UD-Q6_K_XL≈73 tok/s Past in het gedeelde geheugen | UD-Q6_K_XL≈23 tok/s Past in het gedeelde geheugen | UD-Q6_K_XL≈24 tok/s Past in het gedeelde geheugen | UD-Q6_K_XL≈10,3 tok/s Past in het RAM (CPU) | UD-Q6_K_XL≈23 tok/s Past in het RAM (CPU) |
| Qwen3 8B HF | 8.2B | Q8_0≈31 tok/s Past in het videogeheugen | Q8_0≈25 tok/s Past in het videogeheugen | Q8_0≈80 tok/s Past in het videogeheugen | Q8_0≈87 tok/s Past in het videogeheugen | Q8_0≈154 tok/s Past in het videogeheugen | Q8_0≈154 tok/s Past in het videogeheugen | Q8_0≈62 tok/s Past in het videogeheugen | Q8_0≈50 tok/s Past in het videogeheugen | Q8_0≈42 tok/s Past in het videogeheugen | Q8_0≈41 tok/s Past in het gedeelde geheugen | Q8_0≈62 tok/s Past in het gedeelde geheugen | Q8_0≈19,2 tok/s Past in het gedeelde geheugen | Q8_0≈21 tok/s Past in het gedeelde geheugen | UD-Q6_K_XL≈10,2 tok/s Past in het RAM (CPU) | Q8_0≈21 tok/s Past in het RAM (CPU) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈32 tok/s Past in het videogeheugen | Q8_0≈17,8 tok/s Past in het videogeheugen | Q8_0≈58 tok/s Past in het videogeheugen | Q8_0≈62 tok/s Past in het videogeheugen | Q8_0≈111 tok/s Past in het videogeheugen | Q8_0≈111 tok/s Past in het videogeheugen | Q8_0≈44 tok/s Past in het videogeheugen | Q8_0≈36 tok/s Past in het videogeheugen | Q8_0≈30 tok/s Past in het videogeheugen | Q8_0≈30 tok/s Past in het gedeelde geheugen | Q8_0≈44 tok/s Past in het gedeelde geheugen | Q8_0≈13,8 tok/s Past in het gedeelde geheugen | Q8_0≈14,8 tok/s Past in het gedeelde geheugen | Q4_1≈10,2 tok/s Past in het RAM (CPU) | Q8_0≈17,1 tok/s Past in het RAM (CPU) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈30 tok/s Past in het videogeheugen | Q6_K≈18,0 tok/s Past in het videogeheugen | Q8_0≈46 tok/s Past in het videogeheugen | Q8_0≈49 tok/s Past in het videogeheugen | Q8_0≈88 tok/s Past in het videogeheugen | Q8_0≈88 tok/s Past in het videogeheugen | Q8_0≈35 tok/s Past in het videogeheugen | Q8_0≈29 tok/s Past in het videogeheugen | Q8_0≈24 tok/s Past in het videogeheugen | Q8_0≈23 tok/s Past in het gedeelde geheugen | Q8_0≈35 tok/s Past in het gedeelde geheugen | Q8_0≈10,9 tok/s Past in het gedeelde geheugen | Q8_0≈11,7 tok/s Past in het gedeelde geheugen | UD-Q3_K_XL≈10,1 tok/s Past in het RAM (CPU) | Q8_0≈14,6 tok/s Past in het RAM (CPU) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈53 tok/s Draait met offload naar RAM | MXFP4≈55 tok/s Past in het videogeheugen | MXFP4162 tok/sgemeten Past in het videogeheugen | MXFP4≈194 tok/s Past in het videogeheugen | MXFP4≈344 tok/s Past in het videogeheugen | MXFP4≈344 tok/s Past in het videogeheugen | MXFP4≈138 tok/s Past in het videogeheugen | MXFP4≈112 tok/s Past in het videogeheugen | MXFP4≈95 tok/s Past in het videogeheugen | MXFP4≈80 tok/s Past in het gedeelde geheugen | MXFP4116 tok/sgemeten Past in het gedeelde geheugen | MXFP4≈59 tok/s Past in het gedeelde geheugen | MXFP4≈62 tok/s Past in het gedeelde geheugen | MXFP4≈17,2 tok/s Past in het RAM (CPU) | MXFP4≈39 tok/s Past in het RAM (CPU) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈10,2 tok/s Draait met offload naar RAM | UD-Q3_K_XL≈18,4 tok/s Past in het videogeheugen | Q6_K≈37 tok/s Past in het videogeheugen | Q6_K≈40 tok/s Past in het videogeheugen | Q8_0≈56 tok/s Past in het videogeheugen | Q8_0≈56 tok/s Past in het videogeheugen | Q8_0≈22 tok/s Past in het videogeheugen | Q8_0≈18,2 tok/s Past in het videogeheugen | Q8_0≈15,3 tok/s Past in het videogeheugen | Q8_0≈14,9 tok/s Past in het gedeelde geheugen | Q8_0≈22 tok/s Past in het gedeelde geheugen | Q5_K_M≈10,3 tok/s Past in het gedeelde geheugen | Q5_K_M≈11,0 tok/s Past in het gedeelde geheugen | Q4_K_M≈6,9 tok/s Past in het RAM (CPU) | Q8_0≈10,3 tok/s Past in het RAM (CPU) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈14,7 tok/s Draait met offload naar RAM | UD-Q3_K_M≈56 tok/s Past in het videogeheugen | UD-Q5_K_S≈129 tok/s Past in het videogeheugen | UD-Q5_K_S≈139 tok/s Past in het videogeheugen | UD-Q8_K_XL≈173 tok/s Past in het videogeheugen | UD-Q8_K_XL≈173 tok/s Past in het videogeheugen | UD-Q8_K_XL≈70 tok/s Past in het videogeheugen | UD-Q8_K_XL≈57 tok/s Past in het videogeheugen | UD-Q8_K_XL≈48 tok/s Past in het videogeheugen | UD-Q8_K_XL≈40 tok/s Past in het gedeelde geheugen | UD-Q8_K_XL≈60 tok/s Past in het gedeelde geheugen | UD-Q8_K_XL≈29 tok/s Past in het gedeelde geheugen | UD-Q8_K_XL≈31 tok/s Past in het gedeelde geheugen | UD-Q8_K_XL≈13,7 tok/s Past in het RAM (CPU) | UD-Q8_K_XL≈31 tok/s Past in het RAM (CPU) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈12,7 tok/s Draait met offload naar RAM | Q3_K_S≈18,1 tok/s Past in het videogeheugen | UD-Q5_K_XL≈38 tok/s Past in het videogeheugen | UD-Q5_K_XL≈41 tok/s Past in het videogeheugen | UD-Q6_K_XL≈59 tok/s Past in het videogeheugen | Q8_0≈49 tok/s Past in het videogeheugen | Q8_0≈19,7 tok/s Past in het videogeheugen | Q8_0≈16,0 tok/s Past in het videogeheugen | Q8_0≈13,5 tok/s Past in het videogeheugen | Q8_0≈13,1 tok/s Past in het gedeelde geheugen | Q8_0≈19,6 tok/s Past in het gedeelde geheugen | Q4_1≈10,1 tok/s Past in het gedeelde geheugen | Q4_1≈10,8 tok/s Past in het gedeelde geheugen | Q4_K_M≈6,3 tok/s Past in het RAM (CPU) | UD-Q6_K_XL≈10,8 tok/s Past in het RAM (CPU) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈16,4 tok/s Draait met offload naar RAM | Q3_K_S≈66 tok/s Past in het videogeheugen | Q4_K_M154 tok/sgemeten Past in het videogeheugen | Q5_K_S≈158 tok/s Past in het videogeheugen | UD-Q6_K_XL≈232 tok/s Past in het videogeheugen | Q8_0≈192 tok/s Past in het videogeheugen | Q8_0≈77 tok/s Past in het videogeheugen | Q8_0≈63 tok/s Past in het videogeheugen | Q8_0≈53 tok/s Past in het videogeheugen | Q8_0≈45 tok/s Past in het gedeelde geheugen | Q8_0≈67 tok/s Past in het gedeelde geheugen | Q8_0≈33 tok/s Past in het gedeelde geheugen | Q8_0≈35 tok/s Past in het gedeelde geheugen | Q8_0≈14,3 tok/s Past in het RAM (CPU) | Q8_0≈32 tok/s Past in het RAM (CPU) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈3,8 tok/s Draait met offload naar RAM | Q3_K_S≈10,4 tok/s Draait met offload naar RAM | Q4_1≈37 tok/s Past in het videogeheugen | Q4_1≈40 tok/s Past in het videogeheugen | Q6_K≈55 tok/s Past in het videogeheugen | Q8_0≈43 tok/s Past in het videogeheugen | Q8_0≈17,1 tok/s Past in het videogeheugen | Q8_0≈13,9 tok/s Past in het videogeheugen | Q8_0≈11,7 tok/s Past in het videogeheugen | Q8_0≈11,3 tok/s Past in het gedeelde geheugen | Q8_0≈17,0 tok/s Past in het gedeelde geheugen | IQ4_XS≈10,3 tok/s Past in het gedeelde geheugen | Q4_K_S≈10,3 tok/s Past in het gedeelde geheugen | Q4_K_M≈5,7 tok/s Past in het RAM (CPU) | Q6_K≈10,1 tok/s Past in het RAM (CPU) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈3,7 tok/s Draait met offload naar RAM | UD-IQ3_XXS≈14,1 tok/s Draait met offload naar RAM | UD-Q4_K_XL≈35 tok/s Past in het videogeheugen | UD-Q4_K_XL≈38 tok/s Past in het videogeheugen | Q6_K≈51 tok/s Past in het videogeheugen | Q8_0≈40 tok/s Past in het videogeheugen | Q8_0≈16,0 tok/s Past in het videogeheugen | Q8_0≈13,0 tok/s Past in het videogeheugen | Q8_0≈11,0 tok/s Past in het videogeheugen | Q8_0≈10,6 tok/s Past in het gedeelde geheugen | Q8_0≈16,0 tok/s Past in het gedeelde geheugen | UD-Q3_K_XL≈10,3 tok/s Past in het gedeelde geheugen | IQ4_XS≈10,2 tok/s Past in het gedeelde geheugen | Q4_K_M≈5,4 tok/s Past in het RAM (CPU) | Q5_K_M≈10,8 tok/s Past in het RAM (CPU) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈17,9 tok/s Draait met offload naar RAM | Q8_0≈18,7 tok/s Draait met offload naar RAM | Q4_K_S≈191 tok/s Past in het videogeheugen | Q4_K_S≈205 tok/s Past in het videogeheugen | Q6_K≈274 tok/s Past in het videogeheugen | Q8_0≈220 tok/s Past in het videogeheugen | Q8_0≈89 tok/s Past in het videogeheugen | Q8_0≈72 tok/s Past in het videogeheugen | Q8_0≈61 tok/s Past in het videogeheugen | Q8_0≈51 tok/s Past in het gedeelde geheugen | Q8_0≈77 tok/s Past in het gedeelde geheugen | Q8_0≈37 tok/s Past in het gedeelde geheugen | Q8_0≈40 tok/s Past in het gedeelde geheugen | Q8_0≈15,0 tok/s Past in het RAM (CPU) | Q8_0≈34 tok/s Past in het RAM (CPU) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈1,3 tok/s Draait met offload naar RAM | Q4_K_M≈1,4 tok/s Draait met offload naar RAM | Q4_K_M≈2,0 tok/s Draait met offload naar RAM | Q4_K_M≈2,0 tok/s Draait met offload naar RAM | UD-IQ3_XXS≈49 tok/s Past in het videogeheugen | Q8_0≈18,8 tok/s Past in het videogeheugen | Q4_K_M16,3 tok/sgemeten Past in het videogeheugen | Q4_1≈10,3 tok/s Past in het videogeheugen | IQ4_XS≈10,0 tok/s Past in het videogeheugen | UD-Q3_K_XL≈10,6 tok/s Past in het gedeelde geheugen | Q5_K_M≈11,2 tok/s Past in het gedeelde geheugen | Q4_K_M≈4,1 tok/s Past in het gedeelde geheugen | Q4_K_M≈4,4 tok/s Past in het gedeelde geheugen | Q4_K_M≈2,9 tok/s Past in het RAM (CPU) | Q4_K_M≈6,6 tok/s Past in het RAM (CPU) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈24 tok/s Draait met offload naar RAM | Q6_K≈21 tok/s Draait met offload naar RAM | UD-Q6_K_XL≈26 tok/s Draait met offload naar RAM | UD-Q6_K_XL≈26 tok/s Draait met offload naar RAM | UD-Q6_K_XL≈31 tok/s Draait met offload naar RAM | Q8_0≈213 tok/s Past in het videogeheugen | Q4_K_S≈145 tok/s Past in het videogeheugen | UD-Q6_K_XL≈84 tok/s Past in het videogeheugen | Q8_0≈59 tok/s Past in het videogeheugen | Q8_0≈49 tok/s Past in het gedeelde geheugen | Q8_0≈74 tok/s Past in het gedeelde geheugen | Q8_0≈36 tok/s Past in het gedeelde geheugen | Q8_0≈39 tok/s Past in het gedeelde geheugen | Q8_0≈14,8 tok/s Past in het RAM (CPU) | Q8_0≈33 tok/s Past in het RAM (CPU) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈5,3 tok/s Draait met offload naar RAM | Q4_K_S≈5,1 tok/s Draait met offload naar RAM | Q4_K_M≈5,6 tok/s Draait met offload naar RAM | Q4_K_M≈5,7 tok/s Draait met offload naar RAM | Q3_K_M≈10,2 tok/s Draait met offload naar RAM | Q5_K_M≈55 tok/s Past in het videogeheugen | Q4_0≈10,0 tok/s Draait met offload naar RAM | UD-Q4_K_XL≈22 tok/s Past in het videogeheugen | Q5_K_M≈15,2 tok/s Past in het videogeheugen | Q5_K_M≈12,8 tok/s Past in het gedeelde geheugen | Q8_0≈13,9 tok/s Past in het gedeelde geheugen | Q4_K_M≈10,6 tok/s Past in het gedeelde geheugen | Q5_K_M≈10,0 tok/s Past in het gedeelde geheugen | Q4_K_M≈8,0 tok/s Past in het RAM (CPU) | Q8_0≈13,1 tok/s Past in het RAM (CPU) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈19,1 tok/s Draait met offload naar RAM | MXFP4≈19,6 tok/s Draait met offload naar RAM | MXFP426–28 tok/sgemeten Draait met offload naar RAM | MXFP4≈25 tok/s Draait met offload naar RAM | MXFP4≈31 tok/s Draait met offload naar RAM | MXFP4≈258 tok/s Past in het videogeheugen | MXFP4≈36 tok/s Draait met offload naar RAM | MXFP441–73 tok/sgemeten Past in het videogeheugen | MXFP4≈71 tok/s Past in het videogeheugen | MXFP4≈60 tok/s Past in het gedeelde geheugen | MXFP4≈90 tok/s Past in het gedeelde geheugen | MXFP450 tok/sgemeten Past in het gedeelde geheugen | MXFP461 tok/sgemeten Past in het gedeelde geheugen | MXFP4≈15,8 tok/s Past in het RAM (CPU) | MXFP4≈36 tok/s Past in het RAM (CPU) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈10,5 tok/s Draait met offload naar RAM | UD-IQ4_NL≈10,8 tok/s Draait met offload naar RAM | Q4_K_S≈11,1 tok/s Draait met offload naar RAM | Q4_K_S≈11,2 tok/s Draait met offload naar RAM | UD-Q4_K_XL≈11,9 tok/s Draait met offload naar RAM | UD-Q5_K_XL≈97 tok/s Past in het videogeheugen | UD-IQ3_XXS≈76 tok/s Past in het videogeheugen | UD-IQ4_NL≈46 tok/s Past in het videogeheugen | UD-Q5_K_XL≈27 tok/s Past in het videogeheugen | UD-Q5_K_XL≈23 tok/s Past in het gedeelde geheugen | Q8_0≈24 tok/s Past in het gedeelde geheugen | Q6_K≈15,1 tok/s Past in het gedeelde geheugen | Q6_K≈16,1 tok/s Past in het gedeelde geheugen | UD-Q5_K_XL≈10,4 tok/s Past in het RAM (CPU) | Q8_0≈19,3 tok/s Past in het RAM (CPU) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | UD-Q4_K_XL≈10,8 tok/s Draait met offload naar RAM | UD-Q2_K_XL≈8,0 tok/ssterke compressie Draait met offload naar RAM | Q3_K_M≈6,1 tok/s Draait met offload naar RAM | UD-Q3_K_XL≈11,7 tok/s Draait met offload naar RAM | UD-Q2_K_XL≈19,4 tok/ssterke compressie Past in het gedeelde geheugen | Q8_0≈10,8 tok/s Past in het gedeelde geheugen | UD-Q3_K_XL≈12,2 tok/s Past in het gedeelde geheugen | UD-Q3_K_XL≈13,0 tok/s Past in het gedeelde geheugen | Q4_K_M≈7,2 tok/s Past in het RAM (CPU) | Q8_0≈10,9 tok/s Past in het RAM (CPU) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | UD-IQ3_XXS≈7,3 tok/s Draait met offload naar RAM | UD-IQ1_S≈5,6 tok/ssterke compressie Draait met offload naar RAM | UD-IQ2_XXS≈4,7 tok/ssterke compressie Draait met offload naar RAM | UD-IQ3_XXS≈3,5 tok/s Draait met offload naar RAM | UD-TQ1_0≈16,2 tok/ssterke compressie Past in het gedeelde geheugen | Q4_1≈10,0 tok/s Past in het gedeelde geheugen | UD-IQ1_M≈9,6 tok/ssterke compressie Past in het gedeelde geheugen | UD-IQ1_M≈10,3 tok/ssterke compressie Past in het gedeelde geheugen | Q4_K_M≈4,7 tok/s Past in het RAM (CPU) | Q4_1≈10,2 tok/s Past in het RAM (CPU) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | UD-IQ1_S≈16,9 tok/ssterke compressie Draait met offload naar RAM | ✕ Past niet | ✕ Past niet | UD-IQ1_S≈8,0 tok/ssterke compressie Draait met offload naar RAM | ✕ Past niet | Q3_K_M≈14,9 tok/s Past in het gedeelde geheugen | ✕ Past niet | ✕ Past niet | Q4_K_M≈5,2 tok/s Past in het RAM (CPU) | Q3_K_M≈13,9 tok/s Past in het RAM (CPU) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | ✕ Past niet | UD-Q2_K_XL≈22 tok/ssterke compressie Past in het gedeelde geheugen | ✕ Past niet | ✕ Past niet | Q3_K_S≈7,2 tok/s Past in het RAM (CPU) | UD-IQ2_XXS≈19,7 tok/ssterke compressie Past in het RAM (CPU) |
Rekenhulp: past het?
Wat er opengaat bij elke geheugengrootte (context 8K)
- 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B sterke compressie: Gemma 3 12B · Qwen3 14B
- 12 GB Gemma 3 12B · Qwen3 14B sterke compressie: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B sterke compressie: Gemma 4 31B · Qwen3.5 35B A3B
- 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B sterke compressie: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B sterke compressie: GLM 4.5 Air
- 96 GB GLM 4.5 Air · gpt-oss-120b sterke compressie: Qwen3 235B A22B · GLM 4.7
- 128 GB Qwen3 235B A22B
- 192 GB GLM 4.7 sterke compressie: DeepSeek R1
- 256 GB sterke compressie: Kimi K2.5
- 512 GB DeepSeek R1 · Kimi K2.5
≈ schattingen voor een context van 8K: gewichten + KV-cache + runtime-overhead tegenover het geheugen; snelheid uit de geheugenbandbreedte. De werkelijke cijfers hangen af van de runtime en de instellingen.
Bijgewerkt · Bronnen: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
Insluiten op je site
Plak deze code waar de infographic moet verschijnen: hij werkt zichzelf bij. Gratis te gebruiken — behoud de bronvermelding met link.
Een matrix van modellen en machines
In de rijen staan bekende modellen met open gewichten (open weights), van ongeveer 3B tot 1T parameters. De kolommen zijn videokaarten, configuraties met meerdere GPU's, Apple- en AMD-machines met gedeeld geheugen en CPU-servers. Een cel vertelt drie dingen: welke quantisatie we aanraden, waar het model terechtkomt (videogeheugen, gedeeld geheugen, server-RAM, offload naar RAM of „Past niet”) en een geschatte generatiesnelheid in tokens per seconde.
Waar het geheugen naartoe gaat
Het benodigde geheugen bestaat uit drie delen. De gewichten zijn het aantal parameters maal het aantal bits per gewicht, of de echte grootte van het quant-bestand op Hugging Face als dat bestaat. Daarbovenop komt de KV-cache, het geheugen voor het gesprek zelf. De matrix rekent met een context van 8192 tokens; in de rekenhulp kun je die verhogen, en bij een lange context kan de cache net zo veel ruimte vragen als een klein model. Tot slot gaat er ongeveer 1,5 GB naar de runtime en buffers, plus de visuele projector van een VLM.
Is het totaal groter dan het videogeheugen (VRAM), maar past het samen met het systeem-RAM, dan toont de cel offload: het model draait wel, alleen trager.
Waarom MoE vaak sneller is
De snelheid volgt uit de geheugenbandbreedte gedeeld door het aantal bytes dat per token gelezen wordt. Een mixture-of-experts-model (MoE) leest per token alleen zijn actieve parameters. Daardoor genereert een groot MoE-model soms vlotter dan een kleiner dicht model.
Welke quant er in de cel staat
- We nemen de zwaarste quant tot en met Q8_0 die nog minstens 10 tokens per seconde haalt.
- Lukt dat niet, dan wordt het een bestand uit de Q4-klasse, zoals Q4_K_M.
- BF16 raden we nooit aan: dubbel zo veel geheugen voor nauwelijks merkbare winst.
- Onder Q3 gaan we alleen als er niets anders past; de cel meldt dan „sterke compressie”.
Hoe nauwkeurig is dit?
Getallen met ≈ zijn schattingen, geijkt aan gemeten runs en binnen ongeveer ±35% daarvan. Staat er een echte meting, dan zie je die waarde met een link naar de bron. De schatting gaat alleen over het genereren, niet over het inlezen van een lange prompt, en drivers, runtimeversie en instellingen duwen het resultaat beide kanten op. Modellen zonder veiligheidsfilters zitten achter een schakelaar.
Onder de matrix reken je je eigen machine door, en een ladder toont wat er bij 8, 12, 16, 24, 48, 96 en 128 GB bijkomt. GGUF-bestanden open je met lokale AI-apps zoals llama.cpp, LM Studio, Ollama en Jan. Complete machines vind je bij de pc-configuraties.