Naar de inhoud
fedi.software

Welk open model past op jouw hardware — 2026

Open-weightsmodellen tegenover populaire videokaarten en computers: de aanbevolen quantisatie (de grootste tot Q8 die nog 10 of meer tokens per seconde haalt, anders een van klasse Q4; onder Q3 alleen als niets anders past), waar het draait (videogeheugen, gedeeld geheugen of met offload naar RAM) en een geschatte generatiesnelheid.

Model Parameters
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s Past in het videogeheugen Q8_0≈67 tok/s Past in het videogeheugen Q8_0≈218 tok/s Past in het videogeheugen Q8_0≈235 tok/s Past in het videogeheugen Q8_0≈417 tok/s Past in het videogeheugen Q8_0≈417 tok/s Past in het videogeheugen Q8_0≈168 tok/s Past in het videogeheugen Q8_0≈136 tok/s Past in het videogeheugen Q8_0≈115 tok/s Past in het videogeheugen Q8_0≈111 tok/s Past in het gedeelde geheugen Q8_0≈167 tok/s Past in het gedeelde geheugen Q8_0≈52 tok/s Past in het gedeelde geheugen Q8_0≈56 tok/s Past in het gedeelde geheugen Q8_0≈15,0 tok/s Past in het RAM (CPU) Q8_0≈34 tok/s Past in het RAM (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s Past in het videogeheugen Q8_0≈59 tok/s Past in het videogeheugen Q8_0≈192 tok/s Past in het videogeheugen Q8_0≈207 tok/s Past in het videogeheugen Q8_0≈368 tok/s Past in het videogeheugen Q8_0≈368 tok/s Past in het videogeheugen Q8_0≈148 tok/s Past in het videogeheugen Q8_0≈120 tok/s Past in het videogeheugen Q8_0≈101 tok/s Past in het videogeheugen Q8_0≈98 tok/s Past in het gedeelde geheugen Q8_0≈147 tok/s Past in het gedeelde geheugen Q8_0≈46 tok/s Past in het gedeelde geheugen Q8_0≈49 tok/s Past in het gedeelde geheugen Q8_0≈14,3 tok/s Past in het RAM (CPU) Q8_0≈32 tok/s Past in het RAM (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s Past in het videogeheugen Q8_0≈54 tok/s Past in het videogeheugen Q8_0≈175 tok/s Past in het videogeheugen Q8_0≈189 tok/s Past in het videogeheugen Q8_0≈335 tok/s Past in het videogeheugen Q8_0≈335 tok/s Past in het videogeheugen Q8_0≈135 tok/s Past in het videogeheugen Q8_0≈109 tok/s Past in het videogeheugen Q8_0≈92 tok/s Past in het videogeheugen Q8_0≈89 tok/s Past in het gedeelde geheugen Q8_0≈134 tok/s Past in het gedeelde geheugen Q8_0≈42 tok/s Past in het gedeelde geheugen Q8_0≈45 tok/s Past in het gedeelde geheugen Q8_0≈13,8 tok/s Past in het RAM (CPU) Q8_0≈31 tok/s Past in het RAM (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s Past in het videogeheugen UD-Q6_K_XL≈29 tok/s Past in het videogeheugen UD-Q6_K_XL≈95 tok/s Past in het videogeheugen UD-Q6_K_XL≈103 tok/s Past in het videogeheugen UD-Q6_K_XL≈182 tok/s Past in het videogeheugen UD-Q6_K_XL≈182 tok/s Past in het videogeheugen UD-Q6_K_XL≈73 tok/s Past in het videogeheugen UD-Q6_K_XL≈59 tok/s Past in het videogeheugen UD-Q6_K_XL≈50 tok/s Past in het videogeheugen UD-Q6_K_XL≈49 tok/s Past in het gedeelde geheugen UD-Q6_K_XL≈73 tok/s Past in het gedeelde geheugen UD-Q6_K_XL≈23 tok/s Past in het gedeelde geheugen UD-Q6_K_XL≈24 tok/s Past in het gedeelde geheugen UD-Q6_K_XL≈10,3 tok/s Past in het RAM (CPU) UD-Q6_K_XL≈23 tok/s Past in het RAM (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s Past in het videogeheugen Q8_0≈25 tok/s Past in het videogeheugen Q8_0≈80 tok/s Past in het videogeheugen Q8_0≈87 tok/s Past in het videogeheugen Q8_0≈154 tok/s Past in het videogeheugen Q8_0≈154 tok/s Past in het videogeheugen Q8_0≈62 tok/s Past in het videogeheugen Q8_0≈50 tok/s Past in het videogeheugen Q8_0≈42 tok/s Past in het videogeheugen Q8_0≈41 tok/s Past in het gedeelde geheugen Q8_0≈62 tok/s Past in het gedeelde geheugen Q8_0≈19,2 tok/s Past in het gedeelde geheugen Q8_0≈21 tok/s Past in het gedeelde geheugen UD-Q6_K_XL≈10,2 tok/s Past in het RAM (CPU) Q8_0≈21 tok/s Past in het RAM (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s Past in het videogeheugen Q8_0≈17,8 tok/s Past in het videogeheugen Q8_0≈58 tok/s Past in het videogeheugen Q8_0≈62 tok/s Past in het videogeheugen Q8_0≈111 tok/s Past in het videogeheugen Q8_0≈111 tok/s Past in het videogeheugen Q8_0≈44 tok/s Past in het videogeheugen Q8_0≈36 tok/s Past in het videogeheugen Q8_0≈30 tok/s Past in het videogeheugen Q8_0≈30 tok/s Past in het gedeelde geheugen Q8_0≈44 tok/s Past in het gedeelde geheugen Q8_0≈13,8 tok/s Past in het gedeelde geheugen Q8_0≈14,8 tok/s Past in het gedeelde geheugen Q4_1≈10,2 tok/s Past in het RAM (CPU) Q8_0≈17,1 tok/s Past in het RAM (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s Past in het videogeheugen Q6_K≈18,0 tok/s Past in het videogeheugen Q8_0≈46 tok/s Past in het videogeheugen Q8_0≈49 tok/s Past in het videogeheugen Q8_0≈88 tok/s Past in het videogeheugen Q8_0≈88 tok/s Past in het videogeheugen Q8_0≈35 tok/s Past in het videogeheugen Q8_0≈29 tok/s Past in het videogeheugen Q8_0≈24 tok/s Past in het videogeheugen Q8_0≈23 tok/s Past in het gedeelde geheugen Q8_0≈35 tok/s Past in het gedeelde geheugen Q8_0≈10,9 tok/s Past in het gedeelde geheugen Q8_0≈11,7 tok/s Past in het gedeelde geheugen UD-Q3_K_XL≈10,1 tok/s Past in het RAM (CPU) Q8_0≈14,6 tok/s Past in het RAM (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s Draait met offload naar RAM MXFP4≈55 tok/s Past in het videogeheugen MXFP4162 tok/sgemeten Past in het videogeheugen MXFP4≈194 tok/s Past in het videogeheugen MXFP4≈344 tok/s Past in het videogeheugen MXFP4≈344 tok/s Past in het videogeheugen MXFP4≈138 tok/s Past in het videogeheugen MXFP4≈112 tok/s Past in het videogeheugen MXFP4≈95 tok/s Past in het videogeheugen MXFP4≈80 tok/s Past in het gedeelde geheugen MXFP4116 tok/sgemeten Past in het gedeelde geheugen MXFP4≈59 tok/s Past in het gedeelde geheugen MXFP4≈62 tok/s Past in het gedeelde geheugen MXFP4≈17,2 tok/s Past in het RAM (CPU) MXFP4≈39 tok/s Past in het RAM (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10,2 tok/s Draait met offload naar RAM UD-Q3_K_XL≈18,4 tok/s Past in het videogeheugen Q6_K≈37 tok/s Past in het videogeheugen Q6_K≈40 tok/s Past in het videogeheugen Q8_0≈56 tok/s Past in het videogeheugen Q8_0≈56 tok/s Past in het videogeheugen Q8_0≈22 tok/s Past in het videogeheugen Q8_0≈18,2 tok/s Past in het videogeheugen Q8_0≈15,3 tok/s Past in het videogeheugen Q8_0≈14,9 tok/s Past in het gedeelde geheugen Q8_0≈22 tok/s Past in het gedeelde geheugen Q5_K_M≈10,3 tok/s Past in het gedeelde geheugen Q5_K_M≈11,0 tok/s Past in het gedeelde geheugen Q4_K_M≈6,9 tok/s Past in het RAM (CPU) Q8_0≈10,3 tok/s Past in het RAM (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14,7 tok/s Draait met offload naar RAM UD-Q3_K_M≈56 tok/s Past in het videogeheugen UD-Q5_K_S≈129 tok/s Past in het videogeheugen UD-Q5_K_S≈139 tok/s Past in het videogeheugen UD-Q8_K_XL≈173 tok/s Past in het videogeheugen UD-Q8_K_XL≈173 tok/s Past in het videogeheugen UD-Q8_K_XL≈70 tok/s Past in het videogeheugen UD-Q8_K_XL≈57 tok/s Past in het videogeheugen UD-Q8_K_XL≈48 tok/s Past in het videogeheugen UD-Q8_K_XL≈40 tok/s Past in het gedeelde geheugen UD-Q8_K_XL≈60 tok/s Past in het gedeelde geheugen UD-Q8_K_XL≈29 tok/s Past in het gedeelde geheugen UD-Q8_K_XL≈31 tok/s Past in het gedeelde geheugen UD-Q8_K_XL≈13,7 tok/s Past in het RAM (CPU) UD-Q8_K_XL≈31 tok/s Past in het RAM (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12,7 tok/s Draait met offload naar RAM Q3_K_S≈18,1 tok/s Past in het videogeheugen UD-Q5_K_XL≈38 tok/s Past in het videogeheugen UD-Q5_K_XL≈41 tok/s Past in het videogeheugen UD-Q6_K_XL≈59 tok/s Past in het videogeheugen Q8_0≈49 tok/s Past in het videogeheugen Q8_0≈19,7 tok/s Past in het videogeheugen Q8_0≈16,0 tok/s Past in het videogeheugen Q8_0≈13,5 tok/s Past in het videogeheugen Q8_0≈13,1 tok/s Past in het gedeelde geheugen Q8_0≈19,6 tok/s Past in het gedeelde geheugen Q4_1≈10,1 tok/s Past in het gedeelde geheugen Q4_1≈10,8 tok/s Past in het gedeelde geheugen Q4_K_M≈6,3 tok/s Past in het RAM (CPU) UD-Q6_K_XL≈10,8 tok/s Past in het RAM (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16,4 tok/s Draait met offload naar RAM Q3_K_S≈66 tok/s Past in het videogeheugen Q4_K_M154 tok/sgemeten Past in het videogeheugen Q5_K_S≈158 tok/s Past in het videogeheugen UD-Q6_K_XL≈232 tok/s Past in het videogeheugen Q8_0≈192 tok/s Past in het videogeheugen Q8_0≈77 tok/s Past in het videogeheugen Q8_0≈63 tok/s Past in het videogeheugen Q8_0≈53 tok/s Past in het videogeheugen Q8_0≈45 tok/s Past in het gedeelde geheugen Q8_0≈67 tok/s Past in het gedeelde geheugen Q8_0≈33 tok/s Past in het gedeelde geheugen Q8_0≈35 tok/s Past in het gedeelde geheugen Q8_0≈14,3 tok/s Past in het RAM (CPU) Q8_0≈32 tok/s Past in het RAM (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3,8 tok/s Draait met offload naar RAM Q3_K_S≈10,4 tok/s Draait met offload naar RAM Q4_1≈37 tok/s Past in het videogeheugen Q4_1≈40 tok/s Past in het videogeheugen Q6_K≈55 tok/s Past in het videogeheugen Q8_0≈43 tok/s Past in het videogeheugen Q8_0≈17,1 tok/s Past in het videogeheugen Q8_0≈13,9 tok/s Past in het videogeheugen Q8_0≈11,7 tok/s Past in het videogeheugen Q8_0≈11,3 tok/s Past in het gedeelde geheugen Q8_0≈17,0 tok/s Past in het gedeelde geheugen IQ4_XS≈10,3 tok/s Past in het gedeelde geheugen Q4_K_S≈10,3 tok/s Past in het gedeelde geheugen Q4_K_M≈5,7 tok/s Past in het RAM (CPU) Q6_K≈10,1 tok/s Past in het RAM (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3,7 tok/s Draait met offload naar RAM UD-IQ3_XXS≈14,1 tok/s Draait met offload naar RAM UD-Q4_K_XL≈35 tok/s Past in het videogeheugen UD-Q4_K_XL≈38 tok/s Past in het videogeheugen Q6_K≈51 tok/s Past in het videogeheugen Q8_0≈40 tok/s Past in het videogeheugen Q8_0≈16,0 tok/s Past in het videogeheugen Q8_0≈13,0 tok/s Past in het videogeheugen Q8_0≈11,0 tok/s Past in het videogeheugen Q8_0≈10,6 tok/s Past in het gedeelde geheugen Q8_0≈16,0 tok/s Past in het gedeelde geheugen UD-Q3_K_XL≈10,3 tok/s Past in het gedeelde geheugen IQ4_XS≈10,2 tok/s Past in het gedeelde geheugen Q4_K_M≈5,4 tok/s Past in het RAM (CPU) Q5_K_M≈10,8 tok/s Past in het RAM (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17,9 tok/s Draait met offload naar RAM Q8_0≈18,7 tok/s Draait met offload naar RAM Q4_K_S≈191 tok/s Past in het videogeheugen Q4_K_S≈205 tok/s Past in het videogeheugen Q6_K≈274 tok/s Past in het videogeheugen Q8_0≈220 tok/s Past in het videogeheugen Q8_0≈89 tok/s Past in het videogeheugen Q8_0≈72 tok/s Past in het videogeheugen Q8_0≈61 tok/s Past in het videogeheugen Q8_0≈51 tok/s Past in het gedeelde geheugen Q8_0≈77 tok/s Past in het gedeelde geheugen Q8_0≈37 tok/s Past in het gedeelde geheugen Q8_0≈40 tok/s Past in het gedeelde geheugen Q8_0≈15,0 tok/s Past in het RAM (CPU) Q8_0≈34 tok/s Past in het RAM (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1,3 tok/s Draait met offload naar RAM Q4_K_M≈1,4 tok/s Draait met offload naar RAM Q4_K_M≈2,0 tok/s Draait met offload naar RAM Q4_K_M≈2,0 tok/s Draait met offload naar RAM UD-IQ3_XXS≈49 tok/s Past in het videogeheugen Q8_0≈18,8 tok/s Past in het videogeheugen Q4_K_M16,3 tok/sgemeten Past in het videogeheugen Q4_1≈10,3 tok/s Past in het videogeheugen IQ4_XS≈10,0 tok/s Past in het videogeheugen UD-Q3_K_XL≈10,6 tok/s Past in het gedeelde geheugen Q5_K_M≈11,2 tok/s Past in het gedeelde geheugen Q4_K_M≈4,1 tok/s Past in het gedeelde geheugen Q4_K_M≈4,4 tok/s Past in het gedeelde geheugen Q4_K_M≈2,9 tok/s Past in het RAM (CPU) Q4_K_M≈6,6 tok/s Past in het RAM (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s Draait met offload naar RAM Q6_K≈21 tok/s Draait met offload naar RAM UD-Q6_K_XL≈26 tok/s Draait met offload naar RAM UD-Q6_K_XL≈26 tok/s Draait met offload naar RAM UD-Q6_K_XL≈31 tok/s Draait met offload naar RAM Q8_0≈213 tok/s Past in het videogeheugen Q4_K_S≈145 tok/s Past in het videogeheugen UD-Q6_K_XL≈84 tok/s Past in het videogeheugen Q8_0≈59 tok/s Past in het videogeheugen Q8_0≈49 tok/s Past in het gedeelde geheugen Q8_0≈74 tok/s Past in het gedeelde geheugen Q8_0≈36 tok/s Past in het gedeelde geheugen Q8_0≈39 tok/s Past in het gedeelde geheugen Q8_0≈14,8 tok/s Past in het RAM (CPU) Q8_0≈33 tok/s Past in het RAM (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5,3 tok/s Draait met offload naar RAM Q4_K_S≈5,1 tok/s Draait met offload naar RAM Q4_K_M≈5,6 tok/s Draait met offload naar RAM Q4_K_M≈5,7 tok/s Draait met offload naar RAM Q3_K_M≈10,2 tok/s Draait met offload naar RAM Q5_K_M≈55 tok/s Past in het videogeheugen Q4_0≈10,0 tok/s Draait met offload naar RAM UD-Q4_K_XL≈22 tok/s Past in het videogeheugen Q5_K_M≈15,2 tok/s Past in het videogeheugen Q5_K_M≈12,8 tok/s Past in het gedeelde geheugen Q8_0≈13,9 tok/s Past in het gedeelde geheugen Q4_K_M≈10,6 tok/s Past in het gedeelde geheugen Q5_K_M≈10,0 tok/s Past in het gedeelde geheugen Q4_K_M≈8,0 tok/s Past in het RAM (CPU) Q8_0≈13,1 tok/s Past in het RAM (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19,1 tok/s Draait met offload naar RAM MXFP4≈19,6 tok/s Draait met offload naar RAM MXFP426–28 tok/sgemeten Draait met offload naar RAM MXFP4≈25 tok/s Draait met offload naar RAM MXFP4≈31 tok/s Draait met offload naar RAM MXFP4≈258 tok/s Past in het videogeheugen MXFP4≈36 tok/s Draait met offload naar RAM MXFP441–73 tok/sgemeten Past in het videogeheugen MXFP4≈71 tok/s Past in het videogeheugen MXFP4≈60 tok/s Past in het gedeelde geheugen MXFP4≈90 tok/s Past in het gedeelde geheugen MXFP450 tok/sgemeten Past in het gedeelde geheugen MXFP461 tok/sgemeten Past in het gedeelde geheugen MXFP4≈15,8 tok/s Past in het RAM (CPU) MXFP4≈36 tok/s Past in het RAM (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10,5 tok/s Draait met offload naar RAM UD-IQ4_NL≈10,8 tok/s Draait met offload naar RAM Q4_K_S≈11,1 tok/s Draait met offload naar RAM Q4_K_S≈11,2 tok/s Draait met offload naar RAM UD-Q4_K_XL≈11,9 tok/s Draait met offload naar RAM UD-Q5_K_XL≈97 tok/s Past in het videogeheugen UD-IQ3_XXS≈76 tok/s Past in het videogeheugen UD-IQ4_NL≈46 tok/s Past in het videogeheugen UD-Q5_K_XL≈27 tok/s Past in het videogeheugen UD-Q5_K_XL≈23 tok/s Past in het gedeelde geheugen Q8_0≈24 tok/s Past in het gedeelde geheugen Q6_K≈15,1 tok/s Past in het gedeelde geheugen Q6_K≈16,1 tok/s Past in het gedeelde geheugen UD-Q5_K_XL≈10,4 tok/s Past in het RAM (CPU) Q8_0≈19,3 tok/s Past in het RAM (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet UD-Q4_K_XL≈10,8 tok/s Draait met offload naar RAM UD-Q2_K_XL≈8,0 tok/ssterke compressie Draait met offload naar RAM Q3_K_M≈6,1 tok/s Draait met offload naar RAM UD-Q3_K_XL≈11,7 tok/s Draait met offload naar RAM UD-Q2_K_XL≈19,4 tok/ssterke compressie Past in het gedeelde geheugen Q8_0≈10,8 tok/s Past in het gedeelde geheugen UD-Q3_K_XL≈12,2 tok/s Past in het gedeelde geheugen UD-Q3_K_XL≈13,0 tok/s Past in het gedeelde geheugen Q4_K_M≈7,2 tok/s Past in het RAM (CPU) Q8_0≈10,9 tok/s Past in het RAM (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet UD-IQ3_XXS≈7,3 tok/s Draait met offload naar RAM UD-IQ1_S≈5,6 tok/ssterke compressie Draait met offload naar RAM UD-IQ2_XXS≈4,7 tok/ssterke compressie Draait met offload naar RAM UD-IQ3_XXS≈3,5 tok/s Draait met offload naar RAM UD-TQ1_0≈16,2 tok/ssterke compressie Past in het gedeelde geheugen Q4_1≈10,0 tok/s Past in het gedeelde geheugen UD-IQ1_M≈9,6 tok/ssterke compressie Past in het gedeelde geheugen UD-IQ1_M≈10,3 tok/ssterke compressie Past in het gedeelde geheugen Q4_K_M≈4,7 tok/s Past in het RAM (CPU) Q4_1≈10,2 tok/s Past in het RAM (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet UD-IQ1_S≈16,9 tok/ssterke compressie Draait met offload naar RAM ✕ Past niet ✕ Past niet UD-IQ1_S≈8,0 tok/ssterke compressie Draait met offload naar RAM ✕ Past niet Q3_K_M≈14,9 tok/s Past in het gedeelde geheugen ✕ Past niet ✕ Past niet Q4_K_M≈5,2 tok/s Past in het RAM (CPU) Q3_K_M≈13,9 tok/s Past in het RAM (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet ✕ Past niet UD-Q2_K_XL≈22 tok/ssterke compressie Past in het gedeelde geheugen ✕ Past niet ✕ Past niet Q3_K_S≈7,2 tok/s Past in het RAM (CPU) UD-IQ2_XXS≈19,7 tok/ssterke compressie Past in het RAM (CPU)

Wat er opengaat bij elke geheugengrootte (context 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B sterke compressie: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B sterke compressie: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B sterke compressie: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B sterke compressie: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B sterke compressie: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b sterke compressie: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 sterke compressie: DeepSeek R1
  9. 256 GB sterke compressie: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ schattingen voor een context van 8K: gewichten + KV-cache + runtime-overhead tegenover het geheugen; snelheid uit de geheugenbandbreedte. De werkelijke cijfers hangen af van de runtime en de instellingen.

Bijgewerkt · Bronnen: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Insluiten op je site

Plak deze code waar de infographic moet verschijnen: hij werkt zichzelf bij. Gratis te gebruiken — behoud de bronvermelding met link.

JSON Onze data: CC BY 4.0 met een link naar de bron; data van derden behouden de licentie van hun bron.

Een matrix van modellen en machines

In de rijen staan bekende modellen met open gewichten (open weights), van ongeveer 3B tot 1T parameters. De kolommen zijn videokaarten, configuraties met meerdere GPU's, Apple- en AMD-machines met gedeeld geheugen en CPU-servers. Een cel vertelt drie dingen: welke quantisatie we aanraden, waar het model terechtkomt (videogeheugen, gedeeld geheugen, server-RAM, offload naar RAM of „Past niet”) en een geschatte generatiesnelheid in tokens per seconde.

Waar het geheugen naartoe gaat

Het benodigde geheugen bestaat uit drie delen. De gewichten zijn het aantal parameters maal het aantal bits per gewicht, of de echte grootte van het quant-bestand op Hugging Face als dat bestaat. Daarbovenop komt de KV-cache, het geheugen voor het gesprek zelf. De matrix rekent met een context van 8192 tokens; in de rekenhulp kun je die verhogen, en bij een lange context kan de cache net zo veel ruimte vragen als een klein model. Tot slot gaat er ongeveer 1,5 GB naar de runtime en buffers, plus de visuele projector van een VLM.

Is het totaal groter dan het videogeheugen (VRAM), maar past het samen met het systeem-RAM, dan toont de cel offload: het model draait wel, alleen trager.

Waarom MoE vaak sneller is

De snelheid volgt uit de geheugenbandbreedte gedeeld door het aantal bytes dat per token gelezen wordt. Een mixture-of-experts-model (MoE) leest per token alleen zijn actieve parameters. Daardoor genereert een groot MoE-model soms vlotter dan een kleiner dicht model.

Welke quant er in de cel staat

  • We nemen de zwaarste quant tot en met Q8_0 die nog minstens 10 tokens per seconde haalt.
  • Lukt dat niet, dan wordt het een bestand uit de Q4-klasse, zoals Q4_K_M.
  • BF16 raden we nooit aan: dubbel zo veel geheugen voor nauwelijks merkbare winst.
  • Onder Q3 gaan we alleen als er niets anders past; de cel meldt dan „sterke compressie”.

Hoe nauwkeurig is dit?

Getallen met ≈ zijn schattingen, geijkt aan gemeten runs en binnen ongeveer ±35% daarvan. Staat er een echte meting, dan zie je die waarde met een link naar de bron. De schatting gaat alleen over het genereren, niet over het inlezen van een lange prompt, en drivers, runtimeversie en instellingen duwen het resultaat beide kanten op. Modellen zonder veiligheidsfilters zitten achter een schakelaar.

Onder de matrix reken je je eigen machine door, en een ladder toont wat er bij 8, 12, 16, 24, 48, 96 en 128 GB bijkomt. GGUF-bestanden open je met lokale AI-apps zoals llama.cpp, LM Studio, Ollama en Jan. Complete machines vind je bij de pc-configuraties.