Hoppa till innehållet
fedi.software

Vilken öppen modell passar din hårdvara — 2026

Modeller med öppna vikter mot populära grafikkort och datorer: den rekommenderade kvantiseringen (den största upp till Q8 som fortfarande ger 10 eller fler tokens per sekund, annars en av Q4-klass; under Q3 bara när inget annat ryms), var den körs (grafikminne, delat minne eller avlastad till RAM) och en ungefärlig genereringshastighet.

Modell Parametrar
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s Ryms i grafikminnet Q8_0≈67 tok/s Ryms i grafikminnet Q8_0≈218 tok/s Ryms i grafikminnet Q8_0≈235 tok/s Ryms i grafikminnet Q8_0≈417 tok/s Ryms i grafikminnet Q8_0≈417 tok/s Ryms i grafikminnet Q8_0≈168 tok/s Ryms i grafikminnet Q8_0≈136 tok/s Ryms i grafikminnet Q8_0≈115 tok/s Ryms i grafikminnet Q8_0≈111 tok/s Ryms i det delade minnet Q8_0≈167 tok/s Ryms i det delade minnet Q8_0≈52 tok/s Ryms i det delade minnet Q8_0≈56 tok/s Ryms i det delade minnet Q8_0≈15,0 tok/s Ryms i RAM (CPU) Q8_0≈34 tok/s Ryms i RAM (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s Ryms i grafikminnet Q8_0≈59 tok/s Ryms i grafikminnet Q8_0≈192 tok/s Ryms i grafikminnet Q8_0≈207 tok/s Ryms i grafikminnet Q8_0≈368 tok/s Ryms i grafikminnet Q8_0≈368 tok/s Ryms i grafikminnet Q8_0≈148 tok/s Ryms i grafikminnet Q8_0≈120 tok/s Ryms i grafikminnet Q8_0≈101 tok/s Ryms i grafikminnet Q8_0≈98 tok/s Ryms i det delade minnet Q8_0≈147 tok/s Ryms i det delade minnet Q8_0≈46 tok/s Ryms i det delade minnet Q8_0≈49 tok/s Ryms i det delade minnet Q8_0≈14,3 tok/s Ryms i RAM (CPU) Q8_0≈32 tok/s Ryms i RAM (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s Ryms i grafikminnet Q8_0≈54 tok/s Ryms i grafikminnet Q8_0≈175 tok/s Ryms i grafikminnet Q8_0≈189 tok/s Ryms i grafikminnet Q8_0≈335 tok/s Ryms i grafikminnet Q8_0≈335 tok/s Ryms i grafikminnet Q8_0≈135 tok/s Ryms i grafikminnet Q8_0≈109 tok/s Ryms i grafikminnet Q8_0≈92 tok/s Ryms i grafikminnet Q8_0≈89 tok/s Ryms i det delade minnet Q8_0≈134 tok/s Ryms i det delade minnet Q8_0≈42 tok/s Ryms i det delade minnet Q8_0≈45 tok/s Ryms i det delade minnet Q8_0≈13,8 tok/s Ryms i RAM (CPU) Q8_0≈31 tok/s Ryms i RAM (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s Ryms i grafikminnet UD-Q6_K_XL≈29 tok/s Ryms i grafikminnet UD-Q6_K_XL≈95 tok/s Ryms i grafikminnet UD-Q6_K_XL≈103 tok/s Ryms i grafikminnet UD-Q6_K_XL≈182 tok/s Ryms i grafikminnet UD-Q6_K_XL≈182 tok/s Ryms i grafikminnet UD-Q6_K_XL≈73 tok/s Ryms i grafikminnet UD-Q6_K_XL≈59 tok/s Ryms i grafikminnet UD-Q6_K_XL≈50 tok/s Ryms i grafikminnet UD-Q6_K_XL≈49 tok/s Ryms i det delade minnet UD-Q6_K_XL≈73 tok/s Ryms i det delade minnet UD-Q6_K_XL≈23 tok/s Ryms i det delade minnet UD-Q6_K_XL≈24 tok/s Ryms i det delade minnet UD-Q6_K_XL≈10,3 tok/s Ryms i RAM (CPU) UD-Q6_K_XL≈23 tok/s Ryms i RAM (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s Ryms i grafikminnet Q8_0≈25 tok/s Ryms i grafikminnet Q8_0≈80 tok/s Ryms i grafikminnet Q8_0≈87 tok/s Ryms i grafikminnet Q8_0≈154 tok/s Ryms i grafikminnet Q8_0≈154 tok/s Ryms i grafikminnet Q8_0≈62 tok/s Ryms i grafikminnet Q8_0≈50 tok/s Ryms i grafikminnet Q8_0≈42 tok/s Ryms i grafikminnet Q8_0≈41 tok/s Ryms i det delade minnet Q8_0≈62 tok/s Ryms i det delade minnet Q8_0≈19,2 tok/s Ryms i det delade minnet Q8_0≈21 tok/s Ryms i det delade minnet UD-Q6_K_XL≈10,2 tok/s Ryms i RAM (CPU) Q8_0≈21 tok/s Ryms i RAM (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s Ryms i grafikminnet Q8_0≈17,8 tok/s Ryms i grafikminnet Q8_0≈58 tok/s Ryms i grafikminnet Q8_0≈62 tok/s Ryms i grafikminnet Q8_0≈111 tok/s Ryms i grafikminnet Q8_0≈111 tok/s Ryms i grafikminnet Q8_0≈44 tok/s Ryms i grafikminnet Q8_0≈36 tok/s Ryms i grafikminnet Q8_0≈30 tok/s Ryms i grafikminnet Q8_0≈30 tok/s Ryms i det delade minnet Q8_0≈44 tok/s Ryms i det delade minnet Q8_0≈13,8 tok/s Ryms i det delade minnet Q8_0≈14,8 tok/s Ryms i det delade minnet Q4_1≈10,2 tok/s Ryms i RAM (CPU) Q8_0≈17,1 tok/s Ryms i RAM (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s Ryms i grafikminnet Q6_K≈18,0 tok/s Ryms i grafikminnet Q8_0≈46 tok/s Ryms i grafikminnet Q8_0≈49 tok/s Ryms i grafikminnet Q8_0≈88 tok/s Ryms i grafikminnet Q8_0≈88 tok/s Ryms i grafikminnet Q8_0≈35 tok/s Ryms i grafikminnet Q8_0≈29 tok/s Ryms i grafikminnet Q8_0≈24 tok/s Ryms i grafikminnet Q8_0≈23 tok/s Ryms i det delade minnet Q8_0≈35 tok/s Ryms i det delade minnet Q8_0≈10,9 tok/s Ryms i det delade minnet Q8_0≈11,7 tok/s Ryms i det delade minnet UD-Q3_K_XL≈10,1 tok/s Ryms i RAM (CPU) Q8_0≈14,6 tok/s Ryms i RAM (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s Körs med avlastning till RAM MXFP4≈55 tok/s Ryms i grafikminnet MXFP4162 tok/suppmätt Ryms i grafikminnet MXFP4≈194 tok/s Ryms i grafikminnet MXFP4≈344 tok/s Ryms i grafikminnet MXFP4≈344 tok/s Ryms i grafikminnet MXFP4≈138 tok/s Ryms i grafikminnet MXFP4≈112 tok/s Ryms i grafikminnet MXFP4≈95 tok/s Ryms i grafikminnet MXFP4≈80 tok/s Ryms i det delade minnet MXFP4116 tok/suppmätt Ryms i det delade minnet MXFP4≈59 tok/s Ryms i det delade minnet MXFP4≈62 tok/s Ryms i det delade minnet MXFP4≈17,2 tok/s Ryms i RAM (CPU) MXFP4≈39 tok/s Ryms i RAM (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10,2 tok/s Körs med avlastning till RAM UD-Q3_K_XL≈18,4 tok/s Ryms i grafikminnet Q6_K≈37 tok/s Ryms i grafikminnet Q6_K≈40 tok/s Ryms i grafikminnet Q8_0≈56 tok/s Ryms i grafikminnet Q8_0≈56 tok/s Ryms i grafikminnet Q8_0≈22 tok/s Ryms i grafikminnet Q8_0≈18,2 tok/s Ryms i grafikminnet Q8_0≈15,3 tok/s Ryms i grafikminnet Q8_0≈14,9 tok/s Ryms i det delade minnet Q8_0≈22 tok/s Ryms i det delade minnet Q5_K_M≈10,3 tok/s Ryms i det delade minnet Q5_K_M≈11,0 tok/s Ryms i det delade minnet Q4_K_M≈6,9 tok/s Ryms i RAM (CPU) Q8_0≈10,3 tok/s Ryms i RAM (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14,7 tok/s Körs med avlastning till RAM UD-Q3_K_M≈56 tok/s Ryms i grafikminnet UD-Q5_K_S≈129 tok/s Ryms i grafikminnet UD-Q5_K_S≈139 tok/s Ryms i grafikminnet UD-Q8_K_XL≈173 tok/s Ryms i grafikminnet UD-Q8_K_XL≈173 tok/s Ryms i grafikminnet UD-Q8_K_XL≈70 tok/s Ryms i grafikminnet UD-Q8_K_XL≈57 tok/s Ryms i grafikminnet UD-Q8_K_XL≈48 tok/s Ryms i grafikminnet UD-Q8_K_XL≈40 tok/s Ryms i det delade minnet UD-Q8_K_XL≈60 tok/s Ryms i det delade minnet UD-Q8_K_XL≈29 tok/s Ryms i det delade minnet UD-Q8_K_XL≈31 tok/s Ryms i det delade minnet UD-Q8_K_XL≈13,7 tok/s Ryms i RAM (CPU) UD-Q8_K_XL≈31 tok/s Ryms i RAM (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12,7 tok/s Körs med avlastning till RAM Q3_K_S≈18,1 tok/s Ryms i grafikminnet UD-Q5_K_XL≈38 tok/s Ryms i grafikminnet UD-Q5_K_XL≈41 tok/s Ryms i grafikminnet UD-Q6_K_XL≈59 tok/s Ryms i grafikminnet Q8_0≈49 tok/s Ryms i grafikminnet Q8_0≈19,7 tok/s Ryms i grafikminnet Q8_0≈16,0 tok/s Ryms i grafikminnet Q8_0≈13,5 tok/s Ryms i grafikminnet Q8_0≈13,1 tok/s Ryms i det delade minnet Q8_0≈19,6 tok/s Ryms i det delade minnet Q4_1≈10,1 tok/s Ryms i det delade minnet Q4_1≈10,8 tok/s Ryms i det delade minnet Q4_K_M≈6,3 tok/s Ryms i RAM (CPU) UD-Q6_K_XL≈10,8 tok/s Ryms i RAM (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16,4 tok/s Körs med avlastning till RAM Q3_K_S≈66 tok/s Ryms i grafikminnet Q4_K_M154 tok/suppmätt Ryms i grafikminnet Q5_K_S≈158 tok/s Ryms i grafikminnet UD-Q6_K_XL≈232 tok/s Ryms i grafikminnet Q8_0≈192 tok/s Ryms i grafikminnet Q8_0≈77 tok/s Ryms i grafikminnet Q8_0≈63 tok/s Ryms i grafikminnet Q8_0≈53 tok/s Ryms i grafikminnet Q8_0≈45 tok/s Ryms i det delade minnet Q8_0≈67 tok/s Ryms i det delade minnet Q8_0≈33 tok/s Ryms i det delade minnet Q8_0≈35 tok/s Ryms i det delade minnet Q8_0≈14,3 tok/s Ryms i RAM (CPU) Q8_0≈32 tok/s Ryms i RAM (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3,8 tok/s Körs med avlastning till RAM Q3_K_S≈10,4 tok/s Körs med avlastning till RAM Q4_1≈37 tok/s Ryms i grafikminnet Q4_1≈40 tok/s Ryms i grafikminnet Q6_K≈55 tok/s Ryms i grafikminnet Q8_0≈43 tok/s Ryms i grafikminnet Q8_0≈17,1 tok/s Ryms i grafikminnet Q8_0≈13,9 tok/s Ryms i grafikminnet Q8_0≈11,7 tok/s Ryms i grafikminnet Q8_0≈11,3 tok/s Ryms i det delade minnet Q8_0≈17,0 tok/s Ryms i det delade minnet IQ4_XS≈10,3 tok/s Ryms i det delade minnet Q4_K_S≈10,3 tok/s Ryms i det delade minnet Q4_K_M≈5,7 tok/s Ryms i RAM (CPU) Q6_K≈10,1 tok/s Ryms i RAM (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3,7 tok/s Körs med avlastning till RAM UD-IQ3_XXS≈14,1 tok/s Körs med avlastning till RAM UD-Q4_K_XL≈35 tok/s Ryms i grafikminnet UD-Q4_K_XL≈38 tok/s Ryms i grafikminnet Q6_K≈51 tok/s Ryms i grafikminnet Q8_0≈40 tok/s Ryms i grafikminnet Q8_0≈16,0 tok/s Ryms i grafikminnet Q8_0≈13,0 tok/s Ryms i grafikminnet Q8_0≈11,0 tok/s Ryms i grafikminnet Q8_0≈10,6 tok/s Ryms i det delade minnet Q8_0≈16,0 tok/s Ryms i det delade minnet UD-Q3_K_XL≈10,3 tok/s Ryms i det delade minnet IQ4_XS≈10,2 tok/s Ryms i det delade minnet Q4_K_M≈5,4 tok/s Ryms i RAM (CPU) Q5_K_M≈10,8 tok/s Ryms i RAM (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17,9 tok/s Körs med avlastning till RAM Q8_0≈18,7 tok/s Körs med avlastning till RAM Q4_K_S≈191 tok/s Ryms i grafikminnet Q4_K_S≈205 tok/s Ryms i grafikminnet Q6_K≈274 tok/s Ryms i grafikminnet Q8_0≈220 tok/s Ryms i grafikminnet Q8_0≈89 tok/s Ryms i grafikminnet Q8_0≈72 tok/s Ryms i grafikminnet Q8_0≈61 tok/s Ryms i grafikminnet Q8_0≈51 tok/s Ryms i det delade minnet Q8_0≈77 tok/s Ryms i det delade minnet Q8_0≈37 tok/s Ryms i det delade minnet Q8_0≈40 tok/s Ryms i det delade minnet Q8_0≈15,0 tok/s Ryms i RAM (CPU) Q8_0≈34 tok/s Ryms i RAM (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1,3 tok/s Körs med avlastning till RAM Q4_K_M≈1,4 tok/s Körs med avlastning till RAM Q4_K_M≈2,0 tok/s Körs med avlastning till RAM Q4_K_M≈2,0 tok/s Körs med avlastning till RAM UD-IQ3_XXS≈49 tok/s Ryms i grafikminnet Q8_0≈18,8 tok/s Ryms i grafikminnet Q4_K_M16,3 tok/suppmätt Ryms i grafikminnet Q4_1≈10,3 tok/s Ryms i grafikminnet IQ4_XS≈10,0 tok/s Ryms i grafikminnet UD-Q3_K_XL≈10,6 tok/s Ryms i det delade minnet Q5_K_M≈11,2 tok/s Ryms i det delade minnet Q4_K_M≈4,1 tok/s Ryms i det delade minnet Q4_K_M≈4,4 tok/s Ryms i det delade minnet Q4_K_M≈2,9 tok/s Ryms i RAM (CPU) Q4_K_M≈6,6 tok/s Ryms i RAM (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s Körs med avlastning till RAM Q6_K≈21 tok/s Körs med avlastning till RAM UD-Q6_K_XL≈26 tok/s Körs med avlastning till RAM UD-Q6_K_XL≈26 tok/s Körs med avlastning till RAM UD-Q6_K_XL≈31 tok/s Körs med avlastning till RAM Q8_0≈213 tok/s Ryms i grafikminnet Q4_K_S≈145 tok/s Ryms i grafikminnet UD-Q6_K_XL≈84 tok/s Ryms i grafikminnet Q8_0≈59 tok/s Ryms i grafikminnet Q8_0≈49 tok/s Ryms i det delade minnet Q8_0≈74 tok/s Ryms i det delade minnet Q8_0≈36 tok/s Ryms i det delade minnet Q8_0≈39 tok/s Ryms i det delade minnet Q8_0≈14,8 tok/s Ryms i RAM (CPU) Q8_0≈33 tok/s Ryms i RAM (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5,3 tok/s Körs med avlastning till RAM Q4_K_S≈5,1 tok/s Körs med avlastning till RAM Q4_K_M≈5,6 tok/s Körs med avlastning till RAM Q4_K_M≈5,7 tok/s Körs med avlastning till RAM Q3_K_M≈10,2 tok/s Körs med avlastning till RAM Q5_K_M≈55 tok/s Ryms i grafikminnet Q4_0≈10,0 tok/s Körs med avlastning till RAM UD-Q4_K_XL≈22 tok/s Ryms i grafikminnet Q5_K_M≈15,2 tok/s Ryms i grafikminnet Q5_K_M≈12,8 tok/s Ryms i det delade minnet Q8_0≈13,9 tok/s Ryms i det delade minnet Q4_K_M≈10,6 tok/s Ryms i det delade minnet Q5_K_M≈10,0 tok/s Ryms i det delade minnet Q4_K_M≈8,0 tok/s Ryms i RAM (CPU) Q8_0≈13,1 tok/s Ryms i RAM (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19,1 tok/s Körs med avlastning till RAM MXFP4≈19,6 tok/s Körs med avlastning till RAM MXFP426–28 tok/suppmätt Körs med avlastning till RAM MXFP4≈25 tok/s Körs med avlastning till RAM MXFP4≈31 tok/s Körs med avlastning till RAM MXFP4≈258 tok/s Ryms i grafikminnet MXFP4≈36 tok/s Körs med avlastning till RAM MXFP441–73 tok/suppmätt Ryms i grafikminnet MXFP4≈71 tok/s Ryms i grafikminnet MXFP4≈60 tok/s Ryms i det delade minnet MXFP4≈90 tok/s Ryms i det delade minnet MXFP450 tok/suppmätt Ryms i det delade minnet MXFP461 tok/suppmätt Ryms i det delade minnet MXFP4≈15,8 tok/s Ryms i RAM (CPU) MXFP4≈36 tok/s Ryms i RAM (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10,5 tok/s Körs med avlastning till RAM UD-IQ4_NL≈10,8 tok/s Körs med avlastning till RAM Q4_K_S≈11,1 tok/s Körs med avlastning till RAM Q4_K_S≈11,2 tok/s Körs med avlastning till RAM UD-Q4_K_XL≈11,9 tok/s Körs med avlastning till RAM UD-Q5_K_XL≈97 tok/s Ryms i grafikminnet UD-IQ3_XXS≈76 tok/s Ryms i grafikminnet UD-IQ4_NL≈46 tok/s Ryms i grafikminnet UD-Q5_K_XL≈27 tok/s Ryms i grafikminnet UD-Q5_K_XL≈23 tok/s Ryms i det delade minnet Q8_0≈24 tok/s Ryms i det delade minnet Q6_K≈15,1 tok/s Ryms i det delade minnet Q6_K≈16,1 tok/s Ryms i det delade minnet UD-Q5_K_XL≈10,4 tok/s Ryms i RAM (CPU) Q8_0≈19,3 tok/s Ryms i RAM (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte UD-Q4_K_XL≈10,8 tok/s Körs med avlastning till RAM UD-Q2_K_XL≈8,0 tok/skraftig komprimering Körs med avlastning till RAM Q3_K_M≈6,1 tok/s Körs med avlastning till RAM UD-Q3_K_XL≈11,7 tok/s Körs med avlastning till RAM UD-Q2_K_XL≈19,4 tok/skraftig komprimering Ryms i det delade minnet Q8_0≈10,8 tok/s Ryms i det delade minnet UD-Q3_K_XL≈12,2 tok/s Ryms i det delade minnet UD-Q3_K_XL≈13,0 tok/s Ryms i det delade minnet Q4_K_M≈7,2 tok/s Ryms i RAM (CPU) Q8_0≈10,9 tok/s Ryms i RAM (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte UD-IQ3_XXS≈7,3 tok/s Körs med avlastning till RAM UD-IQ1_S≈5,6 tok/skraftig komprimering Körs med avlastning till RAM UD-IQ2_XXS≈4,7 tok/skraftig komprimering Körs med avlastning till RAM UD-IQ3_XXS≈3,5 tok/s Körs med avlastning till RAM UD-TQ1_0≈16,2 tok/skraftig komprimering Ryms i det delade minnet Q4_1≈10,0 tok/s Ryms i det delade minnet UD-IQ1_M≈9,6 tok/skraftig komprimering Ryms i det delade minnet UD-IQ1_M≈10,3 tok/skraftig komprimering Ryms i det delade minnet Q4_K_M≈4,7 tok/s Ryms i RAM (CPU) Q4_1≈10,2 tok/s Ryms i RAM (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte UD-IQ1_S≈16,9 tok/skraftig komprimering Körs med avlastning till RAM ✕ Ryms inte ✕ Ryms inte UD-IQ1_S≈8,0 tok/skraftig komprimering Körs med avlastning till RAM ✕ Ryms inte Q3_K_M≈14,9 tok/s Ryms i det delade minnet ✕ Ryms inte ✕ Ryms inte Q4_K_M≈5,2 tok/s Ryms i RAM (CPU) Q3_K_M≈13,9 tok/s Ryms i RAM (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte ✕ Ryms inte UD-Q2_K_XL≈22 tok/skraftig komprimering Ryms i det delade minnet ✕ Ryms inte ✕ Ryms inte Q3_K_S≈7,2 tok/s Ryms i RAM (CPU) UD-IQ2_XXS≈19,7 tok/skraftig komprimering Ryms i RAM (CPU)

Vad som öppnar sig vid varje minnesstorlek (kontext 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B kraftig komprimering: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B kraftig komprimering: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B kraftig komprimering: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B kraftig komprimering: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B kraftig komprimering: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b kraftig komprimering: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 kraftig komprimering: DeepSeek R1
  9. 256 GB kraftig komprimering: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ uppskattningar för ett sammanhang på 8K: vikter + KV-cache + körmiljöns overhead mot minnet; hastighet från minnesbandbredden. De faktiska siffrorna beror på körmiljö och inställningar.

Uppdaterad · Källor: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Bädda in på din webbplats

Klistra in koden där infografiken ska visas: den uppdaterar sig själv. Gratis att använda — behåll källänken.

JSON Våra data: CC BY 4.0 med länk till källan; tredjepartsdata behåller källans licens.

Läs en ruta i matrisen

Raderna är kända modeller med öppna vikter (open weights), från ungefär 3B till 1T parametrar. Kolumnerna är grafikkort, byggen med flera GPU:er, Apple- och AMD-maskiner med delat minne samt CPU-servrar. Varje ruta anger vilken kvantisering vi rekommenderar, var modellen hamnar – grafikminne, delat minne, server-RAM, avlastning till RAM eller ”Ryms inte” – och ungefär hur många tokens per sekund den genererar.

Så räknar vi, steg för steg

  1. Vikterna. Antal parametrar gånger bitar per vikt, eller den verkliga storleken på kvantfilen från Hugging Face när den finns.
  2. KV-cachen. Minnet som håller samtalet. Matrisen räknar med en kontext på 8192 tokens; vid lång kontext kan cachen kräva lika mycket som en liten modell.
  3. Omkostnader. Ungefär 1,5 GB för körmiljö och buffertar, plus bildprojektorn i en VLM.
  4. Hastigheten. Minnesbandbredden delad med antalet byte som läses per token. En mixture-of-experts-modell (MoE) läser bara sina aktiva parametrar, så en stor MoE kan generera snabbare än en mindre tät modell.

Blir summan större än grafikkortets VRAM men ryms tillsammans med system-RAM visar rutan avlastning: modellen körs, bara långsammare.

Varför just den kvanten

Vi väljer den tyngsta kvanten upp till och med Q8_0 som fortfarande ger minst 10 tokens per sekund, annars en fil i Q4-klassen som Q4_K_M. BF16 rekommenderar vi aldrig, eftersom det dubblar minnet för en vinst du knappt märker. Under Q3 går vi bara när inget annat ryms, och då varnar rutan för ”kraftig komprimering”.

Räkna på din egen dator

Kalkylatorn under matrisen tar modell, kvant, kontextlängd och hårdvara, eller bara ditt grafikminne, RAM och din minnesbandbredd, och ritar vikter, KV-cache och omkostnader som en stapel mot kapaciteten. Stegen under den visar vad som öppnas vid 8, 12, 16, 24, 48, 96 och 128 GB.

Siffror med ≈ är uppskattningar, kalibrerade mot uppmätta körningar och inom ungefär ±35 % av dem; finns en riktig mätning visas den med länk till källan. Uppskattningen gäller bara genereringen, inte tiden det tar att läsa in en lång fråga, och drivrutiner, version och inställningar flyttar resultatet åt båda hållen. Modeller utan säkerhetsfilter döljs bakom en brytare. GGUF-filer körs i lokala AI-appar som llama.cpp, LM Studio, Ollama och Jan, och hela maskiner hittar du bland datorbyggena.