Hvilken åpen modell passer for maskinvaren din — 2026
Åpne vektmodeller mot populære skjermkort og datamaskiner: anbefalt kvantisering (den største opp til Q8 som fortsatt gir 10 eller flere tokens per sekund, ellers en av Q4-klassen; under Q3 bare når ingenting annet passer), hvor den kjører (grafikkminne, felles minne eller avlastet til RAM) og en omtrentlig genereringshastighet.
| Modell | Parametere | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈84 tok/s Passer i grafikkminnet | Q8_0≈67 tok/s Passer i grafikkminnet | Q8_0≈218 tok/s Passer i grafikkminnet | Q8_0≈235 tok/s Passer i grafikkminnet | Q8_0≈417 tok/s Passer i grafikkminnet | Q8_0≈417 tok/s Passer i grafikkminnet | Q8_0≈168 tok/s Passer i grafikkminnet | Q8_0≈136 tok/s Passer i grafikkminnet | Q8_0≈115 tok/s Passer i grafikkminnet | Q8_0≈111 tok/s Får plass i felles minne | Q8_0≈167 tok/s Får plass i felles minne | Q8_0≈52 tok/s Får plass i felles minne | Q8_0≈56 tok/s Får plass i felles minne | Q8_0≈15,0 tok/s Får plass i RAM (CPU) | Q8_0≈34 tok/s Får plass i RAM (CPU) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈74 tok/s Passer i grafikkminnet | Q8_0≈59 tok/s Passer i grafikkminnet | Q8_0≈192 tok/s Passer i grafikkminnet | Q8_0≈207 tok/s Passer i grafikkminnet | Q8_0≈368 tok/s Passer i grafikkminnet | Q8_0≈368 tok/s Passer i grafikkminnet | Q8_0≈148 tok/s Passer i grafikkminnet | Q8_0≈120 tok/s Passer i grafikkminnet | Q8_0≈101 tok/s Passer i grafikkminnet | Q8_0≈98 tok/s Får plass i felles minne | Q8_0≈147 tok/s Får plass i felles minne | Q8_0≈46 tok/s Får plass i felles minne | Q8_0≈49 tok/s Får plass i felles minne | Q8_0≈14,3 tok/s Får plass i RAM (CPU) | Q8_0≈32 tok/s Får plass i RAM (CPU) |
| Gemma 3 4B HF | 4.3B | Q8_0≈67 tok/s Passer i grafikkminnet | Q8_0≈54 tok/s Passer i grafikkminnet | Q8_0≈175 tok/s Passer i grafikkminnet | Q8_0≈189 tok/s Passer i grafikkminnet | Q8_0≈335 tok/s Passer i grafikkminnet | Q8_0≈335 tok/s Passer i grafikkminnet | Q8_0≈135 tok/s Passer i grafikkminnet | Q8_0≈109 tok/s Passer i grafikkminnet | Q8_0≈92 tok/s Passer i grafikkminnet | Q8_0≈89 tok/s Får plass i felles minne | Q8_0≈134 tok/s Får plass i felles minne | Q8_0≈42 tok/s Får plass i felles minne | Q8_0≈45 tok/s Får plass i felles minne | Q8_0≈13,8 tok/s Får plass i RAM (CPU) | Q8_0≈31 tok/s Får plass i RAM (CPU) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈37 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈29 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈95 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈103 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈182 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈182 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈73 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈59 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈50 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈49 tok/s Får plass i felles minne | UD-Q6_K_XL≈73 tok/s Får plass i felles minne | UD-Q6_K_XL≈23 tok/s Får plass i felles minne | UD-Q6_K_XL≈24 tok/s Får plass i felles minne | UD-Q6_K_XL≈10,3 tok/s Får plass i RAM (CPU) | UD-Q6_K_XL≈23 tok/s Får plass i RAM (CPU) |
| Qwen3 8B HF | 8.2B | Q8_0≈31 tok/s Passer i grafikkminnet | Q8_0≈25 tok/s Passer i grafikkminnet | Q8_0≈80 tok/s Passer i grafikkminnet | Q8_0≈87 tok/s Passer i grafikkminnet | Q8_0≈154 tok/s Passer i grafikkminnet | Q8_0≈154 tok/s Passer i grafikkminnet | Q8_0≈62 tok/s Passer i grafikkminnet | Q8_0≈50 tok/s Passer i grafikkminnet | Q8_0≈42 tok/s Passer i grafikkminnet | Q8_0≈41 tok/s Får plass i felles minne | Q8_0≈62 tok/s Får plass i felles minne | Q8_0≈19,2 tok/s Får plass i felles minne | Q8_0≈21 tok/s Får plass i felles minne | UD-Q6_K_XL≈10,2 tok/s Får plass i RAM (CPU) | Q8_0≈21 tok/s Får plass i RAM (CPU) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈32 tok/s Passer i grafikkminnet | Q8_0≈17,8 tok/s Passer i grafikkminnet | Q8_0≈58 tok/s Passer i grafikkminnet | Q8_0≈62 tok/s Passer i grafikkminnet | Q8_0≈111 tok/s Passer i grafikkminnet | Q8_0≈111 tok/s Passer i grafikkminnet | Q8_0≈44 tok/s Passer i grafikkminnet | Q8_0≈36 tok/s Passer i grafikkminnet | Q8_0≈30 tok/s Passer i grafikkminnet | Q8_0≈30 tok/s Får plass i felles minne | Q8_0≈44 tok/s Får plass i felles minne | Q8_0≈13,8 tok/s Får plass i felles minne | Q8_0≈14,8 tok/s Får plass i felles minne | Q4_1≈10,2 tok/s Får plass i RAM (CPU) | Q8_0≈17,1 tok/s Får plass i RAM (CPU) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈30 tok/s Passer i grafikkminnet | Q6_K≈18,0 tok/s Passer i grafikkminnet | Q8_0≈46 tok/s Passer i grafikkminnet | Q8_0≈49 tok/s Passer i grafikkminnet | Q8_0≈88 tok/s Passer i grafikkminnet | Q8_0≈88 tok/s Passer i grafikkminnet | Q8_0≈35 tok/s Passer i grafikkminnet | Q8_0≈29 tok/s Passer i grafikkminnet | Q8_0≈24 tok/s Passer i grafikkminnet | Q8_0≈23 tok/s Får plass i felles minne | Q8_0≈35 tok/s Får plass i felles minne | Q8_0≈10,9 tok/s Får plass i felles minne | Q8_0≈11,7 tok/s Får plass i felles minne | UD-Q3_K_XL≈10,1 tok/s Får plass i RAM (CPU) | Q8_0≈14,6 tok/s Får plass i RAM (CPU) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈53 tok/s Kjører med avlasting til RAM | MXFP4≈55 tok/s Passer i grafikkminnet | MXFP4162 tok/smålt Passer i grafikkminnet | MXFP4≈194 tok/s Passer i grafikkminnet | MXFP4≈344 tok/s Passer i grafikkminnet | MXFP4≈344 tok/s Passer i grafikkminnet | MXFP4≈138 tok/s Passer i grafikkminnet | MXFP4≈112 tok/s Passer i grafikkminnet | MXFP4≈95 tok/s Passer i grafikkminnet | MXFP4≈80 tok/s Får plass i felles minne | MXFP4116 tok/smålt Får plass i felles minne | MXFP4≈59 tok/s Får plass i felles minne | MXFP4≈62 tok/s Får plass i felles minne | MXFP4≈17,2 tok/s Får plass i RAM (CPU) | MXFP4≈39 tok/s Får plass i RAM (CPU) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈10,2 tok/s Kjører med avlasting til RAM | UD-Q3_K_XL≈18,4 tok/s Passer i grafikkminnet | Q6_K≈37 tok/s Passer i grafikkminnet | Q6_K≈40 tok/s Passer i grafikkminnet | Q8_0≈56 tok/s Passer i grafikkminnet | Q8_0≈56 tok/s Passer i grafikkminnet | Q8_0≈22 tok/s Passer i grafikkminnet | Q8_0≈18,2 tok/s Passer i grafikkminnet | Q8_0≈15,3 tok/s Passer i grafikkminnet | Q8_0≈14,9 tok/s Får plass i felles minne | Q8_0≈22 tok/s Får plass i felles minne | Q5_K_M≈10,3 tok/s Får plass i felles minne | Q5_K_M≈11,0 tok/s Får plass i felles minne | Q4_K_M≈6,9 tok/s Får plass i RAM (CPU) | Q8_0≈10,3 tok/s Får plass i RAM (CPU) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈14,7 tok/s Kjører med avlasting til RAM | UD-Q3_K_M≈56 tok/s Passer i grafikkminnet | UD-Q5_K_S≈129 tok/s Passer i grafikkminnet | UD-Q5_K_S≈139 tok/s Passer i grafikkminnet | UD-Q8_K_XL≈173 tok/s Passer i grafikkminnet | UD-Q8_K_XL≈173 tok/s Passer i grafikkminnet | UD-Q8_K_XL≈70 tok/s Passer i grafikkminnet | UD-Q8_K_XL≈57 tok/s Passer i grafikkminnet | UD-Q8_K_XL≈48 tok/s Passer i grafikkminnet | UD-Q8_K_XL≈40 tok/s Får plass i felles minne | UD-Q8_K_XL≈60 tok/s Får plass i felles minne | UD-Q8_K_XL≈29 tok/s Får plass i felles minne | UD-Q8_K_XL≈31 tok/s Får plass i felles minne | UD-Q8_K_XL≈13,7 tok/s Får plass i RAM (CPU) | UD-Q8_K_XL≈31 tok/s Får plass i RAM (CPU) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈12,7 tok/s Kjører med avlasting til RAM | Q3_K_S≈18,1 tok/s Passer i grafikkminnet | UD-Q5_K_XL≈38 tok/s Passer i grafikkminnet | UD-Q5_K_XL≈41 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈59 tok/s Passer i grafikkminnet | Q8_0≈49 tok/s Passer i grafikkminnet | Q8_0≈19,7 tok/s Passer i grafikkminnet | Q8_0≈16,0 tok/s Passer i grafikkminnet | Q8_0≈13,5 tok/s Passer i grafikkminnet | Q8_0≈13,1 tok/s Får plass i felles minne | Q8_0≈19,6 tok/s Får plass i felles minne | Q4_1≈10,1 tok/s Får plass i felles minne | Q4_1≈10,8 tok/s Får plass i felles minne | Q4_K_M≈6,3 tok/s Får plass i RAM (CPU) | UD-Q6_K_XL≈10,8 tok/s Får plass i RAM (CPU) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈16,4 tok/s Kjører med avlasting til RAM | Q3_K_S≈66 tok/s Passer i grafikkminnet | Q4_K_M154 tok/smålt Passer i grafikkminnet | Q5_K_S≈158 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈232 tok/s Passer i grafikkminnet | Q8_0≈192 tok/s Passer i grafikkminnet | Q8_0≈77 tok/s Passer i grafikkminnet | Q8_0≈63 tok/s Passer i grafikkminnet | Q8_0≈53 tok/s Passer i grafikkminnet | Q8_0≈45 tok/s Får plass i felles minne | Q8_0≈67 tok/s Får plass i felles minne | Q8_0≈33 tok/s Får plass i felles minne | Q8_0≈35 tok/s Får plass i felles minne | Q8_0≈14,3 tok/s Får plass i RAM (CPU) | Q8_0≈32 tok/s Får plass i RAM (CPU) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈3,8 tok/s Kjører med avlasting til RAM | Q3_K_S≈10,4 tok/s Kjører med avlasting til RAM | Q4_1≈37 tok/s Passer i grafikkminnet | Q4_1≈40 tok/s Passer i grafikkminnet | Q6_K≈55 tok/s Passer i grafikkminnet | Q8_0≈43 tok/s Passer i grafikkminnet | Q8_0≈17,1 tok/s Passer i grafikkminnet | Q8_0≈13,9 tok/s Passer i grafikkminnet | Q8_0≈11,7 tok/s Passer i grafikkminnet | Q8_0≈11,3 tok/s Får plass i felles minne | Q8_0≈17,0 tok/s Får plass i felles minne | IQ4_XS≈10,3 tok/s Får plass i felles minne | Q4_K_S≈10,3 tok/s Får plass i felles minne | Q4_K_M≈5,7 tok/s Får plass i RAM (CPU) | Q6_K≈10,1 tok/s Får plass i RAM (CPU) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈3,7 tok/s Kjører med avlasting til RAM | UD-IQ3_XXS≈14,1 tok/s Kjører med avlasting til RAM | UD-Q4_K_XL≈35 tok/s Passer i grafikkminnet | UD-Q4_K_XL≈38 tok/s Passer i grafikkminnet | Q6_K≈51 tok/s Passer i grafikkminnet | Q8_0≈40 tok/s Passer i grafikkminnet | Q8_0≈16,0 tok/s Passer i grafikkminnet | Q8_0≈13,0 tok/s Passer i grafikkminnet | Q8_0≈11,0 tok/s Passer i grafikkminnet | Q8_0≈10,6 tok/s Får plass i felles minne | Q8_0≈16,0 tok/s Får plass i felles minne | UD-Q3_K_XL≈10,3 tok/s Får plass i felles minne | IQ4_XS≈10,2 tok/s Får plass i felles minne | Q4_K_M≈5,4 tok/s Får plass i RAM (CPU) | Q5_K_M≈10,8 tok/s Får plass i RAM (CPU) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈17,9 tok/s Kjører med avlasting til RAM | Q8_0≈18,7 tok/s Kjører med avlasting til RAM | Q4_K_S≈191 tok/s Passer i grafikkminnet | Q4_K_S≈205 tok/s Passer i grafikkminnet | Q6_K≈274 tok/s Passer i grafikkminnet | Q8_0≈220 tok/s Passer i grafikkminnet | Q8_0≈89 tok/s Passer i grafikkminnet | Q8_0≈72 tok/s Passer i grafikkminnet | Q8_0≈61 tok/s Passer i grafikkminnet | Q8_0≈51 tok/s Får plass i felles minne | Q8_0≈77 tok/s Får plass i felles minne | Q8_0≈37 tok/s Får plass i felles minne | Q8_0≈40 tok/s Får plass i felles minne | Q8_0≈15,0 tok/s Får plass i RAM (CPU) | Q8_0≈34 tok/s Får plass i RAM (CPU) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈1,3 tok/s Kjører med avlasting til RAM | Q4_K_M≈1,4 tok/s Kjører med avlasting til RAM | Q4_K_M≈2,0 tok/s Kjører med avlasting til RAM | Q4_K_M≈2,0 tok/s Kjører med avlasting til RAM | UD-IQ3_XXS≈49 tok/s Passer i grafikkminnet | Q8_0≈18,8 tok/s Passer i grafikkminnet | Q4_K_M16,3 tok/smålt Passer i grafikkminnet | Q4_1≈10,3 tok/s Passer i grafikkminnet | IQ4_XS≈10,0 tok/s Passer i grafikkminnet | UD-Q3_K_XL≈10,6 tok/s Får plass i felles minne | Q5_K_M≈11,2 tok/s Får plass i felles minne | Q4_K_M≈4,1 tok/s Får plass i felles minne | Q4_K_M≈4,4 tok/s Får plass i felles minne | Q4_K_M≈2,9 tok/s Får plass i RAM (CPU) | Q4_K_M≈6,6 tok/s Får plass i RAM (CPU) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈24 tok/s Kjører med avlasting til RAM | Q6_K≈21 tok/s Kjører med avlasting til RAM | UD-Q6_K_XL≈26 tok/s Kjører med avlasting til RAM | UD-Q6_K_XL≈26 tok/s Kjører med avlasting til RAM | UD-Q6_K_XL≈31 tok/s Kjører med avlasting til RAM | Q8_0≈213 tok/s Passer i grafikkminnet | Q4_K_S≈145 tok/s Passer i grafikkminnet | UD-Q6_K_XL≈84 tok/s Passer i grafikkminnet | Q8_0≈59 tok/s Passer i grafikkminnet | Q8_0≈49 tok/s Får plass i felles minne | Q8_0≈74 tok/s Får plass i felles minne | Q8_0≈36 tok/s Får plass i felles minne | Q8_0≈39 tok/s Får plass i felles minne | Q8_0≈14,8 tok/s Får plass i RAM (CPU) | Q8_0≈33 tok/s Får plass i RAM (CPU) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈5,3 tok/s Kjører med avlasting til RAM | Q4_K_S≈5,1 tok/s Kjører med avlasting til RAM | Q4_K_M≈5,6 tok/s Kjører med avlasting til RAM | Q4_K_M≈5,7 tok/s Kjører med avlasting til RAM | Q3_K_M≈10,2 tok/s Kjører med avlasting til RAM | Q5_K_M≈55 tok/s Passer i grafikkminnet | Q4_0≈10,0 tok/s Kjører med avlasting til RAM | UD-Q4_K_XL≈22 tok/s Passer i grafikkminnet | Q5_K_M≈15,2 tok/s Passer i grafikkminnet | Q5_K_M≈12,8 tok/s Får plass i felles minne | Q8_0≈13,9 tok/s Får plass i felles minne | Q4_K_M≈10,6 tok/s Får plass i felles minne | Q5_K_M≈10,0 tok/s Får plass i felles minne | Q4_K_M≈8,0 tok/s Får plass i RAM (CPU) | Q8_0≈13,1 tok/s Får plass i RAM (CPU) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈19,1 tok/s Kjører med avlasting til RAM | MXFP4≈19,6 tok/s Kjører med avlasting til RAM | MXFP426–28 tok/smålt Kjører med avlasting til RAM | MXFP4≈25 tok/s Kjører med avlasting til RAM | MXFP4≈31 tok/s Kjører med avlasting til RAM | MXFP4≈258 tok/s Passer i grafikkminnet | MXFP4≈36 tok/s Kjører med avlasting til RAM | MXFP441–73 tok/smålt Passer i grafikkminnet | MXFP4≈71 tok/s Passer i grafikkminnet | MXFP4≈60 tok/s Får plass i felles minne | MXFP4≈90 tok/s Får plass i felles minne | MXFP450 tok/smålt Får plass i felles minne | MXFP461 tok/smålt Får plass i felles minne | MXFP4≈15,8 tok/s Får plass i RAM (CPU) | MXFP4≈36 tok/s Får plass i RAM (CPU) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈10,5 tok/s Kjører med avlasting til RAM | UD-IQ4_NL≈10,8 tok/s Kjører med avlasting til RAM | Q4_K_S≈11,1 tok/s Kjører med avlasting til RAM | Q4_K_S≈11,2 tok/s Kjører med avlasting til RAM | UD-Q4_K_XL≈11,9 tok/s Kjører med avlasting til RAM | UD-Q5_K_XL≈97 tok/s Passer i grafikkminnet | UD-IQ3_XXS≈76 tok/s Passer i grafikkminnet | UD-IQ4_NL≈46 tok/s Passer i grafikkminnet | UD-Q5_K_XL≈27 tok/s Passer i grafikkminnet | UD-Q5_K_XL≈23 tok/s Får plass i felles minne | Q8_0≈24 tok/s Får plass i felles minne | Q6_K≈15,1 tok/s Får plass i felles minne | Q6_K≈16,1 tok/s Får plass i felles minne | UD-Q5_K_XL≈10,4 tok/s Får plass i RAM (CPU) | Q8_0≈19,3 tok/s Får plass i RAM (CPU) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | UD-Q4_K_XL≈10,8 tok/s Kjører med avlasting til RAM | UD-Q2_K_XL≈8,0 tok/skraftig komprimering Kjører med avlasting til RAM | Q3_K_M≈6,1 tok/s Kjører med avlasting til RAM | UD-Q3_K_XL≈11,7 tok/s Kjører med avlasting til RAM | UD-Q2_K_XL≈19,4 tok/skraftig komprimering Får plass i felles minne | Q8_0≈10,8 tok/s Får plass i felles minne | UD-Q3_K_XL≈12,2 tok/s Får plass i felles minne | UD-Q3_K_XL≈13,0 tok/s Får plass i felles minne | Q4_K_M≈7,2 tok/s Får plass i RAM (CPU) | Q8_0≈10,9 tok/s Får plass i RAM (CPU) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | UD-IQ3_XXS≈7,3 tok/s Kjører med avlasting til RAM | UD-IQ1_S≈5,6 tok/skraftig komprimering Kjører med avlasting til RAM | UD-IQ2_XXS≈4,7 tok/skraftig komprimering Kjører med avlasting til RAM | UD-IQ3_XXS≈3,5 tok/s Kjører med avlasting til RAM | UD-TQ1_0≈16,2 tok/skraftig komprimering Får plass i felles minne | Q4_1≈10,0 tok/s Får plass i felles minne | UD-IQ1_M≈9,6 tok/skraftig komprimering Får plass i felles minne | UD-IQ1_M≈10,3 tok/skraftig komprimering Får plass i felles minne | Q4_K_M≈4,7 tok/s Får plass i RAM (CPU) | Q4_1≈10,2 tok/s Får plass i RAM (CPU) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | UD-IQ1_S≈16,9 tok/skraftig komprimering Kjører med avlasting til RAM | ✕ Passer ikke | ✕ Passer ikke | UD-IQ1_S≈8,0 tok/skraftig komprimering Kjører med avlasting til RAM | ✕ Passer ikke | Q3_K_M≈14,9 tok/s Får plass i felles minne | ✕ Passer ikke | ✕ Passer ikke | Q4_K_M≈5,2 tok/s Får plass i RAM (CPU) | Q3_K_M≈13,9 tok/s Får plass i RAM (CPU) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | UD-Q2_K_XL≈22 tok/skraftig komprimering Får plass i felles minne | ✕ Passer ikke | ✕ Passer ikke | Q3_K_S≈7,2 tok/s Får plass i RAM (CPU) | UD-IQ2_XXS≈19,7 tok/skraftig komprimering Får plass i RAM (CPU) |
Kalkulator: passer den?
Hva som åpner seg ved hver minnestørrelse (kontekst 8K)
- 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B kraftig komprimering: Gemma 3 12B · Qwen3 14B
- 12 GB Gemma 3 12B · Qwen3 14B kraftig komprimering: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B kraftig komprimering: Gemma 4 31B · Qwen3.5 35B A3B
- 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B kraftig komprimering: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B kraftig komprimering: GLM 4.5 Air
- 96 GB GLM 4.5 Air · gpt-oss-120b kraftig komprimering: Qwen3 235B A22B · GLM 4.7
- 128 GB Qwen3 235B A22B
- 192 GB GLM 4.7 kraftig komprimering: DeepSeek R1
- 256 GB kraftig komprimering: Kimi K2.5
- 512 GB DeepSeek R1 · Kimi K2.5
≈ estimater for en kontekst på 8K: vekter + KV-cache + kjøretidsoverhead mot minnet; hastighet fra minnebåndbredden. De faktiske tallene avhenger av kjøretid og innstillinger.
Oppdatert · Kilder: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
Bygg inn på nettstedet ditt
Lim inn denne koden der infografikken skal vises: den oppdaterer seg selv. Gratis å bruke — behold kildelenken.
Modeller mot maskiner
Matrisen har kjente modeller med åpne vekter (open weights) i radene, fra rundt 3B til 1T parametere. Kolonnene er grafikkort, bygg med flere GPU-er, Apple- og AMD-maskiner med felles minne og CPU-servere. Hver celle oppgir kvantiseringen vi anbefaler, hvor modellen havner, og omtrent hvor mange tokens i sekundet den genererer. Fargen skiller mellom grafikkminne, felles minne, server-RAM, avlasting til RAM og «Passer ikke».
Tre poster i minneregnskapet
Vektene er hovedposten: antall parametere ganger bit per vekt, eller den faktiske størrelsen på kvantfilen fra Hugging Face når den finnes. Så kommer KV-hurtigbufferen som holder på samtalen. Matrisen regner med en kontekst på 8192 tokens; i kalkulatoren kan du øke den, og med lang kontekst kan bufferen kreve like mye som en liten modell. Til slutt legger vi til omtrent 1,5 GB for kjøremiljø og buffere, pluss bildeprojektoren i en VLM.
Blir summen større enn grafikkortets VRAM, men får plass sammen med system-RAM, viser cellen avlasting. Modellen kjører, bare saktere.
Fart og MoE
Hastigheten anslås som minnebåndbredde delt på antall byte som leses per token. En mixture-of-experts-modell (MoE) leser bare de aktive parameterne sine for hvert token. Derfor kan en stor MoE-modell generere raskere enn en mindre, tett modell.
Valg av kvant
- Vi tar den tyngste kvanten opp til og med Q8_0 som fortsatt gir minst 10 tokens i sekundet.
- Går ikke det, blir det en fil i Q4-klassen, for eksempel Q4_K_M.
- BF16 anbefales aldri: dobbelt så mye minne for en gevinst du knapt merker.
- Under Q3 går vi bare når ingenting annet får plass, og da står det «kraftig komprimering» i cellen.
Hvor presist er det?
Tall med ≈ er anslag, kalibrert mot målte kjøringer og innenfor omtrent ±35 % av dem. Finnes en ekte måling, vises den med lenke til kilden. Anslaget gjelder bare genereringen, ikke tiden det tar å lese inn et langt spørsmål, og drivere, versjon og innstillinger kan dra resultatet begge veier. Modeller uten sikkerhetsfiltre skjules bak en bryter.
Under matrisen kan du regne på din egen maskin, og en stige viser hva som åpner seg ved 8, 12, 16, 24, 48, 96 og 128 GB. GGUF-filer kjøres i lokale AI-apper som llama.cpp, LM Studio, Ollama og Jan. Hele maskiner finner du under PC-bygg.