Hopp til innholdet
fedi.software

Hvilken åpen modell passer for maskinvaren din — 2026

Åpne vektmodeller mot populære skjermkort og datamaskiner: anbefalt kvantisering (den største opp til Q8 som fortsatt gir 10 eller flere tokens per sekund, ellers en av Q4-klassen; under Q3 bare når ingenting annet passer), hvor den kjører (grafikkminne, felles minne eller avlastet til RAM) og en omtrentlig genereringshastighet.

Modell Parametere
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s Passer i grafikkminnet Q8_0≈67 tok/s Passer i grafikkminnet Q8_0≈218 tok/s Passer i grafikkminnet Q8_0≈235 tok/s Passer i grafikkminnet Q8_0≈417 tok/s Passer i grafikkminnet Q8_0≈417 tok/s Passer i grafikkminnet Q8_0≈168 tok/s Passer i grafikkminnet Q8_0≈136 tok/s Passer i grafikkminnet Q8_0≈115 tok/s Passer i grafikkminnet Q8_0≈111 tok/s Får plass i felles minne Q8_0≈167 tok/s Får plass i felles minne Q8_0≈52 tok/s Får plass i felles minne Q8_0≈56 tok/s Får plass i felles minne Q8_0≈15,0 tok/s Får plass i RAM (CPU) Q8_0≈34 tok/s Får plass i RAM (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s Passer i grafikkminnet Q8_0≈59 tok/s Passer i grafikkminnet Q8_0≈192 tok/s Passer i grafikkminnet Q8_0≈207 tok/s Passer i grafikkminnet Q8_0≈368 tok/s Passer i grafikkminnet Q8_0≈368 tok/s Passer i grafikkminnet Q8_0≈148 tok/s Passer i grafikkminnet Q8_0≈120 tok/s Passer i grafikkminnet Q8_0≈101 tok/s Passer i grafikkminnet Q8_0≈98 tok/s Får plass i felles minne Q8_0≈147 tok/s Får plass i felles minne Q8_0≈46 tok/s Får plass i felles minne Q8_0≈49 tok/s Får plass i felles minne Q8_0≈14,3 tok/s Får plass i RAM (CPU) Q8_0≈32 tok/s Får plass i RAM (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s Passer i grafikkminnet Q8_0≈54 tok/s Passer i grafikkminnet Q8_0≈175 tok/s Passer i grafikkminnet Q8_0≈189 tok/s Passer i grafikkminnet Q8_0≈335 tok/s Passer i grafikkminnet Q8_0≈335 tok/s Passer i grafikkminnet Q8_0≈135 tok/s Passer i grafikkminnet Q8_0≈109 tok/s Passer i grafikkminnet Q8_0≈92 tok/s Passer i grafikkminnet Q8_0≈89 tok/s Får plass i felles minne Q8_0≈134 tok/s Får plass i felles minne Q8_0≈42 tok/s Får plass i felles minne Q8_0≈45 tok/s Får plass i felles minne Q8_0≈13,8 tok/s Får plass i RAM (CPU) Q8_0≈31 tok/s Får plass i RAM (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s Passer i grafikkminnet UD-Q6_K_XL≈29 tok/s Passer i grafikkminnet UD-Q6_K_XL≈95 tok/s Passer i grafikkminnet UD-Q6_K_XL≈103 tok/s Passer i grafikkminnet UD-Q6_K_XL≈182 tok/s Passer i grafikkminnet UD-Q6_K_XL≈182 tok/s Passer i grafikkminnet UD-Q6_K_XL≈73 tok/s Passer i grafikkminnet UD-Q6_K_XL≈59 tok/s Passer i grafikkminnet UD-Q6_K_XL≈50 tok/s Passer i grafikkminnet UD-Q6_K_XL≈49 tok/s Får plass i felles minne UD-Q6_K_XL≈73 tok/s Får plass i felles minne UD-Q6_K_XL≈23 tok/s Får plass i felles minne UD-Q6_K_XL≈24 tok/s Får plass i felles minne UD-Q6_K_XL≈10,3 tok/s Får plass i RAM (CPU) UD-Q6_K_XL≈23 tok/s Får plass i RAM (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s Passer i grafikkminnet Q8_0≈25 tok/s Passer i grafikkminnet Q8_0≈80 tok/s Passer i grafikkminnet Q8_0≈87 tok/s Passer i grafikkminnet Q8_0≈154 tok/s Passer i grafikkminnet Q8_0≈154 tok/s Passer i grafikkminnet Q8_0≈62 tok/s Passer i grafikkminnet Q8_0≈50 tok/s Passer i grafikkminnet Q8_0≈42 tok/s Passer i grafikkminnet Q8_0≈41 tok/s Får plass i felles minne Q8_0≈62 tok/s Får plass i felles minne Q8_0≈19,2 tok/s Får plass i felles minne Q8_0≈21 tok/s Får plass i felles minne UD-Q6_K_XL≈10,2 tok/s Får plass i RAM (CPU) Q8_0≈21 tok/s Får plass i RAM (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s Passer i grafikkminnet Q8_0≈17,8 tok/s Passer i grafikkminnet Q8_0≈58 tok/s Passer i grafikkminnet Q8_0≈62 tok/s Passer i grafikkminnet Q8_0≈111 tok/s Passer i grafikkminnet Q8_0≈111 tok/s Passer i grafikkminnet Q8_0≈44 tok/s Passer i grafikkminnet Q8_0≈36 tok/s Passer i grafikkminnet Q8_0≈30 tok/s Passer i grafikkminnet Q8_0≈30 tok/s Får plass i felles minne Q8_0≈44 tok/s Får plass i felles minne Q8_0≈13,8 tok/s Får plass i felles minne Q8_0≈14,8 tok/s Får plass i felles minne Q4_1≈10,2 tok/s Får plass i RAM (CPU) Q8_0≈17,1 tok/s Får plass i RAM (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s Passer i grafikkminnet Q6_K≈18,0 tok/s Passer i grafikkminnet Q8_0≈46 tok/s Passer i grafikkminnet Q8_0≈49 tok/s Passer i grafikkminnet Q8_0≈88 tok/s Passer i grafikkminnet Q8_0≈88 tok/s Passer i grafikkminnet Q8_0≈35 tok/s Passer i grafikkminnet Q8_0≈29 tok/s Passer i grafikkminnet Q8_0≈24 tok/s Passer i grafikkminnet Q8_0≈23 tok/s Får plass i felles minne Q8_0≈35 tok/s Får plass i felles minne Q8_0≈10,9 tok/s Får plass i felles minne Q8_0≈11,7 tok/s Får plass i felles minne UD-Q3_K_XL≈10,1 tok/s Får plass i RAM (CPU) Q8_0≈14,6 tok/s Får plass i RAM (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s Kjører med avlasting til RAM MXFP4≈55 tok/s Passer i grafikkminnet MXFP4162 tok/smålt Passer i grafikkminnet MXFP4≈194 tok/s Passer i grafikkminnet MXFP4≈344 tok/s Passer i grafikkminnet MXFP4≈344 tok/s Passer i grafikkminnet MXFP4≈138 tok/s Passer i grafikkminnet MXFP4≈112 tok/s Passer i grafikkminnet MXFP4≈95 tok/s Passer i grafikkminnet MXFP4≈80 tok/s Får plass i felles minne MXFP4116 tok/smålt Får plass i felles minne MXFP4≈59 tok/s Får plass i felles minne MXFP4≈62 tok/s Får plass i felles minne MXFP4≈17,2 tok/s Får plass i RAM (CPU) MXFP4≈39 tok/s Får plass i RAM (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10,2 tok/s Kjører med avlasting til RAM UD-Q3_K_XL≈18,4 tok/s Passer i grafikkminnet Q6_K≈37 tok/s Passer i grafikkminnet Q6_K≈40 tok/s Passer i grafikkminnet Q8_0≈56 tok/s Passer i grafikkminnet Q8_0≈56 tok/s Passer i grafikkminnet Q8_0≈22 tok/s Passer i grafikkminnet Q8_0≈18,2 tok/s Passer i grafikkminnet Q8_0≈15,3 tok/s Passer i grafikkminnet Q8_0≈14,9 tok/s Får plass i felles minne Q8_0≈22 tok/s Får plass i felles minne Q5_K_M≈10,3 tok/s Får plass i felles minne Q5_K_M≈11,0 tok/s Får plass i felles minne Q4_K_M≈6,9 tok/s Får plass i RAM (CPU) Q8_0≈10,3 tok/s Får plass i RAM (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14,7 tok/s Kjører med avlasting til RAM UD-Q3_K_M≈56 tok/s Passer i grafikkminnet UD-Q5_K_S≈129 tok/s Passer i grafikkminnet UD-Q5_K_S≈139 tok/s Passer i grafikkminnet UD-Q8_K_XL≈173 tok/s Passer i grafikkminnet UD-Q8_K_XL≈173 tok/s Passer i grafikkminnet UD-Q8_K_XL≈70 tok/s Passer i grafikkminnet UD-Q8_K_XL≈57 tok/s Passer i grafikkminnet UD-Q8_K_XL≈48 tok/s Passer i grafikkminnet UD-Q8_K_XL≈40 tok/s Får plass i felles minne UD-Q8_K_XL≈60 tok/s Får plass i felles minne UD-Q8_K_XL≈29 tok/s Får plass i felles minne UD-Q8_K_XL≈31 tok/s Får plass i felles minne UD-Q8_K_XL≈13,7 tok/s Får plass i RAM (CPU) UD-Q8_K_XL≈31 tok/s Får plass i RAM (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12,7 tok/s Kjører med avlasting til RAM Q3_K_S≈18,1 tok/s Passer i grafikkminnet UD-Q5_K_XL≈38 tok/s Passer i grafikkminnet UD-Q5_K_XL≈41 tok/s Passer i grafikkminnet UD-Q6_K_XL≈59 tok/s Passer i grafikkminnet Q8_0≈49 tok/s Passer i grafikkminnet Q8_0≈19,7 tok/s Passer i grafikkminnet Q8_0≈16,0 tok/s Passer i grafikkminnet Q8_0≈13,5 tok/s Passer i grafikkminnet Q8_0≈13,1 tok/s Får plass i felles minne Q8_0≈19,6 tok/s Får plass i felles minne Q4_1≈10,1 tok/s Får plass i felles minne Q4_1≈10,8 tok/s Får plass i felles minne Q4_K_M≈6,3 tok/s Får plass i RAM (CPU) UD-Q6_K_XL≈10,8 tok/s Får plass i RAM (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16,4 tok/s Kjører med avlasting til RAM Q3_K_S≈66 tok/s Passer i grafikkminnet Q4_K_M154 tok/smålt Passer i grafikkminnet Q5_K_S≈158 tok/s Passer i grafikkminnet UD-Q6_K_XL≈232 tok/s Passer i grafikkminnet Q8_0≈192 tok/s Passer i grafikkminnet Q8_0≈77 tok/s Passer i grafikkminnet Q8_0≈63 tok/s Passer i grafikkminnet Q8_0≈53 tok/s Passer i grafikkminnet Q8_0≈45 tok/s Får plass i felles minne Q8_0≈67 tok/s Får plass i felles minne Q8_0≈33 tok/s Får plass i felles minne Q8_0≈35 tok/s Får plass i felles minne Q8_0≈14,3 tok/s Får plass i RAM (CPU) Q8_0≈32 tok/s Får plass i RAM (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3,8 tok/s Kjører med avlasting til RAM Q3_K_S≈10,4 tok/s Kjører med avlasting til RAM Q4_1≈37 tok/s Passer i grafikkminnet Q4_1≈40 tok/s Passer i grafikkminnet Q6_K≈55 tok/s Passer i grafikkminnet Q8_0≈43 tok/s Passer i grafikkminnet Q8_0≈17,1 tok/s Passer i grafikkminnet Q8_0≈13,9 tok/s Passer i grafikkminnet Q8_0≈11,7 tok/s Passer i grafikkminnet Q8_0≈11,3 tok/s Får plass i felles minne Q8_0≈17,0 tok/s Får plass i felles minne IQ4_XS≈10,3 tok/s Får plass i felles minne Q4_K_S≈10,3 tok/s Får plass i felles minne Q4_K_M≈5,7 tok/s Får plass i RAM (CPU) Q6_K≈10,1 tok/s Får plass i RAM (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3,7 tok/s Kjører med avlasting til RAM UD-IQ3_XXS≈14,1 tok/s Kjører med avlasting til RAM UD-Q4_K_XL≈35 tok/s Passer i grafikkminnet UD-Q4_K_XL≈38 tok/s Passer i grafikkminnet Q6_K≈51 tok/s Passer i grafikkminnet Q8_0≈40 tok/s Passer i grafikkminnet Q8_0≈16,0 tok/s Passer i grafikkminnet Q8_0≈13,0 tok/s Passer i grafikkminnet Q8_0≈11,0 tok/s Passer i grafikkminnet Q8_0≈10,6 tok/s Får plass i felles minne Q8_0≈16,0 tok/s Får plass i felles minne UD-Q3_K_XL≈10,3 tok/s Får plass i felles minne IQ4_XS≈10,2 tok/s Får plass i felles minne Q4_K_M≈5,4 tok/s Får plass i RAM (CPU) Q5_K_M≈10,8 tok/s Får plass i RAM (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17,9 tok/s Kjører med avlasting til RAM Q8_0≈18,7 tok/s Kjører med avlasting til RAM Q4_K_S≈191 tok/s Passer i grafikkminnet Q4_K_S≈205 tok/s Passer i grafikkminnet Q6_K≈274 tok/s Passer i grafikkminnet Q8_0≈220 tok/s Passer i grafikkminnet Q8_0≈89 tok/s Passer i grafikkminnet Q8_0≈72 tok/s Passer i grafikkminnet Q8_0≈61 tok/s Passer i grafikkminnet Q8_0≈51 tok/s Får plass i felles minne Q8_0≈77 tok/s Får plass i felles minne Q8_0≈37 tok/s Får plass i felles minne Q8_0≈40 tok/s Får plass i felles minne Q8_0≈15,0 tok/s Får plass i RAM (CPU) Q8_0≈34 tok/s Får plass i RAM (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1,3 tok/s Kjører med avlasting til RAM Q4_K_M≈1,4 tok/s Kjører med avlasting til RAM Q4_K_M≈2,0 tok/s Kjører med avlasting til RAM Q4_K_M≈2,0 tok/s Kjører med avlasting til RAM UD-IQ3_XXS≈49 tok/s Passer i grafikkminnet Q8_0≈18,8 tok/s Passer i grafikkminnet Q4_K_M16,3 tok/smålt Passer i grafikkminnet Q4_1≈10,3 tok/s Passer i grafikkminnet IQ4_XS≈10,0 tok/s Passer i grafikkminnet UD-Q3_K_XL≈10,6 tok/s Får plass i felles minne Q5_K_M≈11,2 tok/s Får plass i felles minne Q4_K_M≈4,1 tok/s Får plass i felles minne Q4_K_M≈4,4 tok/s Får plass i felles minne Q4_K_M≈2,9 tok/s Får plass i RAM (CPU) Q4_K_M≈6,6 tok/s Får plass i RAM (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s Kjører med avlasting til RAM Q6_K≈21 tok/s Kjører med avlasting til RAM UD-Q6_K_XL≈26 tok/s Kjører med avlasting til RAM UD-Q6_K_XL≈26 tok/s Kjører med avlasting til RAM UD-Q6_K_XL≈31 tok/s Kjører med avlasting til RAM Q8_0≈213 tok/s Passer i grafikkminnet Q4_K_S≈145 tok/s Passer i grafikkminnet UD-Q6_K_XL≈84 tok/s Passer i grafikkminnet Q8_0≈59 tok/s Passer i grafikkminnet Q8_0≈49 tok/s Får plass i felles minne Q8_0≈74 tok/s Får plass i felles minne Q8_0≈36 tok/s Får plass i felles minne Q8_0≈39 tok/s Får plass i felles minne Q8_0≈14,8 tok/s Får plass i RAM (CPU) Q8_0≈33 tok/s Får plass i RAM (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5,3 tok/s Kjører med avlasting til RAM Q4_K_S≈5,1 tok/s Kjører med avlasting til RAM Q4_K_M≈5,6 tok/s Kjører med avlasting til RAM Q4_K_M≈5,7 tok/s Kjører med avlasting til RAM Q3_K_M≈10,2 tok/s Kjører med avlasting til RAM Q5_K_M≈55 tok/s Passer i grafikkminnet Q4_0≈10,0 tok/s Kjører med avlasting til RAM UD-Q4_K_XL≈22 tok/s Passer i grafikkminnet Q5_K_M≈15,2 tok/s Passer i grafikkminnet Q5_K_M≈12,8 tok/s Får plass i felles minne Q8_0≈13,9 tok/s Får plass i felles minne Q4_K_M≈10,6 tok/s Får plass i felles minne Q5_K_M≈10,0 tok/s Får plass i felles minne Q4_K_M≈8,0 tok/s Får plass i RAM (CPU) Q8_0≈13,1 tok/s Får plass i RAM (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19,1 tok/s Kjører med avlasting til RAM MXFP4≈19,6 tok/s Kjører med avlasting til RAM MXFP426–28 tok/smålt Kjører med avlasting til RAM MXFP4≈25 tok/s Kjører med avlasting til RAM MXFP4≈31 tok/s Kjører med avlasting til RAM MXFP4≈258 tok/s Passer i grafikkminnet MXFP4≈36 tok/s Kjører med avlasting til RAM MXFP441–73 tok/smålt Passer i grafikkminnet MXFP4≈71 tok/s Passer i grafikkminnet MXFP4≈60 tok/s Får plass i felles minne MXFP4≈90 tok/s Får plass i felles minne MXFP450 tok/smålt Får plass i felles minne MXFP461 tok/smålt Får plass i felles minne MXFP4≈15,8 tok/s Får plass i RAM (CPU) MXFP4≈36 tok/s Får plass i RAM (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10,5 tok/s Kjører med avlasting til RAM UD-IQ4_NL≈10,8 tok/s Kjører med avlasting til RAM Q4_K_S≈11,1 tok/s Kjører med avlasting til RAM Q4_K_S≈11,2 tok/s Kjører med avlasting til RAM UD-Q4_K_XL≈11,9 tok/s Kjører med avlasting til RAM UD-Q5_K_XL≈97 tok/s Passer i grafikkminnet UD-IQ3_XXS≈76 tok/s Passer i grafikkminnet UD-IQ4_NL≈46 tok/s Passer i grafikkminnet UD-Q5_K_XL≈27 tok/s Passer i grafikkminnet UD-Q5_K_XL≈23 tok/s Får plass i felles minne Q8_0≈24 tok/s Får plass i felles minne Q6_K≈15,1 tok/s Får plass i felles minne Q6_K≈16,1 tok/s Får plass i felles minne UD-Q5_K_XL≈10,4 tok/s Får plass i RAM (CPU) Q8_0≈19,3 tok/s Får plass i RAM (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke UD-Q4_K_XL≈10,8 tok/s Kjører med avlasting til RAM UD-Q2_K_XL≈8,0 tok/skraftig komprimering Kjører med avlasting til RAM Q3_K_M≈6,1 tok/s Kjører med avlasting til RAM UD-Q3_K_XL≈11,7 tok/s Kjører med avlasting til RAM UD-Q2_K_XL≈19,4 tok/skraftig komprimering Får plass i felles minne Q8_0≈10,8 tok/s Får plass i felles minne UD-Q3_K_XL≈12,2 tok/s Får plass i felles minne UD-Q3_K_XL≈13,0 tok/s Får plass i felles minne Q4_K_M≈7,2 tok/s Får plass i RAM (CPU) Q8_0≈10,9 tok/s Får plass i RAM (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke UD-IQ3_XXS≈7,3 tok/s Kjører med avlasting til RAM UD-IQ1_S≈5,6 tok/skraftig komprimering Kjører med avlasting til RAM UD-IQ2_XXS≈4,7 tok/skraftig komprimering Kjører med avlasting til RAM UD-IQ3_XXS≈3,5 tok/s Kjører med avlasting til RAM UD-TQ1_0≈16,2 tok/skraftig komprimering Får plass i felles minne Q4_1≈10,0 tok/s Får plass i felles minne UD-IQ1_M≈9,6 tok/skraftig komprimering Får plass i felles minne UD-IQ1_M≈10,3 tok/skraftig komprimering Får plass i felles minne Q4_K_M≈4,7 tok/s Får plass i RAM (CPU) Q4_1≈10,2 tok/s Får plass i RAM (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke UD-IQ1_S≈16,9 tok/skraftig komprimering Kjører med avlasting til RAM ✕ Passer ikke ✕ Passer ikke UD-IQ1_S≈8,0 tok/skraftig komprimering Kjører med avlasting til RAM ✕ Passer ikke Q3_K_M≈14,9 tok/s Får plass i felles minne ✕ Passer ikke ✕ Passer ikke Q4_K_M≈5,2 tok/s Får plass i RAM (CPU) Q3_K_M≈13,9 tok/s Får plass i RAM (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke UD-Q2_K_XL≈22 tok/skraftig komprimering Får plass i felles minne ✕ Passer ikke ✕ Passer ikke Q3_K_S≈7,2 tok/s Får plass i RAM (CPU) UD-IQ2_XXS≈19,7 tok/skraftig komprimering Får plass i RAM (CPU)

Hva som åpner seg ved hver minnestørrelse (kontekst 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B kraftig komprimering: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B kraftig komprimering: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B kraftig komprimering: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B kraftig komprimering: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B kraftig komprimering: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b kraftig komprimering: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 kraftig komprimering: DeepSeek R1
  9. 256 GB kraftig komprimering: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ estimater for en kontekst på 8K: vekter + KV-cache + kjøretidsoverhead mot minnet; hastighet fra minnebåndbredden. De faktiske tallene avhenger av kjøretid og innstillinger.

Oppdatert · Kilder: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Bygg inn på nettstedet ditt

Lim inn denne koden der infografikken skal vises: den oppdaterer seg selv. Gratis å bruke — behold kildelenken.

JSON Våre data: CC BY 4.0 med lenke til kilden; tredjepartsdata beholder kildens lisens.

Modeller mot maskiner

Matrisen har kjente modeller med åpne vekter (open weights) i radene, fra rundt 3B til 1T parametere. Kolonnene er grafikkort, bygg med flere GPU-er, Apple- og AMD-maskiner med felles minne og CPU-servere. Hver celle oppgir kvantiseringen vi anbefaler, hvor modellen havner, og omtrent hvor mange tokens i sekundet den genererer. Fargen skiller mellom grafikkminne, felles minne, server-RAM, avlasting til RAM og «Passer ikke».

Tre poster i minneregnskapet

Vektene er hovedposten: antall parametere ganger bit per vekt, eller den faktiske størrelsen på kvantfilen fra Hugging Face når den finnes. Så kommer KV-hurtigbufferen som holder på samtalen. Matrisen regner med en kontekst på 8192 tokens; i kalkulatoren kan du øke den, og med lang kontekst kan bufferen kreve like mye som en liten modell. Til slutt legger vi til omtrent 1,5 GB for kjøremiljø og buffere, pluss bildeprojektoren i en VLM.

Blir summen større enn grafikkortets VRAM, men får plass sammen med system-RAM, viser cellen avlasting. Modellen kjører, bare saktere.

Fart og MoE

Hastigheten anslås som minnebåndbredde delt på antall byte som leses per token. En mixture-of-experts-modell (MoE) leser bare de aktive parameterne sine for hvert token. Derfor kan en stor MoE-modell generere raskere enn en mindre, tett modell.

Valg av kvant

  • Vi tar den tyngste kvanten opp til og med Q8_0 som fortsatt gir minst 10 tokens i sekundet.
  • Går ikke det, blir det en fil i Q4-klassen, for eksempel Q4_K_M.
  • BF16 anbefales aldri: dobbelt så mye minne for en gevinst du knapt merker.
  • Under Q3 går vi bare når ingenting annet får plass, og da står det «kraftig komprimering» i cellen.

Hvor presist er det?

Tall med ≈ er anslag, kalibrert mot målte kjøringer og innenfor omtrent ±35 % av dem. Finnes en ekte måling, vises den med lenke til kilden. Anslaget gjelder bare genereringen, ikke tiden det tar å lese inn et langt spørsmål, og drivere, versjon og innstillinger kan dra resultatet begge veier. Modeller uten sikkerhetsfiltre skjules bak en bryter.

Under matrisen kan du regne på din egen maskin, og en stige viser hva som åpner seg ved 8, 12, 16, 24, 48, 96 og 128 GB. GGUF-filer kjøres i lokale AI-apper som llama.cpp, LM Studio, Ollama og Jan. Hele maskiner finner du under PC-bygg.