Gå til indhold
fedi.software

Hvilken åben model passer til din hardware — 2026

Open weights-modeller holdt op mod populære grafikkort og computere: den anbefalede kvantisering (den største op til Q8, der stadig giver 10 eller flere tokens i sekundet, ellers en af Q4-klassen; under Q3 kun når intet andet kan være der), hvor den kører (grafikhukommelse, fælles hukommelse eller aflastet til RAM) og en omtrentlig genereringshastighed.

Model Parametre
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s Passer i grafikhukommelsen Q8_0≈67 tok/s Passer i grafikhukommelsen Q8_0≈218 tok/s Passer i grafikhukommelsen Q8_0≈235 tok/s Passer i grafikhukommelsen Q8_0≈417 tok/s Passer i grafikhukommelsen Q8_0≈417 tok/s Passer i grafikhukommelsen Q8_0≈168 tok/s Passer i grafikhukommelsen Q8_0≈136 tok/s Passer i grafikhukommelsen Q8_0≈115 tok/s Passer i grafikhukommelsen Q8_0≈111 tok/s Passer i den fælles hukommelse Q8_0≈167 tok/s Passer i den fælles hukommelse Q8_0≈52 tok/s Passer i den fælles hukommelse Q8_0≈56 tok/s Passer i den fælles hukommelse Q8_0≈15,0 tok/s Passer i RAM (CPU) Q8_0≈34 tok/s Passer i RAM (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s Passer i grafikhukommelsen Q8_0≈59 tok/s Passer i grafikhukommelsen Q8_0≈192 tok/s Passer i grafikhukommelsen Q8_0≈207 tok/s Passer i grafikhukommelsen Q8_0≈368 tok/s Passer i grafikhukommelsen Q8_0≈368 tok/s Passer i grafikhukommelsen Q8_0≈148 tok/s Passer i grafikhukommelsen Q8_0≈120 tok/s Passer i grafikhukommelsen Q8_0≈101 tok/s Passer i grafikhukommelsen Q8_0≈98 tok/s Passer i den fælles hukommelse Q8_0≈147 tok/s Passer i den fælles hukommelse Q8_0≈46 tok/s Passer i den fælles hukommelse Q8_0≈49 tok/s Passer i den fælles hukommelse Q8_0≈14,3 tok/s Passer i RAM (CPU) Q8_0≈32 tok/s Passer i RAM (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s Passer i grafikhukommelsen Q8_0≈54 tok/s Passer i grafikhukommelsen Q8_0≈175 tok/s Passer i grafikhukommelsen Q8_0≈189 tok/s Passer i grafikhukommelsen Q8_0≈335 tok/s Passer i grafikhukommelsen Q8_0≈335 tok/s Passer i grafikhukommelsen Q8_0≈135 tok/s Passer i grafikhukommelsen Q8_0≈109 tok/s Passer i grafikhukommelsen Q8_0≈92 tok/s Passer i grafikhukommelsen Q8_0≈89 tok/s Passer i den fælles hukommelse Q8_0≈134 tok/s Passer i den fælles hukommelse Q8_0≈42 tok/s Passer i den fælles hukommelse Q8_0≈45 tok/s Passer i den fælles hukommelse Q8_0≈13,8 tok/s Passer i RAM (CPU) Q8_0≈31 tok/s Passer i RAM (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈29 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈95 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈103 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈182 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈182 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈73 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈59 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈50 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈49 tok/s Passer i den fælles hukommelse UD-Q6_K_XL≈73 tok/s Passer i den fælles hukommelse UD-Q6_K_XL≈23 tok/s Passer i den fælles hukommelse UD-Q6_K_XL≈24 tok/s Passer i den fælles hukommelse UD-Q6_K_XL≈10,3 tok/s Passer i RAM (CPU) UD-Q6_K_XL≈23 tok/s Passer i RAM (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s Passer i grafikhukommelsen Q8_0≈25 tok/s Passer i grafikhukommelsen Q8_0≈80 tok/s Passer i grafikhukommelsen Q8_0≈87 tok/s Passer i grafikhukommelsen Q8_0≈154 tok/s Passer i grafikhukommelsen Q8_0≈154 tok/s Passer i grafikhukommelsen Q8_0≈62 tok/s Passer i grafikhukommelsen Q8_0≈50 tok/s Passer i grafikhukommelsen Q8_0≈42 tok/s Passer i grafikhukommelsen Q8_0≈41 tok/s Passer i den fælles hukommelse Q8_0≈62 tok/s Passer i den fælles hukommelse Q8_0≈19,2 tok/s Passer i den fælles hukommelse Q8_0≈21 tok/s Passer i den fælles hukommelse UD-Q6_K_XL≈10,2 tok/s Passer i RAM (CPU) Q8_0≈21 tok/s Passer i RAM (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s Passer i grafikhukommelsen Q8_0≈17,8 tok/s Passer i grafikhukommelsen Q8_0≈58 tok/s Passer i grafikhukommelsen Q8_0≈62 tok/s Passer i grafikhukommelsen Q8_0≈111 tok/s Passer i grafikhukommelsen Q8_0≈111 tok/s Passer i grafikhukommelsen Q8_0≈44 tok/s Passer i grafikhukommelsen Q8_0≈36 tok/s Passer i grafikhukommelsen Q8_0≈30 tok/s Passer i grafikhukommelsen Q8_0≈30 tok/s Passer i den fælles hukommelse Q8_0≈44 tok/s Passer i den fælles hukommelse Q8_0≈13,8 tok/s Passer i den fælles hukommelse Q8_0≈14,8 tok/s Passer i den fælles hukommelse Q4_1≈10,2 tok/s Passer i RAM (CPU) Q8_0≈17,1 tok/s Passer i RAM (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s Passer i grafikhukommelsen Q6_K≈18,0 tok/s Passer i grafikhukommelsen Q8_0≈46 tok/s Passer i grafikhukommelsen Q8_0≈49 tok/s Passer i grafikhukommelsen Q8_0≈88 tok/s Passer i grafikhukommelsen Q8_0≈88 tok/s Passer i grafikhukommelsen Q8_0≈35 tok/s Passer i grafikhukommelsen Q8_0≈29 tok/s Passer i grafikhukommelsen Q8_0≈24 tok/s Passer i grafikhukommelsen Q8_0≈23 tok/s Passer i den fælles hukommelse Q8_0≈35 tok/s Passer i den fælles hukommelse Q8_0≈10,9 tok/s Passer i den fælles hukommelse Q8_0≈11,7 tok/s Passer i den fælles hukommelse UD-Q3_K_XL≈10,1 tok/s Passer i RAM (CPU) Q8_0≈14,6 tok/s Passer i RAM (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s Kører med aflastning til RAM MXFP4≈55 tok/s Passer i grafikhukommelsen MXFP4162 tok/smålt Passer i grafikhukommelsen MXFP4≈194 tok/s Passer i grafikhukommelsen MXFP4≈344 tok/s Passer i grafikhukommelsen MXFP4≈344 tok/s Passer i grafikhukommelsen MXFP4≈138 tok/s Passer i grafikhukommelsen MXFP4≈112 tok/s Passer i grafikhukommelsen MXFP4≈95 tok/s Passer i grafikhukommelsen MXFP4≈80 tok/s Passer i den fælles hukommelse MXFP4116 tok/smålt Passer i den fælles hukommelse MXFP4≈59 tok/s Passer i den fælles hukommelse MXFP4≈62 tok/s Passer i den fælles hukommelse MXFP4≈17,2 tok/s Passer i RAM (CPU) MXFP4≈39 tok/s Passer i RAM (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10,2 tok/s Kører med aflastning til RAM UD-Q3_K_XL≈18,4 tok/s Passer i grafikhukommelsen Q6_K≈37 tok/s Passer i grafikhukommelsen Q6_K≈40 tok/s Passer i grafikhukommelsen Q8_0≈56 tok/s Passer i grafikhukommelsen Q8_0≈56 tok/s Passer i grafikhukommelsen Q8_0≈22 tok/s Passer i grafikhukommelsen Q8_0≈18,2 tok/s Passer i grafikhukommelsen Q8_0≈15,3 tok/s Passer i grafikhukommelsen Q8_0≈14,9 tok/s Passer i den fælles hukommelse Q8_0≈22 tok/s Passer i den fælles hukommelse Q5_K_M≈10,3 tok/s Passer i den fælles hukommelse Q5_K_M≈11,0 tok/s Passer i den fælles hukommelse Q4_K_M≈6,9 tok/s Passer i RAM (CPU) Q8_0≈10,3 tok/s Passer i RAM (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14,7 tok/s Kører med aflastning til RAM UD-Q3_K_M≈56 tok/s Passer i grafikhukommelsen UD-Q5_K_S≈129 tok/s Passer i grafikhukommelsen UD-Q5_K_S≈139 tok/s Passer i grafikhukommelsen UD-Q8_K_XL≈173 tok/s Passer i grafikhukommelsen UD-Q8_K_XL≈173 tok/s Passer i grafikhukommelsen UD-Q8_K_XL≈70 tok/s Passer i grafikhukommelsen UD-Q8_K_XL≈57 tok/s Passer i grafikhukommelsen UD-Q8_K_XL≈48 tok/s Passer i grafikhukommelsen UD-Q8_K_XL≈40 tok/s Passer i den fælles hukommelse UD-Q8_K_XL≈60 tok/s Passer i den fælles hukommelse UD-Q8_K_XL≈29 tok/s Passer i den fælles hukommelse UD-Q8_K_XL≈31 tok/s Passer i den fælles hukommelse UD-Q8_K_XL≈13,7 tok/s Passer i RAM (CPU) UD-Q8_K_XL≈31 tok/s Passer i RAM (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12,7 tok/s Kører med aflastning til RAM Q3_K_S≈18,1 tok/s Passer i grafikhukommelsen UD-Q5_K_XL≈38 tok/s Passer i grafikhukommelsen UD-Q5_K_XL≈41 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈59 tok/s Passer i grafikhukommelsen Q8_0≈49 tok/s Passer i grafikhukommelsen Q8_0≈19,7 tok/s Passer i grafikhukommelsen Q8_0≈16,0 tok/s Passer i grafikhukommelsen Q8_0≈13,5 tok/s Passer i grafikhukommelsen Q8_0≈13,1 tok/s Passer i den fælles hukommelse Q8_0≈19,6 tok/s Passer i den fælles hukommelse Q4_1≈10,1 tok/s Passer i den fælles hukommelse Q4_1≈10,8 tok/s Passer i den fælles hukommelse Q4_K_M≈6,3 tok/s Passer i RAM (CPU) UD-Q6_K_XL≈10,8 tok/s Passer i RAM (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16,4 tok/s Kører med aflastning til RAM Q3_K_S≈66 tok/s Passer i grafikhukommelsen Q4_K_M154 tok/smålt Passer i grafikhukommelsen Q5_K_S≈158 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈232 tok/s Passer i grafikhukommelsen Q8_0≈192 tok/s Passer i grafikhukommelsen Q8_0≈77 tok/s Passer i grafikhukommelsen Q8_0≈63 tok/s Passer i grafikhukommelsen Q8_0≈53 tok/s Passer i grafikhukommelsen Q8_0≈45 tok/s Passer i den fælles hukommelse Q8_0≈67 tok/s Passer i den fælles hukommelse Q8_0≈33 tok/s Passer i den fælles hukommelse Q8_0≈35 tok/s Passer i den fælles hukommelse Q8_0≈14,3 tok/s Passer i RAM (CPU) Q8_0≈32 tok/s Passer i RAM (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3,8 tok/s Kører med aflastning til RAM Q3_K_S≈10,4 tok/s Kører med aflastning til RAM Q4_1≈37 tok/s Passer i grafikhukommelsen Q4_1≈40 tok/s Passer i grafikhukommelsen Q6_K≈55 tok/s Passer i grafikhukommelsen Q8_0≈43 tok/s Passer i grafikhukommelsen Q8_0≈17,1 tok/s Passer i grafikhukommelsen Q8_0≈13,9 tok/s Passer i grafikhukommelsen Q8_0≈11,7 tok/s Passer i grafikhukommelsen Q8_0≈11,3 tok/s Passer i den fælles hukommelse Q8_0≈17,0 tok/s Passer i den fælles hukommelse IQ4_XS≈10,3 tok/s Passer i den fælles hukommelse Q4_K_S≈10,3 tok/s Passer i den fælles hukommelse Q4_K_M≈5,7 tok/s Passer i RAM (CPU) Q6_K≈10,1 tok/s Passer i RAM (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3,7 tok/s Kører med aflastning til RAM UD-IQ3_XXS≈14,1 tok/s Kører med aflastning til RAM UD-Q4_K_XL≈35 tok/s Passer i grafikhukommelsen UD-Q4_K_XL≈38 tok/s Passer i grafikhukommelsen Q6_K≈51 tok/s Passer i grafikhukommelsen Q8_0≈40 tok/s Passer i grafikhukommelsen Q8_0≈16,0 tok/s Passer i grafikhukommelsen Q8_0≈13,0 tok/s Passer i grafikhukommelsen Q8_0≈11,0 tok/s Passer i grafikhukommelsen Q8_0≈10,6 tok/s Passer i den fælles hukommelse Q8_0≈16,0 tok/s Passer i den fælles hukommelse UD-Q3_K_XL≈10,3 tok/s Passer i den fælles hukommelse IQ4_XS≈10,2 tok/s Passer i den fælles hukommelse Q4_K_M≈5,4 tok/s Passer i RAM (CPU) Q5_K_M≈10,8 tok/s Passer i RAM (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17,9 tok/s Kører med aflastning til RAM Q8_0≈18,7 tok/s Kører med aflastning til RAM Q4_K_S≈191 tok/s Passer i grafikhukommelsen Q4_K_S≈205 tok/s Passer i grafikhukommelsen Q6_K≈274 tok/s Passer i grafikhukommelsen Q8_0≈220 tok/s Passer i grafikhukommelsen Q8_0≈89 tok/s Passer i grafikhukommelsen Q8_0≈72 tok/s Passer i grafikhukommelsen Q8_0≈61 tok/s Passer i grafikhukommelsen Q8_0≈51 tok/s Passer i den fælles hukommelse Q8_0≈77 tok/s Passer i den fælles hukommelse Q8_0≈37 tok/s Passer i den fælles hukommelse Q8_0≈40 tok/s Passer i den fælles hukommelse Q8_0≈15,0 tok/s Passer i RAM (CPU) Q8_0≈34 tok/s Passer i RAM (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1,3 tok/s Kører med aflastning til RAM Q4_K_M≈1,4 tok/s Kører med aflastning til RAM Q4_K_M≈2,0 tok/s Kører med aflastning til RAM Q4_K_M≈2,0 tok/s Kører med aflastning til RAM UD-IQ3_XXS≈49 tok/s Passer i grafikhukommelsen Q8_0≈18,8 tok/s Passer i grafikhukommelsen Q4_K_M16,3 tok/smålt Passer i grafikhukommelsen Q4_1≈10,3 tok/s Passer i grafikhukommelsen IQ4_XS≈10,0 tok/s Passer i grafikhukommelsen UD-Q3_K_XL≈10,6 tok/s Passer i den fælles hukommelse Q5_K_M≈11,2 tok/s Passer i den fælles hukommelse Q4_K_M≈4,1 tok/s Passer i den fælles hukommelse Q4_K_M≈4,4 tok/s Passer i den fælles hukommelse Q4_K_M≈2,9 tok/s Passer i RAM (CPU) Q4_K_M≈6,6 tok/s Passer i RAM (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s Kører med aflastning til RAM Q6_K≈21 tok/s Kører med aflastning til RAM UD-Q6_K_XL≈26 tok/s Kører med aflastning til RAM UD-Q6_K_XL≈26 tok/s Kører med aflastning til RAM UD-Q6_K_XL≈31 tok/s Kører med aflastning til RAM Q8_0≈213 tok/s Passer i grafikhukommelsen Q4_K_S≈145 tok/s Passer i grafikhukommelsen UD-Q6_K_XL≈84 tok/s Passer i grafikhukommelsen Q8_0≈59 tok/s Passer i grafikhukommelsen Q8_0≈49 tok/s Passer i den fælles hukommelse Q8_0≈74 tok/s Passer i den fælles hukommelse Q8_0≈36 tok/s Passer i den fælles hukommelse Q8_0≈39 tok/s Passer i den fælles hukommelse Q8_0≈14,8 tok/s Passer i RAM (CPU) Q8_0≈33 tok/s Passer i RAM (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5,3 tok/s Kører med aflastning til RAM Q4_K_S≈5,1 tok/s Kører med aflastning til RAM Q4_K_M≈5,6 tok/s Kører med aflastning til RAM Q4_K_M≈5,7 tok/s Kører med aflastning til RAM Q3_K_M≈10,2 tok/s Kører med aflastning til RAM Q5_K_M≈55 tok/s Passer i grafikhukommelsen Q4_0≈10,0 tok/s Kører med aflastning til RAM UD-Q4_K_XL≈22 tok/s Passer i grafikhukommelsen Q5_K_M≈15,2 tok/s Passer i grafikhukommelsen Q5_K_M≈12,8 tok/s Passer i den fælles hukommelse Q8_0≈13,9 tok/s Passer i den fælles hukommelse Q4_K_M≈10,6 tok/s Passer i den fælles hukommelse Q5_K_M≈10,0 tok/s Passer i den fælles hukommelse Q4_K_M≈8,0 tok/s Passer i RAM (CPU) Q8_0≈13,1 tok/s Passer i RAM (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19,1 tok/s Kører med aflastning til RAM MXFP4≈19,6 tok/s Kører med aflastning til RAM MXFP426–28 tok/smålt Kører med aflastning til RAM MXFP4≈25 tok/s Kører med aflastning til RAM MXFP4≈31 tok/s Kører med aflastning til RAM MXFP4≈258 tok/s Passer i grafikhukommelsen MXFP4≈36 tok/s Kører med aflastning til RAM MXFP441–73 tok/smålt Passer i grafikhukommelsen MXFP4≈71 tok/s Passer i grafikhukommelsen MXFP4≈60 tok/s Passer i den fælles hukommelse MXFP4≈90 tok/s Passer i den fælles hukommelse MXFP450 tok/smålt Passer i den fælles hukommelse MXFP461 tok/smålt Passer i den fælles hukommelse MXFP4≈15,8 tok/s Passer i RAM (CPU) MXFP4≈36 tok/s Passer i RAM (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10,5 tok/s Kører med aflastning til RAM UD-IQ4_NL≈10,8 tok/s Kører med aflastning til RAM Q4_K_S≈11,1 tok/s Kører med aflastning til RAM Q4_K_S≈11,2 tok/s Kører med aflastning til RAM UD-Q4_K_XL≈11,9 tok/s Kører med aflastning til RAM UD-Q5_K_XL≈97 tok/s Passer i grafikhukommelsen UD-IQ3_XXS≈76 tok/s Passer i grafikhukommelsen UD-IQ4_NL≈46 tok/s Passer i grafikhukommelsen UD-Q5_K_XL≈27 tok/s Passer i grafikhukommelsen UD-Q5_K_XL≈23 tok/s Passer i den fælles hukommelse Q8_0≈24 tok/s Passer i den fælles hukommelse Q6_K≈15,1 tok/s Passer i den fælles hukommelse Q6_K≈16,1 tok/s Passer i den fælles hukommelse UD-Q5_K_XL≈10,4 tok/s Passer i RAM (CPU) Q8_0≈19,3 tok/s Passer i RAM (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke UD-Q4_K_XL≈10,8 tok/s Kører med aflastning til RAM UD-Q2_K_XL≈8,0 tok/skraftig komprimering Kører med aflastning til RAM Q3_K_M≈6,1 tok/s Kører med aflastning til RAM UD-Q3_K_XL≈11,7 tok/s Kører med aflastning til RAM UD-Q2_K_XL≈19,4 tok/skraftig komprimering Passer i den fælles hukommelse Q8_0≈10,8 tok/s Passer i den fælles hukommelse UD-Q3_K_XL≈12,2 tok/s Passer i den fælles hukommelse UD-Q3_K_XL≈13,0 tok/s Passer i den fælles hukommelse Q4_K_M≈7,2 tok/s Passer i RAM (CPU) Q8_0≈10,9 tok/s Passer i RAM (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke UD-IQ3_XXS≈7,3 tok/s Kører med aflastning til RAM UD-IQ1_S≈5,6 tok/skraftig komprimering Kører med aflastning til RAM UD-IQ2_XXS≈4,7 tok/skraftig komprimering Kører med aflastning til RAM UD-IQ3_XXS≈3,5 tok/s Kører med aflastning til RAM UD-TQ1_0≈16,2 tok/skraftig komprimering Passer i den fælles hukommelse Q4_1≈10,0 tok/s Passer i den fælles hukommelse UD-IQ1_M≈9,6 tok/skraftig komprimering Passer i den fælles hukommelse UD-IQ1_M≈10,3 tok/skraftig komprimering Passer i den fælles hukommelse Q4_K_M≈4,7 tok/s Passer i RAM (CPU) Q4_1≈10,2 tok/s Passer i RAM (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke UD-IQ1_S≈16,9 tok/skraftig komprimering Kører med aflastning til RAM ✕ Passer ikke ✕ Passer ikke UD-IQ1_S≈8,0 tok/skraftig komprimering Kører med aflastning til RAM ✕ Passer ikke Q3_K_M≈14,9 tok/s Passer i den fælles hukommelse ✕ Passer ikke ✕ Passer ikke Q4_K_M≈5,2 tok/s Passer i RAM (CPU) Q3_K_M≈13,9 tok/s Passer i RAM (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke ✕ Passer ikke UD-Q2_K_XL≈22 tok/skraftig komprimering Passer i den fælles hukommelse ✕ Passer ikke ✕ Passer ikke Q3_K_S≈7,2 tok/s Passer i RAM (CPU) UD-IQ2_XXS≈19,7 tok/skraftig komprimering Passer i RAM (CPU)

Hvad der åbner sig ved hver hukommelsesstørrelse (kontekst 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B kraftig komprimering: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B kraftig komprimering: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B kraftig komprimering: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B kraftig komprimering: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B kraftig komprimering: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b kraftig komprimering: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 kraftig komprimering: DeepSeek R1
  9. 256 GB kraftig komprimering: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ estimater for en kontekst på 8K: vægte + KV-cache + runtime-overhead holdt op mod hukommelsen; hastighed ud fra hukommelsesbåndbredden. De reelle tal afhænger af runtime og indstillinger.

Opdateret · Kilder: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Indlejr på dit website

Indsæt denne kode, hvor infografikken skal vises: den opdaterer sig selv. Gratis at bruge — behold kildelinket.

JSON Vores data: CC BY 4.0 med link til kilden; tredjepartsdata beholder kildens licens.

Hvad står der i en celle?

Rækkerne er kendte modeller med åbne vægte (open weights) fra omkring 3B til 1T parametre. Kolonnerne er grafikkort, builds med flere GPU'er, Apple- og AMD-maskiner med fælles hukommelse samt CPU-servere. En celle fortæller, hvilken kvantisering vi anbefaler, hvor modellen ligger (grafikhukommelse, fælles hukommelse, server-RAM, aflastning til RAM eller „Passer ikke”), og hvor mange tokens i sekundet den cirka genererer.

Hvordan regnes hukommelsen ud?

Først vægtene: antal parametre gange bits pr. vægt, eller den faktiske størrelse på kvantfilen fra Hugging Face, når den findes. Dertil kommer KV-cachen, der holder samtalen. Matricen regner med en kontekst på 8192 tokens, og i beregneren kan du ændre den; ved lang kontekst kan cachen fylde lige så meget som en lille model. Til sidst lægger vi omkring 1,5 GB oveni til runtime og buffere, plus visionsprojektoren i en VLM.

Er summen større end grafikkortets VRAM, men passer den sammen med system-RAM, viser cellen aflastning. Modellen kører så stadig, bare langsommere.

Hvorfor kan en stor MoE-model være hurtig?

Hastigheden er hukommelsesbåndbredden divideret med de bytes, der læses pr. token. En mixture-of-experts-model (MoE) læser kun sine aktive parametre for hvert token. Derfor kan en stor MoE generere hurtigere end en mindre tæt model.

Hvilken kvantisering vælger I?

  • Den tungeste kvant op til og med Q8_0, der stadig når mindst 10 tokens i sekundet.
  • Kan det ikke lade sig gøre, en fil i Q4-klassen som Q4_K_M.
  • Aldrig BF16: dobbelt så meget hukommelse for en gevinst, du næppe mærker.
  • Under Q3 kun, når intet andet passer, og så advarer cellen om „kraftig komprimering”.

Hvor meget kan jeg stole på tallene?

Værdier med ≈ er estimater. De er kalibreret mod målte kørsler og ligger inden for cirka ±35 % af dem; findes der en rigtig måling, ser du den med link til kilden. Estimatet dækker kun genereringen, ikke den tid det tager at læse en lang prompt, og drivere, runtimeversion og indstillinger trækker resultatet begge veje. Modeller uden sikkerhedsfiltre er skjult bag en kontakt.

Kan jeg regne på min egen maskine?

Ja. Beregneren under matricen tager model, kvant, kontekst og hardware, eller blot din grafikhukommelse, RAM og båndbredde, og tegner vægte, KV-cache og overhead som én bjælke. Stigen nedenunder viser, hvad der åbner sig ved 8, 12, 16, 24, 48, 96 og 128 GB. GGUF-filer kører i lokale AI-apps som llama.cpp, LM Studio, Ollama og Jan, og færdige maskiner finder du under pc-builds.