Hvilken åben model passer til din hardware — 2026
Open weights-modeller holdt op mod populære grafikkort og computere: den anbefalede kvantisering (den største op til Q8, der stadig giver 10 eller flere tokens i sekundet, ellers en af Q4-klassen; under Q3 kun når intet andet kan være der), hvor den kører (grafikhukommelse, fælles hukommelse eller aflastet til RAM) og en omtrentlig genereringshastighed.
| Model | Parametre | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈84 tok/s Passer i grafikhukommelsen | Q8_0≈67 tok/s Passer i grafikhukommelsen | Q8_0≈218 tok/s Passer i grafikhukommelsen | Q8_0≈235 tok/s Passer i grafikhukommelsen | Q8_0≈417 tok/s Passer i grafikhukommelsen | Q8_0≈417 tok/s Passer i grafikhukommelsen | Q8_0≈168 tok/s Passer i grafikhukommelsen | Q8_0≈136 tok/s Passer i grafikhukommelsen | Q8_0≈115 tok/s Passer i grafikhukommelsen | Q8_0≈111 tok/s Passer i den fælles hukommelse | Q8_0≈167 tok/s Passer i den fælles hukommelse | Q8_0≈52 tok/s Passer i den fælles hukommelse | Q8_0≈56 tok/s Passer i den fælles hukommelse | Q8_0≈15,0 tok/s Passer i RAM (CPU) | Q8_0≈34 tok/s Passer i RAM (CPU) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈74 tok/s Passer i grafikhukommelsen | Q8_0≈59 tok/s Passer i grafikhukommelsen | Q8_0≈192 tok/s Passer i grafikhukommelsen | Q8_0≈207 tok/s Passer i grafikhukommelsen | Q8_0≈368 tok/s Passer i grafikhukommelsen | Q8_0≈368 tok/s Passer i grafikhukommelsen | Q8_0≈148 tok/s Passer i grafikhukommelsen | Q8_0≈120 tok/s Passer i grafikhukommelsen | Q8_0≈101 tok/s Passer i grafikhukommelsen | Q8_0≈98 tok/s Passer i den fælles hukommelse | Q8_0≈147 tok/s Passer i den fælles hukommelse | Q8_0≈46 tok/s Passer i den fælles hukommelse | Q8_0≈49 tok/s Passer i den fælles hukommelse | Q8_0≈14,3 tok/s Passer i RAM (CPU) | Q8_0≈32 tok/s Passer i RAM (CPU) |
| Gemma 3 4B HF | 4.3B | Q8_0≈67 tok/s Passer i grafikhukommelsen | Q8_0≈54 tok/s Passer i grafikhukommelsen | Q8_0≈175 tok/s Passer i grafikhukommelsen | Q8_0≈189 tok/s Passer i grafikhukommelsen | Q8_0≈335 tok/s Passer i grafikhukommelsen | Q8_0≈335 tok/s Passer i grafikhukommelsen | Q8_0≈135 tok/s Passer i grafikhukommelsen | Q8_0≈109 tok/s Passer i grafikhukommelsen | Q8_0≈92 tok/s Passer i grafikhukommelsen | Q8_0≈89 tok/s Passer i den fælles hukommelse | Q8_0≈134 tok/s Passer i den fælles hukommelse | Q8_0≈42 tok/s Passer i den fælles hukommelse | Q8_0≈45 tok/s Passer i den fælles hukommelse | Q8_0≈13,8 tok/s Passer i RAM (CPU) | Q8_0≈31 tok/s Passer i RAM (CPU) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈37 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈29 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈95 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈103 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈182 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈182 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈73 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈59 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈50 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈49 tok/s Passer i den fælles hukommelse | UD-Q6_K_XL≈73 tok/s Passer i den fælles hukommelse | UD-Q6_K_XL≈23 tok/s Passer i den fælles hukommelse | UD-Q6_K_XL≈24 tok/s Passer i den fælles hukommelse | UD-Q6_K_XL≈10,3 tok/s Passer i RAM (CPU) | UD-Q6_K_XL≈23 tok/s Passer i RAM (CPU) |
| Qwen3 8B HF | 8.2B | Q8_0≈31 tok/s Passer i grafikhukommelsen | Q8_0≈25 tok/s Passer i grafikhukommelsen | Q8_0≈80 tok/s Passer i grafikhukommelsen | Q8_0≈87 tok/s Passer i grafikhukommelsen | Q8_0≈154 tok/s Passer i grafikhukommelsen | Q8_0≈154 tok/s Passer i grafikhukommelsen | Q8_0≈62 tok/s Passer i grafikhukommelsen | Q8_0≈50 tok/s Passer i grafikhukommelsen | Q8_0≈42 tok/s Passer i grafikhukommelsen | Q8_0≈41 tok/s Passer i den fælles hukommelse | Q8_0≈62 tok/s Passer i den fælles hukommelse | Q8_0≈19,2 tok/s Passer i den fælles hukommelse | Q8_0≈21 tok/s Passer i den fælles hukommelse | UD-Q6_K_XL≈10,2 tok/s Passer i RAM (CPU) | Q8_0≈21 tok/s Passer i RAM (CPU) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈32 tok/s Passer i grafikhukommelsen | Q8_0≈17,8 tok/s Passer i grafikhukommelsen | Q8_0≈58 tok/s Passer i grafikhukommelsen | Q8_0≈62 tok/s Passer i grafikhukommelsen | Q8_0≈111 tok/s Passer i grafikhukommelsen | Q8_0≈111 tok/s Passer i grafikhukommelsen | Q8_0≈44 tok/s Passer i grafikhukommelsen | Q8_0≈36 tok/s Passer i grafikhukommelsen | Q8_0≈30 tok/s Passer i grafikhukommelsen | Q8_0≈30 tok/s Passer i den fælles hukommelse | Q8_0≈44 tok/s Passer i den fælles hukommelse | Q8_0≈13,8 tok/s Passer i den fælles hukommelse | Q8_0≈14,8 tok/s Passer i den fælles hukommelse | Q4_1≈10,2 tok/s Passer i RAM (CPU) | Q8_0≈17,1 tok/s Passer i RAM (CPU) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈30 tok/s Passer i grafikhukommelsen | Q6_K≈18,0 tok/s Passer i grafikhukommelsen | Q8_0≈46 tok/s Passer i grafikhukommelsen | Q8_0≈49 tok/s Passer i grafikhukommelsen | Q8_0≈88 tok/s Passer i grafikhukommelsen | Q8_0≈88 tok/s Passer i grafikhukommelsen | Q8_0≈35 tok/s Passer i grafikhukommelsen | Q8_0≈29 tok/s Passer i grafikhukommelsen | Q8_0≈24 tok/s Passer i grafikhukommelsen | Q8_0≈23 tok/s Passer i den fælles hukommelse | Q8_0≈35 tok/s Passer i den fælles hukommelse | Q8_0≈10,9 tok/s Passer i den fælles hukommelse | Q8_0≈11,7 tok/s Passer i den fælles hukommelse | UD-Q3_K_XL≈10,1 tok/s Passer i RAM (CPU) | Q8_0≈14,6 tok/s Passer i RAM (CPU) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈53 tok/s Kører med aflastning til RAM | MXFP4≈55 tok/s Passer i grafikhukommelsen | MXFP4162 tok/smålt Passer i grafikhukommelsen | MXFP4≈194 tok/s Passer i grafikhukommelsen | MXFP4≈344 tok/s Passer i grafikhukommelsen | MXFP4≈344 tok/s Passer i grafikhukommelsen | MXFP4≈138 tok/s Passer i grafikhukommelsen | MXFP4≈112 tok/s Passer i grafikhukommelsen | MXFP4≈95 tok/s Passer i grafikhukommelsen | MXFP4≈80 tok/s Passer i den fælles hukommelse | MXFP4116 tok/smålt Passer i den fælles hukommelse | MXFP4≈59 tok/s Passer i den fælles hukommelse | MXFP4≈62 tok/s Passer i den fælles hukommelse | MXFP4≈17,2 tok/s Passer i RAM (CPU) | MXFP4≈39 tok/s Passer i RAM (CPU) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈10,2 tok/s Kører med aflastning til RAM | UD-Q3_K_XL≈18,4 tok/s Passer i grafikhukommelsen | Q6_K≈37 tok/s Passer i grafikhukommelsen | Q6_K≈40 tok/s Passer i grafikhukommelsen | Q8_0≈56 tok/s Passer i grafikhukommelsen | Q8_0≈56 tok/s Passer i grafikhukommelsen | Q8_0≈22 tok/s Passer i grafikhukommelsen | Q8_0≈18,2 tok/s Passer i grafikhukommelsen | Q8_0≈15,3 tok/s Passer i grafikhukommelsen | Q8_0≈14,9 tok/s Passer i den fælles hukommelse | Q8_0≈22 tok/s Passer i den fælles hukommelse | Q5_K_M≈10,3 tok/s Passer i den fælles hukommelse | Q5_K_M≈11,0 tok/s Passer i den fælles hukommelse | Q4_K_M≈6,9 tok/s Passer i RAM (CPU) | Q8_0≈10,3 tok/s Passer i RAM (CPU) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈14,7 tok/s Kører med aflastning til RAM | UD-Q3_K_M≈56 tok/s Passer i grafikhukommelsen | UD-Q5_K_S≈129 tok/s Passer i grafikhukommelsen | UD-Q5_K_S≈139 tok/s Passer i grafikhukommelsen | UD-Q8_K_XL≈173 tok/s Passer i grafikhukommelsen | UD-Q8_K_XL≈173 tok/s Passer i grafikhukommelsen | UD-Q8_K_XL≈70 tok/s Passer i grafikhukommelsen | UD-Q8_K_XL≈57 tok/s Passer i grafikhukommelsen | UD-Q8_K_XL≈48 tok/s Passer i grafikhukommelsen | UD-Q8_K_XL≈40 tok/s Passer i den fælles hukommelse | UD-Q8_K_XL≈60 tok/s Passer i den fælles hukommelse | UD-Q8_K_XL≈29 tok/s Passer i den fælles hukommelse | UD-Q8_K_XL≈31 tok/s Passer i den fælles hukommelse | UD-Q8_K_XL≈13,7 tok/s Passer i RAM (CPU) | UD-Q8_K_XL≈31 tok/s Passer i RAM (CPU) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈12,7 tok/s Kører med aflastning til RAM | Q3_K_S≈18,1 tok/s Passer i grafikhukommelsen | UD-Q5_K_XL≈38 tok/s Passer i grafikhukommelsen | UD-Q5_K_XL≈41 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈59 tok/s Passer i grafikhukommelsen | Q8_0≈49 tok/s Passer i grafikhukommelsen | Q8_0≈19,7 tok/s Passer i grafikhukommelsen | Q8_0≈16,0 tok/s Passer i grafikhukommelsen | Q8_0≈13,5 tok/s Passer i grafikhukommelsen | Q8_0≈13,1 tok/s Passer i den fælles hukommelse | Q8_0≈19,6 tok/s Passer i den fælles hukommelse | Q4_1≈10,1 tok/s Passer i den fælles hukommelse | Q4_1≈10,8 tok/s Passer i den fælles hukommelse | Q4_K_M≈6,3 tok/s Passer i RAM (CPU) | UD-Q6_K_XL≈10,8 tok/s Passer i RAM (CPU) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈16,4 tok/s Kører med aflastning til RAM | Q3_K_S≈66 tok/s Passer i grafikhukommelsen | Q4_K_M154 tok/smålt Passer i grafikhukommelsen | Q5_K_S≈158 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈232 tok/s Passer i grafikhukommelsen | Q8_0≈192 tok/s Passer i grafikhukommelsen | Q8_0≈77 tok/s Passer i grafikhukommelsen | Q8_0≈63 tok/s Passer i grafikhukommelsen | Q8_0≈53 tok/s Passer i grafikhukommelsen | Q8_0≈45 tok/s Passer i den fælles hukommelse | Q8_0≈67 tok/s Passer i den fælles hukommelse | Q8_0≈33 tok/s Passer i den fælles hukommelse | Q8_0≈35 tok/s Passer i den fælles hukommelse | Q8_0≈14,3 tok/s Passer i RAM (CPU) | Q8_0≈32 tok/s Passer i RAM (CPU) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈3,8 tok/s Kører med aflastning til RAM | Q3_K_S≈10,4 tok/s Kører med aflastning til RAM | Q4_1≈37 tok/s Passer i grafikhukommelsen | Q4_1≈40 tok/s Passer i grafikhukommelsen | Q6_K≈55 tok/s Passer i grafikhukommelsen | Q8_0≈43 tok/s Passer i grafikhukommelsen | Q8_0≈17,1 tok/s Passer i grafikhukommelsen | Q8_0≈13,9 tok/s Passer i grafikhukommelsen | Q8_0≈11,7 tok/s Passer i grafikhukommelsen | Q8_0≈11,3 tok/s Passer i den fælles hukommelse | Q8_0≈17,0 tok/s Passer i den fælles hukommelse | IQ4_XS≈10,3 tok/s Passer i den fælles hukommelse | Q4_K_S≈10,3 tok/s Passer i den fælles hukommelse | Q4_K_M≈5,7 tok/s Passer i RAM (CPU) | Q6_K≈10,1 tok/s Passer i RAM (CPU) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈3,7 tok/s Kører med aflastning til RAM | UD-IQ3_XXS≈14,1 tok/s Kører med aflastning til RAM | UD-Q4_K_XL≈35 tok/s Passer i grafikhukommelsen | UD-Q4_K_XL≈38 tok/s Passer i grafikhukommelsen | Q6_K≈51 tok/s Passer i grafikhukommelsen | Q8_0≈40 tok/s Passer i grafikhukommelsen | Q8_0≈16,0 tok/s Passer i grafikhukommelsen | Q8_0≈13,0 tok/s Passer i grafikhukommelsen | Q8_0≈11,0 tok/s Passer i grafikhukommelsen | Q8_0≈10,6 tok/s Passer i den fælles hukommelse | Q8_0≈16,0 tok/s Passer i den fælles hukommelse | UD-Q3_K_XL≈10,3 tok/s Passer i den fælles hukommelse | IQ4_XS≈10,2 tok/s Passer i den fælles hukommelse | Q4_K_M≈5,4 tok/s Passer i RAM (CPU) | Q5_K_M≈10,8 tok/s Passer i RAM (CPU) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈17,9 tok/s Kører med aflastning til RAM | Q8_0≈18,7 tok/s Kører med aflastning til RAM | Q4_K_S≈191 tok/s Passer i grafikhukommelsen | Q4_K_S≈205 tok/s Passer i grafikhukommelsen | Q6_K≈274 tok/s Passer i grafikhukommelsen | Q8_0≈220 tok/s Passer i grafikhukommelsen | Q8_0≈89 tok/s Passer i grafikhukommelsen | Q8_0≈72 tok/s Passer i grafikhukommelsen | Q8_0≈61 tok/s Passer i grafikhukommelsen | Q8_0≈51 tok/s Passer i den fælles hukommelse | Q8_0≈77 tok/s Passer i den fælles hukommelse | Q8_0≈37 tok/s Passer i den fælles hukommelse | Q8_0≈40 tok/s Passer i den fælles hukommelse | Q8_0≈15,0 tok/s Passer i RAM (CPU) | Q8_0≈34 tok/s Passer i RAM (CPU) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈1,3 tok/s Kører med aflastning til RAM | Q4_K_M≈1,4 tok/s Kører med aflastning til RAM | Q4_K_M≈2,0 tok/s Kører med aflastning til RAM | Q4_K_M≈2,0 tok/s Kører med aflastning til RAM | UD-IQ3_XXS≈49 tok/s Passer i grafikhukommelsen | Q8_0≈18,8 tok/s Passer i grafikhukommelsen | Q4_K_M16,3 tok/smålt Passer i grafikhukommelsen | Q4_1≈10,3 tok/s Passer i grafikhukommelsen | IQ4_XS≈10,0 tok/s Passer i grafikhukommelsen | UD-Q3_K_XL≈10,6 tok/s Passer i den fælles hukommelse | Q5_K_M≈11,2 tok/s Passer i den fælles hukommelse | Q4_K_M≈4,1 tok/s Passer i den fælles hukommelse | Q4_K_M≈4,4 tok/s Passer i den fælles hukommelse | Q4_K_M≈2,9 tok/s Passer i RAM (CPU) | Q4_K_M≈6,6 tok/s Passer i RAM (CPU) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈24 tok/s Kører med aflastning til RAM | Q6_K≈21 tok/s Kører med aflastning til RAM | UD-Q6_K_XL≈26 tok/s Kører med aflastning til RAM | UD-Q6_K_XL≈26 tok/s Kører med aflastning til RAM | UD-Q6_K_XL≈31 tok/s Kører med aflastning til RAM | Q8_0≈213 tok/s Passer i grafikhukommelsen | Q4_K_S≈145 tok/s Passer i grafikhukommelsen | UD-Q6_K_XL≈84 tok/s Passer i grafikhukommelsen | Q8_0≈59 tok/s Passer i grafikhukommelsen | Q8_0≈49 tok/s Passer i den fælles hukommelse | Q8_0≈74 tok/s Passer i den fælles hukommelse | Q8_0≈36 tok/s Passer i den fælles hukommelse | Q8_0≈39 tok/s Passer i den fælles hukommelse | Q8_0≈14,8 tok/s Passer i RAM (CPU) | Q8_0≈33 tok/s Passer i RAM (CPU) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈5,3 tok/s Kører med aflastning til RAM | Q4_K_S≈5,1 tok/s Kører med aflastning til RAM | Q4_K_M≈5,6 tok/s Kører med aflastning til RAM | Q4_K_M≈5,7 tok/s Kører med aflastning til RAM | Q3_K_M≈10,2 tok/s Kører med aflastning til RAM | Q5_K_M≈55 tok/s Passer i grafikhukommelsen | Q4_0≈10,0 tok/s Kører med aflastning til RAM | UD-Q4_K_XL≈22 tok/s Passer i grafikhukommelsen | Q5_K_M≈15,2 tok/s Passer i grafikhukommelsen | Q5_K_M≈12,8 tok/s Passer i den fælles hukommelse | Q8_0≈13,9 tok/s Passer i den fælles hukommelse | Q4_K_M≈10,6 tok/s Passer i den fælles hukommelse | Q5_K_M≈10,0 tok/s Passer i den fælles hukommelse | Q4_K_M≈8,0 tok/s Passer i RAM (CPU) | Q8_0≈13,1 tok/s Passer i RAM (CPU) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈19,1 tok/s Kører med aflastning til RAM | MXFP4≈19,6 tok/s Kører med aflastning til RAM | MXFP426–28 tok/smålt Kører med aflastning til RAM | MXFP4≈25 tok/s Kører med aflastning til RAM | MXFP4≈31 tok/s Kører med aflastning til RAM | MXFP4≈258 tok/s Passer i grafikhukommelsen | MXFP4≈36 tok/s Kører med aflastning til RAM | MXFP441–73 tok/smålt Passer i grafikhukommelsen | MXFP4≈71 tok/s Passer i grafikhukommelsen | MXFP4≈60 tok/s Passer i den fælles hukommelse | MXFP4≈90 tok/s Passer i den fælles hukommelse | MXFP450 tok/smålt Passer i den fælles hukommelse | MXFP461 tok/smålt Passer i den fælles hukommelse | MXFP4≈15,8 tok/s Passer i RAM (CPU) | MXFP4≈36 tok/s Passer i RAM (CPU) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈10,5 tok/s Kører med aflastning til RAM | UD-IQ4_NL≈10,8 tok/s Kører med aflastning til RAM | Q4_K_S≈11,1 tok/s Kører med aflastning til RAM | Q4_K_S≈11,2 tok/s Kører med aflastning til RAM | UD-Q4_K_XL≈11,9 tok/s Kører med aflastning til RAM | UD-Q5_K_XL≈97 tok/s Passer i grafikhukommelsen | UD-IQ3_XXS≈76 tok/s Passer i grafikhukommelsen | UD-IQ4_NL≈46 tok/s Passer i grafikhukommelsen | UD-Q5_K_XL≈27 tok/s Passer i grafikhukommelsen | UD-Q5_K_XL≈23 tok/s Passer i den fælles hukommelse | Q8_0≈24 tok/s Passer i den fælles hukommelse | Q6_K≈15,1 tok/s Passer i den fælles hukommelse | Q6_K≈16,1 tok/s Passer i den fælles hukommelse | UD-Q5_K_XL≈10,4 tok/s Passer i RAM (CPU) | Q8_0≈19,3 tok/s Passer i RAM (CPU) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | UD-Q4_K_XL≈10,8 tok/s Kører med aflastning til RAM | UD-Q2_K_XL≈8,0 tok/skraftig komprimering Kører med aflastning til RAM | Q3_K_M≈6,1 tok/s Kører med aflastning til RAM | UD-Q3_K_XL≈11,7 tok/s Kører med aflastning til RAM | UD-Q2_K_XL≈19,4 tok/skraftig komprimering Passer i den fælles hukommelse | Q8_0≈10,8 tok/s Passer i den fælles hukommelse | UD-Q3_K_XL≈12,2 tok/s Passer i den fælles hukommelse | UD-Q3_K_XL≈13,0 tok/s Passer i den fælles hukommelse | Q4_K_M≈7,2 tok/s Passer i RAM (CPU) | Q8_0≈10,9 tok/s Passer i RAM (CPU) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | UD-IQ3_XXS≈7,3 tok/s Kører med aflastning til RAM | UD-IQ1_S≈5,6 tok/skraftig komprimering Kører med aflastning til RAM | UD-IQ2_XXS≈4,7 tok/skraftig komprimering Kører med aflastning til RAM | UD-IQ3_XXS≈3,5 tok/s Kører med aflastning til RAM | UD-TQ1_0≈16,2 tok/skraftig komprimering Passer i den fælles hukommelse | Q4_1≈10,0 tok/s Passer i den fælles hukommelse | UD-IQ1_M≈9,6 tok/skraftig komprimering Passer i den fælles hukommelse | UD-IQ1_M≈10,3 tok/skraftig komprimering Passer i den fælles hukommelse | Q4_K_M≈4,7 tok/s Passer i RAM (CPU) | Q4_1≈10,2 tok/s Passer i RAM (CPU) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | UD-IQ1_S≈16,9 tok/skraftig komprimering Kører med aflastning til RAM | ✕ Passer ikke | ✕ Passer ikke | UD-IQ1_S≈8,0 tok/skraftig komprimering Kører med aflastning til RAM | ✕ Passer ikke | Q3_K_M≈14,9 tok/s Passer i den fælles hukommelse | ✕ Passer ikke | ✕ Passer ikke | Q4_K_M≈5,2 tok/s Passer i RAM (CPU) | Q3_K_M≈13,9 tok/s Passer i RAM (CPU) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | ✕ Passer ikke | UD-Q2_K_XL≈22 tok/skraftig komprimering Passer i den fælles hukommelse | ✕ Passer ikke | ✕ Passer ikke | Q3_K_S≈7,2 tok/s Passer i RAM (CPU) | UD-IQ2_XXS≈19,7 tok/skraftig komprimering Passer i RAM (CPU) |
Beregner: passer den?
Hvad der åbner sig ved hver hukommelsesstørrelse (kontekst 8K)
- 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B kraftig komprimering: Gemma 3 12B · Qwen3 14B
- 12 GB Gemma 3 12B · Qwen3 14B kraftig komprimering: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B kraftig komprimering: Gemma 4 31B · Qwen3.5 35B A3B
- 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B kraftig komprimering: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B kraftig komprimering: GLM 4.5 Air
- 96 GB GLM 4.5 Air · gpt-oss-120b kraftig komprimering: Qwen3 235B A22B · GLM 4.7
- 128 GB Qwen3 235B A22B
- 192 GB GLM 4.7 kraftig komprimering: DeepSeek R1
- 256 GB kraftig komprimering: Kimi K2.5
- 512 GB DeepSeek R1 · Kimi K2.5
≈ estimater for en kontekst på 8K: vægte + KV-cache + runtime-overhead holdt op mod hukommelsen; hastighed ud fra hukommelsesbåndbredden. De reelle tal afhænger af runtime og indstillinger.
Opdateret · Kilder: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
Indlejr på dit website
Indsæt denne kode, hvor infografikken skal vises: den opdaterer sig selv. Gratis at bruge — behold kildelinket.
Hvad står der i en celle?
Rækkerne er kendte modeller med åbne vægte (open weights) fra omkring 3B til 1T parametre. Kolonnerne er grafikkort, builds med flere GPU'er, Apple- og AMD-maskiner med fælles hukommelse samt CPU-servere. En celle fortæller, hvilken kvantisering vi anbefaler, hvor modellen ligger (grafikhukommelse, fælles hukommelse, server-RAM, aflastning til RAM eller „Passer ikke”), og hvor mange tokens i sekundet den cirka genererer.
Hvordan regnes hukommelsen ud?
Først vægtene: antal parametre gange bits pr. vægt, eller den faktiske størrelse på kvantfilen fra Hugging Face, når den findes. Dertil kommer KV-cachen, der holder samtalen. Matricen regner med en kontekst på 8192 tokens, og i beregneren kan du ændre den; ved lang kontekst kan cachen fylde lige så meget som en lille model. Til sidst lægger vi omkring 1,5 GB oveni til runtime og buffere, plus visionsprojektoren i en VLM.
Er summen større end grafikkortets VRAM, men passer den sammen med system-RAM, viser cellen aflastning. Modellen kører så stadig, bare langsommere.
Hvorfor kan en stor MoE-model være hurtig?
Hastigheden er hukommelsesbåndbredden divideret med de bytes, der læses pr. token. En mixture-of-experts-model (MoE) læser kun sine aktive parametre for hvert token. Derfor kan en stor MoE generere hurtigere end en mindre tæt model.
Hvilken kvantisering vælger I?
- Den tungeste kvant op til og med Q8_0, der stadig når mindst 10 tokens i sekundet.
- Kan det ikke lade sig gøre, en fil i Q4-klassen som Q4_K_M.
- Aldrig BF16: dobbelt så meget hukommelse for en gevinst, du næppe mærker.
- Under Q3 kun, når intet andet passer, og så advarer cellen om „kraftig komprimering”.
Hvor meget kan jeg stole på tallene?
Værdier med ≈ er estimater. De er kalibreret mod målte kørsler og ligger inden for cirka ±35 % af dem; findes der en rigtig måling, ser du den med link til kilden. Estimatet dækker kun genereringen, ikke den tid det tager at læse en lang prompt, og drivere, runtimeversion og indstillinger trækker resultatet begge veje. Modeller uden sikkerhedsfiltre er skjult bag en kontakt.
Kan jeg regne på min egen maskine?
Ja. Beregneren under matricen tager model, kvant, kontekst og hardware, eller blot din grafikhukommelse, RAM og båndbredde, og tegner vægte, KV-cache og overhead som én bjælke. Stigen nedenunder viser, hvad der åbner sig ved 8, 12, 16, 24, 48, 96 og 128 GB. GGUF-filer kører i lokale AI-apps som llama.cpp, LM Studio, Ollama og Jan, og færdige maskiner finder du under pc-builds.