Welches offene Modell zu Ihrer Hardware passt — 2026
Open-Weights-Modelle im Vergleich zu gängigen Grafikkarten und Computern: die empfohlene Quantisierung (die größte bis Q8, die noch mindestens 10 Tokens pro Sekunde liefert, sonst eine der Klasse Q4; unterhalb von Q3 nur, wenn sonst nichts passt), wo sie läuft (Grafikspeicher, gemeinsamer Speicher oder in den RAM ausgelagert) und eine ungefähre Generierungsgeschwindigkeit.
| Modell | Parameter | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈84 tok/s Passt in den Grafikspeicher | Q8_0≈67 tok/s Passt in den Grafikspeicher | Q8_0≈218 tok/s Passt in den Grafikspeicher | Q8_0≈235 tok/s Passt in den Grafikspeicher | Q8_0≈417 tok/s Passt in den Grafikspeicher | Q8_0≈417 tok/s Passt in den Grafikspeicher | Q8_0≈168 tok/s Passt in den Grafikspeicher | Q8_0≈136 tok/s Passt in den Grafikspeicher | Q8_0≈115 tok/s Passt in den Grafikspeicher | Q8_0≈111 tok/s Passt in den gemeinsamen Speicher | Q8_0≈167 tok/s Passt in den gemeinsamen Speicher | Q8_0≈52 tok/s Passt in den gemeinsamen Speicher | Q8_0≈56 tok/s Passt in den gemeinsamen Speicher | Q8_0≈15,0 tok/s Passt in den RAM (CPU) | Q8_0≈34 tok/s Passt in den RAM (CPU) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈74 tok/s Passt in den Grafikspeicher | Q8_0≈59 tok/s Passt in den Grafikspeicher | Q8_0≈192 tok/s Passt in den Grafikspeicher | Q8_0≈207 tok/s Passt in den Grafikspeicher | Q8_0≈368 tok/s Passt in den Grafikspeicher | Q8_0≈368 tok/s Passt in den Grafikspeicher | Q8_0≈148 tok/s Passt in den Grafikspeicher | Q8_0≈120 tok/s Passt in den Grafikspeicher | Q8_0≈101 tok/s Passt in den Grafikspeicher | Q8_0≈98 tok/s Passt in den gemeinsamen Speicher | Q8_0≈147 tok/s Passt in den gemeinsamen Speicher | Q8_0≈46 tok/s Passt in den gemeinsamen Speicher | Q8_0≈49 tok/s Passt in den gemeinsamen Speicher | Q8_0≈14,3 tok/s Passt in den RAM (CPU) | Q8_0≈32 tok/s Passt in den RAM (CPU) |
| Gemma 3 4B HF | 4.3B | Q8_0≈67 tok/s Passt in den Grafikspeicher | Q8_0≈54 tok/s Passt in den Grafikspeicher | Q8_0≈175 tok/s Passt in den Grafikspeicher | Q8_0≈189 tok/s Passt in den Grafikspeicher | Q8_0≈335 tok/s Passt in den Grafikspeicher | Q8_0≈335 tok/s Passt in den Grafikspeicher | Q8_0≈135 tok/s Passt in den Grafikspeicher | Q8_0≈109 tok/s Passt in den Grafikspeicher | Q8_0≈92 tok/s Passt in den Grafikspeicher | Q8_0≈89 tok/s Passt in den gemeinsamen Speicher | Q8_0≈134 tok/s Passt in den gemeinsamen Speicher | Q8_0≈42 tok/s Passt in den gemeinsamen Speicher | Q8_0≈45 tok/s Passt in den gemeinsamen Speicher | Q8_0≈13,8 tok/s Passt in den RAM (CPU) | Q8_0≈31 tok/s Passt in den RAM (CPU) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈37 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈29 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈95 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈103 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈182 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈182 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈73 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈59 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈50 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈49 tok/s Passt in den gemeinsamen Speicher | UD-Q6_K_XL≈73 tok/s Passt in den gemeinsamen Speicher | UD-Q6_K_XL≈23 tok/s Passt in den gemeinsamen Speicher | UD-Q6_K_XL≈24 tok/s Passt in den gemeinsamen Speicher | UD-Q6_K_XL≈10,3 tok/s Passt in den RAM (CPU) | UD-Q6_K_XL≈23 tok/s Passt in den RAM (CPU) |
| Qwen3 8B HF | 8.2B | Q8_0≈31 tok/s Passt in den Grafikspeicher | Q8_0≈25 tok/s Passt in den Grafikspeicher | Q8_0≈80 tok/s Passt in den Grafikspeicher | Q8_0≈87 tok/s Passt in den Grafikspeicher | Q8_0≈154 tok/s Passt in den Grafikspeicher | Q8_0≈154 tok/s Passt in den Grafikspeicher | Q8_0≈62 tok/s Passt in den Grafikspeicher | Q8_0≈50 tok/s Passt in den Grafikspeicher | Q8_0≈42 tok/s Passt in den Grafikspeicher | Q8_0≈41 tok/s Passt in den gemeinsamen Speicher | Q8_0≈62 tok/s Passt in den gemeinsamen Speicher | Q8_0≈19,2 tok/s Passt in den gemeinsamen Speicher | Q8_0≈21 tok/s Passt in den gemeinsamen Speicher | UD-Q6_K_XL≈10,2 tok/s Passt in den RAM (CPU) | Q8_0≈21 tok/s Passt in den RAM (CPU) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈32 tok/s Passt in den Grafikspeicher | Q8_0≈17,8 tok/s Passt in den Grafikspeicher | Q8_0≈58 tok/s Passt in den Grafikspeicher | Q8_0≈62 tok/s Passt in den Grafikspeicher | Q8_0≈111 tok/s Passt in den Grafikspeicher | Q8_0≈111 tok/s Passt in den Grafikspeicher | Q8_0≈44 tok/s Passt in den Grafikspeicher | Q8_0≈36 tok/s Passt in den Grafikspeicher | Q8_0≈30 tok/s Passt in den Grafikspeicher | Q8_0≈30 tok/s Passt in den gemeinsamen Speicher | Q8_0≈44 tok/s Passt in den gemeinsamen Speicher | Q8_0≈13,8 tok/s Passt in den gemeinsamen Speicher | Q8_0≈14,8 tok/s Passt in den gemeinsamen Speicher | Q4_1≈10,2 tok/s Passt in den RAM (CPU) | Q8_0≈17,1 tok/s Passt in den RAM (CPU) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈30 tok/s Passt in den Grafikspeicher | Q6_K≈18,0 tok/s Passt in den Grafikspeicher | Q8_0≈46 tok/s Passt in den Grafikspeicher | Q8_0≈49 tok/s Passt in den Grafikspeicher | Q8_0≈88 tok/s Passt in den Grafikspeicher | Q8_0≈88 tok/s Passt in den Grafikspeicher | Q8_0≈35 tok/s Passt in den Grafikspeicher | Q8_0≈29 tok/s Passt in den Grafikspeicher | Q8_0≈24 tok/s Passt in den Grafikspeicher | Q8_0≈23 tok/s Passt in den gemeinsamen Speicher | Q8_0≈35 tok/s Passt in den gemeinsamen Speicher | Q8_0≈10,9 tok/s Passt in den gemeinsamen Speicher | Q8_0≈11,7 tok/s Passt in den gemeinsamen Speicher | UD-Q3_K_XL≈10,1 tok/s Passt in den RAM (CPU) | Q8_0≈14,6 tok/s Passt in den RAM (CPU) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈53 tok/s Läuft mit Auslagerung in den RAM | MXFP4≈55 tok/s Passt in den Grafikspeicher | MXFP4162 tok/sgemessen Passt in den Grafikspeicher | MXFP4≈194 tok/s Passt in den Grafikspeicher | MXFP4≈344 tok/s Passt in den Grafikspeicher | MXFP4≈344 tok/s Passt in den Grafikspeicher | MXFP4≈138 tok/s Passt in den Grafikspeicher | MXFP4≈112 tok/s Passt in den Grafikspeicher | MXFP4≈95 tok/s Passt in den Grafikspeicher | MXFP4≈80 tok/s Passt in den gemeinsamen Speicher | MXFP4116 tok/sgemessen Passt in den gemeinsamen Speicher | MXFP4≈59 tok/s Passt in den gemeinsamen Speicher | MXFP4≈62 tok/s Passt in den gemeinsamen Speicher | MXFP4≈17,2 tok/s Passt in den RAM (CPU) | MXFP4≈39 tok/s Passt in den RAM (CPU) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈10,2 tok/s Läuft mit Auslagerung in den RAM | UD-Q3_K_XL≈18,4 tok/s Passt in den Grafikspeicher | Q6_K≈37 tok/s Passt in den Grafikspeicher | Q6_K≈40 tok/s Passt in den Grafikspeicher | Q8_0≈56 tok/s Passt in den Grafikspeicher | Q8_0≈56 tok/s Passt in den Grafikspeicher | Q8_0≈22 tok/s Passt in den Grafikspeicher | Q8_0≈18,2 tok/s Passt in den Grafikspeicher | Q8_0≈15,3 tok/s Passt in den Grafikspeicher | Q8_0≈14,9 tok/s Passt in den gemeinsamen Speicher | Q8_0≈22 tok/s Passt in den gemeinsamen Speicher | Q5_K_M≈10,3 tok/s Passt in den gemeinsamen Speicher | Q5_K_M≈11,0 tok/s Passt in den gemeinsamen Speicher | Q4_K_M≈6,9 tok/s Passt in den RAM (CPU) | Q8_0≈10,3 tok/s Passt in den RAM (CPU) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈14,7 tok/s Läuft mit Auslagerung in den RAM | UD-Q3_K_M≈56 tok/s Passt in den Grafikspeicher | UD-Q5_K_S≈129 tok/s Passt in den Grafikspeicher | UD-Q5_K_S≈139 tok/s Passt in den Grafikspeicher | UD-Q8_K_XL≈173 tok/s Passt in den Grafikspeicher | UD-Q8_K_XL≈173 tok/s Passt in den Grafikspeicher | UD-Q8_K_XL≈70 tok/s Passt in den Grafikspeicher | UD-Q8_K_XL≈57 tok/s Passt in den Grafikspeicher | UD-Q8_K_XL≈48 tok/s Passt in den Grafikspeicher | UD-Q8_K_XL≈40 tok/s Passt in den gemeinsamen Speicher | UD-Q8_K_XL≈60 tok/s Passt in den gemeinsamen Speicher | UD-Q8_K_XL≈29 tok/s Passt in den gemeinsamen Speicher | UD-Q8_K_XL≈31 tok/s Passt in den gemeinsamen Speicher | UD-Q8_K_XL≈13,7 tok/s Passt in den RAM (CPU) | UD-Q8_K_XL≈31 tok/s Passt in den RAM (CPU) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈12,7 tok/s Läuft mit Auslagerung in den RAM | Q3_K_S≈18,1 tok/s Passt in den Grafikspeicher | UD-Q5_K_XL≈38 tok/s Passt in den Grafikspeicher | UD-Q5_K_XL≈41 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈59 tok/s Passt in den Grafikspeicher | Q8_0≈49 tok/s Passt in den Grafikspeicher | Q8_0≈19,7 tok/s Passt in den Grafikspeicher | Q8_0≈16,0 tok/s Passt in den Grafikspeicher | Q8_0≈13,5 tok/s Passt in den Grafikspeicher | Q8_0≈13,1 tok/s Passt in den gemeinsamen Speicher | Q8_0≈19,6 tok/s Passt in den gemeinsamen Speicher | Q4_1≈10,1 tok/s Passt in den gemeinsamen Speicher | Q4_1≈10,8 tok/s Passt in den gemeinsamen Speicher | Q4_K_M≈6,3 tok/s Passt in den RAM (CPU) | UD-Q6_K_XL≈10,8 tok/s Passt in den RAM (CPU) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈16,4 tok/s Läuft mit Auslagerung in den RAM | Q3_K_S≈66 tok/s Passt in den Grafikspeicher | Q4_K_M154 tok/sgemessen Passt in den Grafikspeicher | Q5_K_S≈158 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈232 tok/s Passt in den Grafikspeicher | Q8_0≈192 tok/s Passt in den Grafikspeicher | Q8_0≈77 tok/s Passt in den Grafikspeicher | Q8_0≈63 tok/s Passt in den Grafikspeicher | Q8_0≈53 tok/s Passt in den Grafikspeicher | Q8_0≈45 tok/s Passt in den gemeinsamen Speicher | Q8_0≈67 tok/s Passt in den gemeinsamen Speicher | Q8_0≈33 tok/s Passt in den gemeinsamen Speicher | Q8_0≈35 tok/s Passt in den gemeinsamen Speicher | Q8_0≈14,3 tok/s Passt in den RAM (CPU) | Q8_0≈32 tok/s Passt in den RAM (CPU) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈3,8 tok/s Läuft mit Auslagerung in den RAM | Q3_K_S≈10,4 tok/s Läuft mit Auslagerung in den RAM | Q4_1≈37 tok/s Passt in den Grafikspeicher | Q4_1≈40 tok/s Passt in den Grafikspeicher | Q6_K≈55 tok/s Passt in den Grafikspeicher | Q8_0≈43 tok/s Passt in den Grafikspeicher | Q8_0≈17,1 tok/s Passt in den Grafikspeicher | Q8_0≈13,9 tok/s Passt in den Grafikspeicher | Q8_0≈11,7 tok/s Passt in den Grafikspeicher | Q8_0≈11,3 tok/s Passt in den gemeinsamen Speicher | Q8_0≈17,0 tok/s Passt in den gemeinsamen Speicher | IQ4_XS≈10,3 tok/s Passt in den gemeinsamen Speicher | Q4_K_S≈10,3 tok/s Passt in den gemeinsamen Speicher | Q4_K_M≈5,7 tok/s Passt in den RAM (CPU) | Q6_K≈10,1 tok/s Passt in den RAM (CPU) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈3,7 tok/s Läuft mit Auslagerung in den RAM | UD-IQ3_XXS≈14,1 tok/s Läuft mit Auslagerung in den RAM | UD-Q4_K_XL≈35 tok/s Passt in den Grafikspeicher | UD-Q4_K_XL≈38 tok/s Passt in den Grafikspeicher | Q6_K≈51 tok/s Passt in den Grafikspeicher | Q8_0≈40 tok/s Passt in den Grafikspeicher | Q8_0≈16,0 tok/s Passt in den Grafikspeicher | Q8_0≈13,0 tok/s Passt in den Grafikspeicher | Q8_0≈11,0 tok/s Passt in den Grafikspeicher | Q8_0≈10,6 tok/s Passt in den gemeinsamen Speicher | Q8_0≈16,0 tok/s Passt in den gemeinsamen Speicher | UD-Q3_K_XL≈10,3 tok/s Passt in den gemeinsamen Speicher | IQ4_XS≈10,2 tok/s Passt in den gemeinsamen Speicher | Q4_K_M≈5,4 tok/s Passt in den RAM (CPU) | Q5_K_M≈10,8 tok/s Passt in den RAM (CPU) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈17,9 tok/s Läuft mit Auslagerung in den RAM | Q8_0≈18,7 tok/s Läuft mit Auslagerung in den RAM | Q4_K_S≈191 tok/s Passt in den Grafikspeicher | Q4_K_S≈205 tok/s Passt in den Grafikspeicher | Q6_K≈274 tok/s Passt in den Grafikspeicher | Q8_0≈220 tok/s Passt in den Grafikspeicher | Q8_0≈89 tok/s Passt in den Grafikspeicher | Q8_0≈72 tok/s Passt in den Grafikspeicher | Q8_0≈61 tok/s Passt in den Grafikspeicher | Q8_0≈51 tok/s Passt in den gemeinsamen Speicher | Q8_0≈77 tok/s Passt in den gemeinsamen Speicher | Q8_0≈37 tok/s Passt in den gemeinsamen Speicher | Q8_0≈40 tok/s Passt in den gemeinsamen Speicher | Q8_0≈15,0 tok/s Passt in den RAM (CPU) | Q8_0≈34 tok/s Passt in den RAM (CPU) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈1,3 tok/s Läuft mit Auslagerung in den RAM | Q4_K_M≈1,4 tok/s Läuft mit Auslagerung in den RAM | Q4_K_M≈2,0 tok/s Läuft mit Auslagerung in den RAM | Q4_K_M≈2,0 tok/s Läuft mit Auslagerung in den RAM | UD-IQ3_XXS≈49 tok/s Passt in den Grafikspeicher | Q8_0≈18,8 tok/s Passt in den Grafikspeicher | Q4_K_M16,3 tok/sgemessen Passt in den Grafikspeicher | Q4_1≈10,3 tok/s Passt in den Grafikspeicher | IQ4_XS≈10,0 tok/s Passt in den Grafikspeicher | UD-Q3_K_XL≈10,6 tok/s Passt in den gemeinsamen Speicher | Q5_K_M≈11,2 tok/s Passt in den gemeinsamen Speicher | Q4_K_M≈4,1 tok/s Passt in den gemeinsamen Speicher | Q4_K_M≈4,4 tok/s Passt in den gemeinsamen Speicher | Q4_K_M≈2,9 tok/s Passt in den RAM (CPU) | Q4_K_M≈6,6 tok/s Passt in den RAM (CPU) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈24 tok/s Läuft mit Auslagerung in den RAM | Q6_K≈21 tok/s Läuft mit Auslagerung in den RAM | UD-Q6_K_XL≈26 tok/s Läuft mit Auslagerung in den RAM | UD-Q6_K_XL≈26 tok/s Läuft mit Auslagerung in den RAM | UD-Q6_K_XL≈31 tok/s Läuft mit Auslagerung in den RAM | Q8_0≈213 tok/s Passt in den Grafikspeicher | Q4_K_S≈145 tok/s Passt in den Grafikspeicher | UD-Q6_K_XL≈84 tok/s Passt in den Grafikspeicher | Q8_0≈59 tok/s Passt in den Grafikspeicher | Q8_0≈49 tok/s Passt in den gemeinsamen Speicher | Q8_0≈74 tok/s Passt in den gemeinsamen Speicher | Q8_0≈36 tok/s Passt in den gemeinsamen Speicher | Q8_0≈39 tok/s Passt in den gemeinsamen Speicher | Q8_0≈14,8 tok/s Passt in den RAM (CPU) | Q8_0≈33 tok/s Passt in den RAM (CPU) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈5,3 tok/s Läuft mit Auslagerung in den RAM | Q4_K_S≈5,1 tok/s Läuft mit Auslagerung in den RAM | Q4_K_M≈5,6 tok/s Läuft mit Auslagerung in den RAM | Q4_K_M≈5,7 tok/s Läuft mit Auslagerung in den RAM | Q3_K_M≈10,2 tok/s Läuft mit Auslagerung in den RAM | Q5_K_M≈55 tok/s Passt in den Grafikspeicher | Q4_0≈10,0 tok/s Läuft mit Auslagerung in den RAM | UD-Q4_K_XL≈22 tok/s Passt in den Grafikspeicher | Q5_K_M≈15,2 tok/s Passt in den Grafikspeicher | Q5_K_M≈12,8 tok/s Passt in den gemeinsamen Speicher | Q8_0≈13,9 tok/s Passt in den gemeinsamen Speicher | Q4_K_M≈10,6 tok/s Passt in den gemeinsamen Speicher | Q5_K_M≈10,0 tok/s Passt in den gemeinsamen Speicher | Q4_K_M≈8,0 tok/s Passt in den RAM (CPU) | Q8_0≈13,1 tok/s Passt in den RAM (CPU) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈19,1 tok/s Läuft mit Auslagerung in den RAM | MXFP4≈19,6 tok/s Läuft mit Auslagerung in den RAM | MXFP426–28 tok/sgemessen Läuft mit Auslagerung in den RAM | MXFP4≈25 tok/s Läuft mit Auslagerung in den RAM | MXFP4≈31 tok/s Läuft mit Auslagerung in den RAM | MXFP4≈258 tok/s Passt in den Grafikspeicher | MXFP4≈36 tok/s Läuft mit Auslagerung in den RAM | MXFP441–73 tok/sgemessen Passt in den Grafikspeicher | MXFP4≈71 tok/s Passt in den Grafikspeicher | MXFP4≈60 tok/s Passt in den gemeinsamen Speicher | MXFP4≈90 tok/s Passt in den gemeinsamen Speicher | MXFP450 tok/sgemessen Passt in den gemeinsamen Speicher | MXFP461 tok/sgemessen Passt in den gemeinsamen Speicher | MXFP4≈15,8 tok/s Passt in den RAM (CPU) | MXFP4≈36 tok/s Passt in den RAM (CPU) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈10,5 tok/s Läuft mit Auslagerung in den RAM | UD-IQ4_NL≈10,8 tok/s Läuft mit Auslagerung in den RAM | Q4_K_S≈11,1 tok/s Läuft mit Auslagerung in den RAM | Q4_K_S≈11,2 tok/s Läuft mit Auslagerung in den RAM | UD-Q4_K_XL≈11,9 tok/s Läuft mit Auslagerung in den RAM | UD-Q5_K_XL≈97 tok/s Passt in den Grafikspeicher | UD-IQ3_XXS≈76 tok/s Passt in den Grafikspeicher | UD-IQ4_NL≈46 tok/s Passt in den Grafikspeicher | UD-Q5_K_XL≈27 tok/s Passt in den Grafikspeicher | UD-Q5_K_XL≈23 tok/s Passt in den gemeinsamen Speicher | Q8_0≈24 tok/s Passt in den gemeinsamen Speicher | Q6_K≈15,1 tok/s Passt in den gemeinsamen Speicher | Q6_K≈16,1 tok/s Passt in den gemeinsamen Speicher | UD-Q5_K_XL≈10,4 tok/s Passt in den RAM (CPU) | Q8_0≈19,3 tok/s Passt in den RAM (CPU) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | UD-Q4_K_XL≈10,8 tok/s Läuft mit Auslagerung in den RAM | UD-Q2_K_XL≈8,0 tok/sstarke Kompression Läuft mit Auslagerung in den RAM | Q3_K_M≈6,1 tok/s Läuft mit Auslagerung in den RAM | UD-Q3_K_XL≈11,7 tok/s Läuft mit Auslagerung in den RAM | UD-Q2_K_XL≈19,4 tok/sstarke Kompression Passt in den gemeinsamen Speicher | Q8_0≈10,8 tok/s Passt in den gemeinsamen Speicher | UD-Q3_K_XL≈12,2 tok/s Passt in den gemeinsamen Speicher | UD-Q3_K_XL≈13,0 tok/s Passt in den gemeinsamen Speicher | Q4_K_M≈7,2 tok/s Passt in den RAM (CPU) | Q8_0≈10,9 tok/s Passt in den RAM (CPU) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | UD-IQ3_XXS≈7,3 tok/s Läuft mit Auslagerung in den RAM | UD-IQ1_S≈5,6 tok/sstarke Kompression Läuft mit Auslagerung in den RAM | UD-IQ2_XXS≈4,7 tok/sstarke Kompression Läuft mit Auslagerung in den RAM | UD-IQ3_XXS≈3,5 tok/s Läuft mit Auslagerung in den RAM | UD-TQ1_0≈16,2 tok/sstarke Kompression Passt in den gemeinsamen Speicher | Q4_1≈10,0 tok/s Passt in den gemeinsamen Speicher | UD-IQ1_M≈9,6 tok/sstarke Kompression Passt in den gemeinsamen Speicher | UD-IQ1_M≈10,3 tok/sstarke Kompression Passt in den gemeinsamen Speicher | Q4_K_M≈4,7 tok/s Passt in den RAM (CPU) | Q4_1≈10,2 tok/s Passt in den RAM (CPU) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | UD-IQ1_S≈16,9 tok/sstarke Kompression Läuft mit Auslagerung in den RAM | ✕ Passt nicht | ✕ Passt nicht | UD-IQ1_S≈8,0 tok/sstarke Kompression Läuft mit Auslagerung in den RAM | ✕ Passt nicht | Q3_K_M≈14,9 tok/s Passt in den gemeinsamen Speicher | ✕ Passt nicht | ✕ Passt nicht | Q4_K_M≈5,2 tok/s Passt in den RAM (CPU) | Q3_K_M≈13,9 tok/s Passt in den RAM (CPU) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | ✕ Passt nicht | UD-Q2_K_XL≈22 tok/sstarke Kompression Passt in den gemeinsamen Speicher | ✕ Passt nicht | ✕ Passt nicht | Q3_K_S≈7,2 tok/s Passt in den RAM (CPU) | UD-IQ2_XXS≈19,7 tok/sstarke Kompression Passt in den RAM (CPU) |
Rechner: passt es?
Was sich bei jeder Speichergröße öffnet (Kontext 8K)
- 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B starke Kompression: Gemma 3 12B · Qwen3 14B
- 12 GB Gemma 3 12B · Qwen3 14B starke Kompression: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B starke Kompression: Gemma 4 31B · Qwen3.5 35B A3B
- 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B starke Kompression: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B starke Kompression: GLM 4.5 Air
- 96 GB GLM 4.5 Air · gpt-oss-120b starke Kompression: Qwen3 235B A22B · GLM 4.7
- 128 GB Qwen3 235B A22B
- 192 GB GLM 4.7 starke Kompression: DeepSeek R1
- 256 GB starke Kompression: Kimi K2.5
- 512 GB DeepSeek R1 · Kimi K2.5
≈ Schätzungen für einen Kontext von 8K: Gewichte + KV-Cache + Laufzeit-Overhead im Verhältnis zum Speicher; Geschwindigkeit aus der Speicherbandbreite. Die realen Werte hängen von Laufzeit und Einstellungen ab.
Aktualisiert · Quellen: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
Auf Ihrer Website einbetten
Fügen Sie diesen Code dort ein, wo die Infografik erscheinen soll: Sie aktualisiert sich von selbst. Kostenlos nutzbar — lassen Sie den Quellenlink stehen.
Matrix, Rechner und Speicherleiter
Die Grafik beantwortet eine einfache Frage: Läuft dieses Modell auf meinem Rechner, und wie schnell? In den Zeilen stehen bekannte Modelle mit offenen Gewichten von etwa 3B bis 1T Parametern, in den Spalten Grafikkarten, Multi-GPU-Konfigurationen, Apple- und AMD-Rechner mit gemeinsamem Speicher sowie CPU-Server. Jede Zelle nennt die empfohlene Quantisierung, den Ort, an dem das Modell liegt, und eine ungefähre Geschwindigkeit in Tokens pro Sekunde. Darunter folgen ein Rechner für eigene Werte und eine Leiter, die zeigt, was bei 8, 12, 16, 24, 48, 96 und 128 GB Speicher möglich wird.
Wie der Speicherbedarf entsteht
- Gewichte: Parameter mal Bits pro Gewicht oder die echte Größe der GGUF-Datei.
- KV-Cache: wächst mit dem Kontext. Die Matrix rechnet mit 8192 Tokens; im Rechner lässt sich der Wert ändern, und ein langer Kontext kann so viel Grafikspeicher (VRAM) belegen wie ein kleines Modell.
- Overhead: rund 1,5 GB für die Laufzeitumgebung, bei einem VLM zusätzlich der Bild-Projektor.
Passt alles in den Grafikspeicher, steht in der Zelle „Passt in den Grafikspeicher“. „Läuft mit Auslagerung in den RAM“ bedeutet, dass ein Teil des Modells im Arbeitsspeicher liegt: Es funktioniert, aber spürbar langsamer.
Woher die Geschwindigkeit kommt
Beim Generieren liest das Modell für jedes Token seine Gewichte aus dem Speicher. Die Geschwindigkeit ergibt sich daher grob aus der Speicherbandbreite geteilt durch die gelesenen Bytes pro Token. Bei MoE-Modellen zählen nur die aktiven Parameter, weshalb ein großes MoE-Modell schneller antworten kann als ein kleineres dichtes Modell. Die empfohlene Quantisierung ist die stärkste Stufe bis Q8_0, die noch mindestens 10 Tokens pro Sekunde schafft, sonst die Q4-Klasse. BF16 wird nie empfohlen, unter Q3 geht die Grafik nur, wenn sonst nichts passt; dann erscheint der Hinweis „starke Kompression“.
Wie genau sind die Werte?
Das Zeichen ≈ markiert eine Schätzung. Sie ist an gemessenen Läufen aus llama.cpp und öffentlichen Berichten kalibriert und liegt etwa ±35% neben ihnen; Laufzeit, Treiber und Einstellungen verschieben das Ergebnis. Zellen mit echter Messung zeigen diese samt Link zur Quelle. Nicht eingerechnet ist das Einlesen eines langen Prompts, nur die Generierung. Modelle ohne Sicherheitsfilter sind hinter einem Schalter verborgen. Passende Rechner im Ganzen finden Sie unter PC-Konfigurationen für lokale KI.