Zum Inhalt springen
fedi.software

Welches offene Modell zu deiner Hardware passt — 2026

Open-Weights-Modelle im Vergleich zu gängigen Grafikkarten und Computern: die empfohlene Quantisierung (die grösste bis Q8, die noch mindestens 10 Tokens pro Sekunde liefert, sonst eine der Klasse Q4; unterhalb von Q3 nur, wenn sonst nichts passt), wo sie läuft (Grafikspeicher, gemeinsamer Speicher oder in den RAM ausgelagert) und eine ungefähre Generierungsgeschwindigkeit.

Modell Parameter
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s Passt in den Grafikspeicher Q8_0≈67 tok/s Passt in den Grafikspeicher Q8_0≈218 tok/s Passt in den Grafikspeicher Q8_0≈235 tok/s Passt in den Grafikspeicher Q8_0≈417 tok/s Passt in den Grafikspeicher Q8_0≈417 tok/s Passt in den Grafikspeicher Q8_0≈168 tok/s Passt in den Grafikspeicher Q8_0≈136 tok/s Passt in den Grafikspeicher Q8_0≈115 tok/s Passt in den Grafikspeicher Q8_0≈111 tok/s Passt in den gemeinsamen Speicher Q8_0≈167 tok/s Passt in den gemeinsamen Speicher Q8_0≈52 tok/s Passt in den gemeinsamen Speicher Q8_0≈56 tok/s Passt in den gemeinsamen Speicher Q8_0≈15.0 tok/s Passt in den RAM (CPU) Q8_0≈34 tok/s Passt in den RAM (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s Passt in den Grafikspeicher Q8_0≈59 tok/s Passt in den Grafikspeicher Q8_0≈192 tok/s Passt in den Grafikspeicher Q8_0≈207 tok/s Passt in den Grafikspeicher Q8_0≈368 tok/s Passt in den Grafikspeicher Q8_0≈368 tok/s Passt in den Grafikspeicher Q8_0≈148 tok/s Passt in den Grafikspeicher Q8_0≈120 tok/s Passt in den Grafikspeicher Q8_0≈101 tok/s Passt in den Grafikspeicher Q8_0≈98 tok/s Passt in den gemeinsamen Speicher Q8_0≈147 tok/s Passt in den gemeinsamen Speicher Q8_0≈46 tok/s Passt in den gemeinsamen Speicher Q8_0≈49 tok/s Passt in den gemeinsamen Speicher Q8_0≈14.3 tok/s Passt in den RAM (CPU) Q8_0≈32 tok/s Passt in den RAM (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s Passt in den Grafikspeicher Q8_0≈54 tok/s Passt in den Grafikspeicher Q8_0≈175 tok/s Passt in den Grafikspeicher Q8_0≈189 tok/s Passt in den Grafikspeicher Q8_0≈335 tok/s Passt in den Grafikspeicher Q8_0≈335 tok/s Passt in den Grafikspeicher Q8_0≈135 tok/s Passt in den Grafikspeicher Q8_0≈109 tok/s Passt in den Grafikspeicher Q8_0≈92 tok/s Passt in den Grafikspeicher Q8_0≈89 tok/s Passt in den gemeinsamen Speicher Q8_0≈134 tok/s Passt in den gemeinsamen Speicher Q8_0≈42 tok/s Passt in den gemeinsamen Speicher Q8_0≈45 tok/s Passt in den gemeinsamen Speicher Q8_0≈13.8 tok/s Passt in den RAM (CPU) Q8_0≈31 tok/s Passt in den RAM (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈29 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈95 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈103 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈182 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈182 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈73 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈59 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈50 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈49 tok/s Passt in den gemeinsamen Speicher UD-Q6_K_XL≈73 tok/s Passt in den gemeinsamen Speicher UD-Q6_K_XL≈23 tok/s Passt in den gemeinsamen Speicher UD-Q6_K_XL≈24 tok/s Passt in den gemeinsamen Speicher UD-Q6_K_XL≈10.3 tok/s Passt in den RAM (CPU) UD-Q6_K_XL≈23 tok/s Passt in den RAM (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s Passt in den Grafikspeicher Q8_0≈25 tok/s Passt in den Grafikspeicher Q8_0≈80 tok/s Passt in den Grafikspeicher Q8_0≈87 tok/s Passt in den Grafikspeicher Q8_0≈154 tok/s Passt in den Grafikspeicher Q8_0≈154 tok/s Passt in den Grafikspeicher Q8_0≈62 tok/s Passt in den Grafikspeicher Q8_0≈50 tok/s Passt in den Grafikspeicher Q8_0≈42 tok/s Passt in den Grafikspeicher Q8_0≈41 tok/s Passt in den gemeinsamen Speicher Q8_0≈62 tok/s Passt in den gemeinsamen Speicher Q8_0≈19.2 tok/s Passt in den gemeinsamen Speicher Q8_0≈21 tok/s Passt in den gemeinsamen Speicher UD-Q6_K_XL≈10.2 tok/s Passt in den RAM (CPU) Q8_0≈21 tok/s Passt in den RAM (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s Passt in den Grafikspeicher Q8_0≈17.8 tok/s Passt in den Grafikspeicher Q8_0≈58 tok/s Passt in den Grafikspeicher Q8_0≈62 tok/s Passt in den Grafikspeicher Q8_0≈111 tok/s Passt in den Grafikspeicher Q8_0≈111 tok/s Passt in den Grafikspeicher Q8_0≈44 tok/s Passt in den Grafikspeicher Q8_0≈36 tok/s Passt in den Grafikspeicher Q8_0≈30 tok/s Passt in den Grafikspeicher Q8_0≈30 tok/s Passt in den gemeinsamen Speicher Q8_0≈44 tok/s Passt in den gemeinsamen Speicher Q8_0≈13.8 tok/s Passt in den gemeinsamen Speicher Q8_0≈14.8 tok/s Passt in den gemeinsamen Speicher Q4_1≈10.2 tok/s Passt in den RAM (CPU) Q8_0≈17.1 tok/s Passt in den RAM (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s Passt in den Grafikspeicher Q6_K≈18.0 tok/s Passt in den Grafikspeicher Q8_0≈46 tok/s Passt in den Grafikspeicher Q8_0≈49 tok/s Passt in den Grafikspeicher Q8_0≈88 tok/s Passt in den Grafikspeicher Q8_0≈88 tok/s Passt in den Grafikspeicher Q8_0≈35 tok/s Passt in den Grafikspeicher Q8_0≈29 tok/s Passt in den Grafikspeicher Q8_0≈24 tok/s Passt in den Grafikspeicher Q8_0≈23 tok/s Passt in den gemeinsamen Speicher Q8_0≈35 tok/s Passt in den gemeinsamen Speicher Q8_0≈10.9 tok/s Passt in den gemeinsamen Speicher Q8_0≈11.7 tok/s Passt in den gemeinsamen Speicher UD-Q3_K_XL≈10.1 tok/s Passt in den RAM (CPU) Q8_0≈14.6 tok/s Passt in den RAM (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s Läuft mit Auslagerung in den RAM MXFP4≈55 tok/s Passt in den Grafikspeicher MXFP4162 tok/sgemessen Passt in den Grafikspeicher MXFP4≈194 tok/s Passt in den Grafikspeicher MXFP4≈344 tok/s Passt in den Grafikspeicher MXFP4≈344 tok/s Passt in den Grafikspeicher MXFP4≈138 tok/s Passt in den Grafikspeicher MXFP4≈112 tok/s Passt in den Grafikspeicher MXFP4≈95 tok/s Passt in den Grafikspeicher MXFP4≈80 tok/s Passt in den gemeinsamen Speicher MXFP4116 tok/sgemessen Passt in den gemeinsamen Speicher MXFP4≈59 tok/s Passt in den gemeinsamen Speicher MXFP4≈62 tok/s Passt in den gemeinsamen Speicher MXFP4≈17.2 tok/s Passt in den RAM (CPU) MXFP4≈39 tok/s Passt in den RAM (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10.2 tok/s Läuft mit Auslagerung in den RAM UD-Q3_K_XL≈18.4 tok/s Passt in den Grafikspeicher Q6_K≈37 tok/s Passt in den Grafikspeicher Q6_K≈40 tok/s Passt in den Grafikspeicher Q8_0≈56 tok/s Passt in den Grafikspeicher Q8_0≈56 tok/s Passt in den Grafikspeicher Q8_0≈22 tok/s Passt in den Grafikspeicher Q8_0≈18.2 tok/s Passt in den Grafikspeicher Q8_0≈15.3 tok/s Passt in den Grafikspeicher Q8_0≈14.9 tok/s Passt in den gemeinsamen Speicher Q8_0≈22 tok/s Passt in den gemeinsamen Speicher Q5_K_M≈10.3 tok/s Passt in den gemeinsamen Speicher Q5_K_M≈11.0 tok/s Passt in den gemeinsamen Speicher Q4_K_M≈6.9 tok/s Passt in den RAM (CPU) Q8_0≈10.3 tok/s Passt in den RAM (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14.7 tok/s Läuft mit Auslagerung in den RAM UD-Q3_K_M≈56 tok/s Passt in den Grafikspeicher UD-Q5_K_S≈129 tok/s Passt in den Grafikspeicher UD-Q5_K_S≈139 tok/s Passt in den Grafikspeicher UD-Q8_K_XL≈173 tok/s Passt in den Grafikspeicher UD-Q8_K_XL≈173 tok/s Passt in den Grafikspeicher UD-Q8_K_XL≈70 tok/s Passt in den Grafikspeicher UD-Q8_K_XL≈57 tok/s Passt in den Grafikspeicher UD-Q8_K_XL≈48 tok/s Passt in den Grafikspeicher UD-Q8_K_XL≈40 tok/s Passt in den gemeinsamen Speicher UD-Q8_K_XL≈60 tok/s Passt in den gemeinsamen Speicher UD-Q8_K_XL≈29 tok/s Passt in den gemeinsamen Speicher UD-Q8_K_XL≈31 tok/s Passt in den gemeinsamen Speicher UD-Q8_K_XL≈13.7 tok/s Passt in den RAM (CPU) UD-Q8_K_XL≈31 tok/s Passt in den RAM (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12.7 tok/s Läuft mit Auslagerung in den RAM Q3_K_S≈18.1 tok/s Passt in den Grafikspeicher UD-Q5_K_XL≈38 tok/s Passt in den Grafikspeicher UD-Q5_K_XL≈41 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈59 tok/s Passt in den Grafikspeicher Q8_0≈49 tok/s Passt in den Grafikspeicher Q8_0≈19.7 tok/s Passt in den Grafikspeicher Q8_0≈16.0 tok/s Passt in den Grafikspeicher Q8_0≈13.5 tok/s Passt in den Grafikspeicher Q8_0≈13.1 tok/s Passt in den gemeinsamen Speicher Q8_0≈19.6 tok/s Passt in den gemeinsamen Speicher Q4_1≈10.1 tok/s Passt in den gemeinsamen Speicher Q4_1≈10.8 tok/s Passt in den gemeinsamen Speicher Q4_K_M≈6.3 tok/s Passt in den RAM (CPU) UD-Q6_K_XL≈10.8 tok/s Passt in den RAM (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16.4 tok/s Läuft mit Auslagerung in den RAM Q3_K_S≈66 tok/s Passt in den Grafikspeicher Q4_K_M154 tok/sgemessen Passt in den Grafikspeicher Q5_K_S≈158 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈232 tok/s Passt in den Grafikspeicher Q8_0≈192 tok/s Passt in den Grafikspeicher Q8_0≈77 tok/s Passt in den Grafikspeicher Q8_0≈63 tok/s Passt in den Grafikspeicher Q8_0≈53 tok/s Passt in den Grafikspeicher Q8_0≈45 tok/s Passt in den gemeinsamen Speicher Q8_0≈67 tok/s Passt in den gemeinsamen Speicher Q8_0≈33 tok/s Passt in den gemeinsamen Speicher Q8_0≈35 tok/s Passt in den gemeinsamen Speicher Q8_0≈14.3 tok/s Passt in den RAM (CPU) Q8_0≈32 tok/s Passt in den RAM (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3.8 tok/s Läuft mit Auslagerung in den RAM Q3_K_S≈10.4 tok/s Läuft mit Auslagerung in den RAM Q4_1≈37 tok/s Passt in den Grafikspeicher Q4_1≈40 tok/s Passt in den Grafikspeicher Q6_K≈55 tok/s Passt in den Grafikspeicher Q8_0≈43 tok/s Passt in den Grafikspeicher Q8_0≈17.1 tok/s Passt in den Grafikspeicher Q8_0≈13.9 tok/s Passt in den Grafikspeicher Q8_0≈11.7 tok/s Passt in den Grafikspeicher Q8_0≈11.3 tok/s Passt in den gemeinsamen Speicher Q8_0≈17.0 tok/s Passt in den gemeinsamen Speicher IQ4_XS≈10.3 tok/s Passt in den gemeinsamen Speicher Q4_K_S≈10.3 tok/s Passt in den gemeinsamen Speicher Q4_K_M≈5.7 tok/s Passt in den RAM (CPU) Q6_K≈10.1 tok/s Passt in den RAM (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3.7 tok/s Läuft mit Auslagerung in den RAM UD-IQ3_XXS≈14.1 tok/s Läuft mit Auslagerung in den RAM UD-Q4_K_XL≈35 tok/s Passt in den Grafikspeicher UD-Q4_K_XL≈38 tok/s Passt in den Grafikspeicher Q6_K≈51 tok/s Passt in den Grafikspeicher Q8_0≈40 tok/s Passt in den Grafikspeicher Q8_0≈16.0 tok/s Passt in den Grafikspeicher Q8_0≈13.0 tok/s Passt in den Grafikspeicher Q8_0≈11.0 tok/s Passt in den Grafikspeicher Q8_0≈10.6 tok/s Passt in den gemeinsamen Speicher Q8_0≈16.0 tok/s Passt in den gemeinsamen Speicher UD-Q3_K_XL≈10.3 tok/s Passt in den gemeinsamen Speicher IQ4_XS≈10.2 tok/s Passt in den gemeinsamen Speicher Q4_K_M≈5.4 tok/s Passt in den RAM (CPU) Q5_K_M≈10.8 tok/s Passt in den RAM (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17.9 tok/s Läuft mit Auslagerung in den RAM Q8_0≈18.7 tok/s Läuft mit Auslagerung in den RAM Q4_K_S≈191 tok/s Passt in den Grafikspeicher Q4_K_S≈205 tok/s Passt in den Grafikspeicher Q6_K≈274 tok/s Passt in den Grafikspeicher Q8_0≈220 tok/s Passt in den Grafikspeicher Q8_0≈89 tok/s Passt in den Grafikspeicher Q8_0≈72 tok/s Passt in den Grafikspeicher Q8_0≈61 tok/s Passt in den Grafikspeicher Q8_0≈51 tok/s Passt in den gemeinsamen Speicher Q8_0≈77 tok/s Passt in den gemeinsamen Speicher Q8_0≈37 tok/s Passt in den gemeinsamen Speicher Q8_0≈40 tok/s Passt in den gemeinsamen Speicher Q8_0≈15.0 tok/s Passt in den RAM (CPU) Q8_0≈34 tok/s Passt in den RAM (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1.3 tok/s Läuft mit Auslagerung in den RAM Q4_K_M≈1.4 tok/s Läuft mit Auslagerung in den RAM Q4_K_M≈2.0 tok/s Läuft mit Auslagerung in den RAM Q4_K_M≈2.0 tok/s Läuft mit Auslagerung in den RAM UD-IQ3_XXS≈49 tok/s Passt in den Grafikspeicher Q8_0≈18.8 tok/s Passt in den Grafikspeicher Q4_K_M16.3 tok/sgemessen Passt in den Grafikspeicher Q4_1≈10.3 tok/s Passt in den Grafikspeicher IQ4_XS≈10.0 tok/s Passt in den Grafikspeicher UD-Q3_K_XL≈10.6 tok/s Passt in den gemeinsamen Speicher Q5_K_M≈11.2 tok/s Passt in den gemeinsamen Speicher Q4_K_M≈4.1 tok/s Passt in den gemeinsamen Speicher Q4_K_M≈4.4 tok/s Passt in den gemeinsamen Speicher Q4_K_M≈2.9 tok/s Passt in den RAM (CPU) Q4_K_M≈6.6 tok/s Passt in den RAM (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s Läuft mit Auslagerung in den RAM Q6_K≈21 tok/s Läuft mit Auslagerung in den RAM UD-Q6_K_XL≈26 tok/s Läuft mit Auslagerung in den RAM UD-Q6_K_XL≈26 tok/s Läuft mit Auslagerung in den RAM UD-Q6_K_XL≈31 tok/s Läuft mit Auslagerung in den RAM Q8_0≈213 tok/s Passt in den Grafikspeicher Q4_K_S≈145 tok/s Passt in den Grafikspeicher UD-Q6_K_XL≈84 tok/s Passt in den Grafikspeicher Q8_0≈59 tok/s Passt in den Grafikspeicher Q8_0≈49 tok/s Passt in den gemeinsamen Speicher Q8_0≈74 tok/s Passt in den gemeinsamen Speicher Q8_0≈36 tok/s Passt in den gemeinsamen Speicher Q8_0≈39 tok/s Passt in den gemeinsamen Speicher Q8_0≈14.8 tok/s Passt in den RAM (CPU) Q8_0≈33 tok/s Passt in den RAM (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5.3 tok/s Läuft mit Auslagerung in den RAM Q4_K_S≈5.1 tok/s Läuft mit Auslagerung in den RAM Q4_K_M≈5.6 tok/s Läuft mit Auslagerung in den RAM Q4_K_M≈5.7 tok/s Läuft mit Auslagerung in den RAM Q3_K_M≈10.2 tok/s Läuft mit Auslagerung in den RAM Q5_K_M≈55 tok/s Passt in den Grafikspeicher Q4_0≈10.0 tok/s Läuft mit Auslagerung in den RAM UD-Q4_K_XL≈22 tok/s Passt in den Grafikspeicher Q5_K_M≈15.2 tok/s Passt in den Grafikspeicher Q5_K_M≈12.8 tok/s Passt in den gemeinsamen Speicher Q8_0≈13.9 tok/s Passt in den gemeinsamen Speicher Q4_K_M≈10.6 tok/s Passt in den gemeinsamen Speicher Q5_K_M≈10.0 tok/s Passt in den gemeinsamen Speicher Q4_K_M≈8.0 tok/s Passt in den RAM (CPU) Q8_0≈13.1 tok/s Passt in den RAM (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19.1 tok/s Läuft mit Auslagerung in den RAM MXFP4≈19.6 tok/s Läuft mit Auslagerung in den RAM MXFP426–28 tok/sgemessen Läuft mit Auslagerung in den RAM MXFP4≈25 tok/s Läuft mit Auslagerung in den RAM MXFP4≈31 tok/s Läuft mit Auslagerung in den RAM MXFP4≈258 tok/s Passt in den Grafikspeicher MXFP4≈36 tok/s Läuft mit Auslagerung in den RAM MXFP441–73 tok/sgemessen Passt in den Grafikspeicher MXFP4≈71 tok/s Passt in den Grafikspeicher MXFP4≈60 tok/s Passt in den gemeinsamen Speicher MXFP4≈90 tok/s Passt in den gemeinsamen Speicher MXFP450 tok/sgemessen Passt in den gemeinsamen Speicher MXFP461 tok/sgemessen Passt in den gemeinsamen Speicher MXFP4≈15.8 tok/s Passt in den RAM (CPU) MXFP4≈36 tok/s Passt in den RAM (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10.5 tok/s Läuft mit Auslagerung in den RAM UD-IQ4_NL≈10.8 tok/s Läuft mit Auslagerung in den RAM Q4_K_S≈11.1 tok/s Läuft mit Auslagerung in den RAM Q4_K_S≈11.2 tok/s Läuft mit Auslagerung in den RAM UD-Q4_K_XL≈11.9 tok/s Läuft mit Auslagerung in den RAM UD-Q5_K_XL≈97 tok/s Passt in den Grafikspeicher UD-IQ3_XXS≈76 tok/s Passt in den Grafikspeicher UD-IQ4_NL≈46 tok/s Passt in den Grafikspeicher UD-Q5_K_XL≈27 tok/s Passt in den Grafikspeicher UD-Q5_K_XL≈23 tok/s Passt in den gemeinsamen Speicher Q8_0≈24 tok/s Passt in den gemeinsamen Speicher Q6_K≈15.1 tok/s Passt in den gemeinsamen Speicher Q6_K≈16.1 tok/s Passt in den gemeinsamen Speicher UD-Q5_K_XL≈10.4 tok/s Passt in den RAM (CPU) Q8_0≈19.3 tok/s Passt in den RAM (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht UD-Q4_K_XL≈10.8 tok/s Läuft mit Auslagerung in den RAM UD-Q2_K_XL≈8.0 tok/sstarke Kompression Läuft mit Auslagerung in den RAM Q3_K_M≈6.1 tok/s Läuft mit Auslagerung in den RAM UD-Q3_K_XL≈11.7 tok/s Läuft mit Auslagerung in den RAM UD-Q2_K_XL≈19.4 tok/sstarke Kompression Passt in den gemeinsamen Speicher Q8_0≈10.8 tok/s Passt in den gemeinsamen Speicher UD-Q3_K_XL≈12.2 tok/s Passt in den gemeinsamen Speicher UD-Q3_K_XL≈13.0 tok/s Passt in den gemeinsamen Speicher Q4_K_M≈7.2 tok/s Passt in den RAM (CPU) Q8_0≈10.9 tok/s Passt in den RAM (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht UD-IQ3_XXS≈7.3 tok/s Läuft mit Auslagerung in den RAM UD-IQ1_S≈5.6 tok/sstarke Kompression Läuft mit Auslagerung in den RAM UD-IQ2_XXS≈4.7 tok/sstarke Kompression Läuft mit Auslagerung in den RAM UD-IQ3_XXS≈3.5 tok/s Läuft mit Auslagerung in den RAM UD-TQ1_0≈16.2 tok/sstarke Kompression Passt in den gemeinsamen Speicher Q4_1≈10.0 tok/s Passt in den gemeinsamen Speicher UD-IQ1_M≈9.6 tok/sstarke Kompression Passt in den gemeinsamen Speicher UD-IQ1_M≈10.3 tok/sstarke Kompression Passt in den gemeinsamen Speicher Q4_K_M≈4.7 tok/s Passt in den RAM (CPU) Q4_1≈10.2 tok/s Passt in den RAM (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht UD-IQ1_S≈16.9 tok/sstarke Kompression Läuft mit Auslagerung in den RAM ✕ Passt nicht ✕ Passt nicht UD-IQ1_S≈8.0 tok/sstarke Kompression Läuft mit Auslagerung in den RAM ✕ Passt nicht Q3_K_M≈14.9 tok/s Passt in den gemeinsamen Speicher ✕ Passt nicht ✕ Passt nicht Q4_K_M≈5.2 tok/s Passt in den RAM (CPU) Q3_K_M≈13.9 tok/s Passt in den RAM (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht ✕ Passt nicht UD-Q2_K_XL≈22 tok/sstarke Kompression Passt in den gemeinsamen Speicher ✕ Passt nicht ✕ Passt nicht Q3_K_S≈7.2 tok/s Passt in den RAM (CPU) UD-IQ2_XXS≈19.7 tok/sstarke Kompression Passt in den RAM (CPU)

Was sich bei jeder Speichergrösse öffnet (Kontext 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B starke Kompression: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B starke Kompression: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B starke Kompression: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B starke Kompression: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B starke Kompression: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b starke Kompression: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 starke Kompression: DeepSeek R1
  9. 256 GB starke Kompression: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ Schätzungen für einen Kontext von 8K: Gewichte + KV-Cache + Laufzeit-Overhead im Verhältnis zum Speicher; Geschwindigkeit aus der Speicherbandbreite. Die realen Werte hängen von Laufzeit und Einstellungen ab.

Aktualisiert · Quellen: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Auf deiner Website einbetten

Füge diesen Code dort ein, wo die Infografik erscheinen soll: Sie aktualisiert sich von selbst. Kostenlos nutzbar — lass den Quellenlink stehen.

JSON Unsere Daten: CC BY 4.0 mit Link zur Quelle; Daten Dritter behalten die Lizenz ihrer Quelle.

Matrix, Rechner und Speicherleiter

Die Grafik beantwortet eine einfache Frage: Läuft dieses Modell auf meinem Rechner, und wie schnell? In den Zeilen stehen bekannte Modelle mit offenen Gewichten von etwa 3B bis 1T Parametern, in den Spalten Grafikkarten, Multi-GPU-Konfigurationen, Apple- und AMD-Rechner mit gemeinsamem Speicher sowie CPU-Server. Jede Zelle nennt die empfohlene Quantisierung, den Ort, an dem das Modell liegt, und eine ungefähre Geschwindigkeit in Tokens pro Sekunde. Darunter folgen ein Rechner für eigene Werte und eine Leiter, die zeigt, was bei 8, 12, 16, 24, 48, 96 und 128 GB Speicher möglich wird.

Wie der Speicherbedarf entsteht

  • Gewichte: Parameter mal Bits pro Gewicht oder die echte Grösse der GGUF-Datei.
  • KV-Cache: wächst mit dem Kontext. Die Matrix rechnet mit 8192 Tokens; im Rechner lässt sich der Wert ändern, und ein langer Kontext kann so viel Grafikspeicher (VRAM) belegen wie ein kleines Modell.
  • Overhead: rund 1,5 GB für die Laufzeitumgebung, bei einem VLM zusätzlich der Bild-Projektor.

Passt alles in den Grafikspeicher, steht in der Zelle «Passt in den Grafikspeicher». «Läuft mit Auslagerung in den RAM» bedeutet, dass ein Teil des Modells im Arbeitsspeicher liegt: Es funktioniert, aber spürbar langsamer.

Woher die Geschwindigkeit kommt

Beim Generieren liest das Modell für jedes Token seine Gewichte aus dem Speicher. Die Geschwindigkeit ergibt sich daher grob aus der Speicherbandbreite geteilt durch die gelesenen Bytes pro Token. Bei MoE-Modellen zählen nur die aktiven Parameter, weshalb ein grosses MoE-Modell schneller antworten kann als ein kleineres dichtes Modell. Die empfohlene Quantisierung ist die stärkste Stufe bis Q8_0, die noch mindestens 10 Tokens pro Sekunde schafft, sonst die Q4-Klasse. BF16 wird nie empfohlen, unter Q3 geht die Grafik nur, wenn sonst nichts passt; dann erscheint der Hinweis «starke Kompression».

Wie genau sind die Werte?

Das Zeichen ≈ markiert eine Schätzung. Sie ist an gemessenen Läufen aus llama.cpp und öffentlichen Berichten kalibriert und liegt etwa ±35% neben ihnen; Laufzeit, Treiber und Einstellungen verschieben das Ergebnis. Zellen mit echter Messung zeigen diese samt Link zur Quelle. Nicht eingerechnet ist das Einlesen eines langen Prompts, nur die Generierung. Modelle ohne Sicherheitsfilter sind hinter einem Schalter verborgen. Passende Rechner im Ganzen finden Sie unter PC-Konfigurationen für lokale KI.