Jaki otwarty model zmieści się na Twoim sprzęcie — 2026
Modele o otwartych wagach na tle popularnych kart graficznych i komputerów: zalecana kwantyzacja (największa do Q8, która nadal daje co najmniej 10 tokenów na sekundę, w przeciwnym razie klasy Q4; poniżej Q3 tylko wtedy, gdy nic innego się nie mieści), gdzie działa (pamięć graficzna, pamięć zunifikowana lub z przeniesieniem do RAM) oraz przybliżona szybkość generowania.
| Model | Parametry | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈84 tok/s Mieści się w pamięci graficznej | Q8_0≈67 tok/s Mieści się w pamięci graficznej | Q8_0≈218 tok/s Mieści się w pamięci graficznej | Q8_0≈235 tok/s Mieści się w pamięci graficznej | Q8_0≈417 tok/s Mieści się w pamięci graficznej | Q8_0≈417 tok/s Mieści się w pamięci graficznej | Q8_0≈168 tok/s Mieści się w pamięci graficznej | Q8_0≈136 tok/s Mieści się w pamięci graficznej | Q8_0≈115 tok/s Mieści się w pamięci graficznej | Q8_0≈111 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈167 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈52 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈56 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈15,0 tok/s Mieści się w RAM (CPU) | Q8_0≈34 tok/s Mieści się w RAM (CPU) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈74 tok/s Mieści się w pamięci graficznej | Q8_0≈59 tok/s Mieści się w pamięci graficznej | Q8_0≈192 tok/s Mieści się w pamięci graficznej | Q8_0≈207 tok/s Mieści się w pamięci graficznej | Q8_0≈368 tok/s Mieści się w pamięci graficznej | Q8_0≈368 tok/s Mieści się w pamięci graficznej | Q8_0≈148 tok/s Mieści się w pamięci graficznej | Q8_0≈120 tok/s Mieści się w pamięci graficznej | Q8_0≈101 tok/s Mieści się w pamięci graficznej | Q8_0≈98 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈147 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈46 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈49 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈14,3 tok/s Mieści się w RAM (CPU) | Q8_0≈32 tok/s Mieści się w RAM (CPU) |
| Gemma 3 4B HF | 4.3B | Q8_0≈67 tok/s Mieści się w pamięci graficznej | Q8_0≈54 tok/s Mieści się w pamięci graficznej | Q8_0≈175 tok/s Mieści się w pamięci graficznej | Q8_0≈189 tok/s Mieści się w pamięci graficznej | Q8_0≈335 tok/s Mieści się w pamięci graficznej | Q8_0≈335 tok/s Mieści się w pamięci graficznej | Q8_0≈135 tok/s Mieści się w pamięci graficznej | Q8_0≈109 tok/s Mieści się w pamięci graficznej | Q8_0≈92 tok/s Mieści się w pamięci graficznej | Q8_0≈89 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈134 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈42 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈45 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈13,8 tok/s Mieści się w RAM (CPU) | Q8_0≈31 tok/s Mieści się w RAM (CPU) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈37 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈29 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈95 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈103 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈182 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈182 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈73 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈59 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈50 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈49 tok/s Mieści się w pamięci zunifikowanej | UD-Q6_K_XL≈73 tok/s Mieści się w pamięci zunifikowanej | UD-Q6_K_XL≈23 tok/s Mieści się w pamięci zunifikowanej | UD-Q6_K_XL≈24 tok/s Mieści się w pamięci zunifikowanej | UD-Q6_K_XL≈10,3 tok/s Mieści się w RAM (CPU) | UD-Q6_K_XL≈23 tok/s Mieści się w RAM (CPU) |
| Qwen3 8B HF | 8.2B | Q8_0≈31 tok/s Mieści się w pamięci graficznej | Q8_0≈25 tok/s Mieści się w pamięci graficznej | Q8_0≈80 tok/s Mieści się w pamięci graficznej | Q8_0≈87 tok/s Mieści się w pamięci graficznej | Q8_0≈154 tok/s Mieści się w pamięci graficznej | Q8_0≈154 tok/s Mieści się w pamięci graficznej | Q8_0≈62 tok/s Mieści się w pamięci graficznej | Q8_0≈50 tok/s Mieści się w pamięci graficznej | Q8_0≈42 tok/s Mieści się w pamięci graficznej | Q8_0≈41 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈62 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈19,2 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈21 tok/s Mieści się w pamięci zunifikowanej | UD-Q6_K_XL≈10,2 tok/s Mieści się w RAM (CPU) | Q8_0≈21 tok/s Mieści się w RAM (CPU) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈32 tok/s Mieści się w pamięci graficznej | Q8_0≈17,8 tok/s Mieści się w pamięci graficznej | Q8_0≈58 tok/s Mieści się w pamięci graficznej | Q8_0≈62 tok/s Mieści się w pamięci graficznej | Q8_0≈111 tok/s Mieści się w pamięci graficznej | Q8_0≈111 tok/s Mieści się w pamięci graficznej | Q8_0≈44 tok/s Mieści się w pamięci graficznej | Q8_0≈36 tok/s Mieści się w pamięci graficznej | Q8_0≈30 tok/s Mieści się w pamięci graficznej | Q8_0≈30 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈44 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈13,8 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈14,8 tok/s Mieści się w pamięci zunifikowanej | Q4_1≈10,2 tok/s Mieści się w RAM (CPU) | Q8_0≈17,1 tok/s Mieści się w RAM (CPU) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈30 tok/s Mieści się w pamięci graficznej | Q6_K≈18,0 tok/s Mieści się w pamięci graficznej | Q8_0≈46 tok/s Mieści się w pamięci graficznej | Q8_0≈49 tok/s Mieści się w pamięci graficznej | Q8_0≈88 tok/s Mieści się w pamięci graficznej | Q8_0≈88 tok/s Mieści się w pamięci graficznej | Q8_0≈35 tok/s Mieści się w pamięci graficznej | Q8_0≈29 tok/s Mieści się w pamięci graficznej | Q8_0≈24 tok/s Mieści się w pamięci graficznej | Q8_0≈23 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈35 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈10,9 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈11,7 tok/s Mieści się w pamięci zunifikowanej | UD-Q3_K_XL≈10,1 tok/s Mieści się w RAM (CPU) | Q8_0≈14,6 tok/s Mieści się w RAM (CPU) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈53 tok/s Działa z przeniesieniem do RAM | MXFP4≈55 tok/s Mieści się w pamięci graficznej | MXFP4162 tok/szmierzone Mieści się w pamięci graficznej | MXFP4≈194 tok/s Mieści się w pamięci graficznej | MXFP4≈344 tok/s Mieści się w pamięci graficznej | MXFP4≈344 tok/s Mieści się w pamięci graficznej | MXFP4≈138 tok/s Mieści się w pamięci graficznej | MXFP4≈112 tok/s Mieści się w pamięci graficznej | MXFP4≈95 tok/s Mieści się w pamięci graficznej | MXFP4≈80 tok/s Mieści się w pamięci zunifikowanej | MXFP4116 tok/szmierzone Mieści się w pamięci zunifikowanej | MXFP4≈59 tok/s Mieści się w pamięci zunifikowanej | MXFP4≈62 tok/s Mieści się w pamięci zunifikowanej | MXFP4≈17,2 tok/s Mieści się w RAM (CPU) | MXFP4≈39 tok/s Mieści się w RAM (CPU) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈10,2 tok/s Działa z przeniesieniem do RAM | UD-Q3_K_XL≈18,4 tok/s Mieści się w pamięci graficznej | Q6_K≈37 tok/s Mieści się w pamięci graficznej | Q6_K≈40 tok/s Mieści się w pamięci graficznej | Q8_0≈56 tok/s Mieści się w pamięci graficznej | Q8_0≈56 tok/s Mieści się w pamięci graficznej | Q8_0≈22 tok/s Mieści się w pamięci graficznej | Q8_0≈18,2 tok/s Mieści się w pamięci graficznej | Q8_0≈15,3 tok/s Mieści się w pamięci graficznej | Q8_0≈14,9 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈22 tok/s Mieści się w pamięci zunifikowanej | Q5_K_M≈10,3 tok/s Mieści się w pamięci zunifikowanej | Q5_K_M≈11,0 tok/s Mieści się w pamięci zunifikowanej | Q4_K_M≈6,9 tok/s Mieści się w RAM (CPU) | Q8_0≈10,3 tok/s Mieści się w RAM (CPU) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈14,7 tok/s Działa z przeniesieniem do RAM | UD-Q3_K_M≈56 tok/s Mieści się w pamięci graficznej | UD-Q5_K_S≈129 tok/s Mieści się w pamięci graficznej | UD-Q5_K_S≈139 tok/s Mieści się w pamięci graficznej | UD-Q8_K_XL≈173 tok/s Mieści się w pamięci graficznej | UD-Q8_K_XL≈173 tok/s Mieści się w pamięci graficznej | UD-Q8_K_XL≈70 tok/s Mieści się w pamięci graficznej | UD-Q8_K_XL≈57 tok/s Mieści się w pamięci graficznej | UD-Q8_K_XL≈48 tok/s Mieści się w pamięci graficznej | UD-Q8_K_XL≈40 tok/s Mieści się w pamięci zunifikowanej | UD-Q8_K_XL≈60 tok/s Mieści się w pamięci zunifikowanej | UD-Q8_K_XL≈29 tok/s Mieści się w pamięci zunifikowanej | UD-Q8_K_XL≈31 tok/s Mieści się w pamięci zunifikowanej | UD-Q8_K_XL≈13,7 tok/s Mieści się w RAM (CPU) | UD-Q8_K_XL≈31 tok/s Mieści się w RAM (CPU) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈12,7 tok/s Działa z przeniesieniem do RAM | Q3_K_S≈18,1 tok/s Mieści się w pamięci graficznej | UD-Q5_K_XL≈38 tok/s Mieści się w pamięci graficznej | UD-Q5_K_XL≈41 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈59 tok/s Mieści się w pamięci graficznej | Q8_0≈49 tok/s Mieści się w pamięci graficznej | Q8_0≈19,7 tok/s Mieści się w pamięci graficznej | Q8_0≈16,0 tok/s Mieści się w pamięci graficznej | Q8_0≈13,5 tok/s Mieści się w pamięci graficznej | Q8_0≈13,1 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈19,6 tok/s Mieści się w pamięci zunifikowanej | Q4_1≈10,1 tok/s Mieści się w pamięci zunifikowanej | Q4_1≈10,8 tok/s Mieści się w pamięci zunifikowanej | Q4_K_M≈6,3 tok/s Mieści się w RAM (CPU) | UD-Q6_K_XL≈10,8 tok/s Mieści się w RAM (CPU) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈16,4 tok/s Działa z przeniesieniem do RAM | Q3_K_S≈66 tok/s Mieści się w pamięci graficznej | Q4_K_M154 tok/szmierzone Mieści się w pamięci graficznej | Q5_K_S≈158 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈232 tok/s Mieści się w pamięci graficznej | Q8_0≈192 tok/s Mieści się w pamięci graficznej | Q8_0≈77 tok/s Mieści się w pamięci graficznej | Q8_0≈63 tok/s Mieści się w pamięci graficznej | Q8_0≈53 tok/s Mieści się w pamięci graficznej | Q8_0≈45 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈67 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈33 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈35 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈14,3 tok/s Mieści się w RAM (CPU) | Q8_0≈32 tok/s Mieści się w RAM (CPU) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈3,8 tok/s Działa z przeniesieniem do RAM | Q3_K_S≈10,4 tok/s Działa z przeniesieniem do RAM | Q4_1≈37 tok/s Mieści się w pamięci graficznej | Q4_1≈40 tok/s Mieści się w pamięci graficznej | Q6_K≈55 tok/s Mieści się w pamięci graficznej | Q8_0≈43 tok/s Mieści się w pamięci graficznej | Q8_0≈17,1 tok/s Mieści się w pamięci graficznej | Q8_0≈13,9 tok/s Mieści się w pamięci graficznej | Q8_0≈11,7 tok/s Mieści się w pamięci graficznej | Q8_0≈11,3 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈17,0 tok/s Mieści się w pamięci zunifikowanej | IQ4_XS≈10,3 tok/s Mieści się w pamięci zunifikowanej | Q4_K_S≈10,3 tok/s Mieści się w pamięci zunifikowanej | Q4_K_M≈5,7 tok/s Mieści się w RAM (CPU) | Q6_K≈10,1 tok/s Mieści się w RAM (CPU) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈3,7 tok/s Działa z przeniesieniem do RAM | UD-IQ3_XXS≈14,1 tok/s Działa z przeniesieniem do RAM | UD-Q4_K_XL≈35 tok/s Mieści się w pamięci graficznej | UD-Q4_K_XL≈38 tok/s Mieści się w pamięci graficznej | Q6_K≈51 tok/s Mieści się w pamięci graficznej | Q8_0≈40 tok/s Mieści się w pamięci graficznej | Q8_0≈16,0 tok/s Mieści się w pamięci graficznej | Q8_0≈13,0 tok/s Mieści się w pamięci graficznej | Q8_0≈11,0 tok/s Mieści się w pamięci graficznej | Q8_0≈10,6 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈16,0 tok/s Mieści się w pamięci zunifikowanej | UD-Q3_K_XL≈10,3 tok/s Mieści się w pamięci zunifikowanej | IQ4_XS≈10,2 tok/s Mieści się w pamięci zunifikowanej | Q4_K_M≈5,4 tok/s Mieści się w RAM (CPU) | Q5_K_M≈10,8 tok/s Mieści się w RAM (CPU) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈17,9 tok/s Działa z przeniesieniem do RAM | Q8_0≈18,7 tok/s Działa z przeniesieniem do RAM | Q4_K_S≈191 tok/s Mieści się w pamięci graficznej | Q4_K_S≈205 tok/s Mieści się w pamięci graficznej | Q6_K≈274 tok/s Mieści się w pamięci graficznej | Q8_0≈220 tok/s Mieści się w pamięci graficznej | Q8_0≈89 tok/s Mieści się w pamięci graficznej | Q8_0≈72 tok/s Mieści się w pamięci graficznej | Q8_0≈61 tok/s Mieści się w pamięci graficznej | Q8_0≈51 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈77 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈37 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈40 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈15,0 tok/s Mieści się w RAM (CPU) | Q8_0≈34 tok/s Mieści się w RAM (CPU) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈1,3 tok/s Działa z przeniesieniem do RAM | Q4_K_M≈1,4 tok/s Działa z przeniesieniem do RAM | Q4_K_M≈2,0 tok/s Działa z przeniesieniem do RAM | Q4_K_M≈2,0 tok/s Działa z przeniesieniem do RAM | UD-IQ3_XXS≈49 tok/s Mieści się w pamięci graficznej | Q8_0≈18,8 tok/s Mieści się w pamięci graficznej | Q4_K_M16,3 tok/szmierzone Mieści się w pamięci graficznej | Q4_1≈10,3 tok/s Mieści się w pamięci graficznej | IQ4_XS≈10,0 tok/s Mieści się w pamięci graficznej | UD-Q3_K_XL≈10,6 tok/s Mieści się w pamięci zunifikowanej | Q5_K_M≈11,2 tok/s Mieści się w pamięci zunifikowanej | Q4_K_M≈4,1 tok/s Mieści się w pamięci zunifikowanej | Q4_K_M≈4,4 tok/s Mieści się w pamięci zunifikowanej | Q4_K_M≈2,9 tok/s Mieści się w RAM (CPU) | Q4_K_M≈6,6 tok/s Mieści się w RAM (CPU) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈24 tok/s Działa z przeniesieniem do RAM | Q6_K≈21 tok/s Działa z przeniesieniem do RAM | UD-Q6_K_XL≈26 tok/s Działa z przeniesieniem do RAM | UD-Q6_K_XL≈26 tok/s Działa z przeniesieniem do RAM | UD-Q6_K_XL≈31 tok/s Działa z przeniesieniem do RAM | Q8_0≈213 tok/s Mieści się w pamięci graficznej | Q4_K_S≈145 tok/s Mieści się w pamięci graficznej | UD-Q6_K_XL≈84 tok/s Mieści się w pamięci graficznej | Q8_0≈59 tok/s Mieści się w pamięci graficznej | Q8_0≈49 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈74 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈36 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈39 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈14,8 tok/s Mieści się w RAM (CPU) | Q8_0≈33 tok/s Mieści się w RAM (CPU) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈5,3 tok/s Działa z przeniesieniem do RAM | Q4_K_S≈5,1 tok/s Działa z przeniesieniem do RAM | Q4_K_M≈5,6 tok/s Działa z przeniesieniem do RAM | Q4_K_M≈5,7 tok/s Działa z przeniesieniem do RAM | Q3_K_M≈10,2 tok/s Działa z przeniesieniem do RAM | Q5_K_M≈55 tok/s Mieści się w pamięci graficznej | Q4_0≈10,0 tok/s Działa z przeniesieniem do RAM | UD-Q4_K_XL≈22 tok/s Mieści się w pamięci graficznej | Q5_K_M≈15,2 tok/s Mieści się w pamięci graficznej | Q5_K_M≈12,8 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈13,9 tok/s Mieści się w pamięci zunifikowanej | Q4_K_M≈10,6 tok/s Mieści się w pamięci zunifikowanej | Q5_K_M≈10,0 tok/s Mieści się w pamięci zunifikowanej | Q4_K_M≈8,0 tok/s Mieści się w RAM (CPU) | Q8_0≈13,1 tok/s Mieści się w RAM (CPU) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈19,1 tok/s Działa z przeniesieniem do RAM | MXFP4≈19,6 tok/s Działa z przeniesieniem do RAM | MXFP426–28 tok/szmierzone Działa z przeniesieniem do RAM | MXFP4≈25 tok/s Działa z przeniesieniem do RAM | MXFP4≈31 tok/s Działa z przeniesieniem do RAM | MXFP4≈258 tok/s Mieści się w pamięci graficznej | MXFP4≈36 tok/s Działa z przeniesieniem do RAM | MXFP441–73 tok/szmierzone Mieści się w pamięci graficznej | MXFP4≈71 tok/s Mieści się w pamięci graficznej | MXFP4≈60 tok/s Mieści się w pamięci zunifikowanej | MXFP4≈90 tok/s Mieści się w pamięci zunifikowanej | MXFP450 tok/szmierzone Mieści się w pamięci zunifikowanej | MXFP461 tok/szmierzone Mieści się w pamięci zunifikowanej | MXFP4≈15,8 tok/s Mieści się w RAM (CPU) | MXFP4≈36 tok/s Mieści się w RAM (CPU) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈10,5 tok/s Działa z przeniesieniem do RAM | UD-IQ4_NL≈10,8 tok/s Działa z przeniesieniem do RAM | Q4_K_S≈11,1 tok/s Działa z przeniesieniem do RAM | Q4_K_S≈11,2 tok/s Działa z przeniesieniem do RAM | UD-Q4_K_XL≈11,9 tok/s Działa z przeniesieniem do RAM | UD-Q5_K_XL≈97 tok/s Mieści się w pamięci graficznej | UD-IQ3_XXS≈76 tok/s Mieści się w pamięci graficznej | UD-IQ4_NL≈46 tok/s Mieści się w pamięci graficznej | UD-Q5_K_XL≈27 tok/s Mieści się w pamięci graficznej | UD-Q5_K_XL≈23 tok/s Mieści się w pamięci zunifikowanej | Q8_0≈24 tok/s Mieści się w pamięci zunifikowanej | Q6_K≈15,1 tok/s Mieści się w pamięci zunifikowanej | Q6_K≈16,1 tok/s Mieści się w pamięci zunifikowanej | UD-Q5_K_XL≈10,4 tok/s Mieści się w RAM (CPU) | Q8_0≈19,3 tok/s Mieści się w RAM (CPU) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | UD-Q4_K_XL≈10,8 tok/s Działa z przeniesieniem do RAM | UD-Q2_K_XL≈8,0 tok/ssilna kompresja Działa z przeniesieniem do RAM | Q3_K_M≈6,1 tok/s Działa z przeniesieniem do RAM | UD-Q3_K_XL≈11,7 tok/s Działa z przeniesieniem do RAM | UD-Q2_K_XL≈19,4 tok/ssilna kompresja Mieści się w pamięci zunifikowanej | Q8_0≈10,8 tok/s Mieści się w pamięci zunifikowanej | UD-Q3_K_XL≈12,2 tok/s Mieści się w pamięci zunifikowanej | UD-Q3_K_XL≈13,0 tok/s Mieści się w pamięci zunifikowanej | Q4_K_M≈7,2 tok/s Mieści się w RAM (CPU) | Q8_0≈10,9 tok/s Mieści się w RAM (CPU) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | UD-IQ3_XXS≈7,3 tok/s Działa z przeniesieniem do RAM | UD-IQ1_S≈5,6 tok/ssilna kompresja Działa z przeniesieniem do RAM | UD-IQ2_XXS≈4,7 tok/ssilna kompresja Działa z przeniesieniem do RAM | UD-IQ3_XXS≈3,5 tok/s Działa z przeniesieniem do RAM | UD-TQ1_0≈16,2 tok/ssilna kompresja Mieści się w pamięci zunifikowanej | Q4_1≈10,0 tok/s Mieści się w pamięci zunifikowanej | UD-IQ1_M≈9,6 tok/ssilna kompresja Mieści się w pamięci zunifikowanej | UD-IQ1_M≈10,3 tok/ssilna kompresja Mieści się w pamięci zunifikowanej | Q4_K_M≈4,7 tok/s Mieści się w RAM (CPU) | Q4_1≈10,2 tok/s Mieści się w RAM (CPU) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | UD-IQ1_S≈16,9 tok/ssilna kompresja Działa z przeniesieniem do RAM | ✕ Nie mieści się | ✕ Nie mieści się | UD-IQ1_S≈8,0 tok/ssilna kompresja Działa z przeniesieniem do RAM | ✕ Nie mieści się | Q3_K_M≈14,9 tok/s Mieści się w pamięci zunifikowanej | ✕ Nie mieści się | ✕ Nie mieści się | Q4_K_M≈5,2 tok/s Mieści się w RAM (CPU) | Q3_K_M≈13,9 tok/s Mieści się w RAM (CPU) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | ✕ Nie mieści się | UD-Q2_K_XL≈22 tok/ssilna kompresja Mieści się w pamięci zunifikowanej | ✕ Nie mieści się | ✕ Nie mieści się | Q3_K_S≈7,2 tok/s Mieści się w RAM (CPU) | UD-IQ2_XXS≈19,7 tok/ssilna kompresja Mieści się w RAM (CPU) |
Kalkulator: czy się zmieści?
Co się otwiera przy każdym rozmiarze pamięci (kontekst 8K)
- 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B silna kompresja: Gemma 3 12B · Qwen3 14B
- 12 GB Gemma 3 12B · Qwen3 14B silna kompresja: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B silna kompresja: Gemma 4 31B · Qwen3.5 35B A3B
- 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B silna kompresja: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B silna kompresja: GLM 4.5 Air
- 96 GB GLM 4.5 Air · gpt-oss-120b silna kompresja: Qwen3 235B A22B · GLM 4.7
- 128 GB Qwen3 235B A22B
- 192 GB GLM 4.7 silna kompresja: DeepSeek R1
- 256 GB silna kompresja: Kimi K2.5
- 512 GB DeepSeek R1 · Kimi K2.5
≈ szacunki dla kontekstu 8K: wagi + pamięć podręczna KV + narzut środowiska uruchomieniowego względem pamięci; szybkość z przepustowości pamięci. Rzeczywiste wartości zależą od środowiska i ustawień.
Zaktualizowano · Źródła: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
Osadź na swojej stronie
Wklej ten kod tam, gdzie ma się pojawić infografika: aktualizuje się sama. Użycie bezpłatne — zachowaj link do źródła.
Co oznacza komórka macierzy?
W wierszach są znane modele z otwartymi wagami (open weights), od około 3B do 1T parametrów. Kolumny to karty graficzne, zestawy z kilkoma GPU, komputery Apple i AMD z pamięcią zunifikowaną oraz serwery CPU. Komórka podaje zalecaną kwantyzację, miejsce, w którym ląduje model – pamięć graficzna, pamięć zunifikowana, RAM serwera, przeniesienie do RAM albo „Nie mieści się” – i przybliżoną prędkość generowania w tokenach na sekundę.
Jak liczona jest pamięć?
Podstawą są wagi: liczba parametrów razy liczba bitów na wagę albo rzeczywisty rozmiar pliku kwantu z Hugging Face, jeśli taki istnieje. Do tego dochodzi pamięć podręczna KV, która przechowuje rozmowę. Macierz zakłada kontekst 8192 tokenów; w kalkulatorze możesz go zwiększyć, a przy długim kontekście ta pamięć potrafi zająć tyle co mały model. Na koniec doliczamy około 1,5 GB na środowisko uruchomieniowe i bufory oraz projektor obrazu w modelu VLM.
Gdy suma przekracza VRAM karty, ale mieści się razem z systemowym RAM, komórka pokazuje przeniesienie do RAM. Model działa, tyle że wolniej.
Dlaczego duży model MoE bywa szybki?
Prędkość to przepustowość pamięci podzielona przez liczbę bajtów odczytywanych na token. Model mixture-of-experts (MoE) czyta przy każdym tokenie tylko aktywne parametry. Dlatego duży MoE potrafi generować szybciej niż mniejszy model gęsty.
Według czego dobieracie kwant?
- Schodzimy od Q8_0 w dół i zatrzymujemy się na kwancie, który daje jeszcze nie mniej niż 10 tokenów na sekundę.
- Jeśli to się nie udaje, wybieramy plik z klasy Q4, na przykład Q4_K_M.
- BF16 nie polecamy nigdy: podwaja zużycie pamięci za ledwie zauważalny zysk.
- Poniżej Q3 schodzimy tylko wtedy, gdy nic innego się nie mieści, a komórka ostrzega wtedy o „silnej kompresji”.
Na ile można ufać liczbom?
Wartości z ≈ to szacunki skalibrowane na zmierzonych przebiegach i mieszczące się w około ±35% od nich; jeśli istnieje prawdziwy pomiar, widać go z linkiem do źródła. Szacunek dotyczy samego generowania, a nie wczytywania długiego zapytania, a sterowniki, wersja środowiska i ustawienia przesuwają wynik w obie strony. Modele bez filtrów bezpieczeństwa są ukryte za przełącznikiem.
Czy policzę własny komputer?
Tak. Kalkulator pod macierzą przyjmuje model, kwant, kontekst i sprzęt albo po prostu twoją pamięć graficzną, RAM i przepustowość, a drabinka niżej pokazuje, co odblokowuje się przy 8, 12, 16, 24, 48, 96 i 128 GB. Pliki GGUF uruchomisz w lokalnych aplikacjach AI, takich jak llama.cpp, LM Studio, Ollama i Jan. Gotowe maszyny opisują zestawy PC.