Przejdź do treści
fedi.software

Jaki otwarty model zmieści się na Twoim sprzęcie — 2026

Modele o otwartych wagach na tle popularnych kart graficznych i komputerów: zalecana kwantyzacja (największa do Q8, która nadal daje co najmniej 10 tokenów na sekundę, w przeciwnym razie klasy Q4; poniżej Q3 tylko wtedy, gdy nic innego się nie mieści), gdzie działa (pamięć graficzna, pamięć zunifikowana lub z przeniesieniem do RAM) oraz przybliżona szybkość generowania.

Model Parametry
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s Mieści się w pamięci graficznej Q8_0≈67 tok/s Mieści się w pamięci graficznej Q8_0≈218 tok/s Mieści się w pamięci graficznej Q8_0≈235 tok/s Mieści się w pamięci graficznej Q8_0≈417 tok/s Mieści się w pamięci graficznej Q8_0≈417 tok/s Mieści się w pamięci graficznej Q8_0≈168 tok/s Mieści się w pamięci graficznej Q8_0≈136 tok/s Mieści się w pamięci graficznej Q8_0≈115 tok/s Mieści się w pamięci graficznej Q8_0≈111 tok/s Mieści się w pamięci zunifikowanej Q8_0≈167 tok/s Mieści się w pamięci zunifikowanej Q8_0≈52 tok/s Mieści się w pamięci zunifikowanej Q8_0≈56 tok/s Mieści się w pamięci zunifikowanej Q8_0≈15,0 tok/s Mieści się w RAM (CPU) Q8_0≈34 tok/s Mieści się w RAM (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s Mieści się w pamięci graficznej Q8_0≈59 tok/s Mieści się w pamięci graficznej Q8_0≈192 tok/s Mieści się w pamięci graficznej Q8_0≈207 tok/s Mieści się w pamięci graficznej Q8_0≈368 tok/s Mieści się w pamięci graficznej Q8_0≈368 tok/s Mieści się w pamięci graficznej Q8_0≈148 tok/s Mieści się w pamięci graficznej Q8_0≈120 tok/s Mieści się w pamięci graficznej Q8_0≈101 tok/s Mieści się w pamięci graficznej Q8_0≈98 tok/s Mieści się w pamięci zunifikowanej Q8_0≈147 tok/s Mieści się w pamięci zunifikowanej Q8_0≈46 tok/s Mieści się w pamięci zunifikowanej Q8_0≈49 tok/s Mieści się w pamięci zunifikowanej Q8_0≈14,3 tok/s Mieści się w RAM (CPU) Q8_0≈32 tok/s Mieści się w RAM (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s Mieści się w pamięci graficznej Q8_0≈54 tok/s Mieści się w pamięci graficznej Q8_0≈175 tok/s Mieści się w pamięci graficznej Q8_0≈189 tok/s Mieści się w pamięci graficznej Q8_0≈335 tok/s Mieści się w pamięci graficznej Q8_0≈335 tok/s Mieści się w pamięci graficznej Q8_0≈135 tok/s Mieści się w pamięci graficznej Q8_0≈109 tok/s Mieści się w pamięci graficznej Q8_0≈92 tok/s Mieści się w pamięci graficznej Q8_0≈89 tok/s Mieści się w pamięci zunifikowanej Q8_0≈134 tok/s Mieści się w pamięci zunifikowanej Q8_0≈42 tok/s Mieści się w pamięci zunifikowanej Q8_0≈45 tok/s Mieści się w pamięci zunifikowanej Q8_0≈13,8 tok/s Mieści się w RAM (CPU) Q8_0≈31 tok/s Mieści się w RAM (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈29 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈95 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈103 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈182 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈182 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈73 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈59 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈50 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈49 tok/s Mieści się w pamięci zunifikowanej UD-Q6_K_XL≈73 tok/s Mieści się w pamięci zunifikowanej UD-Q6_K_XL≈23 tok/s Mieści się w pamięci zunifikowanej UD-Q6_K_XL≈24 tok/s Mieści się w pamięci zunifikowanej UD-Q6_K_XL≈10,3 tok/s Mieści się w RAM (CPU) UD-Q6_K_XL≈23 tok/s Mieści się w RAM (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s Mieści się w pamięci graficznej Q8_0≈25 tok/s Mieści się w pamięci graficznej Q8_0≈80 tok/s Mieści się w pamięci graficznej Q8_0≈87 tok/s Mieści się w pamięci graficznej Q8_0≈154 tok/s Mieści się w pamięci graficznej Q8_0≈154 tok/s Mieści się w pamięci graficznej Q8_0≈62 tok/s Mieści się w pamięci graficznej Q8_0≈50 tok/s Mieści się w pamięci graficznej Q8_0≈42 tok/s Mieści się w pamięci graficznej Q8_0≈41 tok/s Mieści się w pamięci zunifikowanej Q8_0≈62 tok/s Mieści się w pamięci zunifikowanej Q8_0≈19,2 tok/s Mieści się w pamięci zunifikowanej Q8_0≈21 tok/s Mieści się w pamięci zunifikowanej UD-Q6_K_XL≈10,2 tok/s Mieści się w RAM (CPU) Q8_0≈21 tok/s Mieści się w RAM (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s Mieści się w pamięci graficznej Q8_0≈17,8 tok/s Mieści się w pamięci graficznej Q8_0≈58 tok/s Mieści się w pamięci graficznej Q8_0≈62 tok/s Mieści się w pamięci graficznej Q8_0≈111 tok/s Mieści się w pamięci graficznej Q8_0≈111 tok/s Mieści się w pamięci graficznej Q8_0≈44 tok/s Mieści się w pamięci graficznej Q8_0≈36 tok/s Mieści się w pamięci graficznej Q8_0≈30 tok/s Mieści się w pamięci graficznej Q8_0≈30 tok/s Mieści się w pamięci zunifikowanej Q8_0≈44 tok/s Mieści się w pamięci zunifikowanej Q8_0≈13,8 tok/s Mieści się w pamięci zunifikowanej Q8_0≈14,8 tok/s Mieści się w pamięci zunifikowanej Q4_1≈10,2 tok/s Mieści się w RAM (CPU) Q8_0≈17,1 tok/s Mieści się w RAM (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s Mieści się w pamięci graficznej Q6_K≈18,0 tok/s Mieści się w pamięci graficznej Q8_0≈46 tok/s Mieści się w pamięci graficznej Q8_0≈49 tok/s Mieści się w pamięci graficznej Q8_0≈88 tok/s Mieści się w pamięci graficznej Q8_0≈88 tok/s Mieści się w pamięci graficznej Q8_0≈35 tok/s Mieści się w pamięci graficznej Q8_0≈29 tok/s Mieści się w pamięci graficznej Q8_0≈24 tok/s Mieści się w pamięci graficznej Q8_0≈23 tok/s Mieści się w pamięci zunifikowanej Q8_0≈35 tok/s Mieści się w pamięci zunifikowanej Q8_0≈10,9 tok/s Mieści się w pamięci zunifikowanej Q8_0≈11,7 tok/s Mieści się w pamięci zunifikowanej UD-Q3_K_XL≈10,1 tok/s Mieści się w RAM (CPU) Q8_0≈14,6 tok/s Mieści się w RAM (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s Działa z przeniesieniem do RAM MXFP4≈55 tok/s Mieści się w pamięci graficznej MXFP4162 tok/szmierzone Mieści się w pamięci graficznej MXFP4≈194 tok/s Mieści się w pamięci graficznej MXFP4≈344 tok/s Mieści się w pamięci graficznej MXFP4≈344 tok/s Mieści się w pamięci graficznej MXFP4≈138 tok/s Mieści się w pamięci graficznej MXFP4≈112 tok/s Mieści się w pamięci graficznej MXFP4≈95 tok/s Mieści się w pamięci graficznej MXFP4≈80 tok/s Mieści się w pamięci zunifikowanej MXFP4116 tok/szmierzone Mieści się w pamięci zunifikowanej MXFP4≈59 tok/s Mieści się w pamięci zunifikowanej MXFP4≈62 tok/s Mieści się w pamięci zunifikowanej MXFP4≈17,2 tok/s Mieści się w RAM (CPU) MXFP4≈39 tok/s Mieści się w RAM (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10,2 tok/s Działa z przeniesieniem do RAM UD-Q3_K_XL≈18,4 tok/s Mieści się w pamięci graficznej Q6_K≈37 tok/s Mieści się w pamięci graficznej Q6_K≈40 tok/s Mieści się w pamięci graficznej Q8_0≈56 tok/s Mieści się w pamięci graficznej Q8_0≈56 tok/s Mieści się w pamięci graficznej Q8_0≈22 tok/s Mieści się w pamięci graficznej Q8_0≈18,2 tok/s Mieści się w pamięci graficznej Q8_0≈15,3 tok/s Mieści się w pamięci graficznej Q8_0≈14,9 tok/s Mieści się w pamięci zunifikowanej Q8_0≈22 tok/s Mieści się w pamięci zunifikowanej Q5_K_M≈10,3 tok/s Mieści się w pamięci zunifikowanej Q5_K_M≈11,0 tok/s Mieści się w pamięci zunifikowanej Q4_K_M≈6,9 tok/s Mieści się w RAM (CPU) Q8_0≈10,3 tok/s Mieści się w RAM (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14,7 tok/s Działa z przeniesieniem do RAM UD-Q3_K_M≈56 tok/s Mieści się w pamięci graficznej UD-Q5_K_S≈129 tok/s Mieści się w pamięci graficznej UD-Q5_K_S≈139 tok/s Mieści się w pamięci graficznej UD-Q8_K_XL≈173 tok/s Mieści się w pamięci graficznej UD-Q8_K_XL≈173 tok/s Mieści się w pamięci graficznej UD-Q8_K_XL≈70 tok/s Mieści się w pamięci graficznej UD-Q8_K_XL≈57 tok/s Mieści się w pamięci graficznej UD-Q8_K_XL≈48 tok/s Mieści się w pamięci graficznej UD-Q8_K_XL≈40 tok/s Mieści się w pamięci zunifikowanej UD-Q8_K_XL≈60 tok/s Mieści się w pamięci zunifikowanej UD-Q8_K_XL≈29 tok/s Mieści się w pamięci zunifikowanej UD-Q8_K_XL≈31 tok/s Mieści się w pamięci zunifikowanej UD-Q8_K_XL≈13,7 tok/s Mieści się w RAM (CPU) UD-Q8_K_XL≈31 tok/s Mieści się w RAM (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12,7 tok/s Działa z przeniesieniem do RAM Q3_K_S≈18,1 tok/s Mieści się w pamięci graficznej UD-Q5_K_XL≈38 tok/s Mieści się w pamięci graficznej UD-Q5_K_XL≈41 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈59 tok/s Mieści się w pamięci graficznej Q8_0≈49 tok/s Mieści się w pamięci graficznej Q8_0≈19,7 tok/s Mieści się w pamięci graficznej Q8_0≈16,0 tok/s Mieści się w pamięci graficznej Q8_0≈13,5 tok/s Mieści się w pamięci graficznej Q8_0≈13,1 tok/s Mieści się w pamięci zunifikowanej Q8_0≈19,6 tok/s Mieści się w pamięci zunifikowanej Q4_1≈10,1 tok/s Mieści się w pamięci zunifikowanej Q4_1≈10,8 tok/s Mieści się w pamięci zunifikowanej Q4_K_M≈6,3 tok/s Mieści się w RAM (CPU) UD-Q6_K_XL≈10,8 tok/s Mieści się w RAM (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16,4 tok/s Działa z przeniesieniem do RAM Q3_K_S≈66 tok/s Mieści się w pamięci graficznej Q4_K_M154 tok/szmierzone Mieści się w pamięci graficznej Q5_K_S≈158 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈232 tok/s Mieści się w pamięci graficznej Q8_0≈192 tok/s Mieści się w pamięci graficznej Q8_0≈77 tok/s Mieści się w pamięci graficznej Q8_0≈63 tok/s Mieści się w pamięci graficznej Q8_0≈53 tok/s Mieści się w pamięci graficznej Q8_0≈45 tok/s Mieści się w pamięci zunifikowanej Q8_0≈67 tok/s Mieści się w pamięci zunifikowanej Q8_0≈33 tok/s Mieści się w pamięci zunifikowanej Q8_0≈35 tok/s Mieści się w pamięci zunifikowanej Q8_0≈14,3 tok/s Mieści się w RAM (CPU) Q8_0≈32 tok/s Mieści się w RAM (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3,8 tok/s Działa z przeniesieniem do RAM Q3_K_S≈10,4 tok/s Działa z przeniesieniem do RAM Q4_1≈37 tok/s Mieści się w pamięci graficznej Q4_1≈40 tok/s Mieści się w pamięci graficznej Q6_K≈55 tok/s Mieści się w pamięci graficznej Q8_0≈43 tok/s Mieści się w pamięci graficznej Q8_0≈17,1 tok/s Mieści się w pamięci graficznej Q8_0≈13,9 tok/s Mieści się w pamięci graficznej Q8_0≈11,7 tok/s Mieści się w pamięci graficznej Q8_0≈11,3 tok/s Mieści się w pamięci zunifikowanej Q8_0≈17,0 tok/s Mieści się w pamięci zunifikowanej IQ4_XS≈10,3 tok/s Mieści się w pamięci zunifikowanej Q4_K_S≈10,3 tok/s Mieści się w pamięci zunifikowanej Q4_K_M≈5,7 tok/s Mieści się w RAM (CPU) Q6_K≈10,1 tok/s Mieści się w RAM (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3,7 tok/s Działa z przeniesieniem do RAM UD-IQ3_XXS≈14,1 tok/s Działa z przeniesieniem do RAM UD-Q4_K_XL≈35 tok/s Mieści się w pamięci graficznej UD-Q4_K_XL≈38 tok/s Mieści się w pamięci graficznej Q6_K≈51 tok/s Mieści się w pamięci graficznej Q8_0≈40 tok/s Mieści się w pamięci graficznej Q8_0≈16,0 tok/s Mieści się w pamięci graficznej Q8_0≈13,0 tok/s Mieści się w pamięci graficznej Q8_0≈11,0 tok/s Mieści się w pamięci graficznej Q8_0≈10,6 tok/s Mieści się w pamięci zunifikowanej Q8_0≈16,0 tok/s Mieści się w pamięci zunifikowanej UD-Q3_K_XL≈10,3 tok/s Mieści się w pamięci zunifikowanej IQ4_XS≈10,2 tok/s Mieści się w pamięci zunifikowanej Q4_K_M≈5,4 tok/s Mieści się w RAM (CPU) Q5_K_M≈10,8 tok/s Mieści się w RAM (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17,9 tok/s Działa z przeniesieniem do RAM Q8_0≈18,7 tok/s Działa z przeniesieniem do RAM Q4_K_S≈191 tok/s Mieści się w pamięci graficznej Q4_K_S≈205 tok/s Mieści się w pamięci graficznej Q6_K≈274 tok/s Mieści się w pamięci graficznej Q8_0≈220 tok/s Mieści się w pamięci graficznej Q8_0≈89 tok/s Mieści się w pamięci graficznej Q8_0≈72 tok/s Mieści się w pamięci graficznej Q8_0≈61 tok/s Mieści się w pamięci graficznej Q8_0≈51 tok/s Mieści się w pamięci zunifikowanej Q8_0≈77 tok/s Mieści się w pamięci zunifikowanej Q8_0≈37 tok/s Mieści się w pamięci zunifikowanej Q8_0≈40 tok/s Mieści się w pamięci zunifikowanej Q8_0≈15,0 tok/s Mieści się w RAM (CPU) Q8_0≈34 tok/s Mieści się w RAM (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1,3 tok/s Działa z przeniesieniem do RAM Q4_K_M≈1,4 tok/s Działa z przeniesieniem do RAM Q4_K_M≈2,0 tok/s Działa z przeniesieniem do RAM Q4_K_M≈2,0 tok/s Działa z przeniesieniem do RAM UD-IQ3_XXS≈49 tok/s Mieści się w pamięci graficznej Q8_0≈18,8 tok/s Mieści się w pamięci graficznej Q4_K_M16,3 tok/szmierzone Mieści się w pamięci graficznej Q4_1≈10,3 tok/s Mieści się w pamięci graficznej IQ4_XS≈10,0 tok/s Mieści się w pamięci graficznej UD-Q3_K_XL≈10,6 tok/s Mieści się w pamięci zunifikowanej Q5_K_M≈11,2 tok/s Mieści się w pamięci zunifikowanej Q4_K_M≈4,1 tok/s Mieści się w pamięci zunifikowanej Q4_K_M≈4,4 tok/s Mieści się w pamięci zunifikowanej Q4_K_M≈2,9 tok/s Mieści się w RAM (CPU) Q4_K_M≈6,6 tok/s Mieści się w RAM (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s Działa z przeniesieniem do RAM Q6_K≈21 tok/s Działa z przeniesieniem do RAM UD-Q6_K_XL≈26 tok/s Działa z przeniesieniem do RAM UD-Q6_K_XL≈26 tok/s Działa z przeniesieniem do RAM UD-Q6_K_XL≈31 tok/s Działa z przeniesieniem do RAM Q8_0≈213 tok/s Mieści się w pamięci graficznej Q4_K_S≈145 tok/s Mieści się w pamięci graficznej UD-Q6_K_XL≈84 tok/s Mieści się w pamięci graficznej Q8_0≈59 tok/s Mieści się w pamięci graficznej Q8_0≈49 tok/s Mieści się w pamięci zunifikowanej Q8_0≈74 tok/s Mieści się w pamięci zunifikowanej Q8_0≈36 tok/s Mieści się w pamięci zunifikowanej Q8_0≈39 tok/s Mieści się w pamięci zunifikowanej Q8_0≈14,8 tok/s Mieści się w RAM (CPU) Q8_0≈33 tok/s Mieści się w RAM (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5,3 tok/s Działa z przeniesieniem do RAM Q4_K_S≈5,1 tok/s Działa z przeniesieniem do RAM Q4_K_M≈5,6 tok/s Działa z przeniesieniem do RAM Q4_K_M≈5,7 tok/s Działa z przeniesieniem do RAM Q3_K_M≈10,2 tok/s Działa z przeniesieniem do RAM Q5_K_M≈55 tok/s Mieści się w pamięci graficznej Q4_0≈10,0 tok/s Działa z przeniesieniem do RAM UD-Q4_K_XL≈22 tok/s Mieści się w pamięci graficznej Q5_K_M≈15,2 tok/s Mieści się w pamięci graficznej Q5_K_M≈12,8 tok/s Mieści się w pamięci zunifikowanej Q8_0≈13,9 tok/s Mieści się w pamięci zunifikowanej Q4_K_M≈10,6 tok/s Mieści się w pamięci zunifikowanej Q5_K_M≈10,0 tok/s Mieści się w pamięci zunifikowanej Q4_K_M≈8,0 tok/s Mieści się w RAM (CPU) Q8_0≈13,1 tok/s Mieści się w RAM (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19,1 tok/s Działa z przeniesieniem do RAM MXFP4≈19,6 tok/s Działa z przeniesieniem do RAM MXFP426–28 tok/szmierzone Działa z przeniesieniem do RAM MXFP4≈25 tok/s Działa z przeniesieniem do RAM MXFP4≈31 tok/s Działa z przeniesieniem do RAM MXFP4≈258 tok/s Mieści się w pamięci graficznej MXFP4≈36 tok/s Działa z przeniesieniem do RAM MXFP441–73 tok/szmierzone Mieści się w pamięci graficznej MXFP4≈71 tok/s Mieści się w pamięci graficznej MXFP4≈60 tok/s Mieści się w pamięci zunifikowanej MXFP4≈90 tok/s Mieści się w pamięci zunifikowanej MXFP450 tok/szmierzone Mieści się w pamięci zunifikowanej MXFP461 tok/szmierzone Mieści się w pamięci zunifikowanej MXFP4≈15,8 tok/s Mieści się w RAM (CPU) MXFP4≈36 tok/s Mieści się w RAM (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10,5 tok/s Działa z przeniesieniem do RAM UD-IQ4_NL≈10,8 tok/s Działa z przeniesieniem do RAM Q4_K_S≈11,1 tok/s Działa z przeniesieniem do RAM Q4_K_S≈11,2 tok/s Działa z przeniesieniem do RAM UD-Q4_K_XL≈11,9 tok/s Działa z przeniesieniem do RAM UD-Q5_K_XL≈97 tok/s Mieści się w pamięci graficznej UD-IQ3_XXS≈76 tok/s Mieści się w pamięci graficznej UD-IQ4_NL≈46 tok/s Mieści się w pamięci graficznej UD-Q5_K_XL≈27 tok/s Mieści się w pamięci graficznej UD-Q5_K_XL≈23 tok/s Mieści się w pamięci zunifikowanej Q8_0≈24 tok/s Mieści się w pamięci zunifikowanej Q6_K≈15,1 tok/s Mieści się w pamięci zunifikowanej Q6_K≈16,1 tok/s Mieści się w pamięci zunifikowanej UD-Q5_K_XL≈10,4 tok/s Mieści się w RAM (CPU) Q8_0≈19,3 tok/s Mieści się w RAM (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się UD-Q4_K_XL≈10,8 tok/s Działa z przeniesieniem do RAM UD-Q2_K_XL≈8,0 tok/ssilna kompresja Działa z przeniesieniem do RAM Q3_K_M≈6,1 tok/s Działa z przeniesieniem do RAM UD-Q3_K_XL≈11,7 tok/s Działa z przeniesieniem do RAM UD-Q2_K_XL≈19,4 tok/ssilna kompresja Mieści się w pamięci zunifikowanej Q8_0≈10,8 tok/s Mieści się w pamięci zunifikowanej UD-Q3_K_XL≈12,2 tok/s Mieści się w pamięci zunifikowanej UD-Q3_K_XL≈13,0 tok/s Mieści się w pamięci zunifikowanej Q4_K_M≈7,2 tok/s Mieści się w RAM (CPU) Q8_0≈10,9 tok/s Mieści się w RAM (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się UD-IQ3_XXS≈7,3 tok/s Działa z przeniesieniem do RAM UD-IQ1_S≈5,6 tok/ssilna kompresja Działa z przeniesieniem do RAM UD-IQ2_XXS≈4,7 tok/ssilna kompresja Działa z przeniesieniem do RAM UD-IQ3_XXS≈3,5 tok/s Działa z przeniesieniem do RAM UD-TQ1_0≈16,2 tok/ssilna kompresja Mieści się w pamięci zunifikowanej Q4_1≈10,0 tok/s Mieści się w pamięci zunifikowanej UD-IQ1_M≈9,6 tok/ssilna kompresja Mieści się w pamięci zunifikowanej UD-IQ1_M≈10,3 tok/ssilna kompresja Mieści się w pamięci zunifikowanej Q4_K_M≈4,7 tok/s Mieści się w RAM (CPU) Q4_1≈10,2 tok/s Mieści się w RAM (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się UD-IQ1_S≈16,9 tok/ssilna kompresja Działa z przeniesieniem do RAM ✕ Nie mieści się ✕ Nie mieści się UD-IQ1_S≈8,0 tok/ssilna kompresja Działa z przeniesieniem do RAM ✕ Nie mieści się Q3_K_M≈14,9 tok/s Mieści się w pamięci zunifikowanej ✕ Nie mieści się ✕ Nie mieści się Q4_K_M≈5,2 tok/s Mieści się w RAM (CPU) Q3_K_M≈13,9 tok/s Mieści się w RAM (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się ✕ Nie mieści się UD-Q2_K_XL≈22 tok/ssilna kompresja Mieści się w pamięci zunifikowanej ✕ Nie mieści się ✕ Nie mieści się Q3_K_S≈7,2 tok/s Mieści się w RAM (CPU) UD-IQ2_XXS≈19,7 tok/ssilna kompresja Mieści się w RAM (CPU)

Co się otwiera przy każdym rozmiarze pamięci (kontekst 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B silna kompresja: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B silna kompresja: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B silna kompresja: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B silna kompresja: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B silna kompresja: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b silna kompresja: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 silna kompresja: DeepSeek R1
  9. 256 GB silna kompresja: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ szacunki dla kontekstu 8K: wagi + pamięć podręczna KV + narzut środowiska uruchomieniowego względem pamięci; szybkość z przepustowości pamięci. Rzeczywiste wartości zależą od środowiska i ustawień.

Zaktualizowano · Źródła: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Osadź na swojej stronie

Wklej ten kod tam, gdzie ma się pojawić infografika: aktualizuje się sama. Użycie bezpłatne — zachowaj link do źródła.

JSON Nasze dane: CC BY 4.0 z linkiem do źródła; dane zewnętrzne zachowują licencję swojego źródła.

Co oznacza komórka macierzy?

W wierszach są znane modele z otwartymi wagami (open weights), od około 3B do 1T parametrów. Kolumny to karty graficzne, zestawy z kilkoma GPU, komputery Apple i AMD z pamięcią zunifikowaną oraz serwery CPU. Komórka podaje zalecaną kwantyzację, miejsce, w którym ląduje model – pamięć graficzna, pamięć zunifikowana, RAM serwera, przeniesienie do RAM albo „Nie mieści się” – i przybliżoną prędkość generowania w tokenach na sekundę.

Jak liczona jest pamięć?

Podstawą są wagi: liczba parametrów razy liczba bitów na wagę albo rzeczywisty rozmiar pliku kwantu z Hugging Face, jeśli taki istnieje. Do tego dochodzi pamięć podręczna KV, która przechowuje rozmowę. Macierz zakłada kontekst 8192 tokenów; w kalkulatorze możesz go zwiększyć, a przy długim kontekście ta pamięć potrafi zająć tyle co mały model. Na koniec doliczamy około 1,5 GB na środowisko uruchomieniowe i bufory oraz projektor obrazu w modelu VLM.

Gdy suma przekracza VRAM karty, ale mieści się razem z systemowym RAM, komórka pokazuje przeniesienie do RAM. Model działa, tyle że wolniej.

Dlaczego duży model MoE bywa szybki?

Prędkość to przepustowość pamięci podzielona przez liczbę bajtów odczytywanych na token. Model mixture-of-experts (MoE) czyta przy każdym tokenie tylko aktywne parametry. Dlatego duży MoE potrafi generować szybciej niż mniejszy model gęsty.

Według czego dobieracie kwant?

  • Schodzimy od Q8_0 w dół i zatrzymujemy się na kwancie, który daje jeszcze nie mniej niż 10 tokenów na sekundę.
  • Jeśli to się nie udaje, wybieramy plik z klasy Q4, na przykład Q4_K_M.
  • BF16 nie polecamy nigdy: podwaja zużycie pamięci za ledwie zauważalny zysk.
  • Poniżej Q3 schodzimy tylko wtedy, gdy nic innego się nie mieści, a komórka ostrzega wtedy o „silnej kompresji”.

Na ile można ufać liczbom?

Wartości z ≈ to szacunki skalibrowane na zmierzonych przebiegach i mieszczące się w około ±35% od nich; jeśli istnieje prawdziwy pomiar, widać go z linkiem do źródła. Szacunek dotyczy samego generowania, a nie wczytywania długiego zapytania, a sterowniki, wersja środowiska i ustawienia przesuwają wynik w obie strony. Modele bez filtrów bezpieczeństwa są ukryte za przełącznikiem.

Czy policzę własny komputer?

Tak. Kalkulator pod macierzą przyjmuje model, kwant, kontekst i sprzęt albo po prostu twoją pamięć graficzną, RAM i przepustowość, a drabinka niżej pokazuje, co odblokowuje się przy 8, 12, 16, 24, 48, 96 i 128 GB. Pliki GGUF uruchomisz w lokalnych aplikacjach AI, takich jak llama.cpp, LM Studio, Ollama i Jan. Gotowe maszyny opisują zestawy PC.