К содержимому
fedi.software

Какая открытая модель влезет в ваше железо — 2026

Открытые модели против популярных видеокарт и компьютеров: рекомендуемое квантование (самое крупное до Q8, которое ещё даёт от 10 токенов в секунду, иначе класса Q4; ниже Q3 — только если больше ничего не помещается), где модель работает (видеопамять, общая память или с выгрузкой в ОЗУ) и примерная скорость генерации.

Модель Параметры
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 ток/с Помещается в видеопамять Q8_0≈67 ток/с Помещается в видеопамять Q8_0≈218 ток/с Помещается в видеопамять Q8_0≈235 ток/с Помещается в видеопамять Q8_0≈417 ток/с Помещается в видеопамять Q8_0≈417 ток/с Помещается в видеопамять Q8_0≈168 ток/с Помещается в видеопамять Q8_0≈136 ток/с Помещается в видеопамять Q8_0≈115 ток/с Помещается в видеопамять Q8_0≈111 ток/с Помещается в общую память Q8_0≈167 ток/с Помещается в общую память Q8_0≈52 ток/с Помещается в общую память Q8_0≈56 ток/с Помещается в общую память Q8_0≈15,0 ток/с Помещается в ОЗУ (CPU) Q8_0≈34 ток/с Помещается в ОЗУ (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 ток/с Помещается в видеопамять Q8_0≈59 ток/с Помещается в видеопамять Q8_0≈192 ток/с Помещается в видеопамять Q8_0≈207 ток/с Помещается в видеопамять Q8_0≈368 ток/с Помещается в видеопамять Q8_0≈368 ток/с Помещается в видеопамять Q8_0≈148 ток/с Помещается в видеопамять Q8_0≈120 ток/с Помещается в видеопамять Q8_0≈101 ток/с Помещается в видеопамять Q8_0≈98 ток/с Помещается в общую память Q8_0≈147 ток/с Помещается в общую память Q8_0≈46 ток/с Помещается в общую память Q8_0≈49 ток/с Помещается в общую память Q8_0≈14,3 ток/с Помещается в ОЗУ (CPU) Q8_0≈32 ток/с Помещается в ОЗУ (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 ток/с Помещается в видеопамять Q8_0≈54 ток/с Помещается в видеопамять Q8_0≈175 ток/с Помещается в видеопамять Q8_0≈189 ток/с Помещается в видеопамять Q8_0≈335 ток/с Помещается в видеопамять Q8_0≈335 ток/с Помещается в видеопамять Q8_0≈135 ток/с Помещается в видеопамять Q8_0≈109 ток/с Помещается в видеопамять Q8_0≈92 ток/с Помещается в видеопамять Q8_0≈89 ток/с Помещается в общую память Q8_0≈134 ток/с Помещается в общую память Q8_0≈42 ток/с Помещается в общую память Q8_0≈45 ток/с Помещается в общую память Q8_0≈13,8 ток/с Помещается в ОЗУ (CPU) Q8_0≈31 ток/с Помещается в ОЗУ (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 ток/с Помещается в видеопамять UD-Q6_K_XL≈29 ток/с Помещается в видеопамять UD-Q6_K_XL≈95 ток/с Помещается в видеопамять UD-Q6_K_XL≈103 ток/с Помещается в видеопамять UD-Q6_K_XL≈182 ток/с Помещается в видеопамять UD-Q6_K_XL≈182 ток/с Помещается в видеопамять UD-Q6_K_XL≈73 ток/с Помещается в видеопамять UD-Q6_K_XL≈59 ток/с Помещается в видеопамять UD-Q6_K_XL≈50 ток/с Помещается в видеопамять UD-Q6_K_XL≈49 ток/с Помещается в общую память UD-Q6_K_XL≈73 ток/с Помещается в общую память UD-Q6_K_XL≈23 ток/с Помещается в общую память UD-Q6_K_XL≈24 ток/с Помещается в общую память UD-Q6_K_XL≈10,3 ток/с Помещается в ОЗУ (CPU) UD-Q6_K_XL≈23 ток/с Помещается в ОЗУ (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 ток/с Помещается в видеопамять Q8_0≈25 ток/с Помещается в видеопамять Q8_0≈80 ток/с Помещается в видеопамять Q8_0≈87 ток/с Помещается в видеопамять Q8_0≈154 ток/с Помещается в видеопамять Q8_0≈154 ток/с Помещается в видеопамять Q8_0≈62 ток/с Помещается в видеопамять Q8_0≈50 ток/с Помещается в видеопамять Q8_0≈42 ток/с Помещается в видеопамять Q8_0≈41 ток/с Помещается в общую память Q8_0≈62 ток/с Помещается в общую память Q8_0≈19,2 ток/с Помещается в общую память Q8_0≈21 ток/с Помещается в общую память UD-Q6_K_XL≈10,2 ток/с Помещается в ОЗУ (CPU) Q8_0≈21 ток/с Помещается в ОЗУ (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 ток/с Помещается в видеопамять Q8_0≈17,8 ток/с Помещается в видеопамять Q8_0≈58 ток/с Помещается в видеопамять Q8_0≈62 ток/с Помещается в видеопамять Q8_0≈111 ток/с Помещается в видеопамять Q8_0≈111 ток/с Помещается в видеопамять Q8_0≈44 ток/с Помещается в видеопамять Q8_0≈36 ток/с Помещается в видеопамять Q8_0≈30 ток/с Помещается в видеопамять Q8_0≈30 ток/с Помещается в общую память Q8_0≈44 ток/с Помещается в общую память Q8_0≈13,8 ток/с Помещается в общую память Q8_0≈14,8 ток/с Помещается в общую память Q4_1≈10,2 ток/с Помещается в ОЗУ (CPU) Q8_0≈17,1 ток/с Помещается в ОЗУ (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 ток/с Помещается в видеопамять Q6_K≈18,0 ток/с Помещается в видеопамять Q8_0≈46 ток/с Помещается в видеопамять Q8_0≈49 ток/с Помещается в видеопамять Q8_0≈88 ток/с Помещается в видеопамять Q8_0≈88 ток/с Помещается в видеопамять Q8_0≈35 ток/с Помещается в видеопамять Q8_0≈29 ток/с Помещается в видеопамять Q8_0≈24 ток/с Помещается в видеопамять Q8_0≈23 ток/с Помещается в общую память Q8_0≈35 ток/с Помещается в общую память Q8_0≈10,9 ток/с Помещается в общую память Q8_0≈11,7 ток/с Помещается в общую память UD-Q3_K_XL≈10,1 ток/с Помещается в ОЗУ (CPU) Q8_0≈14,6 ток/с Помещается в ОЗУ (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 ток/с Работает с выгрузкой в ОЗУ MXFP4≈55 ток/с Помещается в видеопамять MXFP4162 ток/сзамер Помещается в видеопамять MXFP4≈194 ток/с Помещается в видеопамять MXFP4≈344 ток/с Помещается в видеопамять MXFP4≈344 ток/с Помещается в видеопамять MXFP4≈138 ток/с Помещается в видеопамять MXFP4≈112 ток/с Помещается в видеопамять MXFP4≈95 ток/с Помещается в видеопамять MXFP4≈80 ток/с Помещается в общую память MXFP4116 ток/сзамер Помещается в общую память MXFP4≈59 ток/с Помещается в общую память MXFP4≈62 ток/с Помещается в общую память MXFP4≈17,2 ток/с Помещается в ОЗУ (CPU) MXFP4≈39 ток/с Помещается в ОЗУ (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10,2 ток/с Работает с выгрузкой в ОЗУ UD-Q3_K_XL≈18,4 ток/с Помещается в видеопамять Q6_K≈37 ток/с Помещается в видеопамять Q6_K≈40 ток/с Помещается в видеопамять Q8_0≈56 ток/с Помещается в видеопамять Q8_0≈56 ток/с Помещается в видеопамять Q8_0≈22 ток/с Помещается в видеопамять Q8_0≈18,2 ток/с Помещается в видеопамять Q8_0≈15,3 ток/с Помещается в видеопамять Q8_0≈14,9 ток/с Помещается в общую память Q8_0≈22 ток/с Помещается в общую память Q5_K_M≈10,3 ток/с Помещается в общую память Q5_K_M≈11,0 ток/с Помещается в общую память Q4_K_M≈6,9 ток/с Помещается в ОЗУ (CPU) Q8_0≈10,3 ток/с Помещается в ОЗУ (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14,7 ток/с Работает с выгрузкой в ОЗУ UD-Q3_K_M≈56 ток/с Помещается в видеопамять UD-Q5_K_S≈129 ток/с Помещается в видеопамять UD-Q5_K_S≈139 ток/с Помещается в видеопамять UD-Q8_K_XL≈173 ток/с Помещается в видеопамять UD-Q8_K_XL≈173 ток/с Помещается в видеопамять UD-Q8_K_XL≈70 ток/с Помещается в видеопамять UD-Q8_K_XL≈57 ток/с Помещается в видеопамять UD-Q8_K_XL≈48 ток/с Помещается в видеопамять UD-Q8_K_XL≈40 ток/с Помещается в общую память UD-Q8_K_XL≈60 ток/с Помещается в общую память UD-Q8_K_XL≈29 ток/с Помещается в общую память UD-Q8_K_XL≈31 ток/с Помещается в общую память UD-Q8_K_XL≈13,7 ток/с Помещается в ОЗУ (CPU) UD-Q8_K_XL≈31 ток/с Помещается в ОЗУ (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12,7 ток/с Работает с выгрузкой в ОЗУ Q3_K_S≈18,1 ток/с Помещается в видеопамять UD-Q5_K_XL≈38 ток/с Помещается в видеопамять UD-Q5_K_XL≈41 ток/с Помещается в видеопамять UD-Q6_K_XL≈59 ток/с Помещается в видеопамять Q8_0≈49 ток/с Помещается в видеопамять Q8_0≈19,7 ток/с Помещается в видеопамять Q8_0≈16,0 ток/с Помещается в видеопамять Q8_0≈13,5 ток/с Помещается в видеопамять Q8_0≈13,1 ток/с Помещается в общую память Q8_0≈19,6 ток/с Помещается в общую память Q4_1≈10,1 ток/с Помещается в общую память Q4_1≈10,8 ток/с Помещается в общую память Q4_K_M≈6,3 ток/с Помещается в ОЗУ (CPU) UD-Q6_K_XL≈10,8 ток/с Помещается в ОЗУ (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16,4 ток/с Работает с выгрузкой в ОЗУ Q3_K_S≈66 ток/с Помещается в видеопамять Q4_K_M154 ток/сзамер Помещается в видеопамять Q5_K_S≈158 ток/с Помещается в видеопамять UD-Q6_K_XL≈232 ток/с Помещается в видеопамять Q8_0≈192 ток/с Помещается в видеопамять Q8_0≈77 ток/с Помещается в видеопамять Q8_0≈63 ток/с Помещается в видеопамять Q8_0≈53 ток/с Помещается в видеопамять Q8_0≈45 ток/с Помещается в общую память Q8_0≈67 ток/с Помещается в общую память Q8_0≈33 ток/с Помещается в общую память Q8_0≈35 ток/с Помещается в общую память Q8_0≈14,3 ток/с Помещается в ОЗУ (CPU) Q8_0≈32 ток/с Помещается в ОЗУ (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3,8 ток/с Работает с выгрузкой в ОЗУ Q3_K_S≈10,4 ток/с Работает с выгрузкой в ОЗУ Q4_1≈37 ток/с Помещается в видеопамять Q4_1≈40 ток/с Помещается в видеопамять Q6_K≈55 ток/с Помещается в видеопамять Q8_0≈43 ток/с Помещается в видеопамять Q8_0≈17,1 ток/с Помещается в видеопамять Q8_0≈13,9 ток/с Помещается в видеопамять Q8_0≈11,7 ток/с Помещается в видеопамять Q8_0≈11,3 ток/с Помещается в общую память Q8_0≈17,0 ток/с Помещается в общую память IQ4_XS≈10,3 ток/с Помещается в общую память Q4_K_S≈10,3 ток/с Помещается в общую память Q4_K_M≈5,7 ток/с Помещается в ОЗУ (CPU) Q6_K≈10,1 ток/с Помещается в ОЗУ (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3,7 ток/с Работает с выгрузкой в ОЗУ UD-IQ3_XXS≈14,1 ток/с Работает с выгрузкой в ОЗУ UD-Q4_K_XL≈35 ток/с Помещается в видеопамять UD-Q4_K_XL≈38 ток/с Помещается в видеопамять Q6_K≈51 ток/с Помещается в видеопамять Q8_0≈40 ток/с Помещается в видеопамять Q8_0≈16,0 ток/с Помещается в видеопамять Q8_0≈13,0 ток/с Помещается в видеопамять Q8_0≈11,0 ток/с Помещается в видеопамять Q8_0≈10,6 ток/с Помещается в общую память Q8_0≈16,0 ток/с Помещается в общую память UD-Q3_K_XL≈10,3 ток/с Помещается в общую память IQ4_XS≈10,2 ток/с Помещается в общую память Q4_K_M≈5,4 ток/с Помещается в ОЗУ (CPU) Q5_K_M≈10,8 ток/с Помещается в ОЗУ (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17,9 ток/с Работает с выгрузкой в ОЗУ Q8_0≈18,7 ток/с Работает с выгрузкой в ОЗУ Q4_K_S≈191 ток/с Помещается в видеопамять Q4_K_S≈205 ток/с Помещается в видеопамять Q6_K≈274 ток/с Помещается в видеопамять Q8_0≈220 ток/с Помещается в видеопамять Q8_0≈89 ток/с Помещается в видеопамять Q8_0≈72 ток/с Помещается в видеопамять Q8_0≈61 ток/с Помещается в видеопамять Q8_0≈51 ток/с Помещается в общую память Q8_0≈77 ток/с Помещается в общую память Q8_0≈37 ток/с Помещается в общую память Q8_0≈40 ток/с Помещается в общую память Q8_0≈15,0 ток/с Помещается в ОЗУ (CPU) Q8_0≈34 ток/с Помещается в ОЗУ (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1,3 ток/с Работает с выгрузкой в ОЗУ Q4_K_M≈1,4 ток/с Работает с выгрузкой в ОЗУ Q4_K_M≈2,0 ток/с Работает с выгрузкой в ОЗУ Q4_K_M≈2,0 ток/с Работает с выгрузкой в ОЗУ UD-IQ3_XXS≈49 ток/с Помещается в видеопамять Q8_0≈18,8 ток/с Помещается в видеопамять Q4_K_M16,3 ток/сзамер Помещается в видеопамять Q4_1≈10,3 ток/с Помещается в видеопамять IQ4_XS≈10,0 ток/с Помещается в видеопамять UD-Q3_K_XL≈10,6 ток/с Помещается в общую память Q5_K_M≈11,2 ток/с Помещается в общую память Q4_K_M≈4,1 ток/с Помещается в общую память Q4_K_M≈4,4 ток/с Помещается в общую память Q4_K_M≈2,9 ток/с Помещается в ОЗУ (CPU) Q4_K_M≈6,6 ток/с Помещается в ОЗУ (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 ток/с Работает с выгрузкой в ОЗУ Q6_K≈21 ток/с Работает с выгрузкой в ОЗУ UD-Q6_K_XL≈26 ток/с Работает с выгрузкой в ОЗУ UD-Q6_K_XL≈26 ток/с Работает с выгрузкой в ОЗУ UD-Q6_K_XL≈31 ток/с Работает с выгрузкой в ОЗУ Q8_0≈213 ток/с Помещается в видеопамять Q4_K_S≈145 ток/с Помещается в видеопамять UD-Q6_K_XL≈84 ток/с Помещается в видеопамять Q8_0≈59 ток/с Помещается в видеопамять Q8_0≈49 ток/с Помещается в общую память Q8_0≈74 ток/с Помещается в общую память Q8_0≈36 ток/с Помещается в общую память Q8_0≈39 ток/с Помещается в общую память Q8_0≈14,8 ток/с Помещается в ОЗУ (CPU) Q8_0≈33 ток/с Помещается в ОЗУ (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5,3 ток/с Работает с выгрузкой в ОЗУ Q4_K_S≈5,1 ток/с Работает с выгрузкой в ОЗУ Q4_K_M≈5,6 ток/с Работает с выгрузкой в ОЗУ Q4_K_M≈5,7 ток/с Работает с выгрузкой в ОЗУ Q3_K_M≈10,2 ток/с Работает с выгрузкой в ОЗУ Q5_K_M≈55 ток/с Помещается в видеопамять Q4_0≈10,0 ток/с Работает с выгрузкой в ОЗУ UD-Q4_K_XL≈22 ток/с Помещается в видеопамять Q5_K_M≈15,2 ток/с Помещается в видеопамять Q5_K_M≈12,8 ток/с Помещается в общую память Q8_0≈13,9 ток/с Помещается в общую память Q4_K_M≈10,6 ток/с Помещается в общую память Q5_K_M≈10,0 ток/с Помещается в общую память Q4_K_M≈8,0 ток/с Помещается в ОЗУ (CPU) Q8_0≈13,1 ток/с Помещается в ОЗУ (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19,1 ток/с Работает с выгрузкой в ОЗУ MXFP4≈19,6 ток/с Работает с выгрузкой в ОЗУ MXFP426–28 ток/сзамер Работает с выгрузкой в ОЗУ MXFP4≈25 ток/с Работает с выгрузкой в ОЗУ MXFP4≈31 ток/с Работает с выгрузкой в ОЗУ MXFP4≈258 ток/с Помещается в видеопамять MXFP4≈36 ток/с Работает с выгрузкой в ОЗУ MXFP441–73 ток/сзамер Помещается в видеопамять MXFP4≈71 ток/с Помещается в видеопамять MXFP4≈60 ток/с Помещается в общую память MXFP4≈90 ток/с Помещается в общую память MXFP450 ток/сзамер Помещается в общую память MXFP461 ток/сзамер Помещается в общую память MXFP4≈15,8 ток/с Помещается в ОЗУ (CPU) MXFP4≈36 ток/с Помещается в ОЗУ (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10,5 ток/с Работает с выгрузкой в ОЗУ UD-IQ4_NL≈10,8 ток/с Работает с выгрузкой в ОЗУ Q4_K_S≈11,1 ток/с Работает с выгрузкой в ОЗУ Q4_K_S≈11,2 ток/с Работает с выгрузкой в ОЗУ UD-Q4_K_XL≈11,9 ток/с Работает с выгрузкой в ОЗУ UD-Q5_K_XL≈97 ток/с Помещается в видеопамять UD-IQ3_XXS≈76 ток/с Помещается в видеопамять UD-IQ4_NL≈46 ток/с Помещается в видеопамять UD-Q5_K_XL≈27 ток/с Помещается в видеопамять UD-Q5_K_XL≈23 ток/с Помещается в общую память Q8_0≈24 ток/с Помещается в общую память Q6_K≈15,1 ток/с Помещается в общую память Q6_K≈16,1 ток/с Помещается в общую память UD-Q5_K_XL≈10,4 ток/с Помещается в ОЗУ (CPU) Q8_0≈19,3 ток/с Помещается в ОЗУ (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается UD-Q4_K_XL≈10,8 ток/с Работает с выгрузкой в ОЗУ UD-Q2_K_XL≈8,0 ток/ссильное сжатие Работает с выгрузкой в ОЗУ Q3_K_M≈6,1 ток/с Работает с выгрузкой в ОЗУ UD-Q3_K_XL≈11,7 ток/с Работает с выгрузкой в ОЗУ UD-Q2_K_XL≈19,4 ток/ссильное сжатие Помещается в общую память Q8_0≈10,8 ток/с Помещается в общую память UD-Q3_K_XL≈12,2 ток/с Помещается в общую память UD-Q3_K_XL≈13,0 ток/с Помещается в общую память Q4_K_M≈7,2 ток/с Помещается в ОЗУ (CPU) Q8_0≈10,9 ток/с Помещается в ОЗУ (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается UD-IQ3_XXS≈7,3 ток/с Работает с выгрузкой в ОЗУ UD-IQ1_S≈5,6 ток/ссильное сжатие Работает с выгрузкой в ОЗУ UD-IQ2_XXS≈4,7 ток/ссильное сжатие Работает с выгрузкой в ОЗУ UD-IQ3_XXS≈3,5 ток/с Работает с выгрузкой в ОЗУ UD-TQ1_0≈16,2 ток/ссильное сжатие Помещается в общую память Q4_1≈10,0 ток/с Помещается в общую память UD-IQ1_M≈9,6 ток/ссильное сжатие Помещается в общую память UD-IQ1_M≈10,3 ток/ссильное сжатие Помещается в общую память Q4_K_M≈4,7 ток/с Помещается в ОЗУ (CPU) Q4_1≈10,2 ток/с Помещается в ОЗУ (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается UD-IQ1_S≈16,9 ток/ссильное сжатие Работает с выгрузкой в ОЗУ ✕ Не помещается ✕ Не помещается UD-IQ1_S≈8,0 ток/ссильное сжатие Работает с выгрузкой в ОЗУ ✕ Не помещается Q3_K_M≈14,9 ток/с Помещается в общую память ✕ Не помещается ✕ Не помещается Q4_K_M≈5,2 ток/с Помещается в ОЗУ (CPU) Q3_K_M≈13,9 ток/с Помещается в ОЗУ (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается ✕ Не помещается UD-Q2_K_XL≈22 ток/ссильное сжатие Помещается в общую память ✕ Не помещается ✕ Не помещается Q3_K_S≈7,2 ток/с Помещается в ОЗУ (CPU) UD-IQ2_XXS≈19,7 ток/ссильное сжатие Помещается в ОЗУ (CPU)

Что открывается на каждом объёме памяти (контекст 8K)

  1. 8 ГБ Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B сильное сжатие: Gemma 3 12B · Qwen3 14B
  2. 12 ГБ Gemma 3 12B · Qwen3 14B сильное сжатие: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 ГБ gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B сильное сжатие: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 ГБ Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B сильное сжатие: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 ГБ Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B сильное сжатие: GLM 4.5 Air
  6. 96 ГБ GLM 4.5 Air · gpt-oss-120b сильное сжатие: Qwen3 235B A22B · GLM 4.7
  7. 128 ГБ Qwen3 235B A22B
  8. 192 ГБ GLM 4.7 сильное сжатие: DeepSeek R1
  9. 256 ГБ сильное сжатие: Kimi K2.5
  10. 512 ГБ DeepSeek R1 · Kimi K2.5

≈ оценки для контекста 8K: веса + KV-кэш + накладные расходы против объёма памяти, скорость — по пропускной способности памяти. Реальные цифры зависят от движка и настроек.

Обновлено · Источники: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Вставить на свой сайт

Вставьте этот код туда, где должна быть инфографика, — она будет обновляться сама. Бесплатно, при условии сохранения ссылки на источник.

JSON Наши данные — CC BY 4.0 со ссылкой на источник; сторонние данные сохраняют лицензию своего источника.

Как читать ячейку матрицы?

По строкам — известные модели с открытыми весами, примерно от 3B до 1T параметров. По столбцам — видеокарты, сборки из нескольких GPU, компьютеры Apple и AMD с общей памятью и серверы на CPU. В ячейке указан рекомендуемый квант и примерная скорость генерации в токенах в секунду, а цвет показывает, где живёт модель: «Помещается в видеопамять», «Помещается в общую память», «Помещается в ОЗУ (CPU)», «Работает с выгрузкой в ОЗУ» или «Не помещается».

Из чего складывается нужная память?

  • Веса — число параметров, умноженное на биты на вес, или реальный размер файла кванта с Hugging Face, если он известен.
  • KV-кэш — память под контекст разговора. Матрица считает для 8192 токенов; на длинном контексте кэш может весить больше небольшой модели.
  • Накладные расходы — около 1,5 ГБ на среду выполнения и буферы, у VLM ещё и визуальный проектор.

Если сумма больше VRAM, но влезает вместе с системной памятью, модель работает с выгрузкой — медленнее, но работает.

Как оценивается скорость?

Пропускная способность памяти делится на объём данных, прочитанных на каждый токен. У MoE-моделей читаются только активные параметры, поэтому большая MoE порой генерирует быстрее, чем плотная модель меньшего размера. Все цифры со знаком ≈ — оценки, откалиброванные по реальным замерам и укладывающиеся примерно в ±35% от них. Если для пары «модель — железо» есть замер, в ячейке стоит он и ссылка «замер» на источник.

Почему выбран именно этот квант?

Берём самый крупный квант вплоть до Q8_0, который ещё даёт не меньше 10 токенов в секунду; если такого нет — квант класса Q4, например Q4_K_M. BF16 мы не советуем никогда: памяти он съедает вдвое больше, а прибавку в качестве почти не заметить. Ниже Q3 опускаемся, только когда ничего крупнее не влезает, и тогда в ячейке появляется пометка «сильное сжатие».

А если у меня другое железо?

Ниже матрицы — «Калькулятор: влезет ли?». Выберите модель, квант, контекст и железо или просто введите объём видеопамяти, ОЗУ и пропускную способность памяти: веса, KV-кэш и накладные расходы встанут одной полосой против вашей ёмкости. Рядом лесенка показывает, что открывается на 8, 12, 16, 24, 48, 96 и 128 ГБ. Учтите, что оценка касается только генерации, без времени на чтение длинного запроса. Файлы GGUF запускаются в llama.cpp, LM Studio, Ollama и Jan — см. локальные нейросети. Модели без защитных фильтров скрыты за переключателем «Показать модели без ограничений безопасности».