Ir para o conteúdo
fedi.software

Qual modelo aberto cabe no seu hardware — 2026

Modelos de pesos abertos frente a placas de vídeo e computadores populares: a quantização recomendada (a maior até Q8 que ainda entrega 10 ou mais tokens por segundo; caso contrário, uma da classe Q4; abaixo de Q3 só quando nada mais cabe), onde ele roda (memória de vídeo, memória unificada ou descarregado na RAM) e uma velocidade de geração aproximada.

Modelo Parâmetros
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s Cabe na memória de vídeo Q8_0≈67 tok/s Cabe na memória de vídeo Q8_0≈218 tok/s Cabe na memória de vídeo Q8_0≈235 tok/s Cabe na memória de vídeo Q8_0≈417 tok/s Cabe na memória de vídeo Q8_0≈417 tok/s Cabe na memória de vídeo Q8_0≈168 tok/s Cabe na memória de vídeo Q8_0≈136 tok/s Cabe na memória de vídeo Q8_0≈115 tok/s Cabe na memória de vídeo Q8_0≈111 tok/s Cabe na memória unificada Q8_0≈167 tok/s Cabe na memória unificada Q8_0≈52 tok/s Cabe na memória unificada Q8_0≈56 tok/s Cabe na memória unificada Q8_0≈15,0 tok/s Cabe na RAM (CPU) Q8_0≈34 tok/s Cabe na RAM (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s Cabe na memória de vídeo Q8_0≈59 tok/s Cabe na memória de vídeo Q8_0≈192 tok/s Cabe na memória de vídeo Q8_0≈207 tok/s Cabe na memória de vídeo Q8_0≈368 tok/s Cabe na memória de vídeo Q8_0≈368 tok/s Cabe na memória de vídeo Q8_0≈148 tok/s Cabe na memória de vídeo Q8_0≈120 tok/s Cabe na memória de vídeo Q8_0≈101 tok/s Cabe na memória de vídeo Q8_0≈98 tok/s Cabe na memória unificada Q8_0≈147 tok/s Cabe na memória unificada Q8_0≈46 tok/s Cabe na memória unificada Q8_0≈49 tok/s Cabe na memória unificada Q8_0≈14,3 tok/s Cabe na RAM (CPU) Q8_0≈32 tok/s Cabe na RAM (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s Cabe na memória de vídeo Q8_0≈54 tok/s Cabe na memória de vídeo Q8_0≈175 tok/s Cabe na memória de vídeo Q8_0≈189 tok/s Cabe na memória de vídeo Q8_0≈335 tok/s Cabe na memória de vídeo Q8_0≈335 tok/s Cabe na memória de vídeo Q8_0≈135 tok/s Cabe na memória de vídeo Q8_0≈109 tok/s Cabe na memória de vídeo Q8_0≈92 tok/s Cabe na memória de vídeo Q8_0≈89 tok/s Cabe na memória unificada Q8_0≈134 tok/s Cabe na memória unificada Q8_0≈42 tok/s Cabe na memória unificada Q8_0≈45 tok/s Cabe na memória unificada Q8_0≈13,8 tok/s Cabe na RAM (CPU) Q8_0≈31 tok/s Cabe na RAM (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈29 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈95 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈103 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈182 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈182 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈73 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈59 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈50 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈49 tok/s Cabe na memória unificada UD-Q6_K_XL≈73 tok/s Cabe na memória unificada UD-Q6_K_XL≈23 tok/s Cabe na memória unificada UD-Q6_K_XL≈24 tok/s Cabe na memória unificada UD-Q6_K_XL≈10,3 tok/s Cabe na RAM (CPU) UD-Q6_K_XL≈23 tok/s Cabe na RAM (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s Cabe na memória de vídeo Q8_0≈25 tok/s Cabe na memória de vídeo Q8_0≈80 tok/s Cabe na memória de vídeo Q8_0≈87 tok/s Cabe na memória de vídeo Q8_0≈154 tok/s Cabe na memória de vídeo Q8_0≈154 tok/s Cabe na memória de vídeo Q8_0≈62 tok/s Cabe na memória de vídeo Q8_0≈50 tok/s Cabe na memória de vídeo Q8_0≈42 tok/s Cabe na memória de vídeo Q8_0≈41 tok/s Cabe na memória unificada Q8_0≈62 tok/s Cabe na memória unificada Q8_0≈19,2 tok/s Cabe na memória unificada Q8_0≈21 tok/s Cabe na memória unificada UD-Q6_K_XL≈10,2 tok/s Cabe na RAM (CPU) Q8_0≈21 tok/s Cabe na RAM (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s Cabe na memória de vídeo Q8_0≈17,8 tok/s Cabe na memória de vídeo Q8_0≈58 tok/s Cabe na memória de vídeo Q8_0≈62 tok/s Cabe na memória de vídeo Q8_0≈111 tok/s Cabe na memória de vídeo Q8_0≈111 tok/s Cabe na memória de vídeo Q8_0≈44 tok/s Cabe na memória de vídeo Q8_0≈36 tok/s Cabe na memória de vídeo Q8_0≈30 tok/s Cabe na memória de vídeo Q8_0≈30 tok/s Cabe na memória unificada Q8_0≈44 tok/s Cabe na memória unificada Q8_0≈13,8 tok/s Cabe na memória unificada Q8_0≈14,8 tok/s Cabe na memória unificada Q4_1≈10,2 tok/s Cabe na RAM (CPU) Q8_0≈17,1 tok/s Cabe na RAM (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s Cabe na memória de vídeo Q6_K≈18,0 tok/s Cabe na memória de vídeo Q8_0≈46 tok/s Cabe na memória de vídeo Q8_0≈49 tok/s Cabe na memória de vídeo Q8_0≈88 tok/s Cabe na memória de vídeo Q8_0≈88 tok/s Cabe na memória de vídeo Q8_0≈35 tok/s Cabe na memória de vídeo Q8_0≈29 tok/s Cabe na memória de vídeo Q8_0≈24 tok/s Cabe na memória de vídeo Q8_0≈23 tok/s Cabe na memória unificada Q8_0≈35 tok/s Cabe na memória unificada Q8_0≈10,9 tok/s Cabe na memória unificada Q8_0≈11,7 tok/s Cabe na memória unificada UD-Q3_K_XL≈10,1 tok/s Cabe na RAM (CPU) Q8_0≈14,6 tok/s Cabe na RAM (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s Roda com descarga na RAM MXFP4≈55 tok/s Cabe na memória de vídeo MXFP4162 tok/smedido Cabe na memória de vídeo MXFP4≈194 tok/s Cabe na memória de vídeo MXFP4≈344 tok/s Cabe na memória de vídeo MXFP4≈344 tok/s Cabe na memória de vídeo MXFP4≈138 tok/s Cabe na memória de vídeo MXFP4≈112 tok/s Cabe na memória de vídeo MXFP4≈95 tok/s Cabe na memória de vídeo MXFP4≈80 tok/s Cabe na memória unificada MXFP4116 tok/smedido Cabe na memória unificada MXFP4≈59 tok/s Cabe na memória unificada MXFP4≈62 tok/s Cabe na memória unificada MXFP4≈17,2 tok/s Cabe na RAM (CPU) MXFP4≈39 tok/s Cabe na RAM (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10,2 tok/s Roda com descarga na RAM UD-Q3_K_XL≈18,4 tok/s Cabe na memória de vídeo Q6_K≈37 tok/s Cabe na memória de vídeo Q6_K≈40 tok/s Cabe na memória de vídeo Q8_0≈56 tok/s Cabe na memória de vídeo Q8_0≈56 tok/s Cabe na memória de vídeo Q8_0≈22 tok/s Cabe na memória de vídeo Q8_0≈18,2 tok/s Cabe na memória de vídeo Q8_0≈15,3 tok/s Cabe na memória de vídeo Q8_0≈14,9 tok/s Cabe na memória unificada Q8_0≈22 tok/s Cabe na memória unificada Q5_K_M≈10,3 tok/s Cabe na memória unificada Q5_K_M≈11,0 tok/s Cabe na memória unificada Q4_K_M≈6,9 tok/s Cabe na RAM (CPU) Q8_0≈10,3 tok/s Cabe na RAM (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14,7 tok/s Roda com descarga na RAM UD-Q3_K_M≈56 tok/s Cabe na memória de vídeo UD-Q5_K_S≈129 tok/s Cabe na memória de vídeo UD-Q5_K_S≈139 tok/s Cabe na memória de vídeo UD-Q8_K_XL≈173 tok/s Cabe na memória de vídeo UD-Q8_K_XL≈173 tok/s Cabe na memória de vídeo UD-Q8_K_XL≈70 tok/s Cabe na memória de vídeo UD-Q8_K_XL≈57 tok/s Cabe na memória de vídeo UD-Q8_K_XL≈48 tok/s Cabe na memória de vídeo UD-Q8_K_XL≈40 tok/s Cabe na memória unificada UD-Q8_K_XL≈60 tok/s Cabe na memória unificada UD-Q8_K_XL≈29 tok/s Cabe na memória unificada UD-Q8_K_XL≈31 tok/s Cabe na memória unificada UD-Q8_K_XL≈13,7 tok/s Cabe na RAM (CPU) UD-Q8_K_XL≈31 tok/s Cabe na RAM (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12,7 tok/s Roda com descarga na RAM Q3_K_S≈18,1 tok/s Cabe na memória de vídeo UD-Q5_K_XL≈38 tok/s Cabe na memória de vídeo UD-Q5_K_XL≈41 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈59 tok/s Cabe na memória de vídeo Q8_0≈49 tok/s Cabe na memória de vídeo Q8_0≈19,7 tok/s Cabe na memória de vídeo Q8_0≈16,0 tok/s Cabe na memória de vídeo Q8_0≈13,5 tok/s Cabe na memória de vídeo Q8_0≈13,1 tok/s Cabe na memória unificada Q8_0≈19,6 tok/s Cabe na memória unificada Q4_1≈10,1 tok/s Cabe na memória unificada Q4_1≈10,8 tok/s Cabe na memória unificada Q4_K_M≈6,3 tok/s Cabe na RAM (CPU) UD-Q6_K_XL≈10,8 tok/s Cabe na RAM (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16,4 tok/s Roda com descarga na RAM Q3_K_S≈66 tok/s Cabe na memória de vídeo Q4_K_M154 tok/smedido Cabe na memória de vídeo Q5_K_S≈158 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈232 tok/s Cabe na memória de vídeo Q8_0≈192 tok/s Cabe na memória de vídeo Q8_0≈77 tok/s Cabe na memória de vídeo Q8_0≈63 tok/s Cabe na memória de vídeo Q8_0≈53 tok/s Cabe na memória de vídeo Q8_0≈45 tok/s Cabe na memória unificada Q8_0≈67 tok/s Cabe na memória unificada Q8_0≈33 tok/s Cabe na memória unificada Q8_0≈35 tok/s Cabe na memória unificada Q8_0≈14,3 tok/s Cabe na RAM (CPU) Q8_0≈32 tok/s Cabe na RAM (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3,8 tok/s Roda com descarga na RAM Q3_K_S≈10,4 tok/s Roda com descarga na RAM Q4_1≈37 tok/s Cabe na memória de vídeo Q4_1≈40 tok/s Cabe na memória de vídeo Q6_K≈55 tok/s Cabe na memória de vídeo Q8_0≈43 tok/s Cabe na memória de vídeo Q8_0≈17,1 tok/s Cabe na memória de vídeo Q8_0≈13,9 tok/s Cabe na memória de vídeo Q8_0≈11,7 tok/s Cabe na memória de vídeo Q8_0≈11,3 tok/s Cabe na memória unificada Q8_0≈17,0 tok/s Cabe na memória unificada IQ4_XS≈10,3 tok/s Cabe na memória unificada Q4_K_S≈10,3 tok/s Cabe na memória unificada Q4_K_M≈5,7 tok/s Cabe na RAM (CPU) Q6_K≈10,1 tok/s Cabe na RAM (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3,7 tok/s Roda com descarga na RAM UD-IQ3_XXS≈14,1 tok/s Roda com descarga na RAM UD-Q4_K_XL≈35 tok/s Cabe na memória de vídeo UD-Q4_K_XL≈38 tok/s Cabe na memória de vídeo Q6_K≈51 tok/s Cabe na memória de vídeo Q8_0≈40 tok/s Cabe na memória de vídeo Q8_0≈16,0 tok/s Cabe na memória de vídeo Q8_0≈13,0 tok/s Cabe na memória de vídeo Q8_0≈11,0 tok/s Cabe na memória de vídeo Q8_0≈10,6 tok/s Cabe na memória unificada Q8_0≈16,0 tok/s Cabe na memória unificada UD-Q3_K_XL≈10,3 tok/s Cabe na memória unificada IQ4_XS≈10,2 tok/s Cabe na memória unificada Q4_K_M≈5,4 tok/s Cabe na RAM (CPU) Q5_K_M≈10,8 tok/s Cabe na RAM (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17,9 tok/s Roda com descarga na RAM Q8_0≈18,7 tok/s Roda com descarga na RAM Q4_K_S≈191 tok/s Cabe na memória de vídeo Q4_K_S≈205 tok/s Cabe na memória de vídeo Q6_K≈274 tok/s Cabe na memória de vídeo Q8_0≈220 tok/s Cabe na memória de vídeo Q8_0≈89 tok/s Cabe na memória de vídeo Q8_0≈72 tok/s Cabe na memória de vídeo Q8_0≈61 tok/s Cabe na memória de vídeo Q8_0≈51 tok/s Cabe na memória unificada Q8_0≈77 tok/s Cabe na memória unificada Q8_0≈37 tok/s Cabe na memória unificada Q8_0≈40 tok/s Cabe na memória unificada Q8_0≈15,0 tok/s Cabe na RAM (CPU) Q8_0≈34 tok/s Cabe na RAM (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1,3 tok/s Roda com descarga na RAM Q4_K_M≈1,4 tok/s Roda com descarga na RAM Q4_K_M≈2,0 tok/s Roda com descarga na RAM Q4_K_M≈2,0 tok/s Roda com descarga na RAM UD-IQ3_XXS≈49 tok/s Cabe na memória de vídeo Q8_0≈18,8 tok/s Cabe na memória de vídeo Q4_K_M16,3 tok/smedido Cabe na memória de vídeo Q4_1≈10,3 tok/s Cabe na memória de vídeo IQ4_XS≈10,0 tok/s Cabe na memória de vídeo UD-Q3_K_XL≈10,6 tok/s Cabe na memória unificada Q5_K_M≈11,2 tok/s Cabe na memória unificada Q4_K_M≈4,1 tok/s Cabe na memória unificada Q4_K_M≈4,4 tok/s Cabe na memória unificada Q4_K_M≈2,9 tok/s Cabe na RAM (CPU) Q4_K_M≈6,6 tok/s Cabe na RAM (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s Roda com descarga na RAM Q6_K≈21 tok/s Roda com descarga na RAM UD-Q6_K_XL≈26 tok/s Roda com descarga na RAM UD-Q6_K_XL≈26 tok/s Roda com descarga na RAM UD-Q6_K_XL≈31 tok/s Roda com descarga na RAM Q8_0≈213 tok/s Cabe na memória de vídeo Q4_K_S≈145 tok/s Cabe na memória de vídeo UD-Q6_K_XL≈84 tok/s Cabe na memória de vídeo Q8_0≈59 tok/s Cabe na memória de vídeo Q8_0≈49 tok/s Cabe na memória unificada Q8_0≈74 tok/s Cabe na memória unificada Q8_0≈36 tok/s Cabe na memória unificada Q8_0≈39 tok/s Cabe na memória unificada Q8_0≈14,8 tok/s Cabe na RAM (CPU) Q8_0≈33 tok/s Cabe na RAM (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5,3 tok/s Roda com descarga na RAM Q4_K_S≈5,1 tok/s Roda com descarga na RAM Q4_K_M≈5,6 tok/s Roda com descarga na RAM Q4_K_M≈5,7 tok/s Roda com descarga na RAM Q3_K_M≈10,2 tok/s Roda com descarga na RAM Q5_K_M≈55 tok/s Cabe na memória de vídeo Q4_0≈10,0 tok/s Roda com descarga na RAM UD-Q4_K_XL≈22 tok/s Cabe na memória de vídeo Q5_K_M≈15,2 tok/s Cabe na memória de vídeo Q5_K_M≈12,8 tok/s Cabe na memória unificada Q8_0≈13,9 tok/s Cabe na memória unificada Q4_K_M≈10,6 tok/s Cabe na memória unificada Q5_K_M≈10,0 tok/s Cabe na memória unificada Q4_K_M≈8,0 tok/s Cabe na RAM (CPU) Q8_0≈13,1 tok/s Cabe na RAM (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19,1 tok/s Roda com descarga na RAM MXFP4≈19,6 tok/s Roda com descarga na RAM MXFP426–28 tok/smedido Roda com descarga na RAM MXFP4≈25 tok/s Roda com descarga na RAM MXFP4≈31 tok/s Roda com descarga na RAM MXFP4≈258 tok/s Cabe na memória de vídeo MXFP4≈36 tok/s Roda com descarga na RAM MXFP441–73 tok/smedido Cabe na memória de vídeo MXFP4≈71 tok/s Cabe na memória de vídeo MXFP4≈60 tok/s Cabe na memória unificada MXFP4≈90 tok/s Cabe na memória unificada MXFP450 tok/smedido Cabe na memória unificada MXFP461 tok/smedido Cabe na memória unificada MXFP4≈15,8 tok/s Cabe na RAM (CPU) MXFP4≈36 tok/s Cabe na RAM (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10,5 tok/s Roda com descarga na RAM UD-IQ4_NL≈10,8 tok/s Roda com descarga na RAM Q4_K_S≈11,1 tok/s Roda com descarga na RAM Q4_K_S≈11,2 tok/s Roda com descarga na RAM UD-Q4_K_XL≈11,9 tok/s Roda com descarga na RAM UD-Q5_K_XL≈97 tok/s Cabe na memória de vídeo UD-IQ3_XXS≈76 tok/s Cabe na memória de vídeo UD-IQ4_NL≈46 tok/s Cabe na memória de vídeo UD-Q5_K_XL≈27 tok/s Cabe na memória de vídeo UD-Q5_K_XL≈23 tok/s Cabe na memória unificada Q8_0≈24 tok/s Cabe na memória unificada Q6_K≈15,1 tok/s Cabe na memória unificada Q6_K≈16,1 tok/s Cabe na memória unificada UD-Q5_K_XL≈10,4 tok/s Cabe na RAM (CPU) Q8_0≈19,3 tok/s Cabe na RAM (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe UD-Q4_K_XL≈10,8 tok/s Roda com descarga na RAM UD-Q2_K_XL≈8,0 tok/scompressão forte Roda com descarga na RAM Q3_K_M≈6,1 tok/s Roda com descarga na RAM UD-Q3_K_XL≈11,7 tok/s Roda com descarga na RAM UD-Q2_K_XL≈19,4 tok/scompressão forte Cabe na memória unificada Q8_0≈10,8 tok/s Cabe na memória unificada UD-Q3_K_XL≈12,2 tok/s Cabe na memória unificada UD-Q3_K_XL≈13,0 tok/s Cabe na memória unificada Q4_K_M≈7,2 tok/s Cabe na RAM (CPU) Q8_0≈10,9 tok/s Cabe na RAM (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe UD-IQ3_XXS≈7,3 tok/s Roda com descarga na RAM UD-IQ1_S≈5,6 tok/scompressão forte Roda com descarga na RAM UD-IQ2_XXS≈4,7 tok/scompressão forte Roda com descarga na RAM UD-IQ3_XXS≈3,5 tok/s Roda com descarga na RAM UD-TQ1_0≈16,2 tok/scompressão forte Cabe na memória unificada Q4_1≈10,0 tok/s Cabe na memória unificada UD-IQ1_M≈9,6 tok/scompressão forte Cabe na memória unificada UD-IQ1_M≈10,3 tok/scompressão forte Cabe na memória unificada Q4_K_M≈4,7 tok/s Cabe na RAM (CPU) Q4_1≈10,2 tok/s Cabe na RAM (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe UD-IQ1_S≈16,9 tok/scompressão forte Roda com descarga na RAM ✕ Não cabe ✕ Não cabe UD-IQ1_S≈8,0 tok/scompressão forte Roda com descarga na RAM ✕ Não cabe Q3_K_M≈14,9 tok/s Cabe na memória unificada ✕ Não cabe ✕ Não cabe Q4_K_M≈5,2 tok/s Cabe na RAM (CPU) Q3_K_M≈13,9 tok/s Cabe na RAM (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe ✕ Não cabe UD-Q2_K_XL≈22 tok/scompressão forte Cabe na memória unificada ✕ Não cabe ✕ Não cabe Q3_K_S≈7,2 tok/s Cabe na RAM (CPU) UD-IQ2_XXS≈19,7 tok/scompressão forte Cabe na RAM (CPU)

O que se abre a cada tamanho de memória (contexto 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B compressão forte: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B compressão forte: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B compressão forte: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B compressão forte: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B compressão forte: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b compressão forte: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 compressão forte: DeepSeek R1
  9. 256 GB compressão forte: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ estimativas para um contexto de 8K: pesos + KV cache + sobrecarga do runtime em relação à memória; velocidade a partir da largura de banda da memória. Os números reais dependem do runtime e das configurações.

Atualizado · Fontes: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Incorporar no seu site

Cole este código onde o infográfico deve aparecer: ele se atualiza sozinho. Uso gratuito — mantenha o link de atribuição.

JSON Nossos dados: CC BY 4.0 com link para a fonte; dados de terceiros mantêm a licença da sua fonte.

Matriz, calculadora e escada

Este infográfico responde a uma pergunta direta: o modelo roda no meu computador, e com que velocidade? Nas linhas estão modelos conhecidos de pesos abertos, de cerca de 3B a 1T de parâmetros; nas colunas, placas de vídeo, configurações com várias GPUs, máquinas Apple e AMD com memória unificada e servidores de CPU. Cada célula mostra a quantização recomendada, onde o modelo fica e uma velocidade aproximada de geração em tokens por segundo. Logo abaixo há uma calculadora para os seus próprios valores e uma escada que mostra o que se abre com 8, 12, 16, 24, 48, 96 e 128 GB de memória.

A conta da memória

  • Pesos: parâmetros vezes bits por peso, ou o tamanho real do arquivo GGUF.
  • Cache KV: cresce com o contexto. A matriz usa 8192 tokens; na calculadora dá para mudar, e um contexto longo pode ocupar tanta VRAM quanto um modelo pequeno.
  • Overhead: cerca de 1,5 GB para o ambiente de execução, mais o projetor de visão no caso de um VLM.

“Cabe na memória de vídeo” é a situação ideal. “Roda com descarga na RAM” quer dizer que parte do modelo fica na memória do sistema: funciona, só que mais devagar.

De onde sai a velocidade

Ao gerar texto, o modelo lê os próprios pesos da memória a cada token. Por isso a velocidade é, grosso modo, a largura de banda da memória dividida pelos bytes lidos por token. Nos modelos MoE só contam os parâmetros ativos, e um MoE grande pode responder mais rápido que um modelo denso menor. A quantização recomendada é a de mais bits, até Q8_0, que ainda entrega pelo menos 10 tokens por segundo; se nenhuma chegar lá, fica a classe Q4. Nunca BF16, e nunca abaixo de Q3, a não ser que nada maior caiba: nesse caso a célula avisa “compressão forte”.

Quanto confiar nas estimativas

O sinal ≈ marca uma estimativa calibrada com execuções medidas no llama.cpp e em relatórios públicos; ela fica a cerca de ±35% dessas medições. Runtime, drivers e configurações mexem no resultado real, e a leitura de um prompt longo não entra na conta, só a geração. Células com medição real mostram o número e o link da fonte. Modelos sem filtros de segurança ficam escondidos atrás de uma chave. Para uma máquina completa, veja as configurações de PC para IA local.