Model terbuka mana yang muat di perangkat Anda — 2026
Model open-weights dibandingkan dengan kartu grafis dan komputer populer: kuantisasi yang direkomendasikan (yang terbesar hingga Q8 yang masih menghasilkan 10+ token per detik, jika tidak, kelas Q4; di bawah Q3 hanya bila tidak ada yang lain yang muat), tempat model berjalan (memori grafis, memori terpadu, atau offload ke RAM), dan perkiraan kecepatan generasi.
| Model | Parameter | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈84 tok/s Muat di memori grafis | Q8_0≈67 tok/s Muat di memori grafis | Q8_0≈218 tok/s Muat di memori grafis | Q8_0≈235 tok/s Muat di memori grafis | Q8_0≈417 tok/s Muat di memori grafis | Q8_0≈417 tok/s Muat di memori grafis | Q8_0≈168 tok/s Muat di memori grafis | Q8_0≈136 tok/s Muat di memori grafis | Q8_0≈115 tok/s Muat di memori grafis | Q8_0≈111 tok/s Muat di memori terpadu | Q8_0≈167 tok/s Muat di memori terpadu | Q8_0≈52 tok/s Muat di memori terpadu | Q8_0≈56 tok/s Muat di memori terpadu | Q8_0≈15,0 tok/s Muat di RAM (CPU) | Q8_0≈34 tok/s Muat di RAM (CPU) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈74 tok/s Muat di memori grafis | Q8_0≈59 tok/s Muat di memori grafis | Q8_0≈192 tok/s Muat di memori grafis | Q8_0≈207 tok/s Muat di memori grafis | Q8_0≈368 tok/s Muat di memori grafis | Q8_0≈368 tok/s Muat di memori grafis | Q8_0≈148 tok/s Muat di memori grafis | Q8_0≈120 tok/s Muat di memori grafis | Q8_0≈101 tok/s Muat di memori grafis | Q8_0≈98 tok/s Muat di memori terpadu | Q8_0≈147 tok/s Muat di memori terpadu | Q8_0≈46 tok/s Muat di memori terpadu | Q8_0≈49 tok/s Muat di memori terpadu | Q8_0≈14,3 tok/s Muat di RAM (CPU) | Q8_0≈32 tok/s Muat di RAM (CPU) |
| Gemma 3 4B HF | 4.3B | Q8_0≈67 tok/s Muat di memori grafis | Q8_0≈54 tok/s Muat di memori grafis | Q8_0≈175 tok/s Muat di memori grafis | Q8_0≈189 tok/s Muat di memori grafis | Q8_0≈335 tok/s Muat di memori grafis | Q8_0≈335 tok/s Muat di memori grafis | Q8_0≈135 tok/s Muat di memori grafis | Q8_0≈109 tok/s Muat di memori grafis | Q8_0≈92 tok/s Muat di memori grafis | Q8_0≈89 tok/s Muat di memori terpadu | Q8_0≈134 tok/s Muat di memori terpadu | Q8_0≈42 tok/s Muat di memori terpadu | Q8_0≈45 tok/s Muat di memori terpadu | Q8_0≈13,8 tok/s Muat di RAM (CPU) | Q8_0≈31 tok/s Muat di RAM (CPU) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈37 tok/s Muat di memori grafis | UD-Q6_K_XL≈29 tok/s Muat di memori grafis | UD-Q6_K_XL≈95 tok/s Muat di memori grafis | UD-Q6_K_XL≈103 tok/s Muat di memori grafis | UD-Q6_K_XL≈182 tok/s Muat di memori grafis | UD-Q6_K_XL≈182 tok/s Muat di memori grafis | UD-Q6_K_XL≈73 tok/s Muat di memori grafis | UD-Q6_K_XL≈59 tok/s Muat di memori grafis | UD-Q6_K_XL≈50 tok/s Muat di memori grafis | UD-Q6_K_XL≈49 tok/s Muat di memori terpadu | UD-Q6_K_XL≈73 tok/s Muat di memori terpadu | UD-Q6_K_XL≈23 tok/s Muat di memori terpadu | UD-Q6_K_XL≈24 tok/s Muat di memori terpadu | UD-Q6_K_XL≈10,3 tok/s Muat di RAM (CPU) | UD-Q6_K_XL≈23 tok/s Muat di RAM (CPU) |
| Qwen3 8B HF | 8.2B | Q8_0≈31 tok/s Muat di memori grafis | Q8_0≈25 tok/s Muat di memori grafis | Q8_0≈80 tok/s Muat di memori grafis | Q8_0≈87 tok/s Muat di memori grafis | Q8_0≈154 tok/s Muat di memori grafis | Q8_0≈154 tok/s Muat di memori grafis | Q8_0≈62 tok/s Muat di memori grafis | Q8_0≈50 tok/s Muat di memori grafis | Q8_0≈42 tok/s Muat di memori grafis | Q8_0≈41 tok/s Muat di memori terpadu | Q8_0≈62 tok/s Muat di memori terpadu | Q8_0≈19,2 tok/s Muat di memori terpadu | Q8_0≈21 tok/s Muat di memori terpadu | UD-Q6_K_XL≈10,2 tok/s Muat di RAM (CPU) | Q8_0≈21 tok/s Muat di RAM (CPU) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈32 tok/s Muat di memori grafis | Q8_0≈17,8 tok/s Muat di memori grafis | Q8_0≈58 tok/s Muat di memori grafis | Q8_0≈62 tok/s Muat di memori grafis | Q8_0≈111 tok/s Muat di memori grafis | Q8_0≈111 tok/s Muat di memori grafis | Q8_0≈44 tok/s Muat di memori grafis | Q8_0≈36 tok/s Muat di memori grafis | Q8_0≈30 tok/s Muat di memori grafis | Q8_0≈30 tok/s Muat di memori terpadu | Q8_0≈44 tok/s Muat di memori terpadu | Q8_0≈13,8 tok/s Muat di memori terpadu | Q8_0≈14,8 tok/s Muat di memori terpadu | Q4_1≈10,2 tok/s Muat di RAM (CPU) | Q8_0≈17,1 tok/s Muat di RAM (CPU) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈30 tok/s Muat di memori grafis | Q6_K≈18,0 tok/s Muat di memori grafis | Q8_0≈46 tok/s Muat di memori grafis | Q8_0≈49 tok/s Muat di memori grafis | Q8_0≈88 tok/s Muat di memori grafis | Q8_0≈88 tok/s Muat di memori grafis | Q8_0≈35 tok/s Muat di memori grafis | Q8_0≈29 tok/s Muat di memori grafis | Q8_0≈24 tok/s Muat di memori grafis | Q8_0≈23 tok/s Muat di memori terpadu | Q8_0≈35 tok/s Muat di memori terpadu | Q8_0≈10,9 tok/s Muat di memori terpadu | Q8_0≈11,7 tok/s Muat di memori terpadu | UD-Q3_K_XL≈10,1 tok/s Muat di RAM (CPU) | Q8_0≈14,6 tok/s Muat di RAM (CPU) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈53 tok/s Berjalan dengan offload ke RAM | MXFP4≈55 tok/s Muat di memori grafis | MXFP4162 tok/sterukur Muat di memori grafis | MXFP4≈194 tok/s Muat di memori grafis | MXFP4≈344 tok/s Muat di memori grafis | MXFP4≈344 tok/s Muat di memori grafis | MXFP4≈138 tok/s Muat di memori grafis | MXFP4≈112 tok/s Muat di memori grafis | MXFP4≈95 tok/s Muat di memori grafis | MXFP4≈80 tok/s Muat di memori terpadu | MXFP4116 tok/sterukur Muat di memori terpadu | MXFP4≈59 tok/s Muat di memori terpadu | MXFP4≈62 tok/s Muat di memori terpadu | MXFP4≈17,2 tok/s Muat di RAM (CPU) | MXFP4≈39 tok/s Muat di RAM (CPU) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈10,2 tok/s Berjalan dengan offload ke RAM | UD-Q3_K_XL≈18,4 tok/s Muat di memori grafis | Q6_K≈37 tok/s Muat di memori grafis | Q6_K≈40 tok/s Muat di memori grafis | Q8_0≈56 tok/s Muat di memori grafis | Q8_0≈56 tok/s Muat di memori grafis | Q8_0≈22 tok/s Muat di memori grafis | Q8_0≈18,2 tok/s Muat di memori grafis | Q8_0≈15,3 tok/s Muat di memori grafis | Q8_0≈14,9 tok/s Muat di memori terpadu | Q8_0≈22 tok/s Muat di memori terpadu | Q5_K_M≈10,3 tok/s Muat di memori terpadu | Q5_K_M≈11,0 tok/s Muat di memori terpadu | Q4_K_M≈6,9 tok/s Muat di RAM (CPU) | Q8_0≈10,3 tok/s Muat di RAM (CPU) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈14,7 tok/s Berjalan dengan offload ke RAM | UD-Q3_K_M≈56 tok/s Muat di memori grafis | UD-Q5_K_S≈129 tok/s Muat di memori grafis | UD-Q5_K_S≈139 tok/s Muat di memori grafis | UD-Q8_K_XL≈173 tok/s Muat di memori grafis | UD-Q8_K_XL≈173 tok/s Muat di memori grafis | UD-Q8_K_XL≈70 tok/s Muat di memori grafis | UD-Q8_K_XL≈57 tok/s Muat di memori grafis | UD-Q8_K_XL≈48 tok/s Muat di memori grafis | UD-Q8_K_XL≈40 tok/s Muat di memori terpadu | UD-Q8_K_XL≈60 tok/s Muat di memori terpadu | UD-Q8_K_XL≈29 tok/s Muat di memori terpadu | UD-Q8_K_XL≈31 tok/s Muat di memori terpadu | UD-Q8_K_XL≈13,7 tok/s Muat di RAM (CPU) | UD-Q8_K_XL≈31 tok/s Muat di RAM (CPU) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈12,7 tok/s Berjalan dengan offload ke RAM | Q3_K_S≈18,1 tok/s Muat di memori grafis | UD-Q5_K_XL≈38 tok/s Muat di memori grafis | UD-Q5_K_XL≈41 tok/s Muat di memori grafis | UD-Q6_K_XL≈59 tok/s Muat di memori grafis | Q8_0≈49 tok/s Muat di memori grafis | Q8_0≈19,7 tok/s Muat di memori grafis | Q8_0≈16,0 tok/s Muat di memori grafis | Q8_0≈13,5 tok/s Muat di memori grafis | Q8_0≈13,1 tok/s Muat di memori terpadu | Q8_0≈19,6 tok/s Muat di memori terpadu | Q4_1≈10,1 tok/s Muat di memori terpadu | Q4_1≈10,8 tok/s Muat di memori terpadu | Q4_K_M≈6,3 tok/s Muat di RAM (CPU) | UD-Q6_K_XL≈10,8 tok/s Muat di RAM (CPU) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈16,4 tok/s Berjalan dengan offload ke RAM | Q3_K_S≈66 tok/s Muat di memori grafis | Q4_K_M154 tok/sterukur Muat di memori grafis | Q5_K_S≈158 tok/s Muat di memori grafis | UD-Q6_K_XL≈232 tok/s Muat di memori grafis | Q8_0≈192 tok/s Muat di memori grafis | Q8_0≈77 tok/s Muat di memori grafis | Q8_0≈63 tok/s Muat di memori grafis | Q8_0≈53 tok/s Muat di memori grafis | Q8_0≈45 tok/s Muat di memori terpadu | Q8_0≈67 tok/s Muat di memori terpadu | Q8_0≈33 tok/s Muat di memori terpadu | Q8_0≈35 tok/s Muat di memori terpadu | Q8_0≈14,3 tok/s Muat di RAM (CPU) | Q8_0≈32 tok/s Muat di RAM (CPU) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈3,8 tok/s Berjalan dengan offload ke RAM | Q3_K_S≈10,4 tok/s Berjalan dengan offload ke RAM | Q4_1≈37 tok/s Muat di memori grafis | Q4_1≈40 tok/s Muat di memori grafis | Q6_K≈55 tok/s Muat di memori grafis | Q8_0≈43 tok/s Muat di memori grafis | Q8_0≈17,1 tok/s Muat di memori grafis | Q8_0≈13,9 tok/s Muat di memori grafis | Q8_0≈11,7 tok/s Muat di memori grafis | Q8_0≈11,3 tok/s Muat di memori terpadu | Q8_0≈17,0 tok/s Muat di memori terpadu | IQ4_XS≈10,3 tok/s Muat di memori terpadu | Q4_K_S≈10,3 tok/s Muat di memori terpadu | Q4_K_M≈5,7 tok/s Muat di RAM (CPU) | Q6_K≈10,1 tok/s Muat di RAM (CPU) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈3,7 tok/s Berjalan dengan offload ke RAM | UD-IQ3_XXS≈14,1 tok/s Berjalan dengan offload ke RAM | UD-Q4_K_XL≈35 tok/s Muat di memori grafis | UD-Q4_K_XL≈38 tok/s Muat di memori grafis | Q6_K≈51 tok/s Muat di memori grafis | Q8_0≈40 tok/s Muat di memori grafis | Q8_0≈16,0 tok/s Muat di memori grafis | Q8_0≈13,0 tok/s Muat di memori grafis | Q8_0≈11,0 tok/s Muat di memori grafis | Q8_0≈10,6 tok/s Muat di memori terpadu | Q8_0≈16,0 tok/s Muat di memori terpadu | UD-Q3_K_XL≈10,3 tok/s Muat di memori terpadu | IQ4_XS≈10,2 tok/s Muat di memori terpadu | Q4_K_M≈5,4 tok/s Muat di RAM (CPU) | Q5_K_M≈10,8 tok/s Muat di RAM (CPU) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈17,9 tok/s Berjalan dengan offload ke RAM | Q8_0≈18,7 tok/s Berjalan dengan offload ke RAM | Q4_K_S≈191 tok/s Muat di memori grafis | Q4_K_S≈205 tok/s Muat di memori grafis | Q6_K≈274 tok/s Muat di memori grafis | Q8_0≈220 tok/s Muat di memori grafis | Q8_0≈89 tok/s Muat di memori grafis | Q8_0≈72 tok/s Muat di memori grafis | Q8_0≈61 tok/s Muat di memori grafis | Q8_0≈51 tok/s Muat di memori terpadu | Q8_0≈77 tok/s Muat di memori terpadu | Q8_0≈37 tok/s Muat di memori terpadu | Q8_0≈40 tok/s Muat di memori terpadu | Q8_0≈15,0 tok/s Muat di RAM (CPU) | Q8_0≈34 tok/s Muat di RAM (CPU) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈1,3 tok/s Berjalan dengan offload ke RAM | Q4_K_M≈1,4 tok/s Berjalan dengan offload ke RAM | Q4_K_M≈2,0 tok/s Berjalan dengan offload ke RAM | Q4_K_M≈2,0 tok/s Berjalan dengan offload ke RAM | UD-IQ3_XXS≈49 tok/s Muat di memori grafis | Q8_0≈18,8 tok/s Muat di memori grafis | Q4_K_M16,3 tok/sterukur Muat di memori grafis | Q4_1≈10,3 tok/s Muat di memori grafis | IQ4_XS≈10,0 tok/s Muat di memori grafis | UD-Q3_K_XL≈10,6 tok/s Muat di memori terpadu | Q5_K_M≈11,2 tok/s Muat di memori terpadu | Q4_K_M≈4,1 tok/s Muat di memori terpadu | Q4_K_M≈4,4 tok/s Muat di memori terpadu | Q4_K_M≈2,9 tok/s Muat di RAM (CPU) | Q4_K_M≈6,6 tok/s Muat di RAM (CPU) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈24 tok/s Berjalan dengan offload ke RAM | Q6_K≈21 tok/s Berjalan dengan offload ke RAM | UD-Q6_K_XL≈26 tok/s Berjalan dengan offload ke RAM | UD-Q6_K_XL≈26 tok/s Berjalan dengan offload ke RAM | UD-Q6_K_XL≈31 tok/s Berjalan dengan offload ke RAM | Q8_0≈213 tok/s Muat di memori grafis | Q4_K_S≈145 tok/s Muat di memori grafis | UD-Q6_K_XL≈84 tok/s Muat di memori grafis | Q8_0≈59 tok/s Muat di memori grafis | Q8_0≈49 tok/s Muat di memori terpadu | Q8_0≈74 tok/s Muat di memori terpadu | Q8_0≈36 tok/s Muat di memori terpadu | Q8_0≈39 tok/s Muat di memori terpadu | Q8_0≈14,8 tok/s Muat di RAM (CPU) | Q8_0≈33 tok/s Muat di RAM (CPU) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈5,3 tok/s Berjalan dengan offload ke RAM | Q4_K_S≈5,1 tok/s Berjalan dengan offload ke RAM | Q4_K_M≈5,6 tok/s Berjalan dengan offload ke RAM | Q4_K_M≈5,7 tok/s Berjalan dengan offload ke RAM | Q3_K_M≈10,2 tok/s Berjalan dengan offload ke RAM | Q5_K_M≈55 tok/s Muat di memori grafis | Q4_0≈10,0 tok/s Berjalan dengan offload ke RAM | UD-Q4_K_XL≈22 tok/s Muat di memori grafis | Q5_K_M≈15,2 tok/s Muat di memori grafis | Q5_K_M≈12,8 tok/s Muat di memori terpadu | Q8_0≈13,9 tok/s Muat di memori terpadu | Q4_K_M≈10,6 tok/s Muat di memori terpadu | Q5_K_M≈10,0 tok/s Muat di memori terpadu | Q4_K_M≈8,0 tok/s Muat di RAM (CPU) | Q8_0≈13,1 tok/s Muat di RAM (CPU) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈19,1 tok/s Berjalan dengan offload ke RAM | MXFP4≈19,6 tok/s Berjalan dengan offload ke RAM | MXFP426–28 tok/sterukur Berjalan dengan offload ke RAM | MXFP4≈25 tok/s Berjalan dengan offload ke RAM | MXFP4≈31 tok/s Berjalan dengan offload ke RAM | MXFP4≈258 tok/s Muat di memori grafis | MXFP4≈36 tok/s Berjalan dengan offload ke RAM | MXFP441–73 tok/sterukur Muat di memori grafis | MXFP4≈71 tok/s Muat di memori grafis | MXFP4≈60 tok/s Muat di memori terpadu | MXFP4≈90 tok/s Muat di memori terpadu | MXFP450 tok/sterukur Muat di memori terpadu | MXFP461 tok/sterukur Muat di memori terpadu | MXFP4≈15,8 tok/s Muat di RAM (CPU) | MXFP4≈36 tok/s Muat di RAM (CPU) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈10,5 tok/s Berjalan dengan offload ke RAM | UD-IQ4_NL≈10,8 tok/s Berjalan dengan offload ke RAM | Q4_K_S≈11,1 tok/s Berjalan dengan offload ke RAM | Q4_K_S≈11,2 tok/s Berjalan dengan offload ke RAM | UD-Q4_K_XL≈11,9 tok/s Berjalan dengan offload ke RAM | UD-Q5_K_XL≈97 tok/s Muat di memori grafis | UD-IQ3_XXS≈76 tok/s Muat di memori grafis | UD-IQ4_NL≈46 tok/s Muat di memori grafis | UD-Q5_K_XL≈27 tok/s Muat di memori grafis | UD-Q5_K_XL≈23 tok/s Muat di memori terpadu | Q8_0≈24 tok/s Muat di memori terpadu | Q6_K≈15,1 tok/s Muat di memori terpadu | Q6_K≈16,1 tok/s Muat di memori terpadu | UD-Q5_K_XL≈10,4 tok/s Muat di RAM (CPU) | Q8_0≈19,3 tok/s Muat di RAM (CPU) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | UD-Q4_K_XL≈10,8 tok/s Berjalan dengan offload ke RAM | UD-Q2_K_XL≈8,0 tok/skompresi kuat Berjalan dengan offload ke RAM | Q3_K_M≈6,1 tok/s Berjalan dengan offload ke RAM | UD-Q3_K_XL≈11,7 tok/s Berjalan dengan offload ke RAM | UD-Q2_K_XL≈19,4 tok/skompresi kuat Muat di memori terpadu | Q8_0≈10,8 tok/s Muat di memori terpadu | UD-Q3_K_XL≈12,2 tok/s Muat di memori terpadu | UD-Q3_K_XL≈13,0 tok/s Muat di memori terpadu | Q4_K_M≈7,2 tok/s Muat di RAM (CPU) | Q8_0≈10,9 tok/s Muat di RAM (CPU) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | UD-IQ3_XXS≈7,3 tok/s Berjalan dengan offload ke RAM | UD-IQ1_S≈5,6 tok/skompresi kuat Berjalan dengan offload ke RAM | UD-IQ2_XXS≈4,7 tok/skompresi kuat Berjalan dengan offload ke RAM | UD-IQ3_XXS≈3,5 tok/s Berjalan dengan offload ke RAM | UD-TQ1_0≈16,2 tok/skompresi kuat Muat di memori terpadu | Q4_1≈10,0 tok/s Muat di memori terpadu | UD-IQ1_M≈9,6 tok/skompresi kuat Muat di memori terpadu | UD-IQ1_M≈10,3 tok/skompresi kuat Muat di memori terpadu | Q4_K_M≈4,7 tok/s Muat di RAM (CPU) | Q4_1≈10,2 tok/s Muat di RAM (CPU) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | UD-IQ1_S≈16,9 tok/skompresi kuat Berjalan dengan offload ke RAM | ✕ Tidak muat | ✕ Tidak muat | UD-IQ1_S≈8,0 tok/skompresi kuat Berjalan dengan offload ke RAM | ✕ Tidak muat | Q3_K_M≈14,9 tok/s Muat di memori terpadu | ✕ Tidak muat | ✕ Tidak muat | Q4_K_M≈5,2 tok/s Muat di RAM (CPU) | Q3_K_M≈13,9 tok/s Muat di RAM (CPU) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | ✕ Tidak muat | UD-Q2_K_XL≈22 tok/skompresi kuat Muat di memori terpadu | ✕ Tidak muat | ✕ Tidak muat | Q3_K_S≈7,2 tok/s Muat di RAM (CPU) | UD-IQ2_XXS≈19,7 tok/skompresi kuat Muat di RAM (CPU) |
Kalkulator: muat atau tidak?
Apa yang terbuka pada tiap ukuran memori (konteks 8K)
- 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B kompresi kuat: Gemma 3 12B · Qwen3 14B
- 12 GB Gemma 3 12B · Qwen3 14B kompresi kuat: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B kompresi kuat: Gemma 4 31B · Qwen3.5 35B A3B
- 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B kompresi kuat: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B kompresi kuat: GLM 4.5 Air
- 96 GB GLM 4.5 Air · gpt-oss-120b kompresi kuat: Qwen3 235B A22B · GLM 4.7
- 128 GB Qwen3 235B A22B
- 192 GB GLM 4.7 kompresi kuat: DeepSeek R1
- 256 GB kompresi kuat: Kimi K2.5
- 512 GB DeepSeek R1 · Kimi K2.5
≈ perkiraan untuk konteks 8K: bobot + KV cache + overhead runtime dibandingkan dengan memori; kecepatan dari bandwidth memori. Angka sebenarnya bergantung pada runtime dan pengaturan.
Diperbarui · Sumber: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
Sematkan di situs Anda
Tempel kode ini di tempat infografis akan muncul: diperbarui dengan sendirinya. Gratis digunakan — pertahankan tautan atribusi.
Membaca matriks
Baris berisi model open weights yang dikenal luas, dari sekitar 3B hingga 1T parameter. Kolom berisi kartu grafis, rakitan multi-GPU, mesin Apple dan AMD dengan memori terpadu, serta server yang menjalankan model di CPU. Setiap sel menyebut kuantisasi yang disarankan dan perkiraan kecepatan generasi dalam token per detik, sementara warnanya menunjukkan di mana model berada: memori grafis (VRAM), memori terpadu, RAM server, offload ke RAM, atau tidak muat.
Langkah perhitungan perkiraan
- Bobot. Jumlah parameter dikali bit per bobot, atau ukuran asli file kuantisasi dari Hugging Face bila tersedia.
- KV cache. Memori yang menyimpan percakapan. Matriks memakai konteks 8192 token; pada konteks panjang bagian ini bisa melebihi ukuran model kecil.
- Overhead. Sekitar 1,5 GB untuk runtime dan buffer, ditambah proyektor gambar pada VLM.
- Kecepatan. Bandwidth memori dibagi jumlah byte yang dibaca untuk tiap token. Model MoE hanya membaca parameter aktifnya, sehingga MoE besar bisa menulis lebih cepat daripada model dense yang lebih kecil.
Jika totalnya melebihi VRAM tetapi muat bersama RAM sistem, sel menampilkan offload: model berjalan, hanya lebih lambat. Angka bertanda ≈ adalah perkiraan yang dikalibrasi terhadap pengukuran nyata dan berada dalam kisaran sekitar ±35% darinya; sel yang punya pengukuran asli menampilkan nilai itu beserta tautan sumbernya.
Cara kuantisasi dipilih
Kami naik ke jumlah bit yang lebih tinggi, hingga Q8_0, selama kecepatan tetap minimal 10 token per detik; jika tidak, disarankan file kelas Q4 seperti Q4_K_M. BF16 tidak pernah disarankan karena menggandakan memori untuk peningkatan yang nyaris tak terasa. Di bawah Q3 kami turun hanya bila tidak ada yang lebih besar yang muat, dan sel lalu memberi peringatan «kompresi kuat».
Memeriksa komputer Anda
«Kalkulator: muat atau tidak?» di bawah matriks menerima model, kuantisasi, panjang konteks, dan perangkat keras, atau cukup memori grafis, RAM, dan bandwidth Anda sendiri. Hasilnya berupa satu batang berisi bobot, KV cache, dan overhead dibandingkan kapasitas. Tangga di bawahnya menunjukkan apa yang terbuka pada 8, 12, 16, 24, 48, 96, dan 128 GB.
Perkiraan hanya mencakup generasi, bukan waktu membaca prompt panjang; driver, versi runtime, dan pengaturan menggeser hasil nyata ke dua arah. File GGUF berjalan di llama.cpp, LM Studio, Ollama, dan Jan — lihat aplikasi AI lokal. Model tanpa filter keamanan disembunyikan di balik sakelar. Untuk mesin lengkap, buka rakitan PC.