Langsung ke konten
fedi.software

Model terbuka mana yang muat di perangkat Anda — 2026

Model open-weights dibandingkan dengan kartu grafis dan komputer populer: kuantisasi yang direkomendasikan (yang terbesar hingga Q8 yang masih menghasilkan 10+ token per detik, jika tidak, kelas Q4; di bawah Q3 hanya bila tidak ada yang lain yang muat), tempat model berjalan (memori grafis, memori terpadu, atau offload ke RAM), dan perkiraan kecepatan generasi.

Model Parameter
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s Muat di memori grafis Q8_0≈67 tok/s Muat di memori grafis Q8_0≈218 tok/s Muat di memori grafis Q8_0≈235 tok/s Muat di memori grafis Q8_0≈417 tok/s Muat di memori grafis Q8_0≈417 tok/s Muat di memori grafis Q8_0≈168 tok/s Muat di memori grafis Q8_0≈136 tok/s Muat di memori grafis Q8_0≈115 tok/s Muat di memori grafis Q8_0≈111 tok/s Muat di memori terpadu Q8_0≈167 tok/s Muat di memori terpadu Q8_0≈52 tok/s Muat di memori terpadu Q8_0≈56 tok/s Muat di memori terpadu Q8_0≈15,0 tok/s Muat di RAM (CPU) Q8_0≈34 tok/s Muat di RAM (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s Muat di memori grafis Q8_0≈59 tok/s Muat di memori grafis Q8_0≈192 tok/s Muat di memori grafis Q8_0≈207 tok/s Muat di memori grafis Q8_0≈368 tok/s Muat di memori grafis Q8_0≈368 tok/s Muat di memori grafis Q8_0≈148 tok/s Muat di memori grafis Q8_0≈120 tok/s Muat di memori grafis Q8_0≈101 tok/s Muat di memori grafis Q8_0≈98 tok/s Muat di memori terpadu Q8_0≈147 tok/s Muat di memori terpadu Q8_0≈46 tok/s Muat di memori terpadu Q8_0≈49 tok/s Muat di memori terpadu Q8_0≈14,3 tok/s Muat di RAM (CPU) Q8_0≈32 tok/s Muat di RAM (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s Muat di memori grafis Q8_0≈54 tok/s Muat di memori grafis Q8_0≈175 tok/s Muat di memori grafis Q8_0≈189 tok/s Muat di memori grafis Q8_0≈335 tok/s Muat di memori grafis Q8_0≈335 tok/s Muat di memori grafis Q8_0≈135 tok/s Muat di memori grafis Q8_0≈109 tok/s Muat di memori grafis Q8_0≈92 tok/s Muat di memori grafis Q8_0≈89 tok/s Muat di memori terpadu Q8_0≈134 tok/s Muat di memori terpadu Q8_0≈42 tok/s Muat di memori terpadu Q8_0≈45 tok/s Muat di memori terpadu Q8_0≈13,8 tok/s Muat di RAM (CPU) Q8_0≈31 tok/s Muat di RAM (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s Muat di memori grafis UD-Q6_K_XL≈29 tok/s Muat di memori grafis UD-Q6_K_XL≈95 tok/s Muat di memori grafis UD-Q6_K_XL≈103 tok/s Muat di memori grafis UD-Q6_K_XL≈182 tok/s Muat di memori grafis UD-Q6_K_XL≈182 tok/s Muat di memori grafis UD-Q6_K_XL≈73 tok/s Muat di memori grafis UD-Q6_K_XL≈59 tok/s Muat di memori grafis UD-Q6_K_XL≈50 tok/s Muat di memori grafis UD-Q6_K_XL≈49 tok/s Muat di memori terpadu UD-Q6_K_XL≈73 tok/s Muat di memori terpadu UD-Q6_K_XL≈23 tok/s Muat di memori terpadu UD-Q6_K_XL≈24 tok/s Muat di memori terpadu UD-Q6_K_XL≈10,3 tok/s Muat di RAM (CPU) UD-Q6_K_XL≈23 tok/s Muat di RAM (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s Muat di memori grafis Q8_0≈25 tok/s Muat di memori grafis Q8_0≈80 tok/s Muat di memori grafis Q8_0≈87 tok/s Muat di memori grafis Q8_0≈154 tok/s Muat di memori grafis Q8_0≈154 tok/s Muat di memori grafis Q8_0≈62 tok/s Muat di memori grafis Q8_0≈50 tok/s Muat di memori grafis Q8_0≈42 tok/s Muat di memori grafis Q8_0≈41 tok/s Muat di memori terpadu Q8_0≈62 tok/s Muat di memori terpadu Q8_0≈19,2 tok/s Muat di memori terpadu Q8_0≈21 tok/s Muat di memori terpadu UD-Q6_K_XL≈10,2 tok/s Muat di RAM (CPU) Q8_0≈21 tok/s Muat di RAM (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s Muat di memori grafis Q8_0≈17,8 tok/s Muat di memori grafis Q8_0≈58 tok/s Muat di memori grafis Q8_0≈62 tok/s Muat di memori grafis Q8_0≈111 tok/s Muat di memori grafis Q8_0≈111 tok/s Muat di memori grafis Q8_0≈44 tok/s Muat di memori grafis Q8_0≈36 tok/s Muat di memori grafis Q8_0≈30 tok/s Muat di memori grafis Q8_0≈30 tok/s Muat di memori terpadu Q8_0≈44 tok/s Muat di memori terpadu Q8_0≈13,8 tok/s Muat di memori terpadu Q8_0≈14,8 tok/s Muat di memori terpadu Q4_1≈10,2 tok/s Muat di RAM (CPU) Q8_0≈17,1 tok/s Muat di RAM (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s Muat di memori grafis Q6_K≈18,0 tok/s Muat di memori grafis Q8_0≈46 tok/s Muat di memori grafis Q8_0≈49 tok/s Muat di memori grafis Q8_0≈88 tok/s Muat di memori grafis Q8_0≈88 tok/s Muat di memori grafis Q8_0≈35 tok/s Muat di memori grafis Q8_0≈29 tok/s Muat di memori grafis Q8_0≈24 tok/s Muat di memori grafis Q8_0≈23 tok/s Muat di memori terpadu Q8_0≈35 tok/s Muat di memori terpadu Q8_0≈10,9 tok/s Muat di memori terpadu Q8_0≈11,7 tok/s Muat di memori terpadu UD-Q3_K_XL≈10,1 tok/s Muat di RAM (CPU) Q8_0≈14,6 tok/s Muat di RAM (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s Berjalan dengan offload ke RAM MXFP4≈55 tok/s Muat di memori grafis MXFP4162 tok/sterukur Muat di memori grafis MXFP4≈194 tok/s Muat di memori grafis MXFP4≈344 tok/s Muat di memori grafis MXFP4≈344 tok/s Muat di memori grafis MXFP4≈138 tok/s Muat di memori grafis MXFP4≈112 tok/s Muat di memori grafis MXFP4≈95 tok/s Muat di memori grafis MXFP4≈80 tok/s Muat di memori terpadu MXFP4116 tok/sterukur Muat di memori terpadu MXFP4≈59 tok/s Muat di memori terpadu MXFP4≈62 tok/s Muat di memori terpadu MXFP4≈17,2 tok/s Muat di RAM (CPU) MXFP4≈39 tok/s Muat di RAM (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10,2 tok/s Berjalan dengan offload ke RAM UD-Q3_K_XL≈18,4 tok/s Muat di memori grafis Q6_K≈37 tok/s Muat di memori grafis Q6_K≈40 tok/s Muat di memori grafis Q8_0≈56 tok/s Muat di memori grafis Q8_0≈56 tok/s Muat di memori grafis Q8_0≈22 tok/s Muat di memori grafis Q8_0≈18,2 tok/s Muat di memori grafis Q8_0≈15,3 tok/s Muat di memori grafis Q8_0≈14,9 tok/s Muat di memori terpadu Q8_0≈22 tok/s Muat di memori terpadu Q5_K_M≈10,3 tok/s Muat di memori terpadu Q5_K_M≈11,0 tok/s Muat di memori terpadu Q4_K_M≈6,9 tok/s Muat di RAM (CPU) Q8_0≈10,3 tok/s Muat di RAM (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14,7 tok/s Berjalan dengan offload ke RAM UD-Q3_K_M≈56 tok/s Muat di memori grafis UD-Q5_K_S≈129 tok/s Muat di memori grafis UD-Q5_K_S≈139 tok/s Muat di memori grafis UD-Q8_K_XL≈173 tok/s Muat di memori grafis UD-Q8_K_XL≈173 tok/s Muat di memori grafis UD-Q8_K_XL≈70 tok/s Muat di memori grafis UD-Q8_K_XL≈57 tok/s Muat di memori grafis UD-Q8_K_XL≈48 tok/s Muat di memori grafis UD-Q8_K_XL≈40 tok/s Muat di memori terpadu UD-Q8_K_XL≈60 tok/s Muat di memori terpadu UD-Q8_K_XL≈29 tok/s Muat di memori terpadu UD-Q8_K_XL≈31 tok/s Muat di memori terpadu UD-Q8_K_XL≈13,7 tok/s Muat di RAM (CPU) UD-Q8_K_XL≈31 tok/s Muat di RAM (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12,7 tok/s Berjalan dengan offload ke RAM Q3_K_S≈18,1 tok/s Muat di memori grafis UD-Q5_K_XL≈38 tok/s Muat di memori grafis UD-Q5_K_XL≈41 tok/s Muat di memori grafis UD-Q6_K_XL≈59 tok/s Muat di memori grafis Q8_0≈49 tok/s Muat di memori grafis Q8_0≈19,7 tok/s Muat di memori grafis Q8_0≈16,0 tok/s Muat di memori grafis Q8_0≈13,5 tok/s Muat di memori grafis Q8_0≈13,1 tok/s Muat di memori terpadu Q8_0≈19,6 tok/s Muat di memori terpadu Q4_1≈10,1 tok/s Muat di memori terpadu Q4_1≈10,8 tok/s Muat di memori terpadu Q4_K_M≈6,3 tok/s Muat di RAM (CPU) UD-Q6_K_XL≈10,8 tok/s Muat di RAM (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16,4 tok/s Berjalan dengan offload ke RAM Q3_K_S≈66 tok/s Muat di memori grafis Q4_K_M154 tok/sterukur Muat di memori grafis Q5_K_S≈158 tok/s Muat di memori grafis UD-Q6_K_XL≈232 tok/s Muat di memori grafis Q8_0≈192 tok/s Muat di memori grafis Q8_0≈77 tok/s Muat di memori grafis Q8_0≈63 tok/s Muat di memori grafis Q8_0≈53 tok/s Muat di memori grafis Q8_0≈45 tok/s Muat di memori terpadu Q8_0≈67 tok/s Muat di memori terpadu Q8_0≈33 tok/s Muat di memori terpadu Q8_0≈35 tok/s Muat di memori terpadu Q8_0≈14,3 tok/s Muat di RAM (CPU) Q8_0≈32 tok/s Muat di RAM (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3,8 tok/s Berjalan dengan offload ke RAM Q3_K_S≈10,4 tok/s Berjalan dengan offload ke RAM Q4_1≈37 tok/s Muat di memori grafis Q4_1≈40 tok/s Muat di memori grafis Q6_K≈55 tok/s Muat di memori grafis Q8_0≈43 tok/s Muat di memori grafis Q8_0≈17,1 tok/s Muat di memori grafis Q8_0≈13,9 tok/s Muat di memori grafis Q8_0≈11,7 tok/s Muat di memori grafis Q8_0≈11,3 tok/s Muat di memori terpadu Q8_0≈17,0 tok/s Muat di memori terpadu IQ4_XS≈10,3 tok/s Muat di memori terpadu Q4_K_S≈10,3 tok/s Muat di memori terpadu Q4_K_M≈5,7 tok/s Muat di RAM (CPU) Q6_K≈10,1 tok/s Muat di RAM (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3,7 tok/s Berjalan dengan offload ke RAM UD-IQ3_XXS≈14,1 tok/s Berjalan dengan offload ke RAM UD-Q4_K_XL≈35 tok/s Muat di memori grafis UD-Q4_K_XL≈38 tok/s Muat di memori grafis Q6_K≈51 tok/s Muat di memori grafis Q8_0≈40 tok/s Muat di memori grafis Q8_0≈16,0 tok/s Muat di memori grafis Q8_0≈13,0 tok/s Muat di memori grafis Q8_0≈11,0 tok/s Muat di memori grafis Q8_0≈10,6 tok/s Muat di memori terpadu Q8_0≈16,0 tok/s Muat di memori terpadu UD-Q3_K_XL≈10,3 tok/s Muat di memori terpadu IQ4_XS≈10,2 tok/s Muat di memori terpadu Q4_K_M≈5,4 tok/s Muat di RAM (CPU) Q5_K_M≈10,8 tok/s Muat di RAM (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17,9 tok/s Berjalan dengan offload ke RAM Q8_0≈18,7 tok/s Berjalan dengan offload ke RAM Q4_K_S≈191 tok/s Muat di memori grafis Q4_K_S≈205 tok/s Muat di memori grafis Q6_K≈274 tok/s Muat di memori grafis Q8_0≈220 tok/s Muat di memori grafis Q8_0≈89 tok/s Muat di memori grafis Q8_0≈72 tok/s Muat di memori grafis Q8_0≈61 tok/s Muat di memori grafis Q8_0≈51 tok/s Muat di memori terpadu Q8_0≈77 tok/s Muat di memori terpadu Q8_0≈37 tok/s Muat di memori terpadu Q8_0≈40 tok/s Muat di memori terpadu Q8_0≈15,0 tok/s Muat di RAM (CPU) Q8_0≈34 tok/s Muat di RAM (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1,3 tok/s Berjalan dengan offload ke RAM Q4_K_M≈1,4 tok/s Berjalan dengan offload ke RAM Q4_K_M≈2,0 tok/s Berjalan dengan offload ke RAM Q4_K_M≈2,0 tok/s Berjalan dengan offload ke RAM UD-IQ3_XXS≈49 tok/s Muat di memori grafis Q8_0≈18,8 tok/s Muat di memori grafis Q4_K_M16,3 tok/sterukur Muat di memori grafis Q4_1≈10,3 tok/s Muat di memori grafis IQ4_XS≈10,0 tok/s Muat di memori grafis UD-Q3_K_XL≈10,6 tok/s Muat di memori terpadu Q5_K_M≈11,2 tok/s Muat di memori terpadu Q4_K_M≈4,1 tok/s Muat di memori terpadu Q4_K_M≈4,4 tok/s Muat di memori terpadu Q4_K_M≈2,9 tok/s Muat di RAM (CPU) Q4_K_M≈6,6 tok/s Muat di RAM (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s Berjalan dengan offload ke RAM Q6_K≈21 tok/s Berjalan dengan offload ke RAM UD-Q6_K_XL≈26 tok/s Berjalan dengan offload ke RAM UD-Q6_K_XL≈26 tok/s Berjalan dengan offload ke RAM UD-Q6_K_XL≈31 tok/s Berjalan dengan offload ke RAM Q8_0≈213 tok/s Muat di memori grafis Q4_K_S≈145 tok/s Muat di memori grafis UD-Q6_K_XL≈84 tok/s Muat di memori grafis Q8_0≈59 tok/s Muat di memori grafis Q8_0≈49 tok/s Muat di memori terpadu Q8_0≈74 tok/s Muat di memori terpadu Q8_0≈36 tok/s Muat di memori terpadu Q8_0≈39 tok/s Muat di memori terpadu Q8_0≈14,8 tok/s Muat di RAM (CPU) Q8_0≈33 tok/s Muat di RAM (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5,3 tok/s Berjalan dengan offload ke RAM Q4_K_S≈5,1 tok/s Berjalan dengan offload ke RAM Q4_K_M≈5,6 tok/s Berjalan dengan offload ke RAM Q4_K_M≈5,7 tok/s Berjalan dengan offload ke RAM Q3_K_M≈10,2 tok/s Berjalan dengan offload ke RAM Q5_K_M≈55 tok/s Muat di memori grafis Q4_0≈10,0 tok/s Berjalan dengan offload ke RAM UD-Q4_K_XL≈22 tok/s Muat di memori grafis Q5_K_M≈15,2 tok/s Muat di memori grafis Q5_K_M≈12,8 tok/s Muat di memori terpadu Q8_0≈13,9 tok/s Muat di memori terpadu Q4_K_M≈10,6 tok/s Muat di memori terpadu Q5_K_M≈10,0 tok/s Muat di memori terpadu Q4_K_M≈8,0 tok/s Muat di RAM (CPU) Q8_0≈13,1 tok/s Muat di RAM (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19,1 tok/s Berjalan dengan offload ke RAM MXFP4≈19,6 tok/s Berjalan dengan offload ke RAM MXFP426–28 tok/sterukur Berjalan dengan offload ke RAM MXFP4≈25 tok/s Berjalan dengan offload ke RAM MXFP4≈31 tok/s Berjalan dengan offload ke RAM MXFP4≈258 tok/s Muat di memori grafis MXFP4≈36 tok/s Berjalan dengan offload ke RAM MXFP441–73 tok/sterukur Muat di memori grafis MXFP4≈71 tok/s Muat di memori grafis MXFP4≈60 tok/s Muat di memori terpadu MXFP4≈90 tok/s Muat di memori terpadu MXFP450 tok/sterukur Muat di memori terpadu MXFP461 tok/sterukur Muat di memori terpadu MXFP4≈15,8 tok/s Muat di RAM (CPU) MXFP4≈36 tok/s Muat di RAM (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10,5 tok/s Berjalan dengan offload ke RAM UD-IQ4_NL≈10,8 tok/s Berjalan dengan offload ke RAM Q4_K_S≈11,1 tok/s Berjalan dengan offload ke RAM Q4_K_S≈11,2 tok/s Berjalan dengan offload ke RAM UD-Q4_K_XL≈11,9 tok/s Berjalan dengan offload ke RAM UD-Q5_K_XL≈97 tok/s Muat di memori grafis UD-IQ3_XXS≈76 tok/s Muat di memori grafis UD-IQ4_NL≈46 tok/s Muat di memori grafis UD-Q5_K_XL≈27 tok/s Muat di memori grafis UD-Q5_K_XL≈23 tok/s Muat di memori terpadu Q8_0≈24 tok/s Muat di memori terpadu Q6_K≈15,1 tok/s Muat di memori terpadu Q6_K≈16,1 tok/s Muat di memori terpadu UD-Q5_K_XL≈10,4 tok/s Muat di RAM (CPU) Q8_0≈19,3 tok/s Muat di RAM (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat UD-Q4_K_XL≈10,8 tok/s Berjalan dengan offload ke RAM UD-Q2_K_XL≈8,0 tok/skompresi kuat Berjalan dengan offload ke RAM Q3_K_M≈6,1 tok/s Berjalan dengan offload ke RAM UD-Q3_K_XL≈11,7 tok/s Berjalan dengan offload ke RAM UD-Q2_K_XL≈19,4 tok/skompresi kuat Muat di memori terpadu Q8_0≈10,8 tok/s Muat di memori terpadu UD-Q3_K_XL≈12,2 tok/s Muat di memori terpadu UD-Q3_K_XL≈13,0 tok/s Muat di memori terpadu Q4_K_M≈7,2 tok/s Muat di RAM (CPU) Q8_0≈10,9 tok/s Muat di RAM (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat UD-IQ3_XXS≈7,3 tok/s Berjalan dengan offload ke RAM UD-IQ1_S≈5,6 tok/skompresi kuat Berjalan dengan offload ke RAM UD-IQ2_XXS≈4,7 tok/skompresi kuat Berjalan dengan offload ke RAM UD-IQ3_XXS≈3,5 tok/s Berjalan dengan offload ke RAM UD-TQ1_0≈16,2 tok/skompresi kuat Muat di memori terpadu Q4_1≈10,0 tok/s Muat di memori terpadu UD-IQ1_M≈9,6 tok/skompresi kuat Muat di memori terpadu UD-IQ1_M≈10,3 tok/skompresi kuat Muat di memori terpadu Q4_K_M≈4,7 tok/s Muat di RAM (CPU) Q4_1≈10,2 tok/s Muat di RAM (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat UD-IQ1_S≈16,9 tok/skompresi kuat Berjalan dengan offload ke RAM ✕ Tidak muat ✕ Tidak muat UD-IQ1_S≈8,0 tok/skompresi kuat Berjalan dengan offload ke RAM ✕ Tidak muat Q3_K_M≈14,9 tok/s Muat di memori terpadu ✕ Tidak muat ✕ Tidak muat Q4_K_M≈5,2 tok/s Muat di RAM (CPU) Q3_K_M≈13,9 tok/s Muat di RAM (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat ✕ Tidak muat UD-Q2_K_XL≈22 tok/skompresi kuat Muat di memori terpadu ✕ Tidak muat ✕ Tidak muat Q3_K_S≈7,2 tok/s Muat di RAM (CPU) UD-IQ2_XXS≈19,7 tok/skompresi kuat Muat di RAM (CPU)

Apa yang terbuka pada tiap ukuran memori (konteks 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B kompresi kuat: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B kompresi kuat: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B kompresi kuat: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B kompresi kuat: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B kompresi kuat: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b kompresi kuat: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 kompresi kuat: DeepSeek R1
  9. 256 GB kompresi kuat: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ perkiraan untuk konteks 8K: bobot + KV cache + overhead runtime dibandingkan dengan memori; kecepatan dari bandwidth memori. Angka sebenarnya bergantung pada runtime dan pengaturan.

Diperbarui · Sumber: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Sematkan di situs Anda

Tempel kode ini di tempat infografis akan muncul: diperbarui dengan sendirinya. Gratis digunakan — pertahankan tautan atribusi.

JSON Data kami: CC BY 4.0 dengan tautan ke sumber; data pihak ketiga tetap memakai lisensi sumbernya.

Membaca matriks

Baris berisi model open weights yang dikenal luas, dari sekitar 3B hingga 1T parameter. Kolom berisi kartu grafis, rakitan multi-GPU, mesin Apple dan AMD dengan memori terpadu, serta server yang menjalankan model di CPU. Setiap sel menyebut kuantisasi yang disarankan dan perkiraan kecepatan generasi dalam token per detik, sementara warnanya menunjukkan di mana model berada: memori grafis (VRAM), memori terpadu, RAM server, offload ke RAM, atau tidak muat.

Langkah perhitungan perkiraan

  1. Bobot. Jumlah parameter dikali bit per bobot, atau ukuran asli file kuantisasi dari Hugging Face bila tersedia.
  2. KV cache. Memori yang menyimpan percakapan. Matriks memakai konteks 8192 token; pada konteks panjang bagian ini bisa melebihi ukuran model kecil.
  3. Overhead. Sekitar 1,5 GB untuk runtime dan buffer, ditambah proyektor gambar pada VLM.
  4. Kecepatan. Bandwidth memori dibagi jumlah byte yang dibaca untuk tiap token. Model MoE hanya membaca parameter aktifnya, sehingga MoE besar bisa menulis lebih cepat daripada model dense yang lebih kecil.

Jika totalnya melebihi VRAM tetapi muat bersama RAM sistem, sel menampilkan offload: model berjalan, hanya lebih lambat. Angka bertanda ≈ adalah perkiraan yang dikalibrasi terhadap pengukuran nyata dan berada dalam kisaran sekitar ±35% darinya; sel yang punya pengukuran asli menampilkan nilai itu beserta tautan sumbernya.

Cara kuantisasi dipilih

Kami naik ke jumlah bit yang lebih tinggi, hingga Q8_0, selama kecepatan tetap minimal 10 token per detik; jika tidak, disarankan file kelas Q4 seperti Q4_K_M. BF16 tidak pernah disarankan karena menggandakan memori untuk peningkatan yang nyaris tak terasa. Di bawah Q3 kami turun hanya bila tidak ada yang lebih besar yang muat, dan sel lalu memberi peringatan «kompresi kuat».

Memeriksa komputer Anda

«Kalkulator: muat atau tidak?» di bawah matriks menerima model, kuantisasi, panjang konteks, dan perangkat keras, atau cukup memori grafis, RAM, dan bandwidth Anda sendiri. Hasilnya berupa satu batang berisi bobot, KV cache, dan overhead dibandingkan kapasitas. Tangga di bawahnya menunjukkan apa yang terbuka pada 8, 12, 16, 24, 48, 96, dan 128 GB.

Perkiraan hanya mencakup generasi, bukan waktu membaca prompt panjang; driver, versi runtime, dan pengaturan menggeser hasil nyata ke dua arah. File GGUF berjalan di llama.cpp, LM Studio, Ollama, dan Jan — lihat aplikasi AI lokal. Model tanpa filter keamanan disembunyikan di balik sakelar. Untuk mesin lengkap, buka rakitan PC.