跳到主要內容
fedi.software

哪個開放模型適合你的硬體 — 2026

開放權重模型對照主流顯示卡與電腦:建議的量化等級(不超過 Q8、且仍能達到每秒 10 個以上 token 的最大等級,否則為 Q4 級;僅在其他等級都放不下時才會低於 Q3)、執行位置(顯示記憶體、統一記憶體或卸載至 RAM),以及大致的生成速度。

模型 參數量
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s 可放入顯示記憶體 Q8_0≈67 tok/s 可放入顯示記憶體 Q8_0≈218 tok/s 可放入顯示記憶體 Q8_0≈235 tok/s 可放入顯示記憶體 Q8_0≈417 tok/s 可放入顯示記憶體 Q8_0≈417 tok/s 可放入顯示記憶體 Q8_0≈168 tok/s 可放入顯示記憶體 Q8_0≈136 tok/s 可放入顯示記憶體 Q8_0≈115 tok/s 可放入顯示記憶體 Q8_0≈111 tok/s 可放入統一記憶體 Q8_0≈167 tok/s 可放入統一記憶體 Q8_0≈52 tok/s 可放入統一記憶體 Q8_0≈56 tok/s 可放入統一記憶體 Q8_0≈15.0 tok/s 可放入 RAM(CPU) Q8_0≈34 tok/s 可放入 RAM(CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s 可放入顯示記憶體 Q8_0≈59 tok/s 可放入顯示記憶體 Q8_0≈192 tok/s 可放入顯示記憶體 Q8_0≈207 tok/s 可放入顯示記憶體 Q8_0≈368 tok/s 可放入顯示記憶體 Q8_0≈368 tok/s 可放入顯示記憶體 Q8_0≈148 tok/s 可放入顯示記憶體 Q8_0≈120 tok/s 可放入顯示記憶體 Q8_0≈101 tok/s 可放入顯示記憶體 Q8_0≈98 tok/s 可放入統一記憶體 Q8_0≈147 tok/s 可放入統一記憶體 Q8_0≈46 tok/s 可放入統一記憶體 Q8_0≈49 tok/s 可放入統一記憶體 Q8_0≈14.3 tok/s 可放入 RAM(CPU) Q8_0≈32 tok/s 可放入 RAM(CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s 可放入顯示記憶體 Q8_0≈54 tok/s 可放入顯示記憶體 Q8_0≈175 tok/s 可放入顯示記憶體 Q8_0≈189 tok/s 可放入顯示記憶體 Q8_0≈335 tok/s 可放入顯示記憶體 Q8_0≈335 tok/s 可放入顯示記憶體 Q8_0≈135 tok/s 可放入顯示記憶體 Q8_0≈109 tok/s 可放入顯示記憶體 Q8_0≈92 tok/s 可放入顯示記憶體 Q8_0≈89 tok/s 可放入統一記憶體 Q8_0≈134 tok/s 可放入統一記憶體 Q8_0≈42 tok/s 可放入統一記憶體 Q8_0≈45 tok/s 可放入統一記憶體 Q8_0≈13.8 tok/s 可放入 RAM(CPU) Q8_0≈31 tok/s 可放入 RAM(CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈29 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈95 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈103 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈182 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈182 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈73 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈59 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈50 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈49 tok/s 可放入統一記憶體 UD-Q6_K_XL≈73 tok/s 可放入統一記憶體 UD-Q6_K_XL≈23 tok/s 可放入統一記憶體 UD-Q6_K_XL≈24 tok/s 可放入統一記憶體 UD-Q6_K_XL≈10.3 tok/s 可放入 RAM(CPU) UD-Q6_K_XL≈23 tok/s 可放入 RAM(CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s 可放入顯示記憶體 Q8_0≈25 tok/s 可放入顯示記憶體 Q8_0≈80 tok/s 可放入顯示記憶體 Q8_0≈87 tok/s 可放入顯示記憶體 Q8_0≈154 tok/s 可放入顯示記憶體 Q8_0≈154 tok/s 可放入顯示記憶體 Q8_0≈62 tok/s 可放入顯示記憶體 Q8_0≈50 tok/s 可放入顯示記憶體 Q8_0≈42 tok/s 可放入顯示記憶體 Q8_0≈41 tok/s 可放入統一記憶體 Q8_0≈62 tok/s 可放入統一記憶體 Q8_0≈19.2 tok/s 可放入統一記憶體 Q8_0≈21 tok/s 可放入統一記憶體 UD-Q6_K_XL≈10.2 tok/s 可放入 RAM(CPU) Q8_0≈21 tok/s 可放入 RAM(CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s 可放入顯示記憶體 Q8_0≈17.8 tok/s 可放入顯示記憶體 Q8_0≈58 tok/s 可放入顯示記憶體 Q8_0≈62 tok/s 可放入顯示記憶體 Q8_0≈111 tok/s 可放入顯示記憶體 Q8_0≈111 tok/s 可放入顯示記憶體 Q8_0≈44 tok/s 可放入顯示記憶體 Q8_0≈36 tok/s 可放入顯示記憶體 Q8_0≈30 tok/s 可放入顯示記憶體 Q8_0≈30 tok/s 可放入統一記憶體 Q8_0≈44 tok/s 可放入統一記憶體 Q8_0≈13.8 tok/s 可放入統一記憶體 Q8_0≈14.8 tok/s 可放入統一記憶體 Q4_1≈10.2 tok/s 可放入 RAM(CPU) Q8_0≈17.1 tok/s 可放入 RAM(CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s 可放入顯示記憶體 Q6_K≈18.0 tok/s 可放入顯示記憶體 Q8_0≈46 tok/s 可放入顯示記憶體 Q8_0≈49 tok/s 可放入顯示記憶體 Q8_0≈88 tok/s 可放入顯示記憶體 Q8_0≈88 tok/s 可放入顯示記憶體 Q8_0≈35 tok/s 可放入顯示記憶體 Q8_0≈29 tok/s 可放入顯示記憶體 Q8_0≈24 tok/s 可放入顯示記憶體 Q8_0≈23 tok/s 可放入統一記憶體 Q8_0≈35 tok/s 可放入統一記憶體 Q8_0≈10.9 tok/s 可放入統一記憶體 Q8_0≈11.7 tok/s 可放入統一記憶體 UD-Q3_K_XL≈10.1 tok/s 可放入 RAM(CPU) Q8_0≈14.6 tok/s 可放入 RAM(CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s 需卸載至 RAM 執行 MXFP4≈55 tok/s 可放入顯示記憶體 MXFP4162 tok/s實測 可放入顯示記憶體 MXFP4≈194 tok/s 可放入顯示記憶體 MXFP4≈344 tok/s 可放入顯示記憶體 MXFP4≈344 tok/s 可放入顯示記憶體 MXFP4≈138 tok/s 可放入顯示記憶體 MXFP4≈112 tok/s 可放入顯示記憶體 MXFP4≈95 tok/s 可放入顯示記憶體 MXFP4≈80 tok/s 可放入統一記憶體 MXFP4116 tok/s實測 可放入統一記憶體 MXFP4≈59 tok/s 可放入統一記憶體 MXFP4≈62 tok/s 可放入統一記憶體 MXFP4≈17.2 tok/s 可放入 RAM(CPU) MXFP4≈39 tok/s 可放入 RAM(CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10.2 tok/s 需卸載至 RAM 執行 UD-Q3_K_XL≈18.4 tok/s 可放入顯示記憶體 Q6_K≈37 tok/s 可放入顯示記憶體 Q6_K≈40 tok/s 可放入顯示記憶體 Q8_0≈56 tok/s 可放入顯示記憶體 Q8_0≈56 tok/s 可放入顯示記憶體 Q8_0≈22 tok/s 可放入顯示記憶體 Q8_0≈18.2 tok/s 可放入顯示記憶體 Q8_0≈15.3 tok/s 可放入顯示記憶體 Q8_0≈14.9 tok/s 可放入統一記憶體 Q8_0≈22 tok/s 可放入統一記憶體 Q5_K_M≈10.3 tok/s 可放入統一記憶體 Q5_K_M≈11.0 tok/s 可放入統一記憶體 Q4_K_M≈6.9 tok/s 可放入 RAM(CPU) Q8_0≈10.3 tok/s 可放入 RAM(CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14.7 tok/s 需卸載至 RAM 執行 UD-Q3_K_M≈56 tok/s 可放入顯示記憶體 UD-Q5_K_S≈129 tok/s 可放入顯示記憶體 UD-Q5_K_S≈139 tok/s 可放入顯示記憶體 UD-Q8_K_XL≈173 tok/s 可放入顯示記憶體 UD-Q8_K_XL≈173 tok/s 可放入顯示記憶體 UD-Q8_K_XL≈70 tok/s 可放入顯示記憶體 UD-Q8_K_XL≈57 tok/s 可放入顯示記憶體 UD-Q8_K_XL≈48 tok/s 可放入顯示記憶體 UD-Q8_K_XL≈40 tok/s 可放入統一記憶體 UD-Q8_K_XL≈60 tok/s 可放入統一記憶體 UD-Q8_K_XL≈29 tok/s 可放入統一記憶體 UD-Q8_K_XL≈31 tok/s 可放入統一記憶體 UD-Q8_K_XL≈13.7 tok/s 可放入 RAM(CPU) UD-Q8_K_XL≈31 tok/s 可放入 RAM(CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12.7 tok/s 需卸載至 RAM 執行 Q3_K_S≈18.1 tok/s 可放入顯示記憶體 UD-Q5_K_XL≈38 tok/s 可放入顯示記憶體 UD-Q5_K_XL≈41 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈59 tok/s 可放入顯示記憶體 Q8_0≈49 tok/s 可放入顯示記憶體 Q8_0≈19.7 tok/s 可放入顯示記憶體 Q8_0≈16.0 tok/s 可放入顯示記憶體 Q8_0≈13.5 tok/s 可放入顯示記憶體 Q8_0≈13.1 tok/s 可放入統一記憶體 Q8_0≈19.6 tok/s 可放入統一記憶體 Q4_1≈10.1 tok/s 可放入統一記憶體 Q4_1≈10.8 tok/s 可放入統一記憶體 Q4_K_M≈6.3 tok/s 可放入 RAM(CPU) UD-Q6_K_XL≈10.8 tok/s 可放入 RAM(CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16.4 tok/s 需卸載至 RAM 執行 Q3_K_S≈66 tok/s 可放入顯示記憶體 Q4_K_M154 tok/s實測 可放入顯示記憶體 Q5_K_S≈158 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈232 tok/s 可放入顯示記憶體 Q8_0≈192 tok/s 可放入顯示記憶體 Q8_0≈77 tok/s 可放入顯示記憶體 Q8_0≈63 tok/s 可放入顯示記憶體 Q8_0≈53 tok/s 可放入顯示記憶體 Q8_0≈45 tok/s 可放入統一記憶體 Q8_0≈67 tok/s 可放入統一記憶體 Q8_0≈33 tok/s 可放入統一記憶體 Q8_0≈35 tok/s 可放入統一記憶體 Q8_0≈14.3 tok/s 可放入 RAM(CPU) Q8_0≈32 tok/s 可放入 RAM(CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3.8 tok/s 需卸載至 RAM 執行 Q3_K_S≈10.4 tok/s 需卸載至 RAM 執行 Q4_1≈37 tok/s 可放入顯示記憶體 Q4_1≈40 tok/s 可放入顯示記憶體 Q6_K≈55 tok/s 可放入顯示記憶體 Q8_0≈43 tok/s 可放入顯示記憶體 Q8_0≈17.1 tok/s 可放入顯示記憶體 Q8_0≈13.9 tok/s 可放入顯示記憶體 Q8_0≈11.7 tok/s 可放入顯示記憶體 Q8_0≈11.3 tok/s 可放入統一記憶體 Q8_0≈17.0 tok/s 可放入統一記憶體 IQ4_XS≈10.3 tok/s 可放入統一記憶體 Q4_K_S≈10.3 tok/s 可放入統一記憶體 Q4_K_M≈5.7 tok/s 可放入 RAM(CPU) Q6_K≈10.1 tok/s 可放入 RAM(CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3.7 tok/s 需卸載至 RAM 執行 UD-IQ3_XXS≈14.1 tok/s 需卸載至 RAM 執行 UD-Q4_K_XL≈35 tok/s 可放入顯示記憶體 UD-Q4_K_XL≈38 tok/s 可放入顯示記憶體 Q6_K≈51 tok/s 可放入顯示記憶體 Q8_0≈40 tok/s 可放入顯示記憶體 Q8_0≈16.0 tok/s 可放入顯示記憶體 Q8_0≈13.0 tok/s 可放入顯示記憶體 Q8_0≈11.0 tok/s 可放入顯示記憶體 Q8_0≈10.6 tok/s 可放入統一記憶體 Q8_0≈16.0 tok/s 可放入統一記憶體 UD-Q3_K_XL≈10.3 tok/s 可放入統一記憶體 IQ4_XS≈10.2 tok/s 可放入統一記憶體 Q4_K_M≈5.4 tok/s 可放入 RAM(CPU) Q5_K_M≈10.8 tok/s 可放入 RAM(CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17.9 tok/s 需卸載至 RAM 執行 Q8_0≈18.7 tok/s 需卸載至 RAM 執行 Q4_K_S≈191 tok/s 可放入顯示記憶體 Q4_K_S≈205 tok/s 可放入顯示記憶體 Q6_K≈274 tok/s 可放入顯示記憶體 Q8_0≈220 tok/s 可放入顯示記憶體 Q8_0≈89 tok/s 可放入顯示記憶體 Q8_0≈72 tok/s 可放入顯示記憶體 Q8_0≈61 tok/s 可放入顯示記憶體 Q8_0≈51 tok/s 可放入統一記憶體 Q8_0≈77 tok/s 可放入統一記憶體 Q8_0≈37 tok/s 可放入統一記憶體 Q8_0≈40 tok/s 可放入統一記憶體 Q8_0≈15.0 tok/s 可放入 RAM(CPU) Q8_0≈34 tok/s 可放入 RAM(CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1.3 tok/s 需卸載至 RAM 執行 Q4_K_M≈1.4 tok/s 需卸載至 RAM 執行 Q4_K_M≈2.0 tok/s 需卸載至 RAM 執行 Q4_K_M≈2.0 tok/s 需卸載至 RAM 執行 UD-IQ3_XXS≈49 tok/s 可放入顯示記憶體 Q8_0≈18.8 tok/s 可放入顯示記憶體 Q4_K_M16.3 tok/s實測 可放入顯示記憶體 Q4_1≈10.3 tok/s 可放入顯示記憶體 IQ4_XS≈10.0 tok/s 可放入顯示記憶體 UD-Q3_K_XL≈10.6 tok/s 可放入統一記憶體 Q5_K_M≈11.2 tok/s 可放入統一記憶體 Q4_K_M≈4.1 tok/s 可放入統一記憶體 Q4_K_M≈4.4 tok/s 可放入統一記憶體 Q4_K_M≈2.9 tok/s 可放入 RAM(CPU) Q4_K_M≈6.6 tok/s 可放入 RAM(CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s 需卸載至 RAM 執行 Q6_K≈21 tok/s 需卸載至 RAM 執行 UD-Q6_K_XL≈26 tok/s 需卸載至 RAM 執行 UD-Q6_K_XL≈26 tok/s 需卸載至 RAM 執行 UD-Q6_K_XL≈31 tok/s 需卸載至 RAM 執行 Q8_0≈213 tok/s 可放入顯示記憶體 Q4_K_S≈145 tok/s 可放入顯示記憶體 UD-Q6_K_XL≈84 tok/s 可放入顯示記憶體 Q8_0≈59 tok/s 可放入顯示記憶體 Q8_0≈49 tok/s 可放入統一記憶體 Q8_0≈74 tok/s 可放入統一記憶體 Q8_0≈36 tok/s 可放入統一記憶體 Q8_0≈39 tok/s 可放入統一記憶體 Q8_0≈14.8 tok/s 可放入 RAM(CPU) Q8_0≈33 tok/s 可放入 RAM(CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5.3 tok/s 需卸載至 RAM 執行 Q4_K_S≈5.1 tok/s 需卸載至 RAM 執行 Q4_K_M≈5.6 tok/s 需卸載至 RAM 執行 Q4_K_M≈5.7 tok/s 需卸載至 RAM 執行 Q3_K_M≈10.2 tok/s 需卸載至 RAM 執行 Q5_K_M≈55 tok/s 可放入顯示記憶體 Q4_0≈10.0 tok/s 需卸載至 RAM 執行 UD-Q4_K_XL≈22 tok/s 可放入顯示記憶體 Q5_K_M≈15.2 tok/s 可放入顯示記憶體 Q5_K_M≈12.8 tok/s 可放入統一記憶體 Q8_0≈13.9 tok/s 可放入統一記憶體 Q4_K_M≈10.6 tok/s 可放入統一記憶體 Q5_K_M≈10.0 tok/s 可放入統一記憶體 Q4_K_M≈8.0 tok/s 可放入 RAM(CPU) Q8_0≈13.1 tok/s 可放入 RAM(CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19.1 tok/s 需卸載至 RAM 執行 MXFP4≈19.6 tok/s 需卸載至 RAM 執行 MXFP426–28 tok/s實測 需卸載至 RAM 執行 MXFP4≈25 tok/s 需卸載至 RAM 執行 MXFP4≈31 tok/s 需卸載至 RAM 執行 MXFP4≈258 tok/s 可放入顯示記憶體 MXFP4≈36 tok/s 需卸載至 RAM 執行 MXFP441–73 tok/s實測 可放入顯示記憶體 MXFP4≈71 tok/s 可放入顯示記憶體 MXFP4≈60 tok/s 可放入統一記憶體 MXFP4≈90 tok/s 可放入統一記憶體 MXFP450 tok/s實測 可放入統一記憶體 MXFP461 tok/s實測 可放入統一記憶體 MXFP4≈15.8 tok/s 可放入 RAM(CPU) MXFP4≈36 tok/s 可放入 RAM(CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10.5 tok/s 需卸載至 RAM 執行 UD-IQ4_NL≈10.8 tok/s 需卸載至 RAM 執行 Q4_K_S≈11.1 tok/s 需卸載至 RAM 執行 Q4_K_S≈11.2 tok/s 需卸載至 RAM 執行 UD-Q4_K_XL≈11.9 tok/s 需卸載至 RAM 執行 UD-Q5_K_XL≈97 tok/s 可放入顯示記憶體 UD-IQ3_XXS≈76 tok/s 可放入顯示記憶體 UD-IQ4_NL≈46 tok/s 可放入顯示記憶體 UD-Q5_K_XL≈27 tok/s 可放入顯示記憶體 UD-Q5_K_XL≈23 tok/s 可放入統一記憶體 Q8_0≈24 tok/s 可放入統一記憶體 Q6_K≈15.1 tok/s 可放入統一記憶體 Q6_K≈16.1 tok/s 可放入統一記憶體 UD-Q5_K_XL≈10.4 tok/s 可放入 RAM(CPU) Q8_0≈19.3 tok/s 可放入 RAM(CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 UD-Q4_K_XL≈10.8 tok/s 需卸載至 RAM 執行 UD-Q2_K_XL≈8.0 tok/s高度壓縮 需卸載至 RAM 執行 Q3_K_M≈6.1 tok/s 需卸載至 RAM 執行 UD-Q3_K_XL≈11.7 tok/s 需卸載至 RAM 執行 UD-Q2_K_XL≈19.4 tok/s高度壓縮 可放入統一記憶體 Q8_0≈10.8 tok/s 可放入統一記憶體 UD-Q3_K_XL≈12.2 tok/s 可放入統一記憶體 UD-Q3_K_XL≈13.0 tok/s 可放入統一記憶體 Q4_K_M≈7.2 tok/s 可放入 RAM(CPU) Q8_0≈10.9 tok/s 可放入 RAM(CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 UD-IQ3_XXS≈7.3 tok/s 需卸載至 RAM 執行 UD-IQ1_S≈5.6 tok/s高度壓縮 需卸載至 RAM 執行 UD-IQ2_XXS≈4.7 tok/s高度壓縮 需卸載至 RAM 執行 UD-IQ3_XXS≈3.5 tok/s 需卸載至 RAM 執行 UD-TQ1_0≈16.2 tok/s高度壓縮 可放入統一記憶體 Q4_1≈10.0 tok/s 可放入統一記憶體 UD-IQ1_M≈9.6 tok/s高度壓縮 可放入統一記憶體 UD-IQ1_M≈10.3 tok/s高度壓縮 可放入統一記憶體 Q4_K_M≈4.7 tok/s 可放入 RAM(CPU) Q4_1≈10.2 tok/s 可放入 RAM(CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 UD-IQ1_S≈16.9 tok/s高度壓縮 需卸載至 RAM 執行 ✕ 放不下 ✕ 放不下 UD-IQ1_S≈8.0 tok/s高度壓縮 需卸載至 RAM 執行 ✕ 放不下 Q3_K_M≈14.9 tok/s 可放入統一記憶體 ✕ 放不下 ✕ 放不下 Q4_K_M≈5.2 tok/s 可放入 RAM(CPU) Q3_K_M≈13.9 tok/s 可放入 RAM(CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 ✕ 放不下 UD-Q2_K_XL≈22 tok/s高度壓縮 可放入統一記憶體 ✕ 放不下 ✕ 放不下 Q3_K_S≈7.2 tok/s 可放入 RAM(CPU) UD-IQ2_XXS≈19.7 tok/s高度壓縮 可放入 RAM(CPU)

各記憶體容量能解鎖什麼(上下文 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B 高度壓縮: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B 高度壓縮: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B 高度壓縮: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B 高度壓縮: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B 高度壓縮: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b 高度壓縮: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 高度壓縮: DeepSeek R1
  9. 256 GB 高度壓縮: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ 為 8K 上下文的估算值:權重 + KV 快取 + 執行環境額外開銷,對照記憶體容量;速度依記憶體頻寬推算。實際數字取決於執行環境與設定。

更新日期 · 來源: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

嵌入你的網站

將此程式碼貼在資訊圖表要顯示的位置:它會自動更新。可免費使用 — 請保留出處連結。

JSON 我們的資料:CC BY 4.0,須附來源連結;第三方資料沿用其來源的授權。

先看懂矩陣

列是知名的開放權重模型,參數量約從 3B 到 1T;欄是顯示卡、多 GPU 配置、Apple 與 AMD 的統一記憶體機器,以及 CPU 伺服器。每個格子標出建議的量化、模型放在哪裡,以及大約的生成速度(token/秒)。位置分為顯示記憶體(VRAM)、統一記憶體、伺服器 RAM、卸載至 RAM,或放不下。卸載至 RAM 代表模型有一部分在系統記憶體裡,能跑但會變慢。

三步驟估算

  1. 算記憶體:權重(參數量 × 每個權重的位元數,或量化檔案的實際大小)加上上下文所需的 KV 快取,再加約 1.5 GB 的執行時額外負擔;VLM 還要加上視覺投影器。矩陣以 8192 token 的上下文計算,長上下文可能吃掉相當於一個小模型的記憶體。
  2. 算速度:生成速度約等於記憶體頻寬除以每個 token 讀取的位元組數。MoE 模型只讀取活躍參數,所以大型 MoE 可能比較小的稠密模型更快。
  3. 選量化:在維持每秒至少 10 個 token 的前提下,選到 Q8_0 為止的最大量化,否則改用 Q4 等級;不使用 BF16,低於 Q3 只在沒有更大的放得下時才標為「高度壓縮」。模型檔案多半是 GGUF 格式。

計算器可以自訂模型、量化、上下文與硬體(或自己的顯示記憶體、RAM 和記憶體頻寬),並把權重、KV 快取與額外負擔畫成長條,和記憶體容量對照。另有一張階梯圖,列出 8、12、16、24、48、96、128 GB 各能執行什麼。

估算的可信度

標 ≈ 的是估算值;有實測的格子會顯示測量值與來源連結。估算已用實測校準,誤差大致在 ±35% 以內,但實際速度仍取決於執行環境、驅動程式與設定。估算只含生成,不含讀取長提示的處理。沒有安全過濾的模型預設隱藏,需打開開關才會顯示。