โมเดลเปิดตัวไหนใส่ฮาร์ดแวร์ของคุณได้ — 2026
โมเดล open-weights เทียบกับการ์ดจอและคอมพิวเตอร์ยอดนิยม: ควอนไทเซชันที่แนะนำ (ระดับใหญ่สุดไม่เกิน Q8 ที่ยังได้ 10 โทเค็นต่อวินาทีขึ้นไป มิฉะนั้นเป็นระดับ Q4 และต่ำกว่า Q3 เฉพาะเมื่อไม่มีอย่างอื่นใส่ได้) ตำแหน่งที่รัน (หน่วยความจำการ์ดจอ หน่วยความจำรวม หรือย้ายบางส่วนไปที่ RAM) และความเร็วในการสร้างโดยประมาณ
| โมเดล | พารามิเตอร์ | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈84 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈67 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈218 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈235 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈417 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈417 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈168 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈136 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈115 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈111 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈167 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈52 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈56 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈15.0 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈34 tok/s ใส่ใน RAM ได้ (CPU) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈74 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈59 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈192 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈207 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈368 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈368 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈148 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈120 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈101 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈98 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈147 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈46 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈49 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈14.3 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈32 tok/s ใส่ใน RAM ได้ (CPU) |
| Gemma 3 4B HF | 4.3B | Q8_0≈67 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈54 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈175 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈189 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈335 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈335 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈135 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈109 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈92 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈89 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈134 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈42 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈45 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈13.8 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈31 tok/s ใส่ใน RAM ได้ (CPU) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈37 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈29 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈95 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈103 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈182 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈182 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈73 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈59 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈50 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈49 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q6_K_XL≈73 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q6_K_XL≈23 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q6_K_XL≈24 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q6_K_XL≈10.3 tok/s ใส่ใน RAM ได้ (CPU) | UD-Q6_K_XL≈23 tok/s ใส่ใน RAM ได้ (CPU) |
| Qwen3 8B HF | 8.2B | Q8_0≈31 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈25 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈80 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈87 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈154 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈154 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈62 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈50 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈42 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈41 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈62 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈19.2 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈21 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q6_K_XL≈10.2 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈21 tok/s ใส่ใน RAM ได้ (CPU) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈32 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈17.8 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈58 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈62 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈111 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈111 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈44 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈36 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈30 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈30 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈44 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈13.8 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈14.8 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_1≈10.2 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈17.1 tok/s ใส่ใน RAM ได้ (CPU) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈30 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q6_K≈18.0 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈46 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈49 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈88 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈88 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈35 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈29 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈24 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈23 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈35 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈10.9 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈11.7 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q3_K_XL≈10.1 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈14.6 tok/s ใส่ใน RAM ได้ (CPU) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈53 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | MXFP4≈55 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4162 tok/sวัดจริง ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4≈194 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4≈344 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4≈344 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4≈138 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4≈112 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4≈95 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4≈80 tok/s ใส่ในหน่วยความจำรวมได้ | MXFP4116 tok/sวัดจริง ใส่ในหน่วยความจำรวมได้ | MXFP4≈59 tok/s ใส่ในหน่วยความจำรวมได้ | MXFP4≈62 tok/s ใส่ในหน่วยความจำรวมได้ | MXFP4≈17.2 tok/s ใส่ใน RAM ได้ (CPU) | MXFP4≈39 tok/s ใส่ใน RAM ได้ (CPU) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈10.2 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q3_K_XL≈18.4 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q6_K≈37 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q6_K≈40 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈56 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈56 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈22 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈18.2 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈15.3 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈14.9 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈22 tok/s ใส่ในหน่วยความจำรวมได้ | Q5_K_M≈10.3 tok/s ใส่ในหน่วยความจำรวมได้ | Q5_K_M≈11.0 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈6.9 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈10.3 tok/s ใส่ใน RAM ได้ (CPU) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈14.7 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q3_K_M≈56 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q5_K_S≈129 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q5_K_S≈139 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q8_K_XL≈173 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q8_K_XL≈173 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q8_K_XL≈70 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q8_K_XL≈57 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q8_K_XL≈48 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q8_K_XL≈40 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q8_K_XL≈60 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q8_K_XL≈29 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q8_K_XL≈31 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q8_K_XL≈13.7 tok/s ใส่ใน RAM ได้ (CPU) | UD-Q8_K_XL≈31 tok/s ใส่ใน RAM ได้ (CPU) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈12.7 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q3_K_S≈18.1 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q5_K_XL≈38 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q5_K_XL≈41 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈59 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈49 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈19.7 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈16.0 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈13.5 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈13.1 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈19.6 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_1≈10.1 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_1≈10.8 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈6.3 tok/s ใส่ใน RAM ได้ (CPU) | UD-Q6_K_XL≈10.8 tok/s ใส่ใน RAM ได้ (CPU) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈16.4 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q3_K_S≈66 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q4_K_M154 tok/sวัดจริง ใส่ในหน่วยความจำการ์ดจอได้ | Q5_K_S≈158 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈232 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈192 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈77 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈63 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈53 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈45 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈67 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈33 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈35 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈14.3 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈32 tok/s ใส่ใน RAM ได้ (CPU) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈3.8 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q3_K_S≈10.4 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q4_1≈37 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q4_1≈40 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q6_K≈55 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈43 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈17.1 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈13.9 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈11.7 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈11.3 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈17.0 tok/s ใส่ในหน่วยความจำรวมได้ | IQ4_XS≈10.3 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_S≈10.3 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈5.7 tok/s ใส่ใน RAM ได้ (CPU) | Q6_K≈10.1 tok/s ใส่ใน RAM ได้ (CPU) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈3.7 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-IQ3_XXS≈14.1 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q4_K_XL≈35 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q4_K_XL≈38 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q6_K≈51 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈40 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈16.0 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈13.0 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈11.0 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈10.6 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈16.0 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q3_K_XL≈10.3 tok/s ใส่ในหน่วยความจำรวมได้ | IQ4_XS≈10.2 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈5.4 tok/s ใส่ใน RAM ได้ (CPU) | Q5_K_M≈10.8 tok/s ใส่ใน RAM ได้ (CPU) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈17.9 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q8_0≈18.7 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q4_K_S≈191 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q4_K_S≈205 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q6_K≈274 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈220 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈89 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈72 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈61 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈51 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈77 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈37 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈40 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈15.0 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈34 tok/s ใส่ใน RAM ได้ (CPU) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈1.3 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q4_K_M≈1.4 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q4_K_M≈2.0 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q4_K_M≈2.0 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-IQ3_XXS≈49 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈18.8 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q4_K_M16.3 tok/sวัดจริง ใส่ในหน่วยความจำการ์ดจอได้ | Q4_1≈10.3 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | IQ4_XS≈10.0 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q3_K_XL≈10.6 tok/s ใส่ในหน่วยความจำรวมได้ | Q5_K_M≈11.2 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈4.1 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈4.4 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈2.9 tok/s ใส่ใน RAM ได้ (CPU) | Q4_K_M≈6.6 tok/s ใส่ใน RAM ได้ (CPU) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈24 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q6_K≈21 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q6_K_XL≈26 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q6_K_XL≈26 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q6_K_XL≈31 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q8_0≈213 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q4_K_S≈145 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q6_K_XL≈84 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈59 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q8_0≈49 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈74 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈36 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈39 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈14.8 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈33 tok/s ใส่ใน RAM ได้ (CPU) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈5.3 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q4_K_S≈5.1 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q4_K_M≈5.6 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q4_K_M≈5.7 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q3_K_M≈10.2 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q5_K_M≈55 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q4_0≈10.0 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q4_K_XL≈22 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q5_K_M≈15.2 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | Q5_K_M≈12.8 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈13.9 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈10.6 tok/s ใส่ในหน่วยความจำรวมได้ | Q5_K_M≈10.0 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈8.0 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈13.1 tok/s ใส่ใน RAM ได้ (CPU) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈19.1 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | MXFP4≈19.6 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | MXFP426–28 tok/sวัดจริง รันได้โดยย้ายบางส่วนไปที่ RAM | MXFP4≈25 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | MXFP4≈31 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | MXFP4≈258 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4≈36 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | MXFP441–73 tok/sวัดจริง ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4≈71 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | MXFP4≈60 tok/s ใส่ในหน่วยความจำรวมได้ | MXFP4≈90 tok/s ใส่ในหน่วยความจำรวมได้ | MXFP450 tok/sวัดจริง ใส่ในหน่วยความจำรวมได้ | MXFP461 tok/sวัดจริง ใส่ในหน่วยความจำรวมได้ | MXFP4≈15.8 tok/s ใส่ใน RAM ได้ (CPU) | MXFP4≈36 tok/s ใส่ใน RAM ได้ (CPU) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈10.5 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-IQ4_NL≈10.8 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q4_K_S≈11.1 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | Q4_K_S≈11.2 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q4_K_XL≈11.9 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q5_K_XL≈97 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-IQ3_XXS≈76 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-IQ4_NL≈46 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q5_K_XL≈27 tok/s ใส่ในหน่วยความจำการ์ดจอได้ | UD-Q5_K_XL≈23 tok/s ใส่ในหน่วยความจำรวมได้ | Q8_0≈24 tok/s ใส่ในหน่วยความจำรวมได้ | Q6_K≈15.1 tok/s ใส่ในหน่วยความจำรวมได้ | Q6_K≈16.1 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q5_K_XL≈10.4 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈19.3 tok/s ใส่ใน RAM ได้ (CPU) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | UD-Q4_K_XL≈10.8 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q2_K_XL≈8.0 tok/sบีบอัดสูง รันได้โดยย้ายบางส่วนไปที่ RAM | Q3_K_M≈6.1 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q3_K_XL≈11.7 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-Q2_K_XL≈19.4 tok/sบีบอัดสูง ใส่ในหน่วยความจำรวมได้ | Q8_0≈10.8 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q3_K_XL≈12.2 tok/s ใส่ในหน่วยความจำรวมได้ | UD-Q3_K_XL≈13.0 tok/s ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈7.2 tok/s ใส่ใน RAM ได้ (CPU) | Q8_0≈10.9 tok/s ใส่ใน RAM ได้ (CPU) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | UD-IQ3_XXS≈7.3 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-IQ1_S≈5.6 tok/sบีบอัดสูง รันได้โดยย้ายบางส่วนไปที่ RAM | UD-IQ2_XXS≈4.7 tok/sบีบอัดสูง รันได้โดยย้ายบางส่วนไปที่ RAM | UD-IQ3_XXS≈3.5 tok/s รันได้โดยย้ายบางส่วนไปที่ RAM | UD-TQ1_0≈16.2 tok/sบีบอัดสูง ใส่ในหน่วยความจำรวมได้ | Q4_1≈10.0 tok/s ใส่ในหน่วยความจำรวมได้ | UD-IQ1_M≈9.6 tok/sบีบอัดสูง ใส่ในหน่วยความจำรวมได้ | UD-IQ1_M≈10.3 tok/sบีบอัดสูง ใส่ในหน่วยความจำรวมได้ | Q4_K_M≈4.7 tok/s ใส่ใน RAM ได้ (CPU) | Q4_1≈10.2 tok/s ใส่ใน RAM ได้ (CPU) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | UD-IQ1_S≈16.9 tok/sบีบอัดสูง รันได้โดยย้ายบางส่วนไปที่ RAM | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | UD-IQ1_S≈8.0 tok/sบีบอัดสูง รันได้โดยย้ายบางส่วนไปที่ RAM | ✕ ใส่ไม่ได้ | Q3_K_M≈14.9 tok/s ใส่ในหน่วยความจำรวมได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | Q4_K_M≈5.2 tok/s ใส่ใน RAM ได้ (CPU) | Q3_K_M≈13.9 tok/s ใส่ใน RAM ได้ (CPU) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | UD-Q2_K_XL≈22 tok/sบีบอัดสูง ใส่ในหน่วยความจำรวมได้ | ✕ ใส่ไม่ได้ | ✕ ใส่ไม่ได้ | Q3_K_S≈7.2 tok/s ใส่ใน RAM ได้ (CPU) | UD-IQ2_XXS≈19.7 tok/sบีบอัดสูง ใส่ใน RAM ได้ (CPU) |
เครื่องคิดเลข: ใส่ได้ไหม
สิ่งที่ใช้ได้เพิ่มในแต่ละขนาดหน่วยความจำ (คอนเท็กซ์ 8K)
- 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B บีบอัดสูง: Gemma 3 12B · Qwen3 14B
- 12 GB Gemma 3 12B · Qwen3 14B บีบอัดสูง: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B บีบอัดสูง: Gemma 4 31B · Qwen3.5 35B A3B
- 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B บีบอัดสูง: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B บีบอัดสูง: GLM 4.5 Air
- 96 GB GLM 4.5 Air · gpt-oss-120b บีบอัดสูง: Qwen3 235B A22B · GLM 4.7
- 128 GB Qwen3 235B A22B
- 192 GB GLM 4.7 บีบอัดสูง: DeepSeek R1
- 256 GB บีบอัดสูง: Kimi K2.5
- 512 GB DeepSeek R1 · Kimi K2.5
≈ ค่าประมาณสำหรับคอนเท็กซ์ 8K: น้ำหนัก + KV cache + โอเวอร์เฮดของรันไทม์ เทียบกับหน่วยความจำ ส่วนความเร็วคำนวณจากแบนด์วิดท์หน่วยความจำ ตัวเลขจริงขึ้นอยู่กับรันไทม์และการตั้งค่า
อัปเดตเมื่อ · แหล่งที่มา: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
ฝังบนเว็บไซต์ของคุณ
วางโค้ดนี้ตรงที่ต้องการให้อินโฟกราฟิกปรากฏ: อัปเดตเองอัตโนมัติ ใช้ได้ฟรี — โปรดคงลิงก์อ้างอิงไว้
เมทริกซ์นี้บอกอะไร
แถวคือโมเดลโอเพนเวตที่รู้จักกันดี ขนาดราว 3B ถึง 1T พารามิเตอร์ คอลัมน์คือการ์ดจอ ชุดหลาย GPU เครื่อง Apple และ AMD ที่ใช้หน่วยความจำรวม และเซิร์ฟเวอร์ CPU แต่ละช่องบอกควอนไทซ์ที่แนะนำ ตำแหน่งที่โมเดลอยู่ และความเร็วสร้างข้อความโดยประมาณ (โทเคนต่อวินาที) ตำแหน่งมีห้าแบบ คือหน่วยความจำการ์ดจอ (VRAM) หน่วยความจำรวม RAM ของเซิร์ฟเวอร์ ย้ายบางส่วนไปที่ RAM และใส่ไม่ได้ การย้ายไป RAM หมายถึงโมเดลบางส่วนอยู่ในหน่วยความจำระบบ รันได้แต่ช้าลง
หน่วยความจำคิดอย่างไร
นำน้ำหนัก (จำนวนพารามิเตอร์ × บิตต่อน้ำหนัก หรือขนาดจริงของไฟล์ควอนไทซ์) บวกแคช KV สำหรับคอนเท็กซ์ แล้วบวกส่วนเผื่อของรันไทม์อีกราว 1.5 GB ถ้าเป็น VLM ต้องบวกตัวฉายภาพ (vision projector) ด้วย เมทริกซ์ใช้คอนเท็กซ์ 8192 โทเคน แต่คอนเท็กซ์ยาวอาจกินหน่วยความจำเท่าโมเดลเล็กหนึ่งตัว เครื่องคิดเลขจึงให้คุณเลือกโมเดล ควอนไทซ์ คอนเท็กซ์ และฮาร์ดแวร์ (หรือกรอกหน่วยความจำการ์ดจอ RAM และแบนด์วิดท์ของคุณเอง) แล้วแสดงแท่งน้ำหนัก แคช KV และส่วนเผื่อเทียบกับความจุ นอกจากนี้ยังมีขั้นบันไดที่บอกว่า 8, 12, 16, 24, 48, 96 และ 128 GB รันอะไรได้บ้าง
ความเร็วและควอนไทซ์เลือกอย่างไร
ความเร็วสร้างข้อความใกล้เคียงกับแบนด์วิดท์หน่วยความจำหารด้วยจำนวนไบต์ที่อ่านต่อหนึ่งโทเคน โมเดล MoE อ่านเฉพาะพารามิเตอร์ที่ทำงานอยู่ MoE ขนาดใหญ่จึงอาจเร็วกว่าโมเดลแบบหนาแน่นที่เล็กกว่า ควอนไทซ์ที่แนะนำคือตัวใหญ่สุดไม่เกิน Q8_0 ที่ยังได้อย่างน้อย 10 โทเคนต่อวินาที ถ้าทำไม่ได้ก็ใช้กลุ่ม Q4 ไม่ใช้ BF16 และต่ำกว่า Q3 จะแสดงเป็น “บีบอัดสูง” เฉพาะเมื่อไม่มีตัวที่ใหญ่กว่าใส่ได้ ไฟล์โมเดลส่วนใหญ่อยู่ในรูปแบบ GGUF
ค่าประมาณเชื่อได้แค่ไหน
เครื่องหมาย ≈ คือค่าประมาณ ช่องที่มีผลวัดจริงจะแสดงค่าที่วัดได้พร้อมลิงก์ไปยังแหล่งที่มา ค่าประมาณปรับเทียบกับผลวัดจริงแล้ว และคลาดเคลื่อนราว ±35% แต่ความเร็วจริงขึ้นกับรันไทม์ ไดรเวอร์ และการตั้งค่า ค่าประมาณคิดเฉพาะการสร้างข้อความ ไม่รวมการอ่านพรอมต์ยาว ๆ โมเดลที่ไม่มีตัวกรองความปลอดภัยจะซ่อนไว้จนกว่าจะเปิดสวิตช์