お使いのハードウェアに収まるオープンモデル — 2026
オープンウェイトモデルを人気のグラフィックスカードやコンピューターと照らし合わせます。推奨される量子化(Q8 以下で、毎秒 10 トークン以上を維持できる最大のもの。それが無理なら Q4 クラスで、他に収まらない場合に限り Q3 未満)、動作する場所(グラフィックスメモリ、統合メモリ、または RAM へのオフロード)、おおよその生成速度を示します。
| モデル | パラメータ数 | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈84 tok/s グラフィックスメモリに収まる | Q8_0≈67 tok/s グラフィックスメモリに収まる | Q8_0≈218 tok/s グラフィックスメモリに収まる | Q8_0≈235 tok/s グラフィックスメモリに収まる | Q8_0≈417 tok/s グラフィックスメモリに収まる | Q8_0≈417 tok/s グラフィックスメモリに収まる | Q8_0≈168 tok/s グラフィックスメモリに収まる | Q8_0≈136 tok/s グラフィックスメモリに収まる | Q8_0≈115 tok/s グラフィックスメモリに収まる | Q8_0≈111 tok/s 統合メモリに収まる | Q8_0≈167 tok/s 統合メモリに収まる | Q8_0≈52 tok/s 統合メモリに収まる | Q8_0≈56 tok/s 統合メモリに収まる | Q8_0≈15.0 tok/s RAM に収まる(CPU) | Q8_0≈34 tok/s RAM に収まる(CPU) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈74 tok/s グラフィックスメモリに収まる | Q8_0≈59 tok/s グラフィックスメモリに収まる | Q8_0≈192 tok/s グラフィックスメモリに収まる | Q8_0≈207 tok/s グラフィックスメモリに収まる | Q8_0≈368 tok/s グラフィックスメモリに収まる | Q8_0≈368 tok/s グラフィックスメモリに収まる | Q8_0≈148 tok/s グラフィックスメモリに収まる | Q8_0≈120 tok/s グラフィックスメモリに収まる | Q8_0≈101 tok/s グラフィックスメモリに収まる | Q8_0≈98 tok/s 統合メモリに収まる | Q8_0≈147 tok/s 統合メモリに収まる | Q8_0≈46 tok/s 統合メモリに収まる | Q8_0≈49 tok/s 統合メモリに収まる | Q8_0≈14.3 tok/s RAM に収まる(CPU) | Q8_0≈32 tok/s RAM に収まる(CPU) |
| Gemma 3 4B HF | 4.3B | Q8_0≈67 tok/s グラフィックスメモリに収まる | Q8_0≈54 tok/s グラフィックスメモリに収まる | Q8_0≈175 tok/s グラフィックスメモリに収まる | Q8_0≈189 tok/s グラフィックスメモリに収まる | Q8_0≈335 tok/s グラフィックスメモリに収まる | Q8_0≈335 tok/s グラフィックスメモリに収まる | Q8_0≈135 tok/s グラフィックスメモリに収まる | Q8_0≈109 tok/s グラフィックスメモリに収まる | Q8_0≈92 tok/s グラフィックスメモリに収まる | Q8_0≈89 tok/s 統合メモリに収まる | Q8_0≈134 tok/s 統合メモリに収まる | Q8_0≈42 tok/s 統合メモリに収まる | Q8_0≈45 tok/s 統合メモリに収まる | Q8_0≈13.8 tok/s RAM に収まる(CPU) | Q8_0≈31 tok/s RAM に収まる(CPU) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈37 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈29 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈95 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈103 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈182 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈182 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈73 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈59 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈50 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈49 tok/s 統合メモリに収まる | UD-Q6_K_XL≈73 tok/s 統合メモリに収まる | UD-Q6_K_XL≈23 tok/s 統合メモリに収まる | UD-Q6_K_XL≈24 tok/s 統合メモリに収まる | UD-Q6_K_XL≈10.3 tok/s RAM に収まる(CPU) | UD-Q6_K_XL≈23 tok/s RAM に収まる(CPU) |
| Qwen3 8B HF | 8.2B | Q8_0≈31 tok/s グラフィックスメモリに収まる | Q8_0≈25 tok/s グラフィックスメモリに収まる | Q8_0≈80 tok/s グラフィックスメモリに収まる | Q8_0≈87 tok/s グラフィックスメモリに収まる | Q8_0≈154 tok/s グラフィックスメモリに収まる | Q8_0≈154 tok/s グラフィックスメモリに収まる | Q8_0≈62 tok/s グラフィックスメモリに収まる | Q8_0≈50 tok/s グラフィックスメモリに収まる | Q8_0≈42 tok/s グラフィックスメモリに収まる | Q8_0≈41 tok/s 統合メモリに収まる | Q8_0≈62 tok/s 統合メモリに収まる | Q8_0≈19.2 tok/s 統合メモリに収まる | Q8_0≈21 tok/s 統合メモリに収まる | UD-Q6_K_XL≈10.2 tok/s RAM に収まる(CPU) | Q8_0≈21 tok/s RAM に収まる(CPU) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈32 tok/s グラフィックスメモリに収まる | Q8_0≈17.8 tok/s グラフィックスメモリに収まる | Q8_0≈58 tok/s グラフィックスメモリに収まる | Q8_0≈62 tok/s グラフィックスメモリに収まる | Q8_0≈111 tok/s グラフィックスメモリに収まる | Q8_0≈111 tok/s グラフィックスメモリに収まる | Q8_0≈44 tok/s グラフィックスメモリに収まる | Q8_0≈36 tok/s グラフィックスメモリに収まる | Q8_0≈30 tok/s グラフィックスメモリに収まる | Q8_0≈30 tok/s 統合メモリに収まる | Q8_0≈44 tok/s 統合メモリに収まる | Q8_0≈13.8 tok/s 統合メモリに収まる | Q8_0≈14.8 tok/s 統合メモリに収まる | Q4_1≈10.2 tok/s RAM に収まる(CPU) | Q8_0≈17.1 tok/s RAM に収まる(CPU) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈30 tok/s グラフィックスメモリに収まる | Q6_K≈18.0 tok/s グラフィックスメモリに収まる | Q8_0≈46 tok/s グラフィックスメモリに収まる | Q8_0≈49 tok/s グラフィックスメモリに収まる | Q8_0≈88 tok/s グラフィックスメモリに収まる | Q8_0≈88 tok/s グラフィックスメモリに収まる | Q8_0≈35 tok/s グラフィックスメモリに収まる | Q8_0≈29 tok/s グラフィックスメモリに収まる | Q8_0≈24 tok/s グラフィックスメモリに収まる | Q8_0≈23 tok/s 統合メモリに収まる | Q8_0≈35 tok/s 統合メモリに収まる | Q8_0≈10.9 tok/s 統合メモリに収まる | Q8_0≈11.7 tok/s 統合メモリに収まる | UD-Q3_K_XL≈10.1 tok/s RAM に収まる(CPU) | Q8_0≈14.6 tok/s RAM に収まる(CPU) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈53 tok/s RAM へのオフロードで動作 | MXFP4≈55 tok/s グラフィックスメモリに収まる | MXFP4162 tok/s実測 グラフィックスメモリに収まる | MXFP4≈194 tok/s グラフィックスメモリに収まる | MXFP4≈344 tok/s グラフィックスメモリに収まる | MXFP4≈344 tok/s グラフィックスメモリに収まる | MXFP4≈138 tok/s グラフィックスメモリに収まる | MXFP4≈112 tok/s グラフィックスメモリに収まる | MXFP4≈95 tok/s グラフィックスメモリに収まる | MXFP4≈80 tok/s 統合メモリに収まる | MXFP4116 tok/s実測 統合メモリに収まる | MXFP4≈59 tok/s 統合メモリに収まる | MXFP4≈62 tok/s 統合メモリに収まる | MXFP4≈17.2 tok/s RAM に収まる(CPU) | MXFP4≈39 tok/s RAM に収まる(CPU) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈10.2 tok/s RAM へのオフロードで動作 | UD-Q3_K_XL≈18.4 tok/s グラフィックスメモリに収まる | Q6_K≈37 tok/s グラフィックスメモリに収まる | Q6_K≈40 tok/s グラフィックスメモリに収まる | Q8_0≈56 tok/s グラフィックスメモリに収まる | Q8_0≈56 tok/s グラフィックスメモリに収まる | Q8_0≈22 tok/s グラフィックスメモリに収まる | Q8_0≈18.2 tok/s グラフィックスメモリに収まる | Q8_0≈15.3 tok/s グラフィックスメモリに収まる | Q8_0≈14.9 tok/s 統合メモリに収まる | Q8_0≈22 tok/s 統合メモリに収まる | Q5_K_M≈10.3 tok/s 統合メモリに収まる | Q5_K_M≈11.0 tok/s 統合メモリに収まる | Q4_K_M≈6.9 tok/s RAM に収まる(CPU) | Q8_0≈10.3 tok/s RAM に収まる(CPU) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈14.7 tok/s RAM へのオフロードで動作 | UD-Q3_K_M≈56 tok/s グラフィックスメモリに収まる | UD-Q5_K_S≈129 tok/s グラフィックスメモリに収まる | UD-Q5_K_S≈139 tok/s グラフィックスメモリに収まる | UD-Q8_K_XL≈173 tok/s グラフィックスメモリに収まる | UD-Q8_K_XL≈173 tok/s グラフィックスメモリに収まる | UD-Q8_K_XL≈70 tok/s グラフィックスメモリに収まる | UD-Q8_K_XL≈57 tok/s グラフィックスメモリに収まる | UD-Q8_K_XL≈48 tok/s グラフィックスメモリに収まる | UD-Q8_K_XL≈40 tok/s 統合メモリに収まる | UD-Q8_K_XL≈60 tok/s 統合メモリに収まる | UD-Q8_K_XL≈29 tok/s 統合メモリに収まる | UD-Q8_K_XL≈31 tok/s 統合メモリに収まる | UD-Q8_K_XL≈13.7 tok/s RAM に収まる(CPU) | UD-Q8_K_XL≈31 tok/s RAM に収まる(CPU) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈12.7 tok/s RAM へのオフロードで動作 | Q3_K_S≈18.1 tok/s グラフィックスメモリに収まる | UD-Q5_K_XL≈38 tok/s グラフィックスメモリに収まる | UD-Q5_K_XL≈41 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈59 tok/s グラフィックスメモリに収まる | Q8_0≈49 tok/s グラフィックスメモリに収まる | Q8_0≈19.7 tok/s グラフィックスメモリに収まる | Q8_0≈16.0 tok/s グラフィックスメモリに収まる | Q8_0≈13.5 tok/s グラフィックスメモリに収まる | Q8_0≈13.1 tok/s 統合メモリに収まる | Q8_0≈19.6 tok/s 統合メモリに収まる | Q4_1≈10.1 tok/s 統合メモリに収まる | Q4_1≈10.8 tok/s 統合メモリに収まる | Q4_K_M≈6.3 tok/s RAM に収まる(CPU) | UD-Q6_K_XL≈10.8 tok/s RAM に収まる(CPU) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈16.4 tok/s RAM へのオフロードで動作 | Q3_K_S≈66 tok/s グラフィックスメモリに収まる | Q4_K_M154 tok/s実測 グラフィックスメモリに収まる | Q5_K_S≈158 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈232 tok/s グラフィックスメモリに収まる | Q8_0≈192 tok/s グラフィックスメモリに収まる | Q8_0≈77 tok/s グラフィックスメモリに収まる | Q8_0≈63 tok/s グラフィックスメモリに収まる | Q8_0≈53 tok/s グラフィックスメモリに収まる | Q8_0≈45 tok/s 統合メモリに収まる | Q8_0≈67 tok/s 統合メモリに収まる | Q8_0≈33 tok/s 統合メモリに収まる | Q8_0≈35 tok/s 統合メモリに収まる | Q8_0≈14.3 tok/s RAM に収まる(CPU) | Q8_0≈32 tok/s RAM に収まる(CPU) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈3.8 tok/s RAM へのオフロードで動作 | Q3_K_S≈10.4 tok/s RAM へのオフロードで動作 | Q4_1≈37 tok/s グラフィックスメモリに収まる | Q4_1≈40 tok/s グラフィックスメモリに収まる | Q6_K≈55 tok/s グラフィックスメモリに収まる | Q8_0≈43 tok/s グラフィックスメモリに収まる | Q8_0≈17.1 tok/s グラフィックスメモリに収まる | Q8_0≈13.9 tok/s グラフィックスメモリに収まる | Q8_0≈11.7 tok/s グラフィックスメモリに収まる | Q8_0≈11.3 tok/s 統合メモリに収まる | Q8_0≈17.0 tok/s 統合メモリに収まる | IQ4_XS≈10.3 tok/s 統合メモリに収まる | Q4_K_S≈10.3 tok/s 統合メモリに収まる | Q4_K_M≈5.7 tok/s RAM に収まる(CPU) | Q6_K≈10.1 tok/s RAM に収まる(CPU) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈3.7 tok/s RAM へのオフロードで動作 | UD-IQ3_XXS≈14.1 tok/s RAM へのオフロードで動作 | UD-Q4_K_XL≈35 tok/s グラフィックスメモリに収まる | UD-Q4_K_XL≈38 tok/s グラフィックスメモリに収まる | Q6_K≈51 tok/s グラフィックスメモリに収まる | Q8_0≈40 tok/s グラフィックスメモリに収まる | Q8_0≈16.0 tok/s グラフィックスメモリに収まる | Q8_0≈13.0 tok/s グラフィックスメモリに収まる | Q8_0≈11.0 tok/s グラフィックスメモリに収まる | Q8_0≈10.6 tok/s 統合メモリに収まる | Q8_0≈16.0 tok/s 統合メモリに収まる | UD-Q3_K_XL≈10.3 tok/s 統合メモリに収まる | IQ4_XS≈10.2 tok/s 統合メモリに収まる | Q4_K_M≈5.4 tok/s RAM に収まる(CPU) | Q5_K_M≈10.8 tok/s RAM に収まる(CPU) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈17.9 tok/s RAM へのオフロードで動作 | Q8_0≈18.7 tok/s RAM へのオフロードで動作 | Q4_K_S≈191 tok/s グラフィックスメモリに収まる | Q4_K_S≈205 tok/s グラフィックスメモリに収まる | Q6_K≈274 tok/s グラフィックスメモリに収まる | Q8_0≈220 tok/s グラフィックスメモリに収まる | Q8_0≈89 tok/s グラフィックスメモリに収まる | Q8_0≈72 tok/s グラフィックスメモリに収まる | Q8_0≈61 tok/s グラフィックスメモリに収まる | Q8_0≈51 tok/s 統合メモリに収まる | Q8_0≈77 tok/s 統合メモリに収まる | Q8_0≈37 tok/s 統合メモリに収まる | Q8_0≈40 tok/s 統合メモリに収まる | Q8_0≈15.0 tok/s RAM に収まる(CPU) | Q8_0≈34 tok/s RAM に収まる(CPU) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈1.3 tok/s RAM へのオフロードで動作 | Q4_K_M≈1.4 tok/s RAM へのオフロードで動作 | Q4_K_M≈2.0 tok/s RAM へのオフロードで動作 | Q4_K_M≈2.0 tok/s RAM へのオフロードで動作 | UD-IQ3_XXS≈49 tok/s グラフィックスメモリに収まる | Q8_0≈18.8 tok/s グラフィックスメモリに収まる | Q4_K_M16.3 tok/s実測 グラフィックスメモリに収まる | Q4_1≈10.3 tok/s グラフィックスメモリに収まる | IQ4_XS≈10.0 tok/s グラフィックスメモリに収まる | UD-Q3_K_XL≈10.6 tok/s 統合メモリに収まる | Q5_K_M≈11.2 tok/s 統合メモリに収まる | Q4_K_M≈4.1 tok/s 統合メモリに収まる | Q4_K_M≈4.4 tok/s 統合メモリに収まる | Q4_K_M≈2.9 tok/s RAM に収まる(CPU) | Q4_K_M≈6.6 tok/s RAM に収まる(CPU) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈24 tok/s RAM へのオフロードで動作 | Q6_K≈21 tok/s RAM へのオフロードで動作 | UD-Q6_K_XL≈26 tok/s RAM へのオフロードで動作 | UD-Q6_K_XL≈26 tok/s RAM へのオフロードで動作 | UD-Q6_K_XL≈31 tok/s RAM へのオフロードで動作 | Q8_0≈213 tok/s グラフィックスメモリに収まる | Q4_K_S≈145 tok/s グラフィックスメモリに収まる | UD-Q6_K_XL≈84 tok/s グラフィックスメモリに収まる | Q8_0≈59 tok/s グラフィックスメモリに収まる | Q8_0≈49 tok/s 統合メモリに収まる | Q8_0≈74 tok/s 統合メモリに収まる | Q8_0≈36 tok/s 統合メモリに収まる | Q8_0≈39 tok/s 統合メモリに収まる | Q8_0≈14.8 tok/s RAM に収まる(CPU) | Q8_0≈33 tok/s RAM に収まる(CPU) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈5.3 tok/s RAM へのオフロードで動作 | Q4_K_S≈5.1 tok/s RAM へのオフロードで動作 | Q4_K_M≈5.6 tok/s RAM へのオフロードで動作 | Q4_K_M≈5.7 tok/s RAM へのオフロードで動作 | Q3_K_M≈10.2 tok/s RAM へのオフロードで動作 | Q5_K_M≈55 tok/s グラフィックスメモリに収まる | Q4_0≈10.0 tok/s RAM へのオフロードで動作 | UD-Q4_K_XL≈22 tok/s グラフィックスメモリに収まる | Q5_K_M≈15.2 tok/s グラフィックスメモリに収まる | Q5_K_M≈12.8 tok/s 統合メモリに収まる | Q8_0≈13.9 tok/s 統合メモリに収まる | Q4_K_M≈10.6 tok/s 統合メモリに収まる | Q5_K_M≈10.0 tok/s 統合メモリに収まる | Q4_K_M≈8.0 tok/s RAM に収まる(CPU) | Q8_0≈13.1 tok/s RAM に収まる(CPU) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈19.1 tok/s RAM へのオフロードで動作 | MXFP4≈19.6 tok/s RAM へのオフロードで動作 | MXFP426–28 tok/s実測 RAM へのオフロードで動作 | MXFP4≈25 tok/s RAM へのオフロードで動作 | MXFP4≈31 tok/s RAM へのオフロードで動作 | MXFP4≈258 tok/s グラフィックスメモリに収まる | MXFP4≈36 tok/s RAM へのオフロードで動作 | MXFP441–73 tok/s実測 グラフィックスメモリに収まる | MXFP4≈71 tok/s グラフィックスメモリに収まる | MXFP4≈60 tok/s 統合メモリに収まる | MXFP4≈90 tok/s 統合メモリに収まる | MXFP450 tok/s実測 統合メモリに収まる | MXFP461 tok/s実測 統合メモリに収まる | MXFP4≈15.8 tok/s RAM に収まる(CPU) | MXFP4≈36 tok/s RAM に収まる(CPU) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈10.5 tok/s RAM へのオフロードで動作 | UD-IQ4_NL≈10.8 tok/s RAM へのオフロードで動作 | Q4_K_S≈11.1 tok/s RAM へのオフロードで動作 | Q4_K_S≈11.2 tok/s RAM へのオフロードで動作 | UD-Q4_K_XL≈11.9 tok/s RAM へのオフロードで動作 | UD-Q5_K_XL≈97 tok/s グラフィックスメモリに収まる | UD-IQ3_XXS≈76 tok/s グラフィックスメモリに収まる | UD-IQ4_NL≈46 tok/s グラフィックスメモリに収まる | UD-Q5_K_XL≈27 tok/s グラフィックスメモリに収まる | UD-Q5_K_XL≈23 tok/s 統合メモリに収まる | Q8_0≈24 tok/s 統合メモリに収まる | Q6_K≈15.1 tok/s 統合メモリに収まる | Q6_K≈16.1 tok/s 統合メモリに収まる | UD-Q5_K_XL≈10.4 tok/s RAM に収まる(CPU) | Q8_0≈19.3 tok/s RAM に収まる(CPU) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | UD-Q4_K_XL≈10.8 tok/s RAM へのオフロードで動作 | UD-Q2_K_XL≈8.0 tok/s高圧縮 RAM へのオフロードで動作 | Q3_K_M≈6.1 tok/s RAM へのオフロードで動作 | UD-Q3_K_XL≈11.7 tok/s RAM へのオフロードで動作 | UD-Q2_K_XL≈19.4 tok/s高圧縮 統合メモリに収まる | Q8_0≈10.8 tok/s 統合メモリに収まる | UD-Q3_K_XL≈12.2 tok/s 統合メモリに収まる | UD-Q3_K_XL≈13.0 tok/s 統合メモリに収まる | Q4_K_M≈7.2 tok/s RAM に収まる(CPU) | Q8_0≈10.9 tok/s RAM に収まる(CPU) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | UD-IQ3_XXS≈7.3 tok/s RAM へのオフロードで動作 | UD-IQ1_S≈5.6 tok/s高圧縮 RAM へのオフロードで動作 | UD-IQ2_XXS≈4.7 tok/s高圧縮 RAM へのオフロードで動作 | UD-IQ3_XXS≈3.5 tok/s RAM へのオフロードで動作 | UD-TQ1_0≈16.2 tok/s高圧縮 統合メモリに収まる | Q4_1≈10.0 tok/s 統合メモリに収まる | UD-IQ1_M≈9.6 tok/s高圧縮 統合メモリに収まる | UD-IQ1_M≈10.3 tok/s高圧縮 統合メモリに収まる | Q4_K_M≈4.7 tok/s RAM に収まる(CPU) | Q4_1≈10.2 tok/s RAM に収まる(CPU) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | UD-IQ1_S≈16.9 tok/s高圧縮 RAM へのオフロードで動作 | ✕ 収まらない | ✕ 収まらない | UD-IQ1_S≈8.0 tok/s高圧縮 RAM へのオフロードで動作 | ✕ 収まらない | Q3_K_M≈14.9 tok/s 統合メモリに収まる | ✕ 収まらない | ✕ 収まらない | Q4_K_M≈5.2 tok/s RAM に収まる(CPU) | Q3_K_M≈13.9 tok/s RAM に収まる(CPU) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | ✕ 収まらない | UD-Q2_K_XL≈22 tok/s高圧縮 統合メモリに収まる | ✕ 収まらない | ✕ 収まらない | Q3_K_S≈7.2 tok/s RAM に収まる(CPU) | UD-IQ2_XXS≈19.7 tok/s高圧縮 RAM に収まる(CPU) |
計算ツール:収まる?
メモリ容量ごとに使えるようになるもの(コンテキスト 8K)
- 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B 高圧縮: Gemma 3 12B · Qwen3 14B
- 12 GB Gemma 3 12B · Qwen3 14B 高圧縮: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B 高圧縮: Gemma 4 31B · Qwen3.5 35B A3B
- 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B 高圧縮: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B 高圧縮: GLM 4.5 Air
- 96 GB GLM 4.5 Air · gpt-oss-120b 高圧縮: Qwen3 235B A22B · GLM 4.7
- 128 GB Qwen3 235B A22B
- 192 GB GLM 4.7 高圧縮: DeepSeek R1
- 256 GB 高圧縮: Kimi K2.5
- 512 GB DeepSeek R1 · Kimi K2.5
≈ は 8K コンテキストでの推定値:重み + KV キャッシュ + ランタイムのオーバーヘッドをメモリ容量と比較し、速度はメモリ帯域から算出。実際の数値はランタイムや設定によって異なります。
更新日 · 出典: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
ご自身のサイトに埋め込む
インフォグラフィックを表示したい場所にこのコードを貼り付けてください。自動で更新されます。無料で利用できます — 出典リンクは残してください。
マトリクスの見方
行はおよそ 3B から 1T パラメータまでのよく知られたオープンウェイトモデル、列はグラフィックスカード、複数 GPU の構成、Apple や AMD のユニファイドメモリ機、CPU サーバーです。セルには推奨の量子化、モデルが置かれる場所、そしておおよその生成速度(トークン/秒)が入ります。置き場所は「グラフィックスメモリに収まる」、ユニファイドメモリ、サーバーの RAM、「RAM へのオフロードで動作」、「収まらない」のいずれかです。オフロードは、モデルの一部がシステムメモリに載る状態で、動きはしますが遅くなります。
必要なメモリの計算
必要量は三つの足し算です。重み(パラメータ数 × 1 重みあたりのビット数、または実際の量子化ファイルのサイズ)、コンテキスト分の KV キャッシュ、そしてランタイムのオーバーヘッド約 1.5 GB です。VLM の場合はビジョン用のプロジェクタも加わります。マトリクスはコンテキスト 8192 トークンで計算していますが、長いコンテキストは小さなモデル一つ分のメモリを食うこともあります。そこで計算ツールでは、モデル、量子化、コンテキスト、ハードウェア(または自分の VRAM、RAM、メモリ帯域)を入力すると、重み・KV キャッシュ・オーバーヘッドの棒をメモリ容量と並べて表示します。
速度と量子化の決め方
生成速度は、メモリ帯域を 1 トークンあたりに読むバイト数で割ったものに近くなります。MoE モデルでは読まれるのはアクティブなパラメータだけなので、大きな MoE が小さな密モデルより速いこともあります。推奨の量子化は、10 トークン/秒以上を保てる範囲で Q8_0 までの最大のものです。それが無理なら Q4 クラスを選び、BF16 は使いません。Q3 未満は、それより大きいものが収まらない場合に限り「強い圧縮」として示します。モデルファイルは多くが GGUF 形式で配布されています。
数字の確かさ
≈ の付いた値は推定です。実測のあるセルには計測値と出典へのリンクが表示されます。推定は実測と照らし合わせて調整しており、誤差はおおむね ±35% に収まりますが、実際の速度はランタイム、ドライバー、設定で変わります。また、長いプロンプトを読み込む処理は含まず、生成だけを見積もっています。
メモリ量の段階(8、12、16、24、48、96、128 GB)ごとに何が動くかをまとめた一覧もあります。安全フィルターのないモデルは、スイッチを入れたときだけ表示されます。