Quel modèle ouvert tient sur votre matériel — 2026
Modèles à poids ouverts face aux cartes graphiques et ordinateurs populaires : la quantification recommandée (la plus grande jusqu'à Q8 qui donne encore au moins 10 tokens par seconde, sinon une de classe Q4 ; en dessous de Q3 seulement si rien d'autre ne tient), où il s'exécute (mémoire graphique, mémoire unifiée ou déporté en RAM) et une vitesse de génération approximative.
| Modèle | Paramètres | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5 3B Instruct HF | 3.1B | Q8_0≈84 tok/s Tient dans la mémoire graphique | Q8_0≈67 tok/s Tient dans la mémoire graphique | Q8_0≈218 tok/s Tient dans la mémoire graphique | Q8_0≈235 tok/s Tient dans la mémoire graphique | Q8_0≈417 tok/s Tient dans la mémoire graphique | Q8_0≈417 tok/s Tient dans la mémoire graphique | Q8_0≈168 tok/s Tient dans la mémoire graphique | Q8_0≈136 tok/s Tient dans la mémoire graphique | Q8_0≈115 tok/s Tient dans la mémoire graphique | Q8_0≈111 tok/s Tient dans la mémoire unifiée | Q8_0≈167 tok/s Tient dans la mémoire unifiée | Q8_0≈52 tok/s Tient dans la mémoire unifiée | Q8_0≈56 tok/s Tient dans la mémoire unifiée | Q8_0≈15,0 tok/s Tient dans la RAM (CPU) | Q8_0≈34 tok/s Tient dans la RAM (CPU) |
| Llama 3.2 3B Instruct HF | 3.2B | Q8_0≈74 tok/s Tient dans la mémoire graphique | Q8_0≈59 tok/s Tient dans la mémoire graphique | Q8_0≈192 tok/s Tient dans la mémoire graphique | Q8_0≈207 tok/s Tient dans la mémoire graphique | Q8_0≈368 tok/s Tient dans la mémoire graphique | Q8_0≈368 tok/s Tient dans la mémoire graphique | Q8_0≈148 tok/s Tient dans la mémoire graphique | Q8_0≈120 tok/s Tient dans la mémoire graphique | Q8_0≈101 tok/s Tient dans la mémoire graphique | Q8_0≈98 tok/s Tient dans la mémoire unifiée | Q8_0≈147 tok/s Tient dans la mémoire unifiée | Q8_0≈46 tok/s Tient dans la mémoire unifiée | Q8_0≈49 tok/s Tient dans la mémoire unifiée | Q8_0≈14,3 tok/s Tient dans la RAM (CPU) | Q8_0≈32 tok/s Tient dans la RAM (CPU) |
| Gemma 3 4B HF | 4.3B | Q8_0≈67 tok/s Tient dans la mémoire graphique | Q8_0≈54 tok/s Tient dans la mémoire graphique | Q8_0≈175 tok/s Tient dans la mémoire graphique | Q8_0≈189 tok/s Tient dans la mémoire graphique | Q8_0≈335 tok/s Tient dans la mémoire graphique | Q8_0≈335 tok/s Tient dans la mémoire graphique | Q8_0≈135 tok/s Tient dans la mémoire graphique | Q8_0≈109 tok/s Tient dans la mémoire graphique | Q8_0≈92 tok/s Tient dans la mémoire graphique | Q8_0≈89 tok/s Tient dans la mémoire unifiée | Q8_0≈134 tok/s Tient dans la mémoire unifiée | Q8_0≈42 tok/s Tient dans la mémoire unifiée | Q8_0≈45 tok/s Tient dans la mémoire unifiée | Q8_0≈13,8 tok/s Tient dans la RAM (CPU) | Q8_0≈31 tok/s Tient dans la RAM (CPU) |
| Llama 3.1 8B Instruct HF | 8B | UD-Q6_K_XL≈37 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈29 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈95 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈103 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈182 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈182 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈73 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈59 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈50 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈49 tok/s Tient dans la mémoire unifiée | UD-Q6_K_XL≈73 tok/s Tient dans la mémoire unifiée | UD-Q6_K_XL≈23 tok/s Tient dans la mémoire unifiée | UD-Q6_K_XL≈24 tok/s Tient dans la mémoire unifiée | UD-Q6_K_XL≈10,3 tok/s Tient dans la RAM (CPU) | UD-Q6_K_XL≈23 tok/s Tient dans la RAM (CPU) |
| Qwen3 8B HF | 8.2B | Q8_0≈31 tok/s Tient dans la mémoire graphique | Q8_0≈25 tok/s Tient dans la mémoire graphique | Q8_0≈80 tok/s Tient dans la mémoire graphique | Q8_0≈87 tok/s Tient dans la mémoire graphique | Q8_0≈154 tok/s Tient dans la mémoire graphique | Q8_0≈154 tok/s Tient dans la mémoire graphique | Q8_0≈62 tok/s Tient dans la mémoire graphique | Q8_0≈50 tok/s Tient dans la mémoire graphique | Q8_0≈42 tok/s Tient dans la mémoire graphique | Q8_0≈41 tok/s Tient dans la mémoire unifiée | Q8_0≈62 tok/s Tient dans la mémoire unifiée | Q8_0≈19,2 tok/s Tient dans la mémoire unifiée | Q8_0≈21 tok/s Tient dans la mémoire unifiée | UD-Q6_K_XL≈10,2 tok/s Tient dans la RAM (CPU) | Q8_0≈21 tok/s Tient dans la RAM (CPU) |
| Gemma 3 12B HF | 12.2B | UD-Q5_K_XL≈32 tok/s Tient dans la mémoire graphique | Q8_0≈17,8 tok/s Tient dans la mémoire graphique | Q8_0≈58 tok/s Tient dans la mémoire graphique | Q8_0≈62 tok/s Tient dans la mémoire graphique | Q8_0≈111 tok/s Tient dans la mémoire graphique | Q8_0≈111 tok/s Tient dans la mémoire graphique | Q8_0≈44 tok/s Tient dans la mémoire graphique | Q8_0≈36 tok/s Tient dans la mémoire graphique | Q8_0≈30 tok/s Tient dans la mémoire graphique | Q8_0≈30 tok/s Tient dans la mémoire unifiée | Q8_0≈44 tok/s Tient dans la mémoire unifiée | Q8_0≈13,8 tok/s Tient dans la mémoire unifiée | Q8_0≈14,8 tok/s Tient dans la mémoire unifiée | Q4_1≈10,2 tok/s Tient dans la RAM (CPU) | Q8_0≈17,1 tok/s Tient dans la RAM (CPU) |
| Qwen3 14B HF | 14.8B | Q4_K_M≈30 tok/s Tient dans la mémoire graphique | Q6_K≈18,0 tok/s Tient dans la mémoire graphique | Q8_0≈46 tok/s Tient dans la mémoire graphique | Q8_0≈49 tok/s Tient dans la mémoire graphique | Q8_0≈88 tok/s Tient dans la mémoire graphique | Q8_0≈88 tok/s Tient dans la mémoire graphique | Q8_0≈35 tok/s Tient dans la mémoire graphique | Q8_0≈29 tok/s Tient dans la mémoire graphique | Q8_0≈24 tok/s Tient dans la mémoire graphique | Q8_0≈23 tok/s Tient dans la mémoire unifiée | Q8_0≈35 tok/s Tient dans la mémoire unifiée | Q8_0≈10,9 tok/s Tient dans la mémoire unifiée | Q8_0≈11,7 tok/s Tient dans la mémoire unifiée | UD-Q3_K_XL≈10,1 tok/s Tient dans la RAM (CPU) | Q8_0≈14,6 tok/s Tient dans la RAM (CPU) |
| gpt-oss-20b HFMoE | 20.9B / 3.6B | MXFP4≈53 tok/s Fonctionne avec déport en RAM | MXFP4≈55 tok/s Tient dans la mémoire graphique | MXFP4162 tok/smesuré Tient dans la mémoire graphique | MXFP4≈194 tok/s Tient dans la mémoire graphique | MXFP4≈344 tok/s Tient dans la mémoire graphique | MXFP4≈344 tok/s Tient dans la mémoire graphique | MXFP4≈138 tok/s Tient dans la mémoire graphique | MXFP4≈112 tok/s Tient dans la mémoire graphique | MXFP4≈95 tok/s Tient dans la mémoire graphique | MXFP4≈80 tok/s Tient dans la mémoire unifiée | MXFP4116 tok/smesuré Tient dans la mémoire unifiée | MXFP4≈59 tok/s Tient dans la mémoire unifiée | MXFP4≈62 tok/s Tient dans la mémoire unifiée | MXFP4≈17,2 tok/s Tient dans la RAM (CPU) | MXFP4≈39 tok/s Tient dans la RAM (CPU) |
| Mistral Small 3.2 24B HF | 24B | Q3_K_M≈10,2 tok/s Fonctionne avec déport en RAM | UD-Q3_K_XL≈18,4 tok/s Tient dans la mémoire graphique | Q6_K≈37 tok/s Tient dans la mémoire graphique | Q6_K≈40 tok/s Tient dans la mémoire graphique | Q8_0≈56 tok/s Tient dans la mémoire graphique | Q8_0≈56 tok/s Tient dans la mémoire graphique | Q8_0≈22 tok/s Tient dans la mémoire graphique | Q8_0≈18,2 tok/s Tient dans la mémoire graphique | Q8_0≈15,3 tok/s Tient dans la mémoire graphique | Q8_0≈14,9 tok/s Tient dans la mémoire unifiée | Q8_0≈22 tok/s Tient dans la mémoire unifiée | Q5_K_M≈10,3 tok/s Tient dans la mémoire unifiée | Q5_K_M≈11,0 tok/s Tient dans la mémoire unifiée | Q4_K_M≈6,9 tok/s Tient dans la RAM (CPU) | Q8_0≈10,3 tok/s Tient dans la RAM (CPU) |
| Gemma 4 26B A4B HFMoE | 25.8B / 3.8B | UD-Q8_K_XL≈14,7 tok/s Fonctionne avec déport en RAM | UD-Q3_K_M≈56 tok/s Tient dans la mémoire graphique | UD-Q5_K_S≈129 tok/s Tient dans la mémoire graphique | UD-Q5_K_S≈139 tok/s Tient dans la mémoire graphique | UD-Q8_K_XL≈173 tok/s Tient dans la mémoire graphique | UD-Q8_K_XL≈173 tok/s Tient dans la mémoire graphique | UD-Q8_K_XL≈70 tok/s Tient dans la mémoire graphique | UD-Q8_K_XL≈57 tok/s Tient dans la mémoire graphique | UD-Q8_K_XL≈48 tok/s Tient dans la mémoire graphique | UD-Q8_K_XL≈40 tok/s Tient dans la mémoire unifiée | UD-Q8_K_XL≈60 tok/s Tient dans la mémoire unifiée | UD-Q8_K_XL≈29 tok/s Tient dans la mémoire unifiée | UD-Q8_K_XL≈31 tok/s Tient dans la mémoire unifiée | UD-Q8_K_XL≈13,7 tok/s Tient dans la RAM (CPU) | UD-Q8_K_XL≈31 tok/s Tient dans la RAM (CPU) |
| Gemma 3 27B HF | 27.4B | UD-IQ3_XXS≈12,7 tok/s Fonctionne avec déport en RAM | Q3_K_S≈18,1 tok/s Tient dans la mémoire graphique | UD-Q5_K_XL≈38 tok/s Tient dans la mémoire graphique | UD-Q5_K_XL≈41 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈59 tok/s Tient dans la mémoire graphique | Q8_0≈49 tok/s Tient dans la mémoire graphique | Q8_0≈19,7 tok/s Tient dans la mémoire graphique | Q8_0≈16,0 tok/s Tient dans la mémoire graphique | Q8_0≈13,5 tok/s Tient dans la mémoire graphique | Q8_0≈13,1 tok/s Tient dans la mémoire unifiée | Q8_0≈19,6 tok/s Tient dans la mémoire unifiée | Q4_1≈10,1 tok/s Tient dans la mémoire unifiée | Q4_1≈10,8 tok/s Tient dans la mémoire unifiée | Q4_K_M≈6,3 tok/s Tient dans la RAM (CPU) | UD-Q6_K_XL≈10,8 tok/s Tient dans la RAM (CPU) |
| Qwen3 30B A3B HFMoE | 30.5B / 3.3B | Q8_0≈16,4 tok/s Fonctionne avec déport en RAM | Q3_K_S≈66 tok/s Tient dans la mémoire graphique | Q4_K_M154 tok/smesuré Tient dans la mémoire graphique | Q5_K_S≈158 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈232 tok/s Tient dans la mémoire graphique | Q8_0≈192 tok/s Tient dans la mémoire graphique | Q8_0≈77 tok/s Tient dans la mémoire graphique | Q8_0≈63 tok/s Tient dans la mémoire graphique | Q8_0≈53 tok/s Tient dans la mémoire graphique | Q8_0≈45 tok/s Tient dans la mémoire unifiée | Q8_0≈67 tok/s Tient dans la mémoire unifiée | Q8_0≈33 tok/s Tient dans la mémoire unifiée | Q8_0≈35 tok/s Tient dans la mémoire unifiée | Q8_0≈14,3 tok/s Tient dans la RAM (CPU) | Q8_0≈32 tok/s Tient dans la RAM (CPU) |
| Gemma 4 31B HF | 31.3B | Q4_K_M≈3,8 tok/s Fonctionne avec déport en RAM | Q3_K_S≈10,4 tok/s Fonctionne avec déport en RAM | Q4_1≈37 tok/s Tient dans la mémoire graphique | Q4_1≈40 tok/s Tient dans la mémoire graphique | Q6_K≈55 tok/s Tient dans la mémoire graphique | Q8_0≈43 tok/s Tient dans la mémoire graphique | Q8_0≈17,1 tok/s Tient dans la mémoire graphique | Q8_0≈13,9 tok/s Tient dans la mémoire graphique | Q8_0≈11,7 tok/s Tient dans la mémoire graphique | Q8_0≈11,3 tok/s Tient dans la mémoire unifiée | Q8_0≈17,0 tok/s Tient dans la mémoire unifiée | IQ4_XS≈10,3 tok/s Tient dans la mémoire unifiée | Q4_K_S≈10,3 tok/s Tient dans la mémoire unifiée | Q4_K_M≈5,7 tok/s Tient dans la RAM (CPU) | Q6_K≈10,1 tok/s Tient dans la RAM (CPU) |
| Qwen3 32B HF | 32.8B | Q4_K_M≈3,7 tok/s Fonctionne avec déport en RAM | UD-IQ3_XXS≈14,1 tok/s Fonctionne avec déport en RAM | UD-Q4_K_XL≈35 tok/s Tient dans la mémoire graphique | UD-Q4_K_XL≈38 tok/s Tient dans la mémoire graphique | Q6_K≈51 tok/s Tient dans la mémoire graphique | Q8_0≈40 tok/s Tient dans la mémoire graphique | Q8_0≈16,0 tok/s Tient dans la mémoire graphique | Q8_0≈13,0 tok/s Tient dans la mémoire graphique | Q8_0≈11,0 tok/s Tient dans la mémoire graphique | Q8_0≈10,6 tok/s Tient dans la mémoire unifiée | Q8_0≈16,0 tok/s Tient dans la mémoire unifiée | UD-Q3_K_XL≈10,3 tok/s Tient dans la mémoire unifiée | IQ4_XS≈10,2 tok/s Tient dans la mémoire unifiée | Q4_K_M≈5,4 tok/s Tient dans la RAM (CPU) | Q5_K_M≈10,8 tok/s Tient dans la RAM (CPU) |
| Qwen3.5 35B A3B HFMoE | 36B / 3B | Q8_0≈17,9 tok/s Fonctionne avec déport en RAM | Q8_0≈18,7 tok/s Fonctionne avec déport en RAM | Q4_K_S≈191 tok/s Tient dans la mémoire graphique | Q4_K_S≈205 tok/s Tient dans la mémoire graphique | Q6_K≈274 tok/s Tient dans la mémoire graphique | Q8_0≈220 tok/s Tient dans la mémoire graphique | Q8_0≈89 tok/s Tient dans la mémoire graphique | Q8_0≈72 tok/s Tient dans la mémoire graphique | Q8_0≈61 tok/s Tient dans la mémoire graphique | Q8_0≈51 tok/s Tient dans la mémoire unifiée | Q8_0≈77 tok/s Tient dans la mémoire unifiée | Q8_0≈37 tok/s Tient dans la mémoire unifiée | Q8_0≈40 tok/s Tient dans la mémoire unifiée | Q8_0≈15,0 tok/s Tient dans la RAM (CPU) | Q8_0≈34 tok/s Tient dans la RAM (CPU) |
| Llama 3.3 70B Instruct HF | 70.6B | Q4_K_M≈1,3 tok/s Fonctionne avec déport en RAM | Q4_K_M≈1,4 tok/s Fonctionne avec déport en RAM | Q4_K_M≈2,0 tok/s Fonctionne avec déport en RAM | Q4_K_M≈2,0 tok/s Fonctionne avec déport en RAM | UD-IQ3_XXS≈49 tok/s Tient dans la mémoire graphique | Q8_0≈18,8 tok/s Tient dans la mémoire graphique | Q4_K_M16,3 tok/smesuré Tient dans la mémoire graphique | Q4_1≈10,3 tok/s Tient dans la mémoire graphique | IQ4_XS≈10,0 tok/s Tient dans la mémoire graphique | UD-Q3_K_XL≈10,6 tok/s Tient dans la mémoire unifiée | Q5_K_M≈11,2 tok/s Tient dans la mémoire unifiée | Q4_K_M≈4,1 tok/s Tient dans la mémoire unifiée | Q4_K_M≈4,4 tok/s Tient dans la mémoire unifiée | Q4_K_M≈2,9 tok/s Tient dans la RAM (CPU) | Q4_K_M≈6,6 tok/s Tient dans la RAM (CPU) |
| Qwen3 Next 80B A3B Instruct HFMoE | 81.3B / 3B | Q5_K_M≈24 tok/s Fonctionne avec déport en RAM | Q6_K≈21 tok/s Fonctionne avec déport en RAM | UD-Q6_K_XL≈26 tok/s Fonctionne avec déport en RAM | UD-Q6_K_XL≈26 tok/s Fonctionne avec déport en RAM | UD-Q6_K_XL≈31 tok/s Fonctionne avec déport en RAM | Q8_0≈213 tok/s Tient dans la mémoire graphique | Q4_K_S≈145 tok/s Tient dans la mémoire graphique | UD-Q6_K_XL≈84 tok/s Tient dans la mémoire graphique | Q8_0≈59 tok/s Tient dans la mémoire graphique | Q8_0≈49 tok/s Tient dans la mémoire unifiée | Q8_0≈74 tok/s Tient dans la mémoire unifiée | Q8_0≈36 tok/s Tient dans la mémoire unifiée | Q8_0≈39 tok/s Tient dans la mémoire unifiée | Q8_0≈14,8 tok/s Tient dans la RAM (CPU) | Q8_0≈33 tok/s Tient dans la RAM (CPU) |
| GLM 4.5 Air HFMoE | 110B / 17B | Q4_0≈5,3 tok/s Fonctionne avec déport en RAM | Q4_K_S≈5,1 tok/s Fonctionne avec déport en RAM | Q4_K_M≈5,6 tok/s Fonctionne avec déport en RAM | Q4_K_M≈5,7 tok/s Fonctionne avec déport en RAM | Q3_K_M≈10,2 tok/s Fonctionne avec déport en RAM | Q5_K_M≈55 tok/s Tient dans la mémoire graphique | Q4_0≈10,0 tok/s Fonctionne avec déport en RAM | UD-Q4_K_XL≈22 tok/s Tient dans la mémoire graphique | Q5_K_M≈15,2 tok/s Tient dans la mémoire graphique | Q5_K_M≈12,8 tok/s Tient dans la mémoire unifiée | Q8_0≈13,9 tok/s Tient dans la mémoire unifiée | Q4_K_M≈10,6 tok/s Tient dans la mémoire unifiée | Q5_K_M≈10,0 tok/s Tient dans la mémoire unifiée | Q4_K_M≈8,0 tok/s Tient dans la RAM (CPU) | Q8_0≈13,1 tok/s Tient dans la RAM (CPU) |
| gpt-oss-120b HFMoE | 117B / 5.1B | MXFP4≈19,1 tok/s Fonctionne avec déport en RAM | MXFP4≈19,6 tok/s Fonctionne avec déport en RAM | MXFP426–28 tok/smesuré Fonctionne avec déport en RAM | MXFP4≈25 tok/s Fonctionne avec déport en RAM | MXFP4≈31 tok/s Fonctionne avec déport en RAM | MXFP4≈258 tok/s Tient dans la mémoire graphique | MXFP4≈36 tok/s Fonctionne avec déport en RAM | MXFP441–73 tok/smesuré Tient dans la mémoire graphique | MXFP4≈71 tok/s Tient dans la mémoire graphique | MXFP4≈60 tok/s Tient dans la mémoire unifiée | MXFP4≈90 tok/s Tient dans la mémoire unifiée | MXFP450 tok/smesuré Tient dans la mémoire unifiée | MXFP461 tok/smesuré Tient dans la mémoire unifiée | MXFP4≈15,8 tok/s Tient dans la RAM (CPU) | MXFP4≈36 tok/s Tient dans la RAM (CPU) |
| Qwen3.5 122B A10B HFMoE | 125B / 10B | UD-IQ4_NL≈10,5 tok/s Fonctionne avec déport en RAM | UD-IQ4_NL≈10,8 tok/s Fonctionne avec déport en RAM | Q4_K_S≈11,1 tok/s Fonctionne avec déport en RAM | Q4_K_S≈11,2 tok/s Fonctionne avec déport en RAM | UD-Q4_K_XL≈11,9 tok/s Fonctionne avec déport en RAM | UD-Q5_K_XL≈97 tok/s Tient dans la mémoire graphique | UD-IQ3_XXS≈76 tok/s Tient dans la mémoire graphique | UD-IQ4_NL≈46 tok/s Tient dans la mémoire graphique | UD-Q5_K_XL≈27 tok/s Tient dans la mémoire graphique | UD-Q5_K_XL≈23 tok/s Tient dans la mémoire unifiée | Q8_0≈24 tok/s Tient dans la mémoire unifiée | Q6_K≈15,1 tok/s Tient dans la mémoire unifiée | Q6_K≈16,1 tok/s Tient dans la mémoire unifiée | UD-Q5_K_XL≈10,4 tok/s Tient dans la RAM (CPU) | Q8_0≈19,3 tok/s Tient dans la RAM (CPU) |
| Qwen3 235B A22B HFMoE | 235B / 22B | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | UD-Q4_K_XL≈10,8 tok/s Fonctionne avec déport en RAM | UD-Q2_K_XL≈8,0 tok/scompression forte Fonctionne avec déport en RAM | Q3_K_M≈6,1 tok/s Fonctionne avec déport en RAM | UD-Q3_K_XL≈11,7 tok/s Fonctionne avec déport en RAM | UD-Q2_K_XL≈19,4 tok/scompression forte Tient dans la mémoire unifiée | Q8_0≈10,8 tok/s Tient dans la mémoire unifiée | UD-Q3_K_XL≈12,2 tok/s Tient dans la mémoire unifiée | UD-Q3_K_XL≈13,0 tok/s Tient dans la mémoire unifiée | Q4_K_M≈7,2 tok/s Tient dans la RAM (CPU) | Q8_0≈10,9 tok/s Tient dans la RAM (CPU) |
| GLM 4.7 HFMoE | 358B / 39.2B | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | UD-IQ3_XXS≈7,3 tok/s Fonctionne avec déport en RAM | UD-IQ1_S≈5,6 tok/scompression forte Fonctionne avec déport en RAM | UD-IQ2_XXS≈4,7 tok/scompression forte Fonctionne avec déport en RAM | UD-IQ3_XXS≈3,5 tok/s Fonctionne avec déport en RAM | UD-TQ1_0≈16,2 tok/scompression forte Tient dans la mémoire unifiée | Q4_1≈10,0 tok/s Tient dans la mémoire unifiée | UD-IQ1_M≈9,6 tok/scompression forte Tient dans la mémoire unifiée | UD-IQ1_M≈10,3 tok/scompression forte Tient dans la mémoire unifiée | Q4_K_M≈4,7 tok/s Tient dans la RAM (CPU) | Q4_1≈10,2 tok/s Tient dans la RAM (CPU) |
| DeepSeek R1 HFMoE | 684B / 37B | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | UD-IQ1_S≈16,9 tok/scompression forte Fonctionne avec déport en RAM | ✕ Ne tient pas | ✕ Ne tient pas | UD-IQ1_S≈8,0 tok/scompression forte Fonctionne avec déport en RAM | ✕ Ne tient pas | Q3_K_M≈14,9 tok/s Tient dans la mémoire unifiée | ✕ Ne tient pas | ✕ Ne tient pas | Q4_K_M≈5,2 tok/s Tient dans la RAM (CPU) | Q3_K_M≈13,9 tok/s Tient dans la RAM (CPU) |
| Kimi K2.5 HFMoE | 1,027B / 32B | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | ✕ Ne tient pas | UD-Q2_K_XL≈22 tok/scompression forte Tient dans la mémoire unifiée | ✕ Ne tient pas | ✕ Ne tient pas | Q3_K_S≈7,2 tok/s Tient dans la RAM (CPU) | UD-IQ2_XXS≈19,7 tok/scompression forte Tient dans la RAM (CPU) |
Calculateur : est-ce que ça tient ?
Ce qui s’ouvre à chaque taille de mémoire (contexte 8K)
- 8 Go Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B compression forte: Gemma 3 12B · Qwen3 14B
- 12 Go Gemma 3 12B · Qwen3 14B compression forte: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
- 16 Go gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B compression forte: Gemma 4 31B · Qwen3.5 35B A3B
- 24 Go Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B compression forte: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
- 48 Go Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B compression forte: GLM 4.5 Air
- 96 Go GLM 4.5 Air · gpt-oss-120b compression forte: Qwen3 235B A22B · GLM 4.7
- 128 Go Qwen3 235B A22B
- 192 Go GLM 4.7 compression forte: DeepSeek R1
- 256 Go compression forte: Kimi K2.5
- 512 Go DeepSeek R1 · Kimi K2.5
≈ estimations pour un contexte de 8K : poids + cache KV + surcharge du runtime par rapport à la mémoire ; vitesse déduite de la bande passante mémoire. Les chiffres réels dépendent du runtime et des réglages.
Mis à jour · Sources: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com
Intégrer sur votre site
Collez ce code là où l’infographie doit apparaître : elle se met à jour toute seule. Utilisation gratuite — conservez le lien d’attribution.
Lire la matrice en trois étapes
Cette infographie répond à une question simple : tel modèle tourne-t-il sur mon ordinateur, et à quelle vitesse ? Les lignes listent des modèles connus à poids ouverts, d'environ 3B à 1T de paramètres ; les colonnes, des cartes graphiques, des configurations multi-GPU, des machines Apple et AMD à mémoire unifiée et des serveurs CPU.
- Repérez votre matériel dans les colonnes, ou saisissez dans le calculateur votre mémoire graphique (VRAM), votre RAM et la bande passante mémoire.
- Lisez la cellule. Elle donne la quantification conseillée, l'endroit où loge le modèle et une vitesse de génération approximative en tokens par seconde. « Tient dans la mémoire graphique » est l'idéal ; « Fonctionne avec déport en RAM » signifie qu'une partie du modèle passe en mémoire système : cela marche, mais plus lentement.
- Ajustez le contexte dans le calculateur. La matrice compte 8192 tokens, mais un long contexte peut réclamer autant de mémoire qu'un petit modèle.
Sous la matrice, une échelle montre ce qui devient accessible à 8, 12, 16, 24, 48, 96 et 128 Go de mémoire.
Le calcul derrière chaque case
La mémoire nécessaire additionne trois blocs : les poids (paramètres multipliés par les bits par poids, ou la taille réelle du fichier GGUF), le cache KV lié au contexte et environ 1,5 Go de surcoût pour l'environnement d'exécution, auxquels s'ajoute le projecteur visuel d'un VLM. La vitesse se déduit de la bande passante mémoire divisée par les octets lus à chaque token. Pour un modèle MoE, seuls les paramètres actifs comptent, si bien qu'un gros MoE peut répondre plus vite qu'un modèle dense plus petit.
La quantification conseillée est la plus fine jusqu'à Q8_0 qui tient encore au moins 10 tokens par seconde, sinon la classe Q4. Jamais BF16, et jamais sous Q3 sauf si rien de plus gros ne rentre : la cellule affiche alors « compression forte ».
Quelle confiance accorder aux estimations ?
Le signe ≈ marque une estimation, calibrée sur des exécutions mesurées avec llama.cpp et des rapports publics ; elle reste à environ ±35% de ces mesures. Le moteur, les pilotes et les réglages font varier le résultat réel, et le traitement d'une longue requête n'est pas compté, seule la génération l'est. Les cellules mesurées affichent la mesure et un lien vers la source. Les modèles sans filtres de sécurité restent masqués derrière un interrupteur. Pour une machine complète, voyez les configurations PC pour l'IA locale.