Aller au contenu
fedi.software

Quel modèle ouvert tient sur votre matériel — 2026

Modèles à poids ouverts face aux cartes graphiques et ordinateurs populaires : la quantification recommandée (la plus grande jusqu'à Q8 qui donne encore au moins 10 tokens par seconde, sinon une de classe Q4 ; en dessous de Q3 seulement si rien d'autre ne tient), où il s'exécute (mémoire graphique, mémoire unifiée ou déporté en RAM) et une vitesse de génération approximative.

Modèle Paramètres
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s Tient dans la mémoire graphique Q8_0≈67 tok/s Tient dans la mémoire graphique Q8_0≈218 tok/s Tient dans la mémoire graphique Q8_0≈235 tok/s Tient dans la mémoire graphique Q8_0≈417 tok/s Tient dans la mémoire graphique Q8_0≈417 tok/s Tient dans la mémoire graphique Q8_0≈168 tok/s Tient dans la mémoire graphique Q8_0≈136 tok/s Tient dans la mémoire graphique Q8_0≈115 tok/s Tient dans la mémoire graphique Q8_0≈111 tok/s Tient dans la mémoire unifiée Q8_0≈167 tok/s Tient dans la mémoire unifiée Q8_0≈52 tok/s Tient dans la mémoire unifiée Q8_0≈56 tok/s Tient dans la mémoire unifiée Q8_0≈15,0 tok/s Tient dans la RAM (CPU) Q8_0≈34 tok/s Tient dans la RAM (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s Tient dans la mémoire graphique Q8_0≈59 tok/s Tient dans la mémoire graphique Q8_0≈192 tok/s Tient dans la mémoire graphique Q8_0≈207 tok/s Tient dans la mémoire graphique Q8_0≈368 tok/s Tient dans la mémoire graphique Q8_0≈368 tok/s Tient dans la mémoire graphique Q8_0≈148 tok/s Tient dans la mémoire graphique Q8_0≈120 tok/s Tient dans la mémoire graphique Q8_0≈101 tok/s Tient dans la mémoire graphique Q8_0≈98 tok/s Tient dans la mémoire unifiée Q8_0≈147 tok/s Tient dans la mémoire unifiée Q8_0≈46 tok/s Tient dans la mémoire unifiée Q8_0≈49 tok/s Tient dans la mémoire unifiée Q8_0≈14,3 tok/s Tient dans la RAM (CPU) Q8_0≈32 tok/s Tient dans la RAM (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s Tient dans la mémoire graphique Q8_0≈54 tok/s Tient dans la mémoire graphique Q8_0≈175 tok/s Tient dans la mémoire graphique Q8_0≈189 tok/s Tient dans la mémoire graphique Q8_0≈335 tok/s Tient dans la mémoire graphique Q8_0≈335 tok/s Tient dans la mémoire graphique Q8_0≈135 tok/s Tient dans la mémoire graphique Q8_0≈109 tok/s Tient dans la mémoire graphique Q8_0≈92 tok/s Tient dans la mémoire graphique Q8_0≈89 tok/s Tient dans la mémoire unifiée Q8_0≈134 tok/s Tient dans la mémoire unifiée Q8_0≈42 tok/s Tient dans la mémoire unifiée Q8_0≈45 tok/s Tient dans la mémoire unifiée Q8_0≈13,8 tok/s Tient dans la RAM (CPU) Q8_0≈31 tok/s Tient dans la RAM (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈29 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈95 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈103 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈182 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈182 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈73 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈59 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈50 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈49 tok/s Tient dans la mémoire unifiée UD-Q6_K_XL≈73 tok/s Tient dans la mémoire unifiée UD-Q6_K_XL≈23 tok/s Tient dans la mémoire unifiée UD-Q6_K_XL≈24 tok/s Tient dans la mémoire unifiée UD-Q6_K_XL≈10,3 tok/s Tient dans la RAM (CPU) UD-Q6_K_XL≈23 tok/s Tient dans la RAM (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s Tient dans la mémoire graphique Q8_0≈25 tok/s Tient dans la mémoire graphique Q8_0≈80 tok/s Tient dans la mémoire graphique Q8_0≈87 tok/s Tient dans la mémoire graphique Q8_0≈154 tok/s Tient dans la mémoire graphique Q8_0≈154 tok/s Tient dans la mémoire graphique Q8_0≈62 tok/s Tient dans la mémoire graphique Q8_0≈50 tok/s Tient dans la mémoire graphique Q8_0≈42 tok/s Tient dans la mémoire graphique Q8_0≈41 tok/s Tient dans la mémoire unifiée Q8_0≈62 tok/s Tient dans la mémoire unifiée Q8_0≈19,2 tok/s Tient dans la mémoire unifiée Q8_0≈21 tok/s Tient dans la mémoire unifiée UD-Q6_K_XL≈10,2 tok/s Tient dans la RAM (CPU) Q8_0≈21 tok/s Tient dans la RAM (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s Tient dans la mémoire graphique Q8_0≈17,8 tok/s Tient dans la mémoire graphique Q8_0≈58 tok/s Tient dans la mémoire graphique Q8_0≈62 tok/s Tient dans la mémoire graphique Q8_0≈111 tok/s Tient dans la mémoire graphique Q8_0≈111 tok/s Tient dans la mémoire graphique Q8_0≈44 tok/s Tient dans la mémoire graphique Q8_0≈36 tok/s Tient dans la mémoire graphique Q8_0≈30 tok/s Tient dans la mémoire graphique Q8_0≈30 tok/s Tient dans la mémoire unifiée Q8_0≈44 tok/s Tient dans la mémoire unifiée Q8_0≈13,8 tok/s Tient dans la mémoire unifiée Q8_0≈14,8 tok/s Tient dans la mémoire unifiée Q4_1≈10,2 tok/s Tient dans la RAM (CPU) Q8_0≈17,1 tok/s Tient dans la RAM (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s Tient dans la mémoire graphique Q6_K≈18,0 tok/s Tient dans la mémoire graphique Q8_0≈46 tok/s Tient dans la mémoire graphique Q8_0≈49 tok/s Tient dans la mémoire graphique Q8_0≈88 tok/s Tient dans la mémoire graphique Q8_0≈88 tok/s Tient dans la mémoire graphique Q8_0≈35 tok/s Tient dans la mémoire graphique Q8_0≈29 tok/s Tient dans la mémoire graphique Q8_0≈24 tok/s Tient dans la mémoire graphique Q8_0≈23 tok/s Tient dans la mémoire unifiée Q8_0≈35 tok/s Tient dans la mémoire unifiée Q8_0≈10,9 tok/s Tient dans la mémoire unifiée Q8_0≈11,7 tok/s Tient dans la mémoire unifiée UD-Q3_K_XL≈10,1 tok/s Tient dans la RAM (CPU) Q8_0≈14,6 tok/s Tient dans la RAM (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s Fonctionne avec déport en RAM MXFP4≈55 tok/s Tient dans la mémoire graphique MXFP4162 tok/smesuré Tient dans la mémoire graphique MXFP4≈194 tok/s Tient dans la mémoire graphique MXFP4≈344 tok/s Tient dans la mémoire graphique MXFP4≈344 tok/s Tient dans la mémoire graphique MXFP4≈138 tok/s Tient dans la mémoire graphique MXFP4≈112 tok/s Tient dans la mémoire graphique MXFP4≈95 tok/s Tient dans la mémoire graphique MXFP4≈80 tok/s Tient dans la mémoire unifiée MXFP4116 tok/smesuré Tient dans la mémoire unifiée MXFP4≈59 tok/s Tient dans la mémoire unifiée MXFP4≈62 tok/s Tient dans la mémoire unifiée MXFP4≈17,2 tok/s Tient dans la RAM (CPU) MXFP4≈39 tok/s Tient dans la RAM (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10,2 tok/s Fonctionne avec déport en RAM UD-Q3_K_XL≈18,4 tok/s Tient dans la mémoire graphique Q6_K≈37 tok/s Tient dans la mémoire graphique Q6_K≈40 tok/s Tient dans la mémoire graphique Q8_0≈56 tok/s Tient dans la mémoire graphique Q8_0≈56 tok/s Tient dans la mémoire graphique Q8_0≈22 tok/s Tient dans la mémoire graphique Q8_0≈18,2 tok/s Tient dans la mémoire graphique Q8_0≈15,3 tok/s Tient dans la mémoire graphique Q8_0≈14,9 tok/s Tient dans la mémoire unifiée Q8_0≈22 tok/s Tient dans la mémoire unifiée Q5_K_M≈10,3 tok/s Tient dans la mémoire unifiée Q5_K_M≈11,0 tok/s Tient dans la mémoire unifiée Q4_K_M≈6,9 tok/s Tient dans la RAM (CPU) Q8_0≈10,3 tok/s Tient dans la RAM (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14,7 tok/s Fonctionne avec déport en RAM UD-Q3_K_M≈56 tok/s Tient dans la mémoire graphique UD-Q5_K_S≈129 tok/s Tient dans la mémoire graphique UD-Q5_K_S≈139 tok/s Tient dans la mémoire graphique UD-Q8_K_XL≈173 tok/s Tient dans la mémoire graphique UD-Q8_K_XL≈173 tok/s Tient dans la mémoire graphique UD-Q8_K_XL≈70 tok/s Tient dans la mémoire graphique UD-Q8_K_XL≈57 tok/s Tient dans la mémoire graphique UD-Q8_K_XL≈48 tok/s Tient dans la mémoire graphique UD-Q8_K_XL≈40 tok/s Tient dans la mémoire unifiée UD-Q8_K_XL≈60 tok/s Tient dans la mémoire unifiée UD-Q8_K_XL≈29 tok/s Tient dans la mémoire unifiée UD-Q8_K_XL≈31 tok/s Tient dans la mémoire unifiée UD-Q8_K_XL≈13,7 tok/s Tient dans la RAM (CPU) UD-Q8_K_XL≈31 tok/s Tient dans la RAM (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12,7 tok/s Fonctionne avec déport en RAM Q3_K_S≈18,1 tok/s Tient dans la mémoire graphique UD-Q5_K_XL≈38 tok/s Tient dans la mémoire graphique UD-Q5_K_XL≈41 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈59 tok/s Tient dans la mémoire graphique Q8_0≈49 tok/s Tient dans la mémoire graphique Q8_0≈19,7 tok/s Tient dans la mémoire graphique Q8_0≈16,0 tok/s Tient dans la mémoire graphique Q8_0≈13,5 tok/s Tient dans la mémoire graphique Q8_0≈13,1 tok/s Tient dans la mémoire unifiée Q8_0≈19,6 tok/s Tient dans la mémoire unifiée Q4_1≈10,1 tok/s Tient dans la mémoire unifiée Q4_1≈10,8 tok/s Tient dans la mémoire unifiée Q4_K_M≈6,3 tok/s Tient dans la RAM (CPU) UD-Q6_K_XL≈10,8 tok/s Tient dans la RAM (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16,4 tok/s Fonctionne avec déport en RAM Q3_K_S≈66 tok/s Tient dans la mémoire graphique Q4_K_M154 tok/smesuré Tient dans la mémoire graphique Q5_K_S≈158 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈232 tok/s Tient dans la mémoire graphique Q8_0≈192 tok/s Tient dans la mémoire graphique Q8_0≈77 tok/s Tient dans la mémoire graphique Q8_0≈63 tok/s Tient dans la mémoire graphique Q8_0≈53 tok/s Tient dans la mémoire graphique Q8_0≈45 tok/s Tient dans la mémoire unifiée Q8_0≈67 tok/s Tient dans la mémoire unifiée Q8_0≈33 tok/s Tient dans la mémoire unifiée Q8_0≈35 tok/s Tient dans la mémoire unifiée Q8_0≈14,3 tok/s Tient dans la RAM (CPU) Q8_0≈32 tok/s Tient dans la RAM (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3,8 tok/s Fonctionne avec déport en RAM Q3_K_S≈10,4 tok/s Fonctionne avec déport en RAM Q4_1≈37 tok/s Tient dans la mémoire graphique Q4_1≈40 tok/s Tient dans la mémoire graphique Q6_K≈55 tok/s Tient dans la mémoire graphique Q8_0≈43 tok/s Tient dans la mémoire graphique Q8_0≈17,1 tok/s Tient dans la mémoire graphique Q8_0≈13,9 tok/s Tient dans la mémoire graphique Q8_0≈11,7 tok/s Tient dans la mémoire graphique Q8_0≈11,3 tok/s Tient dans la mémoire unifiée Q8_0≈17,0 tok/s Tient dans la mémoire unifiée IQ4_XS≈10,3 tok/s Tient dans la mémoire unifiée Q4_K_S≈10,3 tok/s Tient dans la mémoire unifiée Q4_K_M≈5,7 tok/s Tient dans la RAM (CPU) Q6_K≈10,1 tok/s Tient dans la RAM (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3,7 tok/s Fonctionne avec déport en RAM UD-IQ3_XXS≈14,1 tok/s Fonctionne avec déport en RAM UD-Q4_K_XL≈35 tok/s Tient dans la mémoire graphique UD-Q4_K_XL≈38 tok/s Tient dans la mémoire graphique Q6_K≈51 tok/s Tient dans la mémoire graphique Q8_0≈40 tok/s Tient dans la mémoire graphique Q8_0≈16,0 tok/s Tient dans la mémoire graphique Q8_0≈13,0 tok/s Tient dans la mémoire graphique Q8_0≈11,0 tok/s Tient dans la mémoire graphique Q8_0≈10,6 tok/s Tient dans la mémoire unifiée Q8_0≈16,0 tok/s Tient dans la mémoire unifiée UD-Q3_K_XL≈10,3 tok/s Tient dans la mémoire unifiée IQ4_XS≈10,2 tok/s Tient dans la mémoire unifiée Q4_K_M≈5,4 tok/s Tient dans la RAM (CPU) Q5_K_M≈10,8 tok/s Tient dans la RAM (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17,9 tok/s Fonctionne avec déport en RAM Q8_0≈18,7 tok/s Fonctionne avec déport en RAM Q4_K_S≈191 tok/s Tient dans la mémoire graphique Q4_K_S≈205 tok/s Tient dans la mémoire graphique Q6_K≈274 tok/s Tient dans la mémoire graphique Q8_0≈220 tok/s Tient dans la mémoire graphique Q8_0≈89 tok/s Tient dans la mémoire graphique Q8_0≈72 tok/s Tient dans la mémoire graphique Q8_0≈61 tok/s Tient dans la mémoire graphique Q8_0≈51 tok/s Tient dans la mémoire unifiée Q8_0≈77 tok/s Tient dans la mémoire unifiée Q8_0≈37 tok/s Tient dans la mémoire unifiée Q8_0≈40 tok/s Tient dans la mémoire unifiée Q8_0≈15,0 tok/s Tient dans la RAM (CPU) Q8_0≈34 tok/s Tient dans la RAM (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1,3 tok/s Fonctionne avec déport en RAM Q4_K_M≈1,4 tok/s Fonctionne avec déport en RAM Q4_K_M≈2,0 tok/s Fonctionne avec déport en RAM Q4_K_M≈2,0 tok/s Fonctionne avec déport en RAM UD-IQ3_XXS≈49 tok/s Tient dans la mémoire graphique Q8_0≈18,8 tok/s Tient dans la mémoire graphique Q4_K_M16,3 tok/smesuré Tient dans la mémoire graphique Q4_1≈10,3 tok/s Tient dans la mémoire graphique IQ4_XS≈10,0 tok/s Tient dans la mémoire graphique UD-Q3_K_XL≈10,6 tok/s Tient dans la mémoire unifiée Q5_K_M≈11,2 tok/s Tient dans la mémoire unifiée Q4_K_M≈4,1 tok/s Tient dans la mémoire unifiée Q4_K_M≈4,4 tok/s Tient dans la mémoire unifiée Q4_K_M≈2,9 tok/s Tient dans la RAM (CPU) Q4_K_M≈6,6 tok/s Tient dans la RAM (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s Fonctionne avec déport en RAM Q6_K≈21 tok/s Fonctionne avec déport en RAM UD-Q6_K_XL≈26 tok/s Fonctionne avec déport en RAM UD-Q6_K_XL≈26 tok/s Fonctionne avec déport en RAM UD-Q6_K_XL≈31 tok/s Fonctionne avec déport en RAM Q8_0≈213 tok/s Tient dans la mémoire graphique Q4_K_S≈145 tok/s Tient dans la mémoire graphique UD-Q6_K_XL≈84 tok/s Tient dans la mémoire graphique Q8_0≈59 tok/s Tient dans la mémoire graphique Q8_0≈49 tok/s Tient dans la mémoire unifiée Q8_0≈74 tok/s Tient dans la mémoire unifiée Q8_0≈36 tok/s Tient dans la mémoire unifiée Q8_0≈39 tok/s Tient dans la mémoire unifiée Q8_0≈14,8 tok/s Tient dans la RAM (CPU) Q8_0≈33 tok/s Tient dans la RAM (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5,3 tok/s Fonctionne avec déport en RAM Q4_K_S≈5,1 tok/s Fonctionne avec déport en RAM Q4_K_M≈5,6 tok/s Fonctionne avec déport en RAM Q4_K_M≈5,7 tok/s Fonctionne avec déport en RAM Q3_K_M≈10,2 tok/s Fonctionne avec déport en RAM Q5_K_M≈55 tok/s Tient dans la mémoire graphique Q4_0≈10,0 tok/s Fonctionne avec déport en RAM UD-Q4_K_XL≈22 tok/s Tient dans la mémoire graphique Q5_K_M≈15,2 tok/s Tient dans la mémoire graphique Q5_K_M≈12,8 tok/s Tient dans la mémoire unifiée Q8_0≈13,9 tok/s Tient dans la mémoire unifiée Q4_K_M≈10,6 tok/s Tient dans la mémoire unifiée Q5_K_M≈10,0 tok/s Tient dans la mémoire unifiée Q4_K_M≈8,0 tok/s Tient dans la RAM (CPU) Q8_0≈13,1 tok/s Tient dans la RAM (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19,1 tok/s Fonctionne avec déport en RAM MXFP4≈19,6 tok/s Fonctionne avec déport en RAM MXFP426–28 tok/smesuré Fonctionne avec déport en RAM MXFP4≈25 tok/s Fonctionne avec déport en RAM MXFP4≈31 tok/s Fonctionne avec déport en RAM MXFP4≈258 tok/s Tient dans la mémoire graphique MXFP4≈36 tok/s Fonctionne avec déport en RAM MXFP441–73 tok/smesuré Tient dans la mémoire graphique MXFP4≈71 tok/s Tient dans la mémoire graphique MXFP4≈60 tok/s Tient dans la mémoire unifiée MXFP4≈90 tok/s Tient dans la mémoire unifiée MXFP450 tok/smesuré Tient dans la mémoire unifiée MXFP461 tok/smesuré Tient dans la mémoire unifiée MXFP4≈15,8 tok/s Tient dans la RAM (CPU) MXFP4≈36 tok/s Tient dans la RAM (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10,5 tok/s Fonctionne avec déport en RAM UD-IQ4_NL≈10,8 tok/s Fonctionne avec déport en RAM Q4_K_S≈11,1 tok/s Fonctionne avec déport en RAM Q4_K_S≈11,2 tok/s Fonctionne avec déport en RAM UD-Q4_K_XL≈11,9 tok/s Fonctionne avec déport en RAM UD-Q5_K_XL≈97 tok/s Tient dans la mémoire graphique UD-IQ3_XXS≈76 tok/s Tient dans la mémoire graphique UD-IQ4_NL≈46 tok/s Tient dans la mémoire graphique UD-Q5_K_XL≈27 tok/s Tient dans la mémoire graphique UD-Q5_K_XL≈23 tok/s Tient dans la mémoire unifiée Q8_0≈24 tok/s Tient dans la mémoire unifiée Q6_K≈15,1 tok/s Tient dans la mémoire unifiée Q6_K≈16,1 tok/s Tient dans la mémoire unifiée UD-Q5_K_XL≈10,4 tok/s Tient dans la RAM (CPU) Q8_0≈19,3 tok/s Tient dans la RAM (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas UD-Q4_K_XL≈10,8 tok/s Fonctionne avec déport en RAM UD-Q2_K_XL≈8,0 tok/scompression forte Fonctionne avec déport en RAM Q3_K_M≈6,1 tok/s Fonctionne avec déport en RAM UD-Q3_K_XL≈11,7 tok/s Fonctionne avec déport en RAM UD-Q2_K_XL≈19,4 tok/scompression forte Tient dans la mémoire unifiée Q8_0≈10,8 tok/s Tient dans la mémoire unifiée UD-Q3_K_XL≈12,2 tok/s Tient dans la mémoire unifiée UD-Q3_K_XL≈13,0 tok/s Tient dans la mémoire unifiée Q4_K_M≈7,2 tok/s Tient dans la RAM (CPU) Q8_0≈10,9 tok/s Tient dans la RAM (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas UD-IQ3_XXS≈7,3 tok/s Fonctionne avec déport en RAM UD-IQ1_S≈5,6 tok/scompression forte Fonctionne avec déport en RAM UD-IQ2_XXS≈4,7 tok/scompression forte Fonctionne avec déport en RAM UD-IQ3_XXS≈3,5 tok/s Fonctionne avec déport en RAM UD-TQ1_0≈16,2 tok/scompression forte Tient dans la mémoire unifiée Q4_1≈10,0 tok/s Tient dans la mémoire unifiée UD-IQ1_M≈9,6 tok/scompression forte Tient dans la mémoire unifiée UD-IQ1_M≈10,3 tok/scompression forte Tient dans la mémoire unifiée Q4_K_M≈4,7 tok/s Tient dans la RAM (CPU) Q4_1≈10,2 tok/s Tient dans la RAM (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas UD-IQ1_S≈16,9 tok/scompression forte Fonctionne avec déport en RAM ✕ Ne tient pas ✕ Ne tient pas UD-IQ1_S≈8,0 tok/scompression forte Fonctionne avec déport en RAM ✕ Ne tient pas Q3_K_M≈14,9 tok/s Tient dans la mémoire unifiée ✕ Ne tient pas ✕ Ne tient pas Q4_K_M≈5,2 tok/s Tient dans la RAM (CPU) Q3_K_M≈13,9 tok/s Tient dans la RAM (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas ✕ Ne tient pas UD-Q2_K_XL≈22 tok/scompression forte Tient dans la mémoire unifiée ✕ Ne tient pas ✕ Ne tient pas Q3_K_S≈7,2 tok/s Tient dans la RAM (CPU) UD-IQ2_XXS≈19,7 tok/scompression forte Tient dans la RAM (CPU)

Ce qui s’ouvre à chaque taille de mémoire (contexte 8K)

  1. 8 Go Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B compression forte: Gemma 3 12B · Qwen3 14B
  2. 12 Go Gemma 3 12B · Qwen3 14B compression forte: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 Go gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B compression forte: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 Go Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B compression forte: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 Go Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B compression forte: GLM 4.5 Air
  6. 96 Go GLM 4.5 Air · gpt-oss-120b compression forte: Qwen3 235B A22B · GLM 4.7
  7. 128 Go Qwen3 235B A22B
  8. 192 Go GLM 4.7 compression forte: DeepSeek R1
  9. 256 Go compression forte: Kimi K2.5
  10. 512 Go DeepSeek R1 · Kimi K2.5

≈ estimations pour un contexte de 8K : poids + cache KV + surcharge du runtime par rapport à la mémoire ; vitesse déduite de la bande passante mémoire. Les chiffres réels dépendent du runtime et des réglages.

Mis à jour · Sources: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Intégrer sur votre site

Collez ce code là où l’infographie doit apparaître : elle se met à jour toute seule. Utilisation gratuite — conservez le lien d’attribution.

JSON Nos données : CC BY 4.0 avec un lien vers la source ; les données tierces gardent la licence de leur source.

Lire la matrice en trois étapes

Cette infographie répond à une question simple : tel modèle tourne-t-il sur mon ordinateur, et à quelle vitesse ? Les lignes listent des modèles connus à poids ouverts, d'environ 3B à 1T de paramètres ; les colonnes, des cartes graphiques, des configurations multi-GPU, des machines Apple et AMD à mémoire unifiée et des serveurs CPU.

  1. Repérez votre matériel dans les colonnes, ou saisissez dans le calculateur votre mémoire graphique (VRAM), votre RAM et la bande passante mémoire.
  2. Lisez la cellule. Elle donne la quantification conseillée, l'endroit où loge le modèle et une vitesse de génération approximative en tokens par seconde. « Tient dans la mémoire graphique » est l'idéal ; « Fonctionne avec déport en RAM » signifie qu'une partie du modèle passe en mémoire système : cela marche, mais plus lentement.
  3. Ajustez le contexte dans le calculateur. La matrice compte 8192 tokens, mais un long contexte peut réclamer autant de mémoire qu'un petit modèle.

Sous la matrice, une échelle montre ce qui devient accessible à 8, 12, 16, 24, 48, 96 et 128 Go de mémoire.

Le calcul derrière chaque case

La mémoire nécessaire additionne trois blocs : les poids (paramètres multipliés par les bits par poids, ou la taille réelle du fichier GGUF), le cache KV lié au contexte et environ 1,5 Go de surcoût pour l'environnement d'exécution, auxquels s'ajoute le projecteur visuel d'un VLM. La vitesse se déduit de la bande passante mémoire divisée par les octets lus à chaque token. Pour un modèle MoE, seuls les paramètres actifs comptent, si bien qu'un gros MoE peut répondre plus vite qu'un modèle dense plus petit.

La quantification conseillée est la plus fine jusqu'à Q8_0 qui tient encore au moins 10 tokens par seconde, sinon la classe Q4. Jamais BF16, et jamais sous Q3 sauf si rien de plus gros ne rentre : la cellule affiche alors « compression forte ».

Quelle confiance accorder aux estimations ?

Le signe ≈ marque une estimation, calibrée sur des exécutions mesurées avec llama.cpp et des rapports publics ; elle reste à environ ±35% de ces mesures. Le moteur, les pilotes et les réglages font varier le résultat réel, et le traitement d'une longue requête n'est pas compté, seule la génération l'est. Les cellules mesurées affichent la mesure et un lien vers la source. Les modèles sans filtres de sécurité restent masqués derrière un interrupteur. Pour une machine complète, voyez les configurations PC pour l'IA locale.