Salt la conținut
fedi.software

Ce model deschis se potrivește hardware-ului dumneavoastră — 2026

Modele cu ponderi deschise comparate cu plăcile video și calculatoarele populare: cuantizarea recomandată (cea mai mare până la Q8 care oferă încă 10 sau mai mulți tokeni pe secundă, altfel una din clasa Q4; sub Q3 doar atunci când nu încape nimic altceva), unde rulează (memorie video, memorie unificată sau descărcat în RAM) și o viteză aproximativă de generare.

Model Parametri
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s Încape în memoria video Q8_0≈67 tok/s Încape în memoria video Q8_0≈218 tok/s Încape în memoria video Q8_0≈235 tok/s Încape în memoria video Q8_0≈417 tok/s Încape în memoria video Q8_0≈417 tok/s Încape în memoria video Q8_0≈168 tok/s Încape în memoria video Q8_0≈136 tok/s Încape în memoria video Q8_0≈115 tok/s Încape în memoria video Q8_0≈111 tok/s Încape în memoria unificată Q8_0≈167 tok/s Încape în memoria unificată Q8_0≈52 tok/s Încape în memoria unificată Q8_0≈56 tok/s Încape în memoria unificată Q8_0≈15,0 tok/s Încape în RAM (CPU) Q8_0≈34 tok/s Încape în RAM (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s Încape în memoria video Q8_0≈59 tok/s Încape în memoria video Q8_0≈192 tok/s Încape în memoria video Q8_0≈207 tok/s Încape în memoria video Q8_0≈368 tok/s Încape în memoria video Q8_0≈368 tok/s Încape în memoria video Q8_0≈148 tok/s Încape în memoria video Q8_0≈120 tok/s Încape în memoria video Q8_0≈101 tok/s Încape în memoria video Q8_0≈98 tok/s Încape în memoria unificată Q8_0≈147 tok/s Încape în memoria unificată Q8_0≈46 tok/s Încape în memoria unificată Q8_0≈49 tok/s Încape în memoria unificată Q8_0≈14,3 tok/s Încape în RAM (CPU) Q8_0≈32 tok/s Încape în RAM (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s Încape în memoria video Q8_0≈54 tok/s Încape în memoria video Q8_0≈175 tok/s Încape în memoria video Q8_0≈189 tok/s Încape în memoria video Q8_0≈335 tok/s Încape în memoria video Q8_0≈335 tok/s Încape în memoria video Q8_0≈135 tok/s Încape în memoria video Q8_0≈109 tok/s Încape în memoria video Q8_0≈92 tok/s Încape în memoria video Q8_0≈89 tok/s Încape în memoria unificată Q8_0≈134 tok/s Încape în memoria unificată Q8_0≈42 tok/s Încape în memoria unificată Q8_0≈45 tok/s Încape în memoria unificată Q8_0≈13,8 tok/s Încape în RAM (CPU) Q8_0≈31 tok/s Încape în RAM (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s Încape în memoria video UD-Q6_K_XL≈29 tok/s Încape în memoria video UD-Q6_K_XL≈95 tok/s Încape în memoria video UD-Q6_K_XL≈103 tok/s Încape în memoria video UD-Q6_K_XL≈182 tok/s Încape în memoria video UD-Q6_K_XL≈182 tok/s Încape în memoria video UD-Q6_K_XL≈73 tok/s Încape în memoria video UD-Q6_K_XL≈59 tok/s Încape în memoria video UD-Q6_K_XL≈50 tok/s Încape în memoria video UD-Q6_K_XL≈49 tok/s Încape în memoria unificată UD-Q6_K_XL≈73 tok/s Încape în memoria unificată UD-Q6_K_XL≈23 tok/s Încape în memoria unificată UD-Q6_K_XL≈24 tok/s Încape în memoria unificată UD-Q6_K_XL≈10,3 tok/s Încape în RAM (CPU) UD-Q6_K_XL≈23 tok/s Încape în RAM (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s Încape în memoria video Q8_0≈25 tok/s Încape în memoria video Q8_0≈80 tok/s Încape în memoria video Q8_0≈87 tok/s Încape în memoria video Q8_0≈154 tok/s Încape în memoria video Q8_0≈154 tok/s Încape în memoria video Q8_0≈62 tok/s Încape în memoria video Q8_0≈50 tok/s Încape în memoria video Q8_0≈42 tok/s Încape în memoria video Q8_0≈41 tok/s Încape în memoria unificată Q8_0≈62 tok/s Încape în memoria unificată Q8_0≈19,2 tok/s Încape în memoria unificată Q8_0≈21 tok/s Încape în memoria unificată UD-Q6_K_XL≈10,2 tok/s Încape în RAM (CPU) Q8_0≈21 tok/s Încape în RAM (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s Încape în memoria video Q8_0≈17,8 tok/s Încape în memoria video Q8_0≈58 tok/s Încape în memoria video Q8_0≈62 tok/s Încape în memoria video Q8_0≈111 tok/s Încape în memoria video Q8_0≈111 tok/s Încape în memoria video Q8_0≈44 tok/s Încape în memoria video Q8_0≈36 tok/s Încape în memoria video Q8_0≈30 tok/s Încape în memoria video Q8_0≈30 tok/s Încape în memoria unificată Q8_0≈44 tok/s Încape în memoria unificată Q8_0≈13,8 tok/s Încape în memoria unificată Q8_0≈14,8 tok/s Încape în memoria unificată Q4_1≈10,2 tok/s Încape în RAM (CPU) Q8_0≈17,1 tok/s Încape în RAM (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s Încape în memoria video Q6_K≈18,0 tok/s Încape în memoria video Q8_0≈46 tok/s Încape în memoria video Q8_0≈49 tok/s Încape în memoria video Q8_0≈88 tok/s Încape în memoria video Q8_0≈88 tok/s Încape în memoria video Q8_0≈35 tok/s Încape în memoria video Q8_0≈29 tok/s Încape în memoria video Q8_0≈24 tok/s Încape în memoria video Q8_0≈23 tok/s Încape în memoria unificată Q8_0≈35 tok/s Încape în memoria unificată Q8_0≈10,9 tok/s Încape în memoria unificată Q8_0≈11,7 tok/s Încape în memoria unificată UD-Q3_K_XL≈10,1 tok/s Încape în RAM (CPU) Q8_0≈14,6 tok/s Încape în RAM (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s Rulează cu descărcare în RAM MXFP4≈55 tok/s Încape în memoria video MXFP4162 tok/smăsurat Încape în memoria video MXFP4≈194 tok/s Încape în memoria video MXFP4≈344 tok/s Încape în memoria video MXFP4≈344 tok/s Încape în memoria video MXFP4≈138 tok/s Încape în memoria video MXFP4≈112 tok/s Încape în memoria video MXFP4≈95 tok/s Încape în memoria video MXFP4≈80 tok/s Încape în memoria unificată MXFP4116 tok/smăsurat Încape în memoria unificată MXFP4≈59 tok/s Încape în memoria unificată MXFP4≈62 tok/s Încape în memoria unificată MXFP4≈17,2 tok/s Încape în RAM (CPU) MXFP4≈39 tok/s Încape în RAM (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10,2 tok/s Rulează cu descărcare în RAM UD-Q3_K_XL≈18,4 tok/s Încape în memoria video Q6_K≈37 tok/s Încape în memoria video Q6_K≈40 tok/s Încape în memoria video Q8_0≈56 tok/s Încape în memoria video Q8_0≈56 tok/s Încape în memoria video Q8_0≈22 tok/s Încape în memoria video Q8_0≈18,2 tok/s Încape în memoria video Q8_0≈15,3 tok/s Încape în memoria video Q8_0≈14,9 tok/s Încape în memoria unificată Q8_0≈22 tok/s Încape în memoria unificată Q5_K_M≈10,3 tok/s Încape în memoria unificată Q5_K_M≈11,0 tok/s Încape în memoria unificată Q4_K_M≈6,9 tok/s Încape în RAM (CPU) Q8_0≈10,3 tok/s Încape în RAM (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14,7 tok/s Rulează cu descărcare în RAM UD-Q3_K_M≈56 tok/s Încape în memoria video UD-Q5_K_S≈129 tok/s Încape în memoria video UD-Q5_K_S≈139 tok/s Încape în memoria video UD-Q8_K_XL≈173 tok/s Încape în memoria video UD-Q8_K_XL≈173 tok/s Încape în memoria video UD-Q8_K_XL≈70 tok/s Încape în memoria video UD-Q8_K_XL≈57 tok/s Încape în memoria video UD-Q8_K_XL≈48 tok/s Încape în memoria video UD-Q8_K_XL≈40 tok/s Încape în memoria unificată UD-Q8_K_XL≈60 tok/s Încape în memoria unificată UD-Q8_K_XL≈29 tok/s Încape în memoria unificată UD-Q8_K_XL≈31 tok/s Încape în memoria unificată UD-Q8_K_XL≈13,7 tok/s Încape în RAM (CPU) UD-Q8_K_XL≈31 tok/s Încape în RAM (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12,7 tok/s Rulează cu descărcare în RAM Q3_K_S≈18,1 tok/s Încape în memoria video UD-Q5_K_XL≈38 tok/s Încape în memoria video UD-Q5_K_XL≈41 tok/s Încape în memoria video UD-Q6_K_XL≈59 tok/s Încape în memoria video Q8_0≈49 tok/s Încape în memoria video Q8_0≈19,7 tok/s Încape în memoria video Q8_0≈16,0 tok/s Încape în memoria video Q8_0≈13,5 tok/s Încape în memoria video Q8_0≈13,1 tok/s Încape în memoria unificată Q8_0≈19,6 tok/s Încape în memoria unificată Q4_1≈10,1 tok/s Încape în memoria unificată Q4_1≈10,8 tok/s Încape în memoria unificată Q4_K_M≈6,3 tok/s Încape în RAM (CPU) UD-Q6_K_XL≈10,8 tok/s Încape în RAM (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16,4 tok/s Rulează cu descărcare în RAM Q3_K_S≈66 tok/s Încape în memoria video Q4_K_M154 tok/smăsurat Încape în memoria video Q5_K_S≈158 tok/s Încape în memoria video UD-Q6_K_XL≈232 tok/s Încape în memoria video Q8_0≈192 tok/s Încape în memoria video Q8_0≈77 tok/s Încape în memoria video Q8_0≈63 tok/s Încape în memoria video Q8_0≈53 tok/s Încape în memoria video Q8_0≈45 tok/s Încape în memoria unificată Q8_0≈67 tok/s Încape în memoria unificată Q8_0≈33 tok/s Încape în memoria unificată Q8_0≈35 tok/s Încape în memoria unificată Q8_0≈14,3 tok/s Încape în RAM (CPU) Q8_0≈32 tok/s Încape în RAM (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3,8 tok/s Rulează cu descărcare în RAM Q3_K_S≈10,4 tok/s Rulează cu descărcare în RAM Q4_1≈37 tok/s Încape în memoria video Q4_1≈40 tok/s Încape în memoria video Q6_K≈55 tok/s Încape în memoria video Q8_0≈43 tok/s Încape în memoria video Q8_0≈17,1 tok/s Încape în memoria video Q8_0≈13,9 tok/s Încape în memoria video Q8_0≈11,7 tok/s Încape în memoria video Q8_0≈11,3 tok/s Încape în memoria unificată Q8_0≈17,0 tok/s Încape în memoria unificată IQ4_XS≈10,3 tok/s Încape în memoria unificată Q4_K_S≈10,3 tok/s Încape în memoria unificată Q4_K_M≈5,7 tok/s Încape în RAM (CPU) Q6_K≈10,1 tok/s Încape în RAM (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3,7 tok/s Rulează cu descărcare în RAM UD-IQ3_XXS≈14,1 tok/s Rulează cu descărcare în RAM UD-Q4_K_XL≈35 tok/s Încape în memoria video UD-Q4_K_XL≈38 tok/s Încape în memoria video Q6_K≈51 tok/s Încape în memoria video Q8_0≈40 tok/s Încape în memoria video Q8_0≈16,0 tok/s Încape în memoria video Q8_0≈13,0 tok/s Încape în memoria video Q8_0≈11,0 tok/s Încape în memoria video Q8_0≈10,6 tok/s Încape în memoria unificată Q8_0≈16,0 tok/s Încape în memoria unificată UD-Q3_K_XL≈10,3 tok/s Încape în memoria unificată IQ4_XS≈10,2 tok/s Încape în memoria unificată Q4_K_M≈5,4 tok/s Încape în RAM (CPU) Q5_K_M≈10,8 tok/s Încape în RAM (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17,9 tok/s Rulează cu descărcare în RAM Q8_0≈18,7 tok/s Rulează cu descărcare în RAM Q4_K_S≈191 tok/s Încape în memoria video Q4_K_S≈205 tok/s Încape în memoria video Q6_K≈274 tok/s Încape în memoria video Q8_0≈220 tok/s Încape în memoria video Q8_0≈89 tok/s Încape în memoria video Q8_0≈72 tok/s Încape în memoria video Q8_0≈61 tok/s Încape în memoria video Q8_0≈51 tok/s Încape în memoria unificată Q8_0≈77 tok/s Încape în memoria unificată Q8_0≈37 tok/s Încape în memoria unificată Q8_0≈40 tok/s Încape în memoria unificată Q8_0≈15,0 tok/s Încape în RAM (CPU) Q8_0≈34 tok/s Încape în RAM (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1,3 tok/s Rulează cu descărcare în RAM Q4_K_M≈1,4 tok/s Rulează cu descărcare în RAM Q4_K_M≈2,0 tok/s Rulează cu descărcare în RAM Q4_K_M≈2,0 tok/s Rulează cu descărcare în RAM UD-IQ3_XXS≈49 tok/s Încape în memoria video Q8_0≈18,8 tok/s Încape în memoria video Q4_K_M16,3 tok/smăsurat Încape în memoria video Q4_1≈10,3 tok/s Încape în memoria video IQ4_XS≈10,0 tok/s Încape în memoria video UD-Q3_K_XL≈10,6 tok/s Încape în memoria unificată Q5_K_M≈11,2 tok/s Încape în memoria unificată Q4_K_M≈4,1 tok/s Încape în memoria unificată Q4_K_M≈4,4 tok/s Încape în memoria unificată Q4_K_M≈2,9 tok/s Încape în RAM (CPU) Q4_K_M≈6,6 tok/s Încape în RAM (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s Rulează cu descărcare în RAM Q6_K≈21 tok/s Rulează cu descărcare în RAM UD-Q6_K_XL≈26 tok/s Rulează cu descărcare în RAM UD-Q6_K_XL≈26 tok/s Rulează cu descărcare în RAM UD-Q6_K_XL≈31 tok/s Rulează cu descărcare în RAM Q8_0≈213 tok/s Încape în memoria video Q4_K_S≈145 tok/s Încape în memoria video UD-Q6_K_XL≈84 tok/s Încape în memoria video Q8_0≈59 tok/s Încape în memoria video Q8_0≈49 tok/s Încape în memoria unificată Q8_0≈74 tok/s Încape în memoria unificată Q8_0≈36 tok/s Încape în memoria unificată Q8_0≈39 tok/s Încape în memoria unificată Q8_0≈14,8 tok/s Încape în RAM (CPU) Q8_0≈33 tok/s Încape în RAM (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5,3 tok/s Rulează cu descărcare în RAM Q4_K_S≈5,1 tok/s Rulează cu descărcare în RAM Q4_K_M≈5,6 tok/s Rulează cu descărcare în RAM Q4_K_M≈5,7 tok/s Rulează cu descărcare în RAM Q3_K_M≈10,2 tok/s Rulează cu descărcare în RAM Q5_K_M≈55 tok/s Încape în memoria video Q4_0≈10,0 tok/s Rulează cu descărcare în RAM UD-Q4_K_XL≈22 tok/s Încape în memoria video Q5_K_M≈15,2 tok/s Încape în memoria video Q5_K_M≈12,8 tok/s Încape în memoria unificată Q8_0≈13,9 tok/s Încape în memoria unificată Q4_K_M≈10,6 tok/s Încape în memoria unificată Q5_K_M≈10,0 tok/s Încape în memoria unificată Q4_K_M≈8,0 tok/s Încape în RAM (CPU) Q8_0≈13,1 tok/s Încape în RAM (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19,1 tok/s Rulează cu descărcare în RAM MXFP4≈19,6 tok/s Rulează cu descărcare în RAM MXFP426–28 tok/smăsurat Rulează cu descărcare în RAM MXFP4≈25 tok/s Rulează cu descărcare în RAM MXFP4≈31 tok/s Rulează cu descărcare în RAM MXFP4≈258 tok/s Încape în memoria video MXFP4≈36 tok/s Rulează cu descărcare în RAM MXFP441–73 tok/smăsurat Încape în memoria video MXFP4≈71 tok/s Încape în memoria video MXFP4≈60 tok/s Încape în memoria unificată MXFP4≈90 tok/s Încape în memoria unificată MXFP450 tok/smăsurat Încape în memoria unificată MXFP461 tok/smăsurat Încape în memoria unificată MXFP4≈15,8 tok/s Încape în RAM (CPU) MXFP4≈36 tok/s Încape în RAM (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10,5 tok/s Rulează cu descărcare în RAM UD-IQ4_NL≈10,8 tok/s Rulează cu descărcare în RAM Q4_K_S≈11,1 tok/s Rulează cu descărcare în RAM Q4_K_S≈11,2 tok/s Rulează cu descărcare în RAM UD-Q4_K_XL≈11,9 tok/s Rulează cu descărcare în RAM UD-Q5_K_XL≈97 tok/s Încape în memoria video UD-IQ3_XXS≈76 tok/s Încape în memoria video UD-IQ4_NL≈46 tok/s Încape în memoria video UD-Q5_K_XL≈27 tok/s Încape în memoria video UD-Q5_K_XL≈23 tok/s Încape în memoria unificată Q8_0≈24 tok/s Încape în memoria unificată Q6_K≈15,1 tok/s Încape în memoria unificată Q6_K≈16,1 tok/s Încape în memoria unificată UD-Q5_K_XL≈10,4 tok/s Încape în RAM (CPU) Q8_0≈19,3 tok/s Încape în RAM (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape UD-Q4_K_XL≈10,8 tok/s Rulează cu descărcare în RAM UD-Q2_K_XL≈8,0 tok/scompresie puternică Rulează cu descărcare în RAM Q3_K_M≈6,1 tok/s Rulează cu descărcare în RAM UD-Q3_K_XL≈11,7 tok/s Rulează cu descărcare în RAM UD-Q2_K_XL≈19,4 tok/scompresie puternică Încape în memoria unificată Q8_0≈10,8 tok/s Încape în memoria unificată UD-Q3_K_XL≈12,2 tok/s Încape în memoria unificată UD-Q3_K_XL≈13,0 tok/s Încape în memoria unificată Q4_K_M≈7,2 tok/s Încape în RAM (CPU) Q8_0≈10,9 tok/s Încape în RAM (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape UD-IQ3_XXS≈7,3 tok/s Rulează cu descărcare în RAM UD-IQ1_S≈5,6 tok/scompresie puternică Rulează cu descărcare în RAM UD-IQ2_XXS≈4,7 tok/scompresie puternică Rulează cu descărcare în RAM UD-IQ3_XXS≈3,5 tok/s Rulează cu descărcare în RAM UD-TQ1_0≈16,2 tok/scompresie puternică Încape în memoria unificată Q4_1≈10,0 tok/s Încape în memoria unificată UD-IQ1_M≈9,6 tok/scompresie puternică Încape în memoria unificată UD-IQ1_M≈10,3 tok/scompresie puternică Încape în memoria unificată Q4_K_M≈4,7 tok/s Încape în RAM (CPU) Q4_1≈10,2 tok/s Încape în RAM (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape UD-IQ1_S≈16,9 tok/scompresie puternică Rulează cu descărcare în RAM ✕ Nu încape ✕ Nu încape UD-IQ1_S≈8,0 tok/scompresie puternică Rulează cu descărcare în RAM ✕ Nu încape Q3_K_M≈14,9 tok/s Încape în memoria unificată ✕ Nu încape ✕ Nu încape Q4_K_M≈5,2 tok/s Încape în RAM (CPU) Q3_K_M≈13,9 tok/s Încape în RAM (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape ✕ Nu încape UD-Q2_K_XL≈22 tok/scompresie puternică Încape în memoria unificată ✕ Nu încape ✕ Nu încape Q3_K_S≈7,2 tok/s Încape în RAM (CPU) UD-IQ2_XXS≈19,7 tok/scompresie puternică Încape în RAM (CPU)

Ce se deblochează la fiecare dimensiune de memorie (context 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B compresie puternică: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B compresie puternică: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B compresie puternică: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B compresie puternică: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B compresie puternică: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b compresie puternică: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 compresie puternică: DeepSeek R1
  9. 256 GB compresie puternică: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ estimări pentru un context de 8K: ponderi + cache KV + overhead-ul runtime-ului raportate la memorie; viteza din lățimea de bandă a memoriei. Valorile reale depind de runtime și de setări.

Actualizat · Surse: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

Încorporați pe site-ul dumneavoastră

Lipiți acest cod acolo unde trebuie să apară infograficul: se actualizează singur. Gratuit — păstrați linkul de atribuire.

JSON Datele noastre: CC BY 4.0 cu link către sursă; datele terților își păstrează licența sursei.

Ce arată matricea?

Pe rânduri sunt modele cunoscute cu ponderi deschise, de la aproximativ 3B până la 1T de parametri; pe coloane, plăci video, configurații cu mai multe GPU-uri, sisteme Apple și AMD cu memorie unificată și servere CPU. Fiecare celulă indică cuantizarea recomandată, locul în care stă modelul și o viteză aproximativă de generare în tokeni pe secundă. Dedesubt găsiți un calculator pentru valorile dumneavoastră și o scară care arată ce devine posibil cu 8, 12, 16, 24, 48, 96 și 128 GB de memorie.

Cum se calculează memoria?

  • Ponderile: parametrii înmulțiți cu biții pe pondere sau dimensiunea reală a fișierului GGUF.
  • Cache-ul KV: crește odată cu contextul. Matricea folosește 8192 de tokeni; în calculator îl puteți modifica, iar un context lung poate ocupa tot atâta VRAM cât un model mic.
  • Overhead-ul: circa 1,5 GB pentru mediul de execuție, plus proiectorul vizual în cazul unui VLM.

„Încape în memoria video” este situația ideală. „Rulează cu descărcare în RAM” înseamnă că o parte a modelului stă în memoria sistemului: funcționează, dar mai lent.

De unde vine viteza?

La generare, modelul își citește ponderile din memorie pentru fiecare token, deci viteza este, aproximativ, lățimea de bandă a memoriei împărțită la octeții citiți pe token. La modelele MoE contează doar parametrii activi, motiv pentru care un MoE mare poate răspunde mai repede decât un model dens mai mic.

Ce cuantizare se recomandă?

Treapta maximă până la Q8_0 care mai asigură cel puțin 10 tokeni pe secundă; dacă nu există, clasa Q4. Niciodată BF16 și niciodată sub Q3, decât dacă nu încape nimic mai mare: atunci celula afișează „compresie puternică”.

Cât de exacte sunt estimările?

Semnul ≈ marchează o estimare, calibrată pe rulări măsurate cu llama.cpp și pe rapoarte publice; ea rămâne la aproximativ ±35% de aceste măsurători. Mediul de rulare, driverele și setările modifică rezultatul real, iar citirea unui prompt lung nu este inclusă, doar generarea. Celulele cu o măsurătoare reală o afișează împreună cu linkul către sursă. Modelele fără filtre de siguranță sunt ascunse în spatele unui comutator. Pentru un sistem complet, consultați configurațiile PC pentru AI local.