본문으로 건너뛰기
fedi.software

내 하드웨어에 맞는 오픈 모델 — 2026

오픈 웨이트 모델을 인기 그래픽카드와 컴퓨터에 맞춰 보여 줍니다. 권장 양자화(초당 10토큰 이상을 유지하는 Q8 이하의 가장 큰 것, 그렇지 않으면 Q4 계열이며, 다른 것이 들어가지 않을 때만 Q3 미만), 실행되는 위치(그래픽 메모리, 통합 메모리 또는 RAM 오프로드), 그리고 대략적인 생성 속도를 안내합니다.

모델 파라미터
Qwen2.5 3B Instruct HF 3.1B Q8_0≈84 tok/s 그래픽 메모리에 들어감 Q8_0≈67 tok/s 그래픽 메모리에 들어감 Q8_0≈218 tok/s 그래픽 메모리에 들어감 Q8_0≈235 tok/s 그래픽 메모리에 들어감 Q8_0≈417 tok/s 그래픽 메모리에 들어감 Q8_0≈417 tok/s 그래픽 메모리에 들어감 Q8_0≈168 tok/s 그래픽 메모리에 들어감 Q8_0≈136 tok/s 그래픽 메모리에 들어감 Q8_0≈115 tok/s 그래픽 메모리에 들어감 Q8_0≈111 tok/s 통합 메모리에 들어감 Q8_0≈167 tok/s 통합 메모리에 들어감 Q8_0≈52 tok/s 통합 메모리에 들어감 Q8_0≈56 tok/s 통합 메모리에 들어감 Q8_0≈15.0 tok/s RAM에 들어감 (CPU) Q8_0≈34 tok/s RAM에 들어감 (CPU)
Llama 3.2 3B Instruct HF 3.2B Q8_0≈74 tok/s 그래픽 메모리에 들어감 Q8_0≈59 tok/s 그래픽 메모리에 들어감 Q8_0≈192 tok/s 그래픽 메모리에 들어감 Q8_0≈207 tok/s 그래픽 메모리에 들어감 Q8_0≈368 tok/s 그래픽 메모리에 들어감 Q8_0≈368 tok/s 그래픽 메모리에 들어감 Q8_0≈148 tok/s 그래픽 메모리에 들어감 Q8_0≈120 tok/s 그래픽 메모리에 들어감 Q8_0≈101 tok/s 그래픽 메모리에 들어감 Q8_0≈98 tok/s 통합 메모리에 들어감 Q8_0≈147 tok/s 통합 메모리에 들어감 Q8_0≈46 tok/s 통합 메모리에 들어감 Q8_0≈49 tok/s 통합 메모리에 들어감 Q8_0≈14.3 tok/s RAM에 들어감 (CPU) Q8_0≈32 tok/s RAM에 들어감 (CPU)
Gemma 3 4B HF 4.3B Q8_0≈67 tok/s 그래픽 메모리에 들어감 Q8_0≈54 tok/s 그래픽 메모리에 들어감 Q8_0≈175 tok/s 그래픽 메모리에 들어감 Q8_0≈189 tok/s 그래픽 메모리에 들어감 Q8_0≈335 tok/s 그래픽 메모리에 들어감 Q8_0≈335 tok/s 그래픽 메모리에 들어감 Q8_0≈135 tok/s 그래픽 메모리에 들어감 Q8_0≈109 tok/s 그래픽 메모리에 들어감 Q8_0≈92 tok/s 그래픽 메모리에 들어감 Q8_0≈89 tok/s 통합 메모리에 들어감 Q8_0≈134 tok/s 통합 메모리에 들어감 Q8_0≈42 tok/s 통합 메모리에 들어감 Q8_0≈45 tok/s 통합 메모리에 들어감 Q8_0≈13.8 tok/s RAM에 들어감 (CPU) Q8_0≈31 tok/s RAM에 들어감 (CPU)
Llama 3.1 8B Instruct HF 8B UD-Q6_K_XL≈37 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈29 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈95 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈103 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈182 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈182 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈73 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈59 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈50 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈49 tok/s 통합 메모리에 들어감 UD-Q6_K_XL≈73 tok/s 통합 메모리에 들어감 UD-Q6_K_XL≈23 tok/s 통합 메모리에 들어감 UD-Q6_K_XL≈24 tok/s 통합 메모리에 들어감 UD-Q6_K_XL≈10.3 tok/s RAM에 들어감 (CPU) UD-Q6_K_XL≈23 tok/s RAM에 들어감 (CPU)
Qwen3 8B HF 8.2B Q8_0≈31 tok/s 그래픽 메모리에 들어감 Q8_0≈25 tok/s 그래픽 메모리에 들어감 Q8_0≈80 tok/s 그래픽 메모리에 들어감 Q8_0≈87 tok/s 그래픽 메모리에 들어감 Q8_0≈154 tok/s 그래픽 메모리에 들어감 Q8_0≈154 tok/s 그래픽 메모리에 들어감 Q8_0≈62 tok/s 그래픽 메모리에 들어감 Q8_0≈50 tok/s 그래픽 메모리에 들어감 Q8_0≈42 tok/s 그래픽 메모리에 들어감 Q8_0≈41 tok/s 통합 메모리에 들어감 Q8_0≈62 tok/s 통합 메모리에 들어감 Q8_0≈19.2 tok/s 통합 메모리에 들어감 Q8_0≈21 tok/s 통합 메모리에 들어감 UD-Q6_K_XL≈10.2 tok/s RAM에 들어감 (CPU) Q8_0≈21 tok/s RAM에 들어감 (CPU)
Gemma 3 12B HF 12.2B UD-Q5_K_XL≈32 tok/s 그래픽 메모리에 들어감 Q8_0≈17.8 tok/s 그래픽 메모리에 들어감 Q8_0≈58 tok/s 그래픽 메모리에 들어감 Q8_0≈62 tok/s 그래픽 메모리에 들어감 Q8_0≈111 tok/s 그래픽 메모리에 들어감 Q8_0≈111 tok/s 그래픽 메모리에 들어감 Q8_0≈44 tok/s 그래픽 메모리에 들어감 Q8_0≈36 tok/s 그래픽 메모리에 들어감 Q8_0≈30 tok/s 그래픽 메모리에 들어감 Q8_0≈30 tok/s 통합 메모리에 들어감 Q8_0≈44 tok/s 통합 메모리에 들어감 Q8_0≈13.8 tok/s 통합 메모리에 들어감 Q8_0≈14.8 tok/s 통합 메모리에 들어감 Q4_1≈10.2 tok/s RAM에 들어감 (CPU) Q8_0≈17.1 tok/s RAM에 들어감 (CPU)
Qwen3 14B HF 14.8B Q4_K_M≈30 tok/s 그래픽 메모리에 들어감 Q6_K≈18.0 tok/s 그래픽 메모리에 들어감 Q8_0≈46 tok/s 그래픽 메모리에 들어감 Q8_0≈49 tok/s 그래픽 메모리에 들어감 Q8_0≈88 tok/s 그래픽 메모리에 들어감 Q8_0≈88 tok/s 그래픽 메모리에 들어감 Q8_0≈35 tok/s 그래픽 메모리에 들어감 Q8_0≈29 tok/s 그래픽 메모리에 들어감 Q8_0≈24 tok/s 그래픽 메모리에 들어감 Q8_0≈23 tok/s 통합 메모리에 들어감 Q8_0≈35 tok/s 통합 메모리에 들어감 Q8_0≈10.9 tok/s 통합 메모리에 들어감 Q8_0≈11.7 tok/s 통합 메모리에 들어감 UD-Q3_K_XL≈10.1 tok/s RAM에 들어감 (CPU) Q8_0≈14.6 tok/s RAM에 들어감 (CPU)
gpt-oss-20b HFMoE 20.9B / 3.6B MXFP4≈53 tok/s RAM 오프로드로 실행 MXFP4≈55 tok/s 그래픽 메모리에 들어감 MXFP4162 tok/s실측 그래픽 메모리에 들어감 MXFP4≈194 tok/s 그래픽 메모리에 들어감 MXFP4≈344 tok/s 그래픽 메모리에 들어감 MXFP4≈344 tok/s 그래픽 메모리에 들어감 MXFP4≈138 tok/s 그래픽 메모리에 들어감 MXFP4≈112 tok/s 그래픽 메모리에 들어감 MXFP4≈95 tok/s 그래픽 메모리에 들어감 MXFP4≈80 tok/s 통합 메모리에 들어감 MXFP4116 tok/s실측 통합 메모리에 들어감 MXFP4≈59 tok/s 통합 메모리에 들어감 MXFP4≈62 tok/s 통합 메모리에 들어감 MXFP4≈17.2 tok/s RAM에 들어감 (CPU) MXFP4≈39 tok/s RAM에 들어감 (CPU)
Mistral Small 3.2 24B HF 24B Q3_K_M≈10.2 tok/s RAM 오프로드로 실행 UD-Q3_K_XL≈18.4 tok/s 그래픽 메모리에 들어감 Q6_K≈37 tok/s 그래픽 메모리에 들어감 Q6_K≈40 tok/s 그래픽 메모리에 들어감 Q8_0≈56 tok/s 그래픽 메모리에 들어감 Q8_0≈56 tok/s 그래픽 메모리에 들어감 Q8_0≈22 tok/s 그래픽 메모리에 들어감 Q8_0≈18.2 tok/s 그래픽 메모리에 들어감 Q8_0≈15.3 tok/s 그래픽 메모리에 들어감 Q8_0≈14.9 tok/s 통합 메모리에 들어감 Q8_0≈22 tok/s 통합 메모리에 들어감 Q5_K_M≈10.3 tok/s 통합 메모리에 들어감 Q5_K_M≈11.0 tok/s 통합 메모리에 들어감 Q4_K_M≈6.9 tok/s RAM에 들어감 (CPU) Q8_0≈10.3 tok/s RAM에 들어감 (CPU)
Gemma 4 26B A4B HFMoE 25.8B / 3.8B UD-Q8_K_XL≈14.7 tok/s RAM 오프로드로 실행 UD-Q3_K_M≈56 tok/s 그래픽 메모리에 들어감 UD-Q5_K_S≈129 tok/s 그래픽 메모리에 들어감 UD-Q5_K_S≈139 tok/s 그래픽 메모리에 들어감 UD-Q8_K_XL≈173 tok/s 그래픽 메모리에 들어감 UD-Q8_K_XL≈173 tok/s 그래픽 메모리에 들어감 UD-Q8_K_XL≈70 tok/s 그래픽 메모리에 들어감 UD-Q8_K_XL≈57 tok/s 그래픽 메모리에 들어감 UD-Q8_K_XL≈48 tok/s 그래픽 메모리에 들어감 UD-Q8_K_XL≈40 tok/s 통합 메모리에 들어감 UD-Q8_K_XL≈60 tok/s 통합 메모리에 들어감 UD-Q8_K_XL≈29 tok/s 통합 메모리에 들어감 UD-Q8_K_XL≈31 tok/s 통합 메모리에 들어감 UD-Q8_K_XL≈13.7 tok/s RAM에 들어감 (CPU) UD-Q8_K_XL≈31 tok/s RAM에 들어감 (CPU)
Gemma 3 27B HF 27.4B UD-IQ3_XXS≈12.7 tok/s RAM 오프로드로 실행 Q3_K_S≈18.1 tok/s 그래픽 메모리에 들어감 UD-Q5_K_XL≈38 tok/s 그래픽 메모리에 들어감 UD-Q5_K_XL≈41 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈59 tok/s 그래픽 메모리에 들어감 Q8_0≈49 tok/s 그래픽 메모리에 들어감 Q8_0≈19.7 tok/s 그래픽 메모리에 들어감 Q8_0≈16.0 tok/s 그래픽 메모리에 들어감 Q8_0≈13.5 tok/s 그래픽 메모리에 들어감 Q8_0≈13.1 tok/s 통합 메모리에 들어감 Q8_0≈19.6 tok/s 통합 메모리에 들어감 Q4_1≈10.1 tok/s 통합 메모리에 들어감 Q4_1≈10.8 tok/s 통합 메모리에 들어감 Q4_K_M≈6.3 tok/s RAM에 들어감 (CPU) UD-Q6_K_XL≈10.8 tok/s RAM에 들어감 (CPU)
Qwen3 30B A3B HFMoE 30.5B / 3.3B Q8_0≈16.4 tok/s RAM 오프로드로 실행 Q3_K_S≈66 tok/s 그래픽 메모리에 들어감 Q4_K_M154 tok/s실측 그래픽 메모리에 들어감 Q5_K_S≈158 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈232 tok/s 그래픽 메모리에 들어감 Q8_0≈192 tok/s 그래픽 메모리에 들어감 Q8_0≈77 tok/s 그래픽 메모리에 들어감 Q8_0≈63 tok/s 그래픽 메모리에 들어감 Q8_0≈53 tok/s 그래픽 메모리에 들어감 Q8_0≈45 tok/s 통합 메모리에 들어감 Q8_0≈67 tok/s 통합 메모리에 들어감 Q8_0≈33 tok/s 통합 메모리에 들어감 Q8_0≈35 tok/s 통합 메모리에 들어감 Q8_0≈14.3 tok/s RAM에 들어감 (CPU) Q8_0≈32 tok/s RAM에 들어감 (CPU)
Gemma 4 31B HF 31.3B Q4_K_M≈3.8 tok/s RAM 오프로드로 실행 Q3_K_S≈10.4 tok/s RAM 오프로드로 실행 Q4_1≈37 tok/s 그래픽 메모리에 들어감 Q4_1≈40 tok/s 그래픽 메모리에 들어감 Q6_K≈55 tok/s 그래픽 메모리에 들어감 Q8_0≈43 tok/s 그래픽 메모리에 들어감 Q8_0≈17.1 tok/s 그래픽 메모리에 들어감 Q8_0≈13.9 tok/s 그래픽 메모리에 들어감 Q8_0≈11.7 tok/s 그래픽 메모리에 들어감 Q8_0≈11.3 tok/s 통합 메모리에 들어감 Q8_0≈17.0 tok/s 통합 메모리에 들어감 IQ4_XS≈10.3 tok/s 통합 메모리에 들어감 Q4_K_S≈10.3 tok/s 통합 메모리에 들어감 Q4_K_M≈5.7 tok/s RAM에 들어감 (CPU) Q6_K≈10.1 tok/s RAM에 들어감 (CPU)
Qwen3 32B HF 32.8B Q4_K_M≈3.7 tok/s RAM 오프로드로 실행 UD-IQ3_XXS≈14.1 tok/s RAM 오프로드로 실행 UD-Q4_K_XL≈35 tok/s 그래픽 메모리에 들어감 UD-Q4_K_XL≈38 tok/s 그래픽 메모리에 들어감 Q6_K≈51 tok/s 그래픽 메모리에 들어감 Q8_0≈40 tok/s 그래픽 메모리에 들어감 Q8_0≈16.0 tok/s 그래픽 메모리에 들어감 Q8_0≈13.0 tok/s 그래픽 메모리에 들어감 Q8_0≈11.0 tok/s 그래픽 메모리에 들어감 Q8_0≈10.6 tok/s 통합 메모리에 들어감 Q8_0≈16.0 tok/s 통합 메모리에 들어감 UD-Q3_K_XL≈10.3 tok/s 통합 메모리에 들어감 IQ4_XS≈10.2 tok/s 통합 메모리에 들어감 Q4_K_M≈5.4 tok/s RAM에 들어감 (CPU) Q5_K_M≈10.8 tok/s RAM에 들어감 (CPU)
Qwen3.5 35B A3B HFMoE 36B / 3B Q8_0≈17.9 tok/s RAM 오프로드로 실행 Q8_0≈18.7 tok/s RAM 오프로드로 실행 Q4_K_S≈191 tok/s 그래픽 메모리에 들어감 Q4_K_S≈205 tok/s 그래픽 메모리에 들어감 Q6_K≈274 tok/s 그래픽 메모리에 들어감 Q8_0≈220 tok/s 그래픽 메모리에 들어감 Q8_0≈89 tok/s 그래픽 메모리에 들어감 Q8_0≈72 tok/s 그래픽 메모리에 들어감 Q8_0≈61 tok/s 그래픽 메모리에 들어감 Q8_0≈51 tok/s 통합 메모리에 들어감 Q8_0≈77 tok/s 통합 메모리에 들어감 Q8_0≈37 tok/s 통합 메모리에 들어감 Q8_0≈40 tok/s 통합 메모리에 들어감 Q8_0≈15.0 tok/s RAM에 들어감 (CPU) Q8_0≈34 tok/s RAM에 들어감 (CPU)
Llama 3.3 70B Instruct HF 70.6B Q4_K_M≈1.3 tok/s RAM 오프로드로 실행 Q4_K_M≈1.4 tok/s RAM 오프로드로 실행 Q4_K_M≈2.0 tok/s RAM 오프로드로 실행 Q4_K_M≈2.0 tok/s RAM 오프로드로 실행 UD-IQ3_XXS≈49 tok/s 그래픽 메모리에 들어감 Q8_0≈18.8 tok/s 그래픽 메모리에 들어감 Q4_K_M16.3 tok/s실측 그래픽 메모리에 들어감 Q4_1≈10.3 tok/s 그래픽 메모리에 들어감 IQ4_XS≈10.0 tok/s 그래픽 메모리에 들어감 UD-Q3_K_XL≈10.6 tok/s 통합 메모리에 들어감 Q5_K_M≈11.2 tok/s 통합 메모리에 들어감 Q4_K_M≈4.1 tok/s 통합 메모리에 들어감 Q4_K_M≈4.4 tok/s 통합 메모리에 들어감 Q4_K_M≈2.9 tok/s RAM에 들어감 (CPU) Q4_K_M≈6.6 tok/s RAM에 들어감 (CPU)
Qwen3 Next 80B A3B Instruct HFMoE 81.3B / 3B Q5_K_M≈24 tok/s RAM 오프로드로 실행 Q6_K≈21 tok/s RAM 오프로드로 실행 UD-Q6_K_XL≈26 tok/s RAM 오프로드로 실행 UD-Q6_K_XL≈26 tok/s RAM 오프로드로 실행 UD-Q6_K_XL≈31 tok/s RAM 오프로드로 실행 Q8_0≈213 tok/s 그래픽 메모리에 들어감 Q4_K_S≈145 tok/s 그래픽 메모리에 들어감 UD-Q6_K_XL≈84 tok/s 그래픽 메모리에 들어감 Q8_0≈59 tok/s 그래픽 메모리에 들어감 Q8_0≈49 tok/s 통합 메모리에 들어감 Q8_0≈74 tok/s 통합 메모리에 들어감 Q8_0≈36 tok/s 통합 메모리에 들어감 Q8_0≈39 tok/s 통합 메모리에 들어감 Q8_0≈14.8 tok/s RAM에 들어감 (CPU) Q8_0≈33 tok/s RAM에 들어감 (CPU)
GLM 4.5 Air HFMoE 110B / 17B Q4_0≈5.3 tok/s RAM 오프로드로 실행 Q4_K_S≈5.1 tok/s RAM 오프로드로 실행 Q4_K_M≈5.6 tok/s RAM 오프로드로 실행 Q4_K_M≈5.7 tok/s RAM 오프로드로 실행 Q3_K_M≈10.2 tok/s RAM 오프로드로 실행 Q5_K_M≈55 tok/s 그래픽 메모리에 들어감 Q4_0≈10.0 tok/s RAM 오프로드로 실행 UD-Q4_K_XL≈22 tok/s 그래픽 메모리에 들어감 Q5_K_M≈15.2 tok/s 그래픽 메모리에 들어감 Q5_K_M≈12.8 tok/s 통합 메모리에 들어감 Q8_0≈13.9 tok/s 통합 메모리에 들어감 Q4_K_M≈10.6 tok/s 통합 메모리에 들어감 Q5_K_M≈10.0 tok/s 통합 메모리에 들어감 Q4_K_M≈8.0 tok/s RAM에 들어감 (CPU) Q8_0≈13.1 tok/s RAM에 들어감 (CPU)
gpt-oss-120b HFMoE 117B / 5.1B MXFP4≈19.1 tok/s RAM 오프로드로 실행 MXFP4≈19.6 tok/s RAM 오프로드로 실행 MXFP426–28 tok/s실측 RAM 오프로드로 실행 MXFP4≈25 tok/s RAM 오프로드로 실행 MXFP4≈31 tok/s RAM 오프로드로 실행 MXFP4≈258 tok/s 그래픽 메모리에 들어감 MXFP4≈36 tok/s RAM 오프로드로 실행 MXFP441–73 tok/s실측 그래픽 메모리에 들어감 MXFP4≈71 tok/s 그래픽 메모리에 들어감 MXFP4≈60 tok/s 통합 메모리에 들어감 MXFP4≈90 tok/s 통합 메모리에 들어감 MXFP450 tok/s실측 통합 메모리에 들어감 MXFP461 tok/s실측 통합 메모리에 들어감 MXFP4≈15.8 tok/s RAM에 들어감 (CPU) MXFP4≈36 tok/s RAM에 들어감 (CPU)
Qwen3.5 122B A10B HFMoE 125B / 10B UD-IQ4_NL≈10.5 tok/s RAM 오프로드로 실행 UD-IQ4_NL≈10.8 tok/s RAM 오프로드로 실행 Q4_K_S≈11.1 tok/s RAM 오프로드로 실행 Q4_K_S≈11.2 tok/s RAM 오프로드로 실행 UD-Q4_K_XL≈11.9 tok/s RAM 오프로드로 실행 UD-Q5_K_XL≈97 tok/s 그래픽 메모리에 들어감 UD-IQ3_XXS≈76 tok/s 그래픽 메모리에 들어감 UD-IQ4_NL≈46 tok/s 그래픽 메모리에 들어감 UD-Q5_K_XL≈27 tok/s 그래픽 메모리에 들어감 UD-Q5_K_XL≈23 tok/s 통합 메모리에 들어감 Q8_0≈24 tok/s 통합 메모리에 들어감 Q6_K≈15.1 tok/s 통합 메모리에 들어감 Q6_K≈16.1 tok/s 통합 메모리에 들어감 UD-Q5_K_XL≈10.4 tok/s RAM에 들어감 (CPU) Q8_0≈19.3 tok/s RAM에 들어감 (CPU)
Qwen3 235B A22B HFMoE 235B / 22B ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 UD-Q4_K_XL≈10.8 tok/s RAM 오프로드로 실행 UD-Q2_K_XL≈8.0 tok/s강한 압축 RAM 오프로드로 실행 Q3_K_M≈6.1 tok/s RAM 오프로드로 실행 UD-Q3_K_XL≈11.7 tok/s RAM 오프로드로 실행 UD-Q2_K_XL≈19.4 tok/s강한 압축 통합 메모리에 들어감 Q8_0≈10.8 tok/s 통합 메모리에 들어감 UD-Q3_K_XL≈12.2 tok/s 통합 메모리에 들어감 UD-Q3_K_XL≈13.0 tok/s 통합 메모리에 들어감 Q4_K_M≈7.2 tok/s RAM에 들어감 (CPU) Q8_0≈10.9 tok/s RAM에 들어감 (CPU)
GLM 4.7 HFMoE 358B / 39.2B ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 UD-IQ3_XXS≈7.3 tok/s RAM 오프로드로 실행 UD-IQ1_S≈5.6 tok/s강한 압축 RAM 오프로드로 실행 UD-IQ2_XXS≈4.7 tok/s강한 압축 RAM 오프로드로 실행 UD-IQ3_XXS≈3.5 tok/s RAM 오프로드로 실행 UD-TQ1_0≈16.2 tok/s강한 압축 통합 메모리에 들어감 Q4_1≈10.0 tok/s 통합 메모리에 들어감 UD-IQ1_M≈9.6 tok/s강한 압축 통합 메모리에 들어감 UD-IQ1_M≈10.3 tok/s강한 압축 통합 메모리에 들어감 Q4_K_M≈4.7 tok/s RAM에 들어감 (CPU) Q4_1≈10.2 tok/s RAM에 들어감 (CPU)
DeepSeek R1 HFMoE 684B / 37B ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 UD-IQ1_S≈16.9 tok/s강한 압축 RAM 오프로드로 실행 ✕ 들어가지 않음 ✕ 들어가지 않음 UD-IQ1_S≈8.0 tok/s강한 압축 RAM 오프로드로 실행 ✕ 들어가지 않음 Q3_K_M≈14.9 tok/s 통합 메모리에 들어감 ✕ 들어가지 않음 ✕ 들어가지 않음 Q4_K_M≈5.2 tok/s RAM에 들어감 (CPU) Q3_K_M≈13.9 tok/s RAM에 들어감 (CPU)
Kimi K2.5 HFMoE 1,027B / 32B ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 ✕ 들어가지 않음 UD-Q2_K_XL≈22 tok/s강한 압축 통합 메모리에 들어감 ✕ 들어가지 않음 ✕ 들어가지 않음 Q3_K_S≈7.2 tok/s RAM에 들어감 (CPU) UD-IQ2_XXS≈19.7 tok/s강한 압축 RAM에 들어감 (CPU)

메모리 용량별로 열리는 모델(컨텍스트 8K)

  1. 8 GB Qwen2.5 3B Instruct · Llama 3.2 3B Instruct · Gemma 3 4B · Llama 3.1 8B Instruct · Qwen3 8B 강한 압축: Gemma 3 12B · Qwen3 14B
  2. 12 GB Gemma 3 12B · Qwen3 14B 강한 압축: Mistral Small 3.2 24B · Gemma 3 27B · Qwen3 30B A3B · Qwen3 32B
  3. 16 GB gpt-oss-20b · Mistral Small 3.2 24B · Gemma 4 26B A4B · Gemma 3 27B · Qwen3 30B A3B 강한 압축: Gemma 4 31B · Qwen3.5 35B A3B
  4. 24 GB Gemma 4 31B · Qwen3 32B · Qwen3.5 35B A3B 강한 압축: Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct
  5. 48 GB Llama 3.3 70B Instruct · Qwen3 Next 80B A3B Instruct · Qwen3.5 122B A10B 강한 압축: GLM 4.5 Air
  6. 96 GB GLM 4.5 Air · gpt-oss-120b 강한 압축: Qwen3 235B A22B · GLM 4.7
  7. 128 GB Qwen3 235B A22B
  8. 192 GB GLM 4.7 강한 압축: DeepSeek R1
  9. 256 GB 강한 압축: Kimi K2.5
  10. 512 GB DeepSeek R1 · Kimi K2.5

≈ 8K 컨텍스트 기준 추정치: 가중치 + KV 캐시 + 런타임 오버헤드를 메모리 용량과 비교했으며, 속도는 메모리 대역폭으로 계산했습니다. 실제 수치는 런타임과 설정에 따라 다릅니다.

업데이트 · 출처: Hugging Face , www.nvidia.com , images.nvidia.com , support.apple.com , www.amd.com

내 사이트에 삽입

인포그래픽을 표시할 위치에 이 코드를 붙여 넣으세요. 저절로 업데이트됩니다. 무료로 사용할 수 있으며, 출처 링크는 유지해 주세요.

JSON 자체 데이터: CC BY 4.0, 출처 링크 필요. 제3자 데이터는 출처의 라이선스를 따릅니다.

매트릭스의 칸은 무엇을 뜻합니까?

행은 약 3B부터 1T 파라미터까지 잘 알려진 오픈 웨이트 모델이고, 열은 그래픽 카드, 다중 GPU 구성, Apple과 AMD의 통합 메모리 머신, CPU 서버입니다. 칸에는 권장 양자화, 모델이 놓이는 위치, 대략적인 생성 속도(토큰/초)가 들어갑니다. 위치는 그래픽 메모리(VRAM), 통합 메모리, 서버 RAM, RAM 오프로드, 들어가지 않음 중 하나입니다. RAM 오프로드는 모델 일부가 시스템 메모리에 놓인 상태로, 실행은 되지만 느려집니다.

필요한 메모리는 어떻게 계산합니까?

가중치(파라미터 수 × 가중치당 비트 수, 또는 실제 양자화 파일 크기)에 컨텍스트용 KV 캐시와 약 1.5 GB의 런타임 오버헤드를 더합니다. VLM이면 비전 프로젝터도 더해집니다. 매트릭스는 컨텍스트 8192 토큰 기준이며, 긴 컨텍스트는 작은 모델 하나만큼 메모리를 쓰기도 합니다. 계산기에 모델, 양자화, 컨텍스트, 하드웨어(또는 내 그래픽 메모리, RAM, 메모리 대역폭)를 넣으면 가중치·KV 캐시·오버헤드 막대를 메모리 용량과 나란히 보여 줍니다. 8, 12, 16, 24, 48, 96, 128 GB 단계마다 실행 가능한 범위를 정리한 사다리도 있습니다.

속도와 양자화는 어떻게 정합니까?

생성 속도는 메모리 대역폭을 토큰당 읽는 바이트 수로 나눈 값에 가깝습니다. MoE 모델은 활성 파라미터만 읽으므로 큰 MoE가 작은 밀집 모델보다 빠를 수 있습니다. 권장 양자화는 초당 10 토큰 이상을 유지하는 한도에서 Q8_0까지의 큰 쪽이고, 어려우면 Q4 계열입니다. BF16은 쓰지 않으며, Q3 미만은 더 큰 것이 들어가지 않을 때만 ‘강한 압축’으로 표시합니다. 모델 파일은 대부분 GGUF 형식입니다.

추정치는 믿을 만합니까?

≈ 표시는 추정치이며, 실측이 있는 칸은 측정값과 출처 링크를 보여 줍니다. 추정은 실측과 맞춰 보정해 대체로 ±35% 이내지만, 실제 속도는 런타임, 드라이버, 설정에 따라 다릅니다. 긴 프롬프트를 읽는 처리는 빠져 있고 생성만 계산합니다. 안전 필터가 없는 모델은 스위치를 켜야 보입니다.