Q4_K_M · 4K 문맥 기준

K2 Horizon 32B 32B 밀도형 모델 · Q4_K_M 예상 메모리 약 21GB

K2 Horizon의 32B 밀집형 모델입니다. 24GB급 장비에서는 Q4와 짧은 문맥부터 확인하고, 긴 입력과 동시 요청을 쓰려면 32GB 이상 메모리 여유를 함께 봐야 합니다.

Q4_K_M 예상 메모리
약 21GB
총 파라미터
32B
활성 파라미터
32B
네이티브 문맥
512K

모델에서 장비로

이 모델을 돌릴 장비 찾기

문서 검색도 함께 돌린다면

임베딩·재정렬 모델을 같은 GPU 또는 통합 메모리에 올릴 때 남겨둘 공간입니다. CPU에서 따로 실행한다면 추가 없음으로 두세요.

조건에 맞는 장비 40· 5개 표시

2× RTX 3090 48GB (NVLink)

여유 있게 사용 · Q4_K_M · 여유 24.3GB

₩5,900,000

48.5 ~ 67.4 tok/s

Studio M4 Max 64GB

여유 있게 사용 · Q4_K_M · 여유 35.3GB

₩6,050,000

21.4 ~ 23.7 tok/s

Studio M5 Max 64GB

여유 있게 사용 · Q4_K_M · 여유 35.3GB

₩6,925,000

24 ~ 26.6 tok/s

MBP M5 Max 64GB

여유 있게 사용 · Q4_K_M · 여유 35.3GB

₩7,300,000

24 ~ 26.6 tok/s

NVIDIA A40 48GB

여유 있게 사용 · Q4_K_M · 여유 25.3GB

₩7,500,000

26.5 ~ 29.5 tok/s

가격은 범위의 중간값이며 GPU 단품에는 기본 본체 비용을 더했습니다. 속도는 동일 모델·4K 입력의 추정 범위입니다.

장비부터 다시 고르고 싶다면

예산, 소음, 운영체제와 중고 허용 여부를 기준으로 모델이 들어가는 구성을 먼저 좁힐 수 있습니다.