Q4_K_M · 4K 문맥 기준

Holo4 35B-A3B 총 35B 중 토큰당 3B가 활성화되는 MoE 모델 · Q4_K_M 예상 메모리 약 22GB

전체 35B 가운데 토큰당 약 3B를 활성화하는 컴퓨터 사용 MoE 모델입니다. 활성 파라미터는 계산량을 설명하며, 로컬 적재에는 전체 가중치와 비전·KV 캐시 여유가 필요합니다.

Q4_K_M 예상 메모리
약 22GB
총 파라미터
35B
활성 파라미터
3B
네이티브 문맥
256K

모델에서 장비로

이 모델을 돌릴 장비 찾기

문서 검색도 함께 돌린다면

임베딩·재정렬 모델을 같은 GPU 또는 통합 메모리에 올릴 때 남겨둘 공간입니다. CPU에서 따로 실행한다면 추가 없음으로 두세요.

조건에 맞는 장비 40· 5개 표시

Mac mini M4 32GB

여유 있게 사용 · Q4_K_M · 여유 5.7GB

₩2,100,000

46.1 ~ 51.5 tok/s

Mac mini M6 32GB

여유 있게 사용 · Q4_K_M · 여유 5.7GB

₩2,774,000

67.2 ~ 74.9 tok/s

MBP M3 Pro 36GB

여유 있게 사용 · Q4_K_M · 여유 8.7GB

₩2,850,000

59.3 ~ 66.1 tok/s

Mac mini M4 Pro 48GB

여유 있게 사용 · Q4_K_M · 여유 19.7GB

₩3,035,000

111.1 ~ 123.4 tok/s

MBA M5 32GB

여유 있게 사용 · Q4_K_M · 여유 5.7GB

₩3,095,000

58.8 ~ 65.7 tok/s

가격은 범위의 중간값이며 GPU 단품에는 기본 본체 비용을 더했습니다. 속도는 동일 모델·4K 입력의 추정 범위입니다.

장비부터 다시 고르고 싶다면

예산, 소음, 운영체제와 중고 허용 여부를 기준으로 모델이 들어가는 구성을 먼저 좁힐 수 있습니다.