TERNARY_PQ2 · 4K 문맥 기준

Bonsai 2 27B 27.36B 밀도형 모델 · TERNARY_PQ2 예상 메모리 약 9GB

Qwen3.8-27B에서 파생된 3값 가중치 모델입니다. PQ2_0 언어 가중치는 7.21GB이며, 일반 llama.cpp가 아닌 Hadamard 변환 지원 런타임이 필요합니다. 속도 화면은 PrismML이 공개한 PQ2_0 측정점을 우선 사용합니다.

TERNARY_PQ2 예상 메모리
약 9GB
총 파라미터
27.36B
활성 파라미터
27.36B
네이티브 문맥
256K

모델에서 장비로

이 모델을 돌릴 장비 찾기

문서 검색도 함께 돌린다면

임베딩·재정렬 모델을 같은 GPU 또는 통합 메모리에 올릴 때 남겨둘 공간입니다. CPU에서 따로 실행한다면 추가 없음으로 두세요.

조건에 맞는 장비 35· 5개 표시

RTX 5060 Ti 16GB

여유 있게 사용 · TERNARY_PQ2 · 여유 6.2GB

₩2,100,000

46.6 ~ 51.6 tok/s

Mac mini M4 Pro 24GB

여유 있게 사용 · TERNARY_PQ2 · 여유 11.2GB

₩2,650,000

27.3 ~ 30.3 tok/s

Mac mini M4 Pro 48GB

여유 있게 사용 · TERNARY_PQ2 · 여유 32.2GB

₩3,035,000

27.3 ~ 30.3 tok/s

RTX 3090 24GB

여유 있게 사용 · TERNARY_PQ2 · 여유 13.7GB

₩3,125,000

93.5 ~ 103.9 tok/s

MBP M4 Pro 48GB

여유 있게 사용 · TERNARY_PQ2 · 여유 32.2GB

₩3,450,000

27.3 ~ 30.3 tok/s

가격은 범위의 중간값이며 GPU 단품에는 기본 본체 비용을 더했습니다. 속도는 동일 모델·4K 입력의 추정 범위입니다.

실행 가이드

Bonsai 2 27B 로컬 서빙 실행 레시피

장비를 고르면 양자화, 안전 문맥, GPU 오프로드, Flash Attention, KV 캐시와 배치 시작값이 함께 바뀍니다.

장비별 속도 튜닝

장비부터 다시 고르고 싶다면

예산, 소음, 운영체제와 중고 허용 여부를 기준으로 모델이 들어가는 구성을 먼저 좁힐 수 있습니다.