Q4 · 4K 문맥 기준

Qwen3.8 27B2.51675648B 밀도형 모델 · Q4_K_M 예상 메모리 약 3GB

2.51675648B 파라미터 밀도형 오픈 가중치 모델로 131,072 토큰 네이티브 컨텍스트를 지원합니다. 표시되는 메모리와 생성 속도는 선택한 양자화 및 하드웨어 사양을 바탕으로 한 추정치이며, 실제 측정값이 아닙니다.

Q4_K_M 예상 메모리
약 3GB
총 파라미터
27B
활성 파라미터
27B
네이티브 문맥
256K

이 모델을 돌릴 대표 장비

RTX 5060 Ti 16GB

가용 15GB · 448GB/s

llama.cpp CUDA · Q4_K_M

토큰 생성

5.6 ~ 5.7 tok/s

첫 토큰

6.9 ~ 12.2초

2× RTX 5090 64GB (PCIe)

가용 61GB · 3584GB/s

llama.cpp CUDA · Q4_K_M · GPU 2장 분할

토큰 생성

87.6 ~ 135.3 tok/s

첫 토큰

1.4 ~ 3.1초

MBA M4 16GB

가용 13GB · 120GB/s

MLX 4비트

토큰 생성

0.0 tok/s

첫 토큰

0.0초 (OOM)

실행 가이드

Qwen3.8 27B 로컬 서빙 실행 레시피

장비를 고르면 양자화, 안전 문맥, GPU 오프로드, Flash Attention, KV 캐시와 배치 시작값이 함께 바뀍니다.

장비별 속도 튜닝

장비부터 다시 고르고 싶다면

예산, 소음, 운영체제와 중고 허용 여부를 기준으로 모델이 들어가는 구성을 먼저 좁힐 수 있습니다.