Q4 · 4K 문맥 기준
Qwen3.8 27B총 124.848460496B 중 토큰당 5.1B가 활성화되는 MoE 모델 · MXFP4 예상 메모리 약 71GB
약 124.85B 전체·약 5.1B 활성의 이미지·비디오 입력 MoE 모델입니다. 네이티브 문맥은 128K이며, DGX Spark의 공식 INT4·MXFP4 수치만 실측 앵커로 사용하고 다른 장비에는 속도를 전이하지 않습니다.
- MXFP4 예상 메모리
- 약 71GB
- 총 파라미터
- 27B
- 활성 파라미터
- 27B
- 네이티브 문맥
- 256K
이 모델을 돌릴 대표 장비
토큰 생성
42.8 ~ 50.3 tok/s
첫 토큰
6.7 ~ 13.3초
실행 가이드
Qwen3.8 27B 로컬 서빙 실행 레시피
장비를 고르면 양자화, 안전 문맥, GPU 오프로드, Flash Attention, KV 캐시와 배치 시작값이 함께 바뀍니다.
장비부터 다시 고르고 싶다면
예산, 소음, 운영체제와 중고 허용 여부를 기준으로 모델이 들어가는 구성을 먼저 좁힐 수 있습니다.