Q4 · 4K 문맥 기준

Qwen3.8 27B총 124.848460496B 중 토큰당 5.1B가 활성화되는 MoE 모델 · MXFP4 예상 메모리 약 71GB

약 124.85B 전체·약 5.1B 활성의 이미지·비디오 입력 MoE 모델입니다. 네이티브 문맥은 128K이며, DGX Spark의 공식 INT4·MXFP4 수치만 실측 앵커로 사용하고 다른 장비에는 속도를 전이하지 않습니다.

MXFP4 예상 메모리
약 71GB
총 파라미터
27B
활성 파라미터
27B
네이티브 문맥
256K

이 모델을 돌릴 대표 장비

DGX Spark 128GB

가용 116GB · 273GB/s

SGLang · NVFP4 · DFlash2

토큰 생성

42.8 ~ 50.3 tok/s

첫 토큰

6.7 ~ 13.3초

실행 가이드

Qwen3.8 27B 로컬 서빙 실행 레시피

장비를 고르면 양자화, 안전 문맥, GPU 오프로드, Flash Attention, KV 캐시와 배치 시작값이 함께 바뀍니다.

장비별 속도 튜닝

장비부터 다시 고르고 싶다면

예산, 소음, 운영체제와 중고 허용 여부를 기준으로 모델이 들어가는 구성을 먼저 좁힐 수 있습니다.