Q4 · 4K 문맥 기준

Qwen3.8 27B총 552B 중 토큰당 16B가 활성화되는 MoE 모델 · Q2_K 264.5GB 저장 파일 · 작업 메모리 미확인

552B 백본과 별도 Engram 테이블을 사용하는 MoE 모델입니다. Spark, RTX 5090과 대용량 Mac의 공개 실행 사례를 장비·포맷별로 구분합니다. SSD 스트리밍과 전용 런타임이 필요한 실험 경로를 포함합니다.

Q2_K 저장 파일
264.5GB · mmap 페이징
총 파라미터
27B
활성 파라미터
27B
네이티브 문맥
256K

이 모델을 돌릴 대표 장비

DGX Spark 128GB

가용 116GB · 273GB/s

SGLang · NVFP4 · DFlash2

토큰 생성

42.8 ~ 50.3 tok/s

첫 토큰

6.7 ~ 13.3초

실행 가이드

Qwen3.8 27B 로컬 서빙 실행 레시피

장비를 고르면 양자화, 안전 문맥, GPU 오프로드, Flash Attention, KV 캐시와 배치 시작값이 함께 바뀍니다.

장비별 속도 튜닝

장비부터 다시 고르고 싶다면

예산, 소음, 운영체제와 중고 허용 여부를 기준으로 모델이 들어가는 구성을 먼저 좁힐 수 있습니다.