Q4 · 4K 문맥 기준
Qwen3.8 27B총 552B 중 토큰당 16B가 활성화되는 MoE 모델 · Q2_K 264.5GB 저장 파일 · 작업 메모리 미확인
552B 백본과 별도 Engram 테이블을 사용하는 MoE 모델입니다. Spark, RTX 5090과 대용량 Mac의 공개 실행 사례를 장비·포맷별로 구분합니다. SSD 스트리밍과 전용 런타임이 필요한 실험 경로를 포함합니다.
- Q2_K 저장 파일
- 264.5GB · mmap 페이징
- 총 파라미터
- 27B
- 활성 파라미터
- 27B
- 네이티브 문맥
- 256K
이 모델을 돌릴 대표 장비
토큰 생성
42.8 ~ 50.3 tok/s
첫 토큰
6.7 ~ 13.3초
실행 가이드
Qwen3.8 27B 로컬 서빙 실행 레시피
장비를 고르면 양자화, 안전 문맥, GPU 오프로드, Flash Attention, KV 캐시와 배치 시작값이 함께 바뀍니다.
장비부터 다시 고르고 싶다면
예산, 소음, 운영체제와 중고 허용 여부를 기준으로 모델이 들어가는 구성을 먼저 좁힐 수 있습니다.