Q4 · 4K 문맥 기준
Qwen3.8-Flash-Next: 총 125B 중 토큰당 6B가 활성화되는 MoE 모델, 최소 메모리와 체감 속도를 함께 보세요.
Qwen3.8-Flash-Next Q4 실행에 필요한 약 108GB 메모리와 장비별 프리필, 토큰 생성 속도, 양자화 및 262,144 토큰 문맥 조건을 비교합니다.
모델 사양
- Q4 필요 메모리
- 약 108GB
- 총 파라미터
- 125B
- 활성 파라미터
- 6B
- 네이티브 문맥
- 262,144 토큰
125B 코어 LM(6B 활성)과 아키텍처 내장 51B n-gram 임베딩 및 4B MTP로 구성된 약 180B 상주 가중치 MoE 모델입니다. 내장 51B n-gram 테이블은 아키텍처 구성 요소이며 UI의 선택형 투기 디코딩 토글과 별개입니다.
대표 장비
- NVIDIA A40 48GB — 가용 46GB, 696GB/s
- Studio M5 Ultra 256GB — 가용 236GB, 1200GB/s
- MBP M3 Max 128GB — 가용 114GB, 400GB/s