Q4 · 4K 문맥 기준

GLM-5.3-Flash (MoE): 총 320B 중 토큰당 18B가 활성화되는 MoE 모델, 최소 메모리와 체감 속도를 함께 보세요.

GLM-5.3-Flash (MoE) Q4 실행에 필요한 약 191GB 메모리와 장비별 프리필, 토큰 생성 속도, 양자화 및 1,048,576 토큰 문맥 조건을 비교합니다.

모델 사양

Q4 필요 메모리
약 191GB
총 파라미터
320B
활성 파라미터
18B
네이티브 문맥
1,048,576 토큰

총 320B 파라미터(18B 활성)의 하이브리드 희소+선형 어텐션 MoE 모델입니다. 공식 1,048,576(1M) 토큰 컨텍스트(text_config.max_position_embeddings)를 지원하며 256GB 이상의 대용량 메모리 환경에 적재됩니다.

대표 장비