모델별 실행 레시피
GLM-5.3-Flash 서빙 가이드: 320B 서버급 MoE 레시피
총 320B 상주와 18B 활성 연산, 공식 체크포인트의 멀티 가속기 서빙
쉽게 말하면
GLM-5.3-Flash는 총 320B 파라미터(18B 활성)의 대형 MoE 모델입니다. 18B 활성 수치는 계산량이지 적재 크기가 아닙니다. 공식 체크포인트는 여러 가속기가 있는 서버 경로로 보고, 256GB 통합 메모리에서의 실행은 호환되는 압축 변환본이 있을 때만 별도 검토합니다.
장비를 고를 때
데스크톱 단일 GPU용 모델이 아닙니다. 256GB 통합 메모리도 공식 체크포인트 경로와 같은 뜻이 아니므로, 변환본 포맷·파일 크기·런타임 지원이 확인되기 전에는 적합 장비로 확정하지 않습니다.
이 글에서 확인할 내용
- 공식 체크포인트 서빙은 여러 고용량 가속기와 빠른 가속기 간 연결을 전제로 합니다.
- 18B 활성 파라미터는 디코드 계산량이며 모델 적재 메모리 용량과는 무관합니다.
- 공식 모델 ID(zai-org/GLM-5.3-Flash)와 vLLM/SGLang 텐서 병렬 구성을 사용합니다.
하드웨어별 속도 튜닝 및 서빙 레시피 요약
단일 사용자 지연시간 최소화 기준의 안전 시작 문맥, 권장 런타임, GPU 오프로드 및 예상 속도 요약입니다.
| 하드웨어 | 적합도 | 권장 런타임 | 안전 문맥 | 토큰 생성 | 첫 토큰 |
|---|---|---|---|---|---|
| MBP M5 Pro 48GB (41GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
| Studio M5 Ultra 256GB (236GB) | 실험적 구동 | 압축 런타임 검증 필요 | 4,096 토큰 | 81.3 ~ 90.3 tok/s | 15.0 ~ 26.1초 |
| Studio M5 Ultra 512GB (480GB) | 실험적 구동 | 압축 런타임 검증 필요 | 4,096 토큰 | 81.3 ~ 90.3 tok/s | 15.0 ~ 26.1초 |
| RTX 4090 24GB (22.5GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
| 2× RTX 3090 48GB (NVLink) (45GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
| RTX PRO 6000 96GB (93GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
| DGX Spark 128GB (116GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
| Ryzen AI Max+ 395 128GB (116GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
상세 튜닝 설정은 위 섹션에서 확인할 수 있습니다. 복사할 실행 명령은 아티팩트와 런타임 경로가 확인된 조합에만 표시합니다.
아티팩트 및 런타임 선택
GLM-5.3-Flash는 총 320B 파라미터(토큰당 18B 활성)의 하이브리드 희소+선형 어텐션 MoE 모델입니다. 커뮤니티 압축본은 포맷과 양자화 방식에 따라 크기가 달라지며, 런타임이 이 아키텍처를 지원하는지도 별도로 확인해야 합니다.
18B 활성 파라미터가 18B 밀도형 모델처럼 가볍다는 뜻은 아닙니다. 공식 모델 ID zai-org/GLM-5.3-Flash를 vLLM·SGLang으로 띄우는 경로는 멀티 GPU 서버로 설명하고, Mac 통합 메모리 경로와 섞지 않습니다.

로컬 서버 구동 (vLLM / SGLang 분산 텐서 병렬)
서버급 로컬 노드에서 SGLang 또는 vLLM을 실행할 때는 장착된 가속기 수와 일치하도록 텐서 병렬(--tp / --tensor-parallel-size)을 설정합니다. 모델의 네이티브 1,048,576(1M) 컨텍스트를 처음부터 지정하지 말고, 16K(16,384토큰)로 적재을 먼저 확인합니다.
모든 명령어는 127.0.0.1에 바인딩합니다. 네트워크에 열 때는 인증과 방화벽을 먼저 구성합니다. 텐서 병렬 환경에서는 GPU 간 통신 병목을 줄이기 위해 고속 NVLink 또는 PCIe 연결 상태를 확인합니다.
SGLang 분산 서빙 실행 (Multi-GPU 서버 노드)
GPU_COUNT=8 # 실제 물리 GPU 수로 수정
python -m sglang.launch_server --model-path zai-org/GLM-5.3-Flash --tp "$GPU_COUNT" --host 127.0.0.1 --port 8000 --context-length 16384SGLang을 이용해 127.0.0.1:8000 포트로 320B 분산 서빙을 시작합니다.
공식 vLLM 분산 서빙 대안
GPU_COUNT=8 # 실제 물리 GPU 수로 수정
vllm serve zai-org/GLM-5.3-Flash --tensor-parallel-size "$GPU_COUNT" --host 127.0.0.1 --port 8000 --max-model-len 16384 --gpu-memory-utilization 0.90vLLM 분산 서빙 시 127.0.0.1 로컬 격리 바인딩을 적용합니다.

엔드포인트 검증 및 희소 어텐션 테스트
서버가 준비되면 curl로 /v1/chat/completions를 호출하여 정상 스트리밍을 확인합니다. 하이브리드 희소+선형 어텐션 구조가 긴 문맥에서도 일정한 처리량을 유지하는지 점검하세요.
18B 활성 연산에 따른 단일 요청 디코드 속도를 측정하고, 분산 가속기 간 부하가 고르게 분산되는지 모니터링합니다.
API 챗 완료 테스트
curl http://127.0.0.1:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "zai-org/GLM-5.3-Flash",
"messages": [
{"role": "user", "content": "대규모 분산 추론 환경의 이점을 정리해줘."}
],
"max_tokens": 512
}'127.0.0.1:8000 엔드포인트 응답을 테스트합니다.

메모리 점검 및 320B 분산 트러블슈팅
320B 가중치가 모든 GPU에 균등하게 적재되었는지 점검합니다. 가용 메모리가 부족할 경우 가속기 수를 늘리거나 컨텍스트 길이를 16K 수준으로 낮춰야 합니다.
컨텍스트를 128K 이상으로 확장할 때는 KV 캐시 메모리 요구량이 급증하므로, 반드시 사전 메모리 계산을 거친 뒤 점진적으로 확장하세요.