모델별 실행 레시피
DeepSeek-V4-Flash 서빙 가이드: 304B 분산 레시피
총 304B 상주와 13B 활성 연산, 4×GB300급 공식 분산 서빙
쉽게 말하면
DeepSeek-V4-Flash-0731은 총 304B 파라미터 중 토큰당 13B가 활성화되는 대형 MoE 모델입니다. 공식 vLLM 예시는 단일 4×GB300 노드를 사용합니다. 소비자용 단일 GPU 레시피로 바꾸지 않고, 서버급 분산 서빙과 API 검증 절차를 그대로 구분합니다.
장비를 고를 때
공식 체크포인트는 소비자용 GPU나 256GB 통합 메모리를 전제로 하지 않습니다. 커뮤니티 압축본은 실험 경로로만 보고 파일 크기, 변환 방식, 런타임 지원을 각각 확인합니다.
이 글에서 확인할 내용
- 총 304B 공식 체크포인트의 vLLM 예시는 4×GB300 노드와 전문가 병렬을 사용합니다.
- 공식 모델 ID(deepseek-ai/DeepSeek-V4-Flash-0731)와 멀티 가속기 분산 병렬을 사용합니다.
- 단일 소비자 GPU 레시피가 아니며 127.0.0.1 로컬 바인딩을 전제로 합니다.
하드웨어별 속도 튜닝 및 서빙 레시피 요약
단일 사용자 지연시간 최소화 기준의 안전 시작 문맥, 권장 런타임, GPU 오프로드 및 예상 속도 요약입니다.
| 하드웨어 | 적합도 | 권장 런타임 | 안전 문맥 | 토큰 생성 | 첫 토큰 |
|---|---|---|---|---|---|
| MBP M5 Pro 48GB (41GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
| Studio M5 Ultra 256GB (236GB) | 실험적 구동 | 압축 런타임 검증 필요 | 4,096 토큰 | 112.5 ~ 125 tok/s | 10.8 ~ 18.8초 |
| Studio M5 Ultra 512GB (480GB) | 실험적 구동 | 압축 런타임 검증 필요 | 4,096 토큰 | 112.5 ~ 125 tok/s | 10.8 ~ 18.8초 |
| RTX 4090 24GB (22.5GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
| 2× RTX 3090 48GB (NVLink) (45GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
| RTX PRO 6000 96GB (93GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
| DGX Spark 128GB (116GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
| Ryzen AI Max+ 395 128GB (116GB) | 메모리 초과 (미지원) | 적재 불가 | 4,096 토큰 | - | - |
상세 튜닝 설정은 위 섹션에서 확인할 수 있습니다. 복사할 실행 명령은 아티팩트와 런타임 경로가 확인된 조합에만 표시합니다.
아티팩트 및 런타임 선택
DeepSeek-V4-Flash-0731은 총 304B 파라미터 중 토큰당 13B가 활성화되는 대규모 MoE 모델로 1M 네이티브 문맥을 지원합니다. 네이티브 문맥 길이는 실제 배포에서 처음부터 설정해야 하는 값이 아닙니다.
공식 모델 ID는 deepseek-ai/DeepSeek-V4-Flash-0731이며, 공식 vLLM 예시는 단일 4×GB300 노드와 전문가 병렬을 사용합니다. 커뮤니티 압축본은 파일 크기와 런타임 호환성이 확인된 경우에만 실험 경로로 다룹니다.

로컬 서버 구동 (vLLM 분산 텐서/전문가 병렬)
공식 vLLM 예시를 따라 데이터 병렬 4와 전문가 병렬을 사용하되, 초기 문맥 길이는 16K(16,384토큰)로 적재 상태를 먼저 확인합니다. 아래 명령은 4×GB300 노드용이며 임의의 4-GPU 구성에 그대로 적용하는 명령이 아닙니다.
기본 바인딩은 127.0.0.1을 유지합니다. 외부 네트워크에 열려면 별도의 인증, 역방향 프록시와 방화벽 규칙이 필요합니다.
vLLM 공식 분산 서빙 (Multi-GPU 서버 노드)
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --host 127.0.0.1 --port 8000 --trust-remote-code --data-parallel-size 4 --enable-expert-parallel --kv-cache-dtype fp8 --block-size 256 --moe-backend deep_gemm_mega_moe --attention-config '{"use_fp4_indexer_cache": true}' --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}' --max-model-len 16384 --gpu-memory-utilization 0.90공식 4×GB300 vLLM·DSpark 구성을 16K 문맥과 127.0.0.1 바인딩으로 시작합니다.

엔드포인트 검증 및 스트리밍 응답 테스트
서버 구동 후 curl을 통해 /v1/chat/completions 엔드포인트를 호출하여 첫 토큰 지연 시간과 13B 활성 파라미터 기준 스트리밍 디코드 속도를 측정합니다.
이 모델은 공식 vLLM에서 DSpark 투기 디코딩을 사용합니다. 기본값과 수락률·토큰 생성 속도를 함께 기록해 해당 프롬프트에서 이득이 있는지 확인합니다.
로컬 챗 완성 스트리밍 테스트
curl http://127.0.0.1:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "deepseek-ai/DeepSeek-V4-Flash-0731",
"messages": [
{"role": "user", "content": "DeepSeek-V4-Flash 분산 서빙 테스트."}
],
"max_tokens": 512
}'127.0.0.1:8000 엔드포인트의 스트리밍 응답을 점검합니다.

메모리 점검 및 가속기 간 부하 균형
네 개 가속기의 가중치와 전문가 레이어 점유가 한쪽에 몰리지 않는지 VRAM과 런타임 로그를 함께 확인합니다.
1M 컨텍스트는 대규모 KV 캐시를 요구하므로 초기 16K에서 메모리 여유를 확인한 뒤 점진적으로 확장하세요.