모델별 실행 레시피

DeepSeek-V4-Flash 서빙 가이드: 304B 분산 레시피

총 304B 상주와 13B 활성 연산, 4×GB300급 공식 분산 서빙

쉽게 말하면

DeepSeek-V4-Flash-0731은 총 304B 파라미터 중 토큰당 13B가 활성화되는 대형 MoE 모델입니다. 공식 vLLM 예시는 단일 4×GB300 노드를 사용합니다. 소비자용 단일 GPU 레시피로 바꾸지 않고, 서버급 분산 서빙과 API 검증 절차를 그대로 구분합니다.

장비를 고를 때

공식 체크포인트는 소비자용 GPU나 256GB 통합 메모리를 전제로 하지 않습니다. 커뮤니티 압축본은 실험 경로로만 보고 파일 크기, 변환 방식, 런타임 지원을 각각 확인합니다.

이 글에서 확인할 내용

  • 총 304B 공식 체크포인트의 vLLM 예시는 4×GB300 노드와 전문가 병렬을 사용합니다.
  • 공식 모델 ID(deepseek-ai/DeepSeek-V4-Flash-0731)와 멀티 가속기 분산 병렬을 사용합니다.
  • 단일 소비자 GPU 레시피가 아니며 127.0.0.1 로컬 바인딩을 전제로 합니다.

하드웨어별 속도 튜닝 및 서빙 레시피 요약

단일 사용자 지연시간 최소화 기준의 안전 시작 문맥, 권장 런타임, GPU 오프로드 및 예상 속도 요약입니다.

하드웨어적합도권장 런타임안전 문맥토큰 생성첫 토큰
MBP M5 Pro 48GB (41GB)메모리 초과 (미지원)적재 불가4,096 토큰--
Studio M5 Ultra 256GB (236GB)실험적 구동압축 런타임 검증 필요4,096 토큰112.5 ~ 125 tok/s10.8 ~ 18.8초
Studio M5 Ultra 512GB (480GB)실험적 구동압축 런타임 검증 필요4,096 토큰112.5 ~ 125 tok/s10.8 ~ 18.8초
RTX 4090 24GB (22.5GB)메모리 초과 (미지원)적재 불가4,096 토큰--
2× RTX 3090 48GB (NVLink) (45GB)메모리 초과 (미지원)적재 불가4,096 토큰--
RTX PRO 6000 96GB (93GB)메모리 초과 (미지원)적재 불가4,096 토큰--
DGX Spark 128GB (116GB)메모리 초과 (미지원)적재 불가4,096 토큰--
Ryzen AI Max+ 395 128GB (116GB)메모리 초과 (미지원)적재 불가4,096 토큰--

상세 튜닝 설정은 위 섹션에서 확인할 수 있습니다. 복사할 실행 명령은 아티팩트와 런타임 경로가 확인된 조합에만 표시합니다.

아티팩트 및 런타임 선택

DeepSeek-V4-Flash-0731은 총 304B 파라미터 중 토큰당 13B가 활성화되는 대규모 MoE 모델로 1M 네이티브 문맥을 지원합니다. 네이티브 문맥 길이는 실제 배포에서 처음부터 설정해야 하는 값이 아닙니다.

공식 모델 ID는 deepseek-ai/DeepSeek-V4-Flash-0731이며, 공식 vLLM 예시는 단일 4×GB300 노드와 전문가 병렬을 사용합니다. 커뮤니티 압축본은 파일 크기와 런타임 호환성이 확인된 경우에만 실험 경로로 다룹니다.

DeepSeek-V4-Flash-0731 304B MoE 모델의 13B 활성 파라미터 및 4×GB300 공식 배치 다이어그램
공식 체크포인트는 단일 4×GB300 노드 예시를 사용하며 소비자용 단일 GPU 경로와 구분해야 합니다.

로컬 서버 구동 (vLLM 분산 텐서/전문가 병렬)

공식 vLLM 예시를 따라 데이터 병렬 4와 전문가 병렬을 사용하되, 초기 문맥 길이는 16K(16,384토큰)로 적재 상태를 먼저 확인합니다. 아래 명령은 4×GB300 노드용이며 임의의 4-GPU 구성에 그대로 적용하는 명령이 아닙니다.

기본 바인딩은 127.0.0.1을 유지합니다. 외부 네트워크에 열려면 별도의 인증, 역방향 프록시와 방화벽 규칙이 필요합니다.

vLLM 공식 분산 서빙 (Multi-GPU 서버 노드)

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731   --host 127.0.0.1   --port 8000   --trust-remote-code   --data-parallel-size 4   --enable-expert-parallel   --kv-cache-dtype fp8   --block-size 256   --moe-backend deep_gemm_mega_moe   --attention-config '{"use_fp4_indexer_cache": true}'   --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'   --max-model-len 16384   --gpu-memory-utilization 0.90

공식 4×GB300 vLLM·DSpark 구성을 16K 문맥과 127.0.0.1 바인딩으로 시작합니다.

deepseek-ai/DeepSeek-V4-Flash-0731 공식 가중치 기반 분산 텐서 및 전문가 병렬 vLLM 서버 구동도
공식 배포 환경 기준 멀티 가속기 분산 파이프라인으로 127.0.0.1 로컬 바인딩 서빙을 설정합니다.

엔드포인트 검증 및 스트리밍 응답 테스트

서버 구동 후 curl을 통해 /v1/chat/completions 엔드포인트를 호출하여 첫 토큰 지연 시간과 13B 활성 파라미터 기준 스트리밍 디코드 속도를 측정합니다.

이 모델은 공식 vLLM에서 DSpark 투기 디코딩을 사용합니다. 기본값과 수락률·토큰 생성 속도를 함께 기록해 해당 프롬프트에서 이득이 있는지 확인합니다.

로컬 챗 완성 스트리밍 테스트

curl http://127.0.0.1:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "deepseek-ai/DeepSeek-V4-Flash-0731",
    "messages": [
      {"role": "user", "content": "DeepSeek-V4-Flash 분산 서빙 테스트."}
    ],
    "max_tokens": 512
  }'

127.0.0.1:8000 엔드포인트의 스트리밍 응답을 점검합니다.

DeepSeek-V4-Flash 로컬 API 엔드포인트 스트리밍 응답 검증 및 멀티 GPU VRAM 부하 균형 점검도
curl 챗 완료 요청으로 응답 지연을 측정하고 가속기 간 메모리 분할 상태를 실시간으로 점검합니다.

메모리 점검 및 가속기 간 부하 균형

네 개 가속기의 가중치와 전문가 레이어 점유가 한쪽에 몰리지 않는지 VRAM과 런타임 로그를 함께 확인합니다.

1M 컨텍스트는 대규모 KV 캐시를 요구하므로 초기 16K에서 메모리 여유를 확인한 뒤 점진적으로 확장하세요.