모델별 실행 레시피
Qwen3.6 35B-A3B 서빙 가이드: vLLM·qwen3 파서 레시피
Q4 데스크톱 경로와 vLLM 0.19.0+ 공식 멀티 GPU 경로
쉽게 말하면
Qwen3.6 35B-A3B는 35B 파라미터 중 토큰당 약 3B가 활성화되는 MoE 모델입니다. 24GB 장비에서는 호환 Q4 변환본과 짧은 문맥으로 시험하고, 32GB 이상에서 운영 여유가 커집니다. 공식 체크포인트용 vLLM 0.19.0+ 경로는 멀티 GPU 서버로 따로 설명합니다.
장비를 고를 때
24GB GPU에서는 메모리 여유가 거의 없습니다. 안정적인 대화와 긴 문맥을 원한다면 32GB 이상 메모리(RTX 32GB+, Mac 48GB/64GB)를 권장합니다.
이 글에서 확인할 내용
- 총 35B 가중치 적재로 24GB 환경은 타이트하며 32GB 이상 메모리가 안정적입니다.
- 토큰당 약 3B 활성 수치는 계산량을 설명하지만 실제 품질과 속도는 별도 검증이 필요합니다.
- 공식 권장 vLLM 0.19.0+ 및 qwen3 추론 파서 옵션과 127.0.0.1 바인딩을 적용합니다.
하드웨어별 속도 튜닝 및 서빙 레시피 요약
단일 사용자 지연시간 최소화 기준의 안전 시작 문맥, 권장 런타임, GPU 오프로드 및 예상 속도 요약입니다.
| 하드웨어 | 적합도 | 권장 런타임 | 안전 문맥 | 토큰 생성 | 첫 토큰 |
|---|---|---|---|---|---|
| MBP M5 Pro 48GB (41GB) | 메모리 적정 | LM Studio | 16,384 토큰 | 22.6 ~ 54.1 tok/s | 8.9 ~ 21.2초 |
| Studio M5 Ultra 256GB (236GB) | 메모리 적정 | LM Studio | 16,384 토큰 | 71.5 ~ 132.7 tok/s | 3.6 ~ 6.7초 |
| Studio M5 Ultra 512GB (480GB) | 메모리 적정 | LM Studio | 16,384 토큰 | 71.5 ~ 132.7 tok/s | 3.6 ~ 6.7초 |
| RTX 4090 24GB (22.5GB) | 메모리 빠듯 | llama.cpp (CUDA) | 4,096 토큰 | 62.7 ~ 157.5 tok/s | 0.68 ~ 0.71초 |
| 2× RTX 3090 48GB (NVLink) (45GB) | 메모리 적정 | llama.cpp (멀티 GPU) | 16,384 토큰 | 76 ~ 238.7 tok/s | 3.7 ~ 6.3초 |
| RTX PRO 6000 96GB (93GB) | 메모리 적정 | llama.cpp (CUDA) | 16,384 토큰 | 107 ~ 268.8 tok/s | 2.6 ~ 3.2초 |
| DGX Spark 128GB (116GB) | 메모리 적정 | llama.cpp (CUDA) | 16,384 토큰 | 16.3 ~ 41 tok/s | 8.8 ~ 12.0초 |
| Ryzen AI Max+ 395 128GB (116GB) | 메모리 적정 | llama.cpp (ROCm/HIP) | 16,384 토큰 | 15.3 ~ 38.4 tok/s | 74.8 ~ 315.1초 |
상세 튜닝 설정은 위 섹션에서 확인할 수 있습니다. 복사할 실행 명령은 아티팩트와 런타임 경로가 확인된 조합에만 표시합니다.
아티팩트 및 런타임 선택
Qwen3.6 35B-A3B는 35B 총 파라미터 중 토큰당 약 3B가 활성화되는 구조입니다. 호환 Q4_K_M 변환본은 대략 20GB 안팎이라 24GB VRAM에서는 4K~8K 문맥과 단일 요청으로 먼저 확인해야 합니다.
32GB 이상 메모리에서는 KV 캐시와 런타임을 위한 여유가 커집니다. 공식 체크포인트는 Q4 변환본과 요구량이 다르며, 공식 문서는 vLLM 0.19.0 이상과 qwen3 추론 파서, 멀티 GPU 텐서 병렬 예시를 안내합니다.

로컬 서버 구동 (vLLM >= 0.19.0)
공식 vLLM 0.19.0 이상에서 Qwen/Qwen3.6-35B-A3B를 서빙할 때는 --reasoning-parser qwen3를 지정합니다. 아래 공식 체크포인트 경로는 물리 GPU 수에 맞춘 텐서 병렬이 필요하며, 시작 문맥은 8K로 낮춰 적재 상태부터 확인합니다.
MTP(다중 토큰 예측) 투기적 디코딩은 공식 런타임에서 지원하는 고급 대안으로 활용할 수 있으나, 기본 복사 가능한 명령어는 표준 서빙 경로로 제공합니다. 네트워크에 열 때는 인증과 방화벽을 먼저 구성합니다.
vLLM 0.19.0+ 공식 체크포인트 (멀티 GPU)
GPU_COUNT=8 # 공식 예시는 8 GPU, 실제 구성에 맞춰 수정
vllm serve Qwen/Qwen3.6-35B-A3B --host 127.0.0.1 --port 8000 --tensor-parallel-size "$GPU_COUNT" --max-model-len 8192 --reasoning-parser qwen3 --gpu-memory-utilization 0.92공식 체크포인트는 장착된 GPU 수에 맞춰 텐서 병렬 크기를 지정합니다.
LM Studio 데스크톱 서빙 (Q4 GGUF)
lms ls
lms load <qwen-3.6-35b-identifier> --gpu=max --context-length=8192
lms server start --port 123432GB 이상 Mac 또는 고용량 GPU에서 LM Studio로 간편하게 로컬 데몬을 시작합니다.

엔드포인트 검증 및 추론 사고 파싱
서버 구동 후 curl 호출을 통해 OpenAI 호환 /v1/chat/completions 응답을 검증합니다. qwen3 추론 파서가 정상 작동하면 생각 블록과 최종 결과가 올바른 구조로 반환됩니다.
같은 프롬프트를 반복해 첫 토큰 시간과 디코드 처리량을 기록합니다. 코딩·수학 문제의 정답률은 속도와 별개의 항목으로 확인합니다.
추론 챗 완성 API 호출 테스트
curl http://127.0.0.1:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "Qwen/Qwen3.6-35B-A3B",
"messages": [
{"role": "user", "content": "파이썬으로 이진 탐색 함수를 작성하고 시간 복잡도를 설명해줘."}
],
"max_tokens": 1024
}'127.0.0.1:8000 엔드포인트로 추론 결과 및 사고 토큰을 검증합니다.

메모리 점검 및 24GB 환경 주의사항
24GB 단일 GPU는 Q4 변환본을 적재한 뒤 남는 메모리가 작을 수 있습니다. max-model-len을 4K~8K로 제한하고 동시 요청을 1개로 둔 상태에서 시작합니다.
32GB 이상에서도 16K·32K가 자동으로 안전한 것은 아닙니다. 실제 KV 캐시 점유와 스왑 여부를 확인하며 한 단계씩 늘립니다.