모델별 실행 레시피

Qwen3.8-27B 로컬 서빙 가이드: LM Studio·vLLM 실행 레시피

27B 밀도형 모델의 실용 메모리 티어와 127.0.0.1 로컬 서빙 단계별 설정

쉽게 말하면

Qwen3.8-27B는 32GB급 고속 메모리 장비에서 호환되는 Q4 변환본을 실행하는 데스크톱 경로와, 공식 가중치를 서버에서 띄우는 경로를 나누어 설명합니다. 8K 문맥으로 시작해 로컬 API를 확인한 뒤 메모리 여유에 맞춰 문맥을 늘립니다.

장비를 고를 때

32GB~48GB 메모리 장비에서는 Q4 양자화 서빙이 안정적입니다. 원본 BF16 정밀도나 긴 문맥 서빙을 원한다면 64GB 이상의 메모리 구성을 검토하세요.

이 글에서 확인할 내용

  • 데스크톱 환경에서는 Q4 양자화(약 17.5GB)와 32GB급 메모리를 권장합니다.
  • 공식 BF16 가중치는 가중치만 약 54GB라 런타임과 KV 캐시 여유가 있는 고용량 NVIDIA 환경이나 멀티 GPU를 전제로 합니다.
  • 초기 8K 컨텍스트와 127.0.0.1 로컬 바인딩으로 안전하게 구동합니다.

하드웨어별 속도 튜닝 및 서빙 레시피 요약

단일 사용자 지연시간 최소화 기준의 안전 시작 문맥, 권장 런타임, GPU 오프로드 및 예상 속도 요약입니다.

하드웨어적합도권장 런타임안전 문맥토큰 생성첫 토큰
MBP M5 Pro 48GB (41GB)메모리 적정LM Studio16,384 토큰13.9 ~ 15.4 tok/s27.3 ~ 49.1초
Studio M5 Ultra 256GB (236GB)메모리 적정LM Studio16,384 토큰54.2 ~ 60.2 tok/s14.5 ~ 26.9초
Studio M5 Ultra 512GB (480GB)메모리 적정LM Studio16,384 토큰54.2 ~ 60.2 tok/s14.5 ~ 26.9초
RTX 4090 24GB (22.5GB)메모리 적정llama.cpp (CUDA)8,192 토큰44.1 ~ 48.7 tok/s6.6 ~ 6.8초
2× RTX 3090 48GB (NVLink) (45GB)메모리 적정llama.cpp (멀티 GPU)16,384 토큰57.5 ~ 79.8 tok/s16.2 ~ 27.5초
RTX PRO 6000 96GB (93GB)메모리 적정llama.cpp (CUDA)16,384 토큰87.6 ~ 96.6 tok/s11.2 ~ 13.7초
DGX Spark 128GB (116GB)메모리 적정llama.cpp (CUDA)16,384 토큰12.3 ~ 13.7 tok/s38.4 ~ 51.9초
Ryzen AI Max+ 395 128GB (116GB)메모리 적정llama.cpp (ROCm/HIP)16,384 토큰11.2 ~ 12.5 tok/s230.8 ~ 431.2초

상세 튜닝 설정은 위 섹션에서 확인할 수 있습니다. 복사할 실행 명령은 아티팩트와 런타임 경로가 확인된 조합에만 표시합니다.

아티팩트 및 런타임 선택

Qwen3.8-27B는 27B 파라미터 밀도형 모델입니다. 개인 데스크톱에서는 현재 런타임과 호환되는 커뮤니티 Q4_K_M GGUF 또는 MLX 변환본을 확인한 뒤 사용하는 경로가 현실적이며, 파일 크기는 대략 17GB대입니다. 32GB급 VRAM이나 36GB 이상 통합 메모리에서도 운영체제와 KV 캐시 몫을 따로 남겨야 합니다.

공식 Hugging Face BF16 가중치(Qwen/Qwen3.8-27B)는 가중치만 약 54GB입니다. vLLM·SGLang 경로는 런타임 여유까지 확보한 고용량 NVIDIA 가속기나 멀티 GPU 서버에 맞습니다. 새 아키텍처는 런타임 지원 시점이 다를 수 있으므로 설치 전에 현재 지원 여부를 확인합니다.

Qwen3.8-27B 모델의 Q4 GGUF 커뮤니티 변환 파일과 공식 BF16 가중치 구조 및 필요 메모리 비교 다이어그램
32GB급 장비에서는 Q4 양자화 파일이 현실적이며, 원본 정밀도 서빙에는 64GB 이상의 메모리가 필요합니다.

로컬 서버 구동 (127.0.0.1)

데스크톱에서는 LM Studio CLI(lms)를 통해 로컬 데몬을 시작합니다. 다운로드 또는 변환한 모델의 식별자를 lms ls 명령어로 확인한 뒤, 최대 GPU 오프로드와 8K(8,192 토큰) 안전 컨텍스트로 로드합니다. 네이티브 256K 전체를 처음부터 지정하면 시작과 동시에 메모리 부족이 발생할 수 있습니다.

보안 원칙: 모든 서빙 명령어는 127.0.0.1(localhost)에만 바인딩합니다. 외부 네트워크(0.0.0.0)로 노출할 경우 인증 체계와 방화벽 설정 없이는 로컬 시스템이 외부 위협에 노출될 수 있습니다.

LM Studio CLI 로컬 서빙 (데스크톱 Q4 GGUF)

# 1. 로컬 모델 식별자 확인
lms ls

# 2. GPU 최대 할당 및 안전 8K 컨텍스트로 모델 로드
lms load <local-model-identifier> --gpu=max --context-length=8192

# 3. 로컬 서버 데몬 시작 (포트 1234, 127.0.0.1 바인딩)
lms server start --port 1234

실제 모델 식별자는 lms ls 결과에 표시된 이름을 그대로 입력합니다.

공식 vLLM 서버 구동 (BF16 / FP8 대용량 메모리)

vllm serve Qwen/Qwen3.8-27B   --host 127.0.0.1   --port 8000   --max-model-len 8192   --gpu-memory-utilization 0.90

공식 BF16 가중치와 런타임 여유가 확보된 NVIDIA 서버에서 127.0.0.1로 실행합니다.

LM Studio 및 vLLM을 활용한 Qwen3.8-27B 127.0.0.1 로컬 서버 구동과 포트 및 기본 컨텍스트 설정 흐름도
로컬 서빙은 127.0.0.1 주소와 8K~16K 안전 시작 컨텍스트로 시작하고 메모리 점유를 확인한 뒤 길이를 늘립니다.

엔드포인트 검증 및 챗 완료 테스트

서버가 구동되면 curl을 통해 OpenAI 호환 REST API가 정상 응답하는지 검증합니다. 먼저 /v1/models 엔드포인트로 모델 로드 상태를 확인한 후, /v1/chat/completions로 간단한 메시지를 전송하여 추론 사고 토큰과 본문 응답이 스트리밍되는지 확인합니다.

Qwen3.8-27B는 reasoning_content 필드 또는 사고 태그를 통해 생각 과정을 출력할 수 있습니다. 클라이언트 설정에서 reasoning effort를 조정하여 응답 길이와 생성 속도의 균형을 맞출 수 있습니다.

API 엔드포인트 헬스체크 및 챗 요청 검증

# 1. 로드된 모델 목록 확인
curl http://127.0.0.1:1234/v1/models

# 2. OpenAI 호환 챗 완성 API 호출
curl http://127.0.0.1:1234/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "<local-model-identifier>",
    "messages": [
      {"role": "user", "content": "로컬 LLM 서빙의 장점을 세 가지로 요약해줘."}
    ],
    "temperature": 0.6,
    "max_tokens": 1024
  }'

127.0.0.1:1234(LM Studio) 또는 127.0.0.1:8000(vLLM) 포트에 맞춰 요청합니다.

Qwen3.8-27B 로컬 엔드포인트의 OpenAI 호환 API 응답 확인 및 추론 사고 토큰과 메모리 검증 다이어그램
기본 활성화된 추론 사고 과정과 KV 캐시 증가량을 확인하며 실제 대화 길이에 맞춘 메모리 여유를 확보합니다.

메모리 점검 및 트러블슈팅

서빙 중 메모리 부족(OOM) 오류가 발생한다면 가장 먼저 컨텍스트 길이를 확인하세요. 27B 모델은 문맥이 길어질수록 KV 캐시 메모리 소모가 급격히 늘어납니다. 8K 문맥에서 안정성이 확인된 후 16K, 32K로 단계별 확장해야 합니다.

생성 속도가 예상보다 낮다면 일부 레이어가 CPU로 넘어갔는지, 저장장치 스왑이 발생하는지 확인합니다. 같은 양자화라도 런타임, 메모리 대역폭, 프롬프트 길이에 따라 실제 속도는 달라집니다.