모델별 실행 레시피
MiniCPM5-2B Q4_K_M을 로컬에서 실행하는 안전한 시작점
MiniCPM5-2B는 2.51675648B 파라미터의 밀도형 모델이며 공식 GGUF, MLX 4비트, GPTQ 배포본이 있습니다. 이 안내는 일반 PC에서 확인하기 쉬운 공식 Q4_K_M GGUF와 llama.cpp의 llama-server를 기준으로 합니다. 사이트에 표시되는 속도와 메모리는 하드웨어 사양을 이용한 추정치이므로, 아래의 짧은 로컬 시험으로 실제 환경을 확인해야 합니다.
실행 레시피
장비별 설정
한 사람이 사용할 때
사용할 장비를 고르면 실행 명령과 조정할 옵션이 나옵니다.
운용 프로필
Apple MacBook Pro M5 Pro (64GB)
메모리 적정권장 런타임: LM Studio (MLX 4비트 (GGUF Q4_K_M과 별도 형식)) · 문서화된 런타임 설정
설치 직후 처음 실행하거나 매일 안정적으로 사용할 때
선택 프로필 문맥
16,384 토큰
런타임 문서에 따른 시작 설정입니다. 아래 순서로 조정하며 속도를 비교하세요.
계산기 예상 디코드
148.3 ~ 164.8 tok/s
단일 사용자 예상치
계산기 예상 TTFT
5.7 ~ 12.3초
프리필: 1,331 ~ 2,890 tok/s
예상 메모리 점유
약 2.59GB / 56GB
남은 여유: 약 53.4GB
서버 주소
http://127.0.0.1:1234
로컬 전용 127.0.0.1
예상치는 계산기의 추천 양자화·가속과 16,384토큰 기준입니다. 위 실행 설정의 실측값은 아닙니다.
이 프로필의 실제 설정
| 적용값 | 왜 이렇게 잡았나 |
|---|---|
| 가중치MLX 4비트 (GGUF Q4_K_M과 별도 형식) | MLX 모델 디렉터리를 사용합니다. GGUF의 Q4_K_M과 같은 파일 형식이 아닙니다. |
| 입력 길이 확인16,384 | lms load의 context-length와 실제 로드 결과를 함께 확인합니다. |
| KV 캐시모델 설정에서 확인 | 이 실행 명령은 KV 캐시 정밀도를 지정하지 않습니다. |
| 프리필 배치런타임 설정에서 확인 | llama.cpp의 batch-size와 ubatch-size를 MLX 설정값으로 대신 쓰지 않습니다. |
| 동시 요청1 | 한 요청의 속도를 확인합니다. 여러 요청의 합산 처리량과 구분합니다. |
| 메모리 여유2GB 이상 | 모델을 불러온 뒤 실제 메모리와 스왑 여부를 확인합니다. |
MBP M5 Pro 64GB 실행 명령어 (LM Studio)
# lms ls에서 확인한 MLX 4비트 모델 식별자를 입력
MODEL_ID=""
lms ls
: "${MODEL_ID:?MLX 모델 식별자를 입력하세요}"
lms load "$MODEL_ID" --gpu=max --context-length=16384
lms server start --port 1234실행 후 확인
- 01서버 시작 로그에서 모델 적재 완료와 실제 컨텍스트 길이를 확인합니다.
- 02준비 실행 뒤 요청은 하나씩 보냅니다. 길이가 같은 서로 다른 입력 세 개로 첫 입력 처리 시간을 기록합니다.
- 03같은 입력을 반복한 결과는 캐시 재사용으로 따로 기록합니다. 첫 입력 결과와 합치지 않습니다.
- 04프리필 tok/s, 디코드 tok/s, 피크 메모리를 함께 기록한 뒤 한 항목씩만 바꿉니다.
바뀌는 점
- 문맥과 동시 요청을 보수적으로 잡아 장비의 최대 처리량보다 낮게 나올 수 있습니다.
한 항목씩 조정
속도를 올리는 순서
여러 값을 한꺼번에 바꾸면 원인을 찾기 어렵습니다.
- STEP 1
기준값 저장
첫 입력과 캐시 재사용을 구분하고 각각 세 번 기록합니다. 프리필·디코드·피크 메모리를 함께 비교합니다.
멈출 때: 오류가 있거나 메모리 여유가 2GB보다 작으면 다음 단계로 넘어가지 않습니다.
- STEP 2
프리필 청크 조정
1,024 → 2,048 → 4,096 순서로 올리며 긴 입력의 TTFT와 피크 메모리를 비교합니다.
멈출 때: TTFT가 줄지 않거나 메모리 정점이 급증하면 직전 값으로 돌아갑니다.
- STEP 3
KV 캐시 조정
문맥이 부족할 때만 F16/BF16 기준값과 Q8 캐시를 같은 질문으로 비교합니다.
멈출 때: 출력 차이가 생기거나 필요한 문맥이 이미 확보됐다면 기본 정밀도를 유지합니다.
- STEP 4
MTP·투기 디코딩
지원 모델에서만 켠 뒤 코드와 일반 문장을 나눠 수락률과 실제 디코드 tok/s를 측정합니다.
멈출 때: 세 번의 중앙값이 기준보다 좋아지지 않으면 끕니다.
- STEP 5
문맥 확장
실제로 필요한 길이까지 두 배씩 늘리고 중간 정보 검색과 스왑 여부를 확인합니다.
멈출 때: 검색 정확도가 떨어지거나 스왑·메모리 압축이 시작되면 한 단계 줄입니다.
내 장비 측정 기록 보내기
같은 조건으로 3회 이상 측정한 JSON을 가져오세요. 전송 버튼을 누르기 전에는 이 브라우저에서만 확인합니다.
장비·모델·실행 조건과 측정값만 받습니다. 질문·답변·원본 로그·파일 경로는 넣지 마세요.
기록 파일이 없다면, 실행 중인 로컬 서버에서 측정 도구로 만들 수 있습니다. Node.js 20 이상이 필요하며 결과를 자동 전송하지 않습니다.
검토한 이용자 제출 기록입니다. 이 사이트의 직접 측정과는 구분합니다.
설정 오류 제보
선택한 설정에서 막힌 부분을 알려주세요. 제보는 관리자만 확인합니다.
전송할 설정 · MBP M5 Pro 64GB · MiniCPM5-2B · 균형 설정
공식 Q4_K_M 파일을 정확히 받습니다
공식 저장소의 Q4 파일 이름은 MiniCPM5-2B-Q4_K_M.gguf입니다. 아래 명령은 그 파일만 models/minicpm5-2b 폴더로 받습니다. 저장소 전체를 내려받지 않으므로 F16과 Q8 파일이 함께 차지하는 공간을 피할 수 있습니다. 다운로드가 끝나면 명령에 적힌 경로와 실제 파일 이름이 같은지 확인하세요.
hf download openbmb/MiniCPM5-2B-GGUF MiniCPM5-2B-Q4_K_M.gguf --local-dir ./models/minicpm5-2b
4,096 토큰으로 로컬 서버를 엽니다
최신 llama.cpp를 설치한 뒤 저장소 루트에서 아래 명령을 실행합니다. --host 127.0.0.1은 같은 컴퓨터에서만 접속하게 하고, -c 4096은 첫 시험의 문맥을 4,096 토큰으로 고정합니다. 이 설정은 모델의 131,072 토큰 네이티브 한계를 뜻하지 않습니다. 짧은 요청이 안정적으로 끝난 뒤 필요한 문서 길이에 맞춰 문맥을 단계적으로 늘리세요.
서버가 켜지면 같은 컴퓨터의 브라우저에서 http://127.0.0.1:8080을 엽니다. -ngl 99는 GPU 적재를 요청하는 옵션이므로 CUDA나 Metal을 지원하는 빌드인지 시작 로그에서 확인하세요. 첫 실행은 파일 읽기와 커널 준비가 포함돼 느릴 수 있습니다. 준비 요청을 한 번 보낸 뒤 같은 길이의 서로 다른 질문 세 개를 넣고, 프리필과 디코드 속도를 따로 기록합니다. 같은 질문만 반복하면 캐시 덕분에 빨라진 것을 모델 자체의 성능으로 오해할 수 있습니다. hf 명령이 없다면 Hugging Face CLI를 먼저 설치하고, llama-server 명령이 없다면 llama.cpp의 실행 파일 경로부터 확인하세요.
llama-server -m ./models/minicpm5-2b/MiniCPM5-2B-Q4_K_M.gguf -ngl 99 -c 4096 --host 127.0.0.1 --port 8080
MLX는 별도 모델과 실행 경로입니다
Apple Silicon에서는 공식 openbmb/MiniCPM5-2B-MLX 4비트 배포본을 선택할 수 있습니다. 이 파일은 GGUF가 아니며 llama-server 명령의 모델 경로에 넣는 방식도 아닙니다. MLX 호환 실행기에서 해당 모델 ID를 사용하고, GGUF 결과와 비교할 때는 문맥 길이와 프롬프트를 같게 맞추세요. 파일 형식과 커널이 다르므로 한쪽의 측정 속도를 다른 쪽의 실측값처럼 옮겨 적으면 안 됩니다.
DSpark는 별도 초안 모델이 필요합니다
MiniCPM5-2B의 공식 안내는 별도 MiniCPM5-2B-DSpark 초안 체크포인트와 호환 SGLang 실행 경로를 제공합니다. 이는 본 모델 안에 내장된 일반 MTP 기능이 아니며, Q4_K_M GGUF 서버에서 이름만 켜는 옵션도 아닙니다. 먼저 기본 모델의 결과를 확인한 뒤 DSpark 전용 체크포인트, SGLang 버전과 실행 명령을 함께 맞춰야 합니다. 이 사이트에서는 장비별 DSpark 측정 자료가 확인될 때까지 가속 배율을 적용하지 않습니다.

수정 내역
사이트의 안내가 바뀐 기록입니다. 설치된 엔진·모델 버전을 자동으로 확인한 결과는 아닙니다.
MiniCPM5 실행 레시피 추가
공식 GGUF 실행 명령과 MLX 배포본을 구분해 안내합니다. DSpark는 장비별 측정 확인 전까지 속도 배율을 적용하지 않습니다.