실행 프로그램과 확장
MTPLX: 맥에서 MTP를 켜면 답변이 빨라질까요?
맥에서 모델은 잘 돌아가는데 긴 답변을 기다리는 시간이 아쉽습니다. MTPLX는 이때 살펴볼 만한 실행 프로그램입니다. 모델이 가진 MTP로 다음 토큰을 미리 제안하고 검증합니다. 다만 이미 받은 파일에 MTP 가중치가 없을 수도 있고, 더 많이 미리 만든다고 더 빨라지는 것도 아닙니다.
미리 쓴 토큰도 확인받아야 합니다
일반 생성이 다음 토큰을 하나씩 이어 간다면, MTP는 몇 개의 후보를 미리 준비합니다. 본체가 후보를 확인해 받아들인 부분을 답변에 붙입니다. 후보가 잘 맞고 검증 비용이 작을 때 한 번에 앞으로 가는 거리가 늘어납니다. 받아들이지 못한 후보가 많으면 미리 한 일이 그대로 이득이 되지는 않습니다.
MTPLX는 별도의 작은 초안 모델을 하나 더 올리는 방식과 구분됩니다. 그렇다고 추가 메모리와 연산이 전혀 없는 것은 아닙니다. 모델과 문맥을 담을 공간이 먼저 있어야 합니다. 긴 문서를 읽는 시간과 답변을 쓰는 시간도 나누어 보세요. MTP의 생성 이득만으로 모든 요청의 첫 글자가 빨라진다고 말할 수는 없습니다.
지금 받은 모델을 쓸 수 있는지부터
대상은 Apple Silicon 맥입니다. 공식 안내는 macOS 14 이상을 명시하며, 터미널 설치는 Python과 MLX 환경도 확인해야 합니다. 앱에서 권하는 모델을 고르는 경로와 직접 환경을 만드는 경로를 처음부터 섞을 필요는 없습니다. 터미널을 쓴다면 아래 설치 뒤 선택 화면에서 모델과 실행 방식을 정할 수 있습니다.
모델 이름이 같아도 GGUF와 MLX는 다른 파일입니다. 또 MLX 파일이라고 모두 MTP가 들어 있는 것은 아닙니다. MTPLX용으로 본체와 맞는 MTP 가중치가 함께 준비된 모델을 확인하세요. 일반 MLX 본체에 출처가 다른 MTP 파일을 붙이는 식의 조합은 피합니다. 모델 지원 목록도 앱과 설치 버전에 맞춰 봐야 합니다.
Homebrew로 설치한 뒤 모델 선택
brew install youssofal/mtplx/mtplx
mtplx startHomebrew가 있는 Apple Silicon 맥의 터미널 예제입니다. 선택한 모델은 별도로 내려받으므로 파일 용량과 여유 메모리를 먼저 확인하세요.
MTP 깊이는 내 맥에서 비교해 고릅니다
우선 짧은 질문이 끝까지 답하는지 확인합니다. 그다음 내 맥에서 일반 생성과 MTP 깊이를 비교하는 튜닝을 실행합니다. 이미 다른 서버가 같은 모델을 올려 두었다면 먼저 종료해 메모리 경쟁을 줄이세요. 앱의 자동 튜닝이나 아래 명령은 인터넷에서 본 다른 맥의 값을 그대로 쓰지 않기 위한 방법입니다.
튜닝에서 고른 값도 평소 작업으로 다시 봅니다. 짧은 질문에서는 괜찮았는데 긴 코드 수정을 반복하면 열이나 메모리 압박 때문에 달라질 수 있습니다. 팬을 높인 모드의 기록과 조용한 기본 모드의 기록도 섞지 마세요. MTP가 이기지 못한 조건이라면 일반 생성을 남겨 두는 것이 정상적인 선택입니다.
현재 모델의 MTP 깊이 다시 비교
mtplx tune --retune모델을 선택한 뒤 실행합니다. 튜닝 결과와 함께 모델·문맥·팬 모드를 기록하고, 평소 질문에서도 완료 시간과 답변을 확인하세요.
채팅이 되면 편집기로 연결합니다
MTPLX는 OpenAI 방식과 Anthropic 방식의 API를 제공합니다. 로컬 클라이언트부터 연결하려면 서버 주소를 127.0.0.1로 유지합니다. 아래 확인은 서버가 응답하는지와 어떤 모델 이름을 내놓는지 보는 용도입니다. 다른 앱의 설정에는 그 모델 ID와 앱이 요구하는 형식의 기본 주소를 넣습니다.
모델 목록이 보이는 것만으로 연동이 끝난 것은 아닙니다. 짧은 대화가 이어지는지, 생각 과정과 본문이 나뉘는지, 필요한 도구 호출이 전달되는지 실제 사용할 앱에서 확인하세요. 편집기가 연결되지 않을 때 모델을 다시 받기 전에 서버 주소, 포트와 모델 이름을 대조하면 불필요한 일을 줄일 수 있습니다.
실행 중인 로컬 서버 확인
curl --fail http://127.0.0.1:8000/health
curl --fail http://127.0.0.1:8000/v1/modelsmtplx start에서 서버를 시작한 상태의 예제입니다. 포트를 바꿨다면 주소도 바꿉니다. 이 응답은 모델의 속도 측정 결과가 아닙니다.
중간에 끊기거나 첫 답만 느릴 때
메모리가 부족하다면 MTP 깊이부터 더 올리지 않습니다. 문맥과 동시에 처리할 요청을 줄이고, 다른 앱이 차지한 메모리와 선택한 파일의 크기를 확인합니다. 실행 환경 자체가 의심되면 mtplx doctor로 상태를 확인하세요. 원인을 찾기 전까지 잘되던 모델과 설정을 남겨 두면 돌아갈 곳이 생깁니다.
같은 문서를 두 번째 넣었을 때만 빨라진다면 캐시 재사용을 먼저 살펴봅니다. MTPLX의 세션 캐시는 대화 상태를 다시 활용하는 기능이며, 모델의 n-gram 테이블을 SSD로 내리는 것과 같은 기능이 아닙니다. 캐시를 쓰는 대화와 처음 읽는 문서는 따로 기록해야 엔진을 바꾼 효과를 과장하지 않게 됩니다.
저장된 대화 상태도 관리 대상입니다. 외부로 공개할 로그에는 질문 원문, 로컬 파일 경로와 인증 정보를 넣지 마세요. 최신 버전으로 바꾼 뒤 문제가 생겼다면 설치 버전과 오류만 남기고, 일단 이전의 정상 조합으로 복구하는 편이 설정을 여러 개 더 켜는 것보다 낫습니다.
oMLX에서 잘 쓰고 있었다면
지금 쓰는 oMLX나 LM Studio에서 모델 관리와 답변 속도가 충분하다면 그대로 써도 됩니다. MTP 지원 파일로 같은 작업의 기다림을 줄일 수 있는지 시험하고 싶을 때 MTPLX를 후보로 추가하면 됩니다. 엔진을 옮겨 얻은 이득과 파일의 양자화를 낮춰 얻은 이득은 나누어 판단하세요.
장비별 레시피에는 현재 정리된 실행 경로가 표시됩니다. 그 경로의 예상 숫자를 MTPLX에서 측정한 속도라고 읽으면 안 됩니다. 이 글의 명령은 설치와 확인 순서를 위한 안내이고, 내 맥에서 남긴 실행 결과가 실제 선택의 기준입니다.
수정 내역
사이트의 안내가 바뀐 기록입니다. 설치된 엔진·모델 버전을 자동으로 확인한 결과는 아닙니다.
MTPLX 설치·튜닝·API 안내 추가
Homebrew 설치부터 모델 선택, MTP 깊이 재튜닝과 로컬 API 확인까지의 순서를 추가했습니다. 본체와 맞는 MTP 가중치가 필요하며, 기존 레시피의 예상 속도는 MTPLX 실측값이 아니라는 점을 구분했습니다.