실행 프로그램과 확장

로컬 LLM 실행 프로그램, 무엇부터 쓰면 될까요?

장비를 고르고 모델도 정했는데, 이번에는 실행 프로그램 이름이 쏟아집니다. 어떤 글은 Ollama면 충분하다고 하고, 다른 글은 엔진을 바꾸니 훨씬 빨라졌다고 합니다. 둘 다 자기 상황에서는 맞는 말일 수 있습니다. 먼저 채팅창 하나가 필요한지, 코딩 도구에 연결할 서버가 필요한지부터 나누어 보겠습니다.

채팅을 하고 싶은가, 다른 프로그램에서 부르고 싶은가

질문을 넣고 답을 읽는 것이 목적이라면 모델을 찾고 불러오는 과정이 짧은 도구가 좋습니다. LM Studio는 화면에서 파일과 실행 상태를 살펴보기 편하고, Ollama는 모델을 이름으로 관리하면서 로컬 API를 사용하는 흐름이 간단합니다. 어느 쪽을 골라도 처음부터 별도의 웹 채팅 화면을 붙일 필요는 없습니다.

반대로 편집기나 코딩 에이전트가 모델을 부르게 하려면 서버 주소와 모델 이름을 맞춰야 합니다. 채팅이 잘된다는 것과 도구 호출까지 잘된다는 것은 다른 확인입니다. 연결할 앱에서 짧은 질문, 스트리밍, 도구 호출을 차례로 시험하면 어디에서 막혔는지 찾기 쉽습니다. API 호환이라는 표시는 이런 확인을 건너뛰라는 뜻이 아닙니다.

맥이라면 엔진보다 파일을 먼저 확인합니다

같은 Qwen 이름을 골랐어도 한쪽은 GGUF, 다른 쪽은 MLX 변환본일 수 있습니다. 둘 다 4비트라고 적혀 있어도 압축 방식과 남겨 둔 가중치가 같다는 보장은 없습니다. 실행 프로그램만 바꾼 비교를 하려다가 모델 파일까지 바꾸면, 무엇 때문에 차이가 났는지 알기 어려워집니다.

Apple Silicon에서 MLX를 사용하려면 oMLX와 MTPLX를 살펴볼 수 있습니다. oMLX 글에서는 모델 관리와 반복 입력의 캐시를, MTPLX 글에서는 지원 모델의 MTP와 내 맥에서 깊이를 고르는 과정을 다룹니다. 지금 쓰는 파일을 그대로 옮길 수 있는지 먼저 읽어 보세요. 이미 필요한 일이 잘된다면 엔진을 전부 설치해 둘 이유는 없습니다.

설정을 직접 잡고 싶을 때 llama.cpp를 봅니다

모델 일부가 CPU에서 돌고 있는지, 문맥을 얼마나 잡을지, GPU에 얼마나 올릴지 직접 조정하고 싶다면 llama.cpp의 서버가 선택지가 됩니다. 대신 앱이 대신하던 파일 관리와 실행 옵션을 직접 챙겨야 합니다. 다른 글의 긴 명령어를 복사하기 전에 자신의 파일 하나로 짧은 요청부터 끝내는 편이 빠릅니다.

여기서 얻는 것은 모든 장비에서 가장 빠르다는 보장보다 설정을 분명하게 남길 수 있다는 점입니다. 잘되던 명령을 저장하고 한 항목만 바꾸면, 메모리가 부족해진 이유나 첫 답변이 늦어진 이유를 되짚을 수 있습니다. 나중에 장비를 비교할 때도 어떤 조건을 맞춰야 하는지 보입니다.

요청이 쌓인다면 서버 쪽 질문이 달라집니다

혼자 채팅할 때는 첫 글자가 언제 나오고 답이 언제 끝나는지가 중요합니다. 문서 처리와 코딩 에이전트가 동시에 요청한다면, 한 답변의 속도만큼 대기열도 중요해집니다. vLLM과 SGLang을 검토할 이유는 이처럼 모델을 지속적으로 서빙하고 요청을 관리해야 할 때 더 분명해집니다.

여러 GPU를 쓸 때도 한 모델을 나눠 담는 것인지, 모델을 각각 올려 요청을 나누는 것인지부터 정합니다. Spark의 ARM64 환경에 일반 PC용 설치 명령을 그대로 옮겨도 된다고 생각하면 안 됩니다. 아래 글의 짧은 시작 예제는 연결 확인용이고, 큰 모델의 양자화·분산 설정은 장비별 레시피에서 이어 봅니다.

바꾸기 전과 후에 같은 일을 시켜 봅니다

평소 쓰는 질문 하나와 문서 하나를 남겨 두세요. 모델 파일, 입력 길이, 출력 제한을 적고 처음 읽는 문서와 다시 읽는 문서를 나누어 봅니다. 출력이 시작되기 전의 시간, 생성이 이어지는 속도, 답을 받은 뒤 고쳐야 했던 부분까지 비교하면 숫자 하나를 보는 것보다 선택이 쉬워집니다.

새 엔진이 빠르게 끝났는데 답변이 짧아졌거나 도구 호출이 빠졌다면 같은 일을 마친 것이 아닐 수 있습니다. 반대로 속도가 비슷해도 모델 전환이 편해져 자주 쓰게 된다면 충분한 이유가 됩니다. 엔진 선택은 승자를 외우는 일이 아니라 내 작업에서 없어져야 할 불편을 찾는 일에 가깝습니다.

수정 내역

사이트의 안내가 바뀐 기록입니다. 설치된 엔진·모델 버전을 자동으로 확인한 결과는 아닙니다.

  1. 실행 프로그램 선택 안내 추가

    Ollama·LM Studio·llama.cpp·oMLX·MTPLX·vLLM·SGLang의 역할을 나눠 설명하는 글을 추가했습니다. 채팅 앱과 API 서버, 한 답변의 대기 시간과 여러 요청의 처리량을 구분해 각 엔진 글로 연결합니다.