실행 프로그램과 확장
Ollama: 내 컴퓨터의 모델을 다른 앱에 연결할 때
모델과 대화는 됐는데 코드 편집기에 연결하니 답이 오지 않습니다. 이때 더 큰 모델을 받거나 장비를 바꾸기 전에 확인할 것이 있습니다. 모델이 실행되는 곳, 앱이 요청을 보내는 주소, 앱이 기대하는 기능이 서로 맞는지부터 보겠습니다.
연결을 단순하게 유지하고 싶을 때
Ollama는 모델을 관리하고 요청을 받아 답을 돌려주는 일을 묶어 줍니다. 내가 만든 짧은 스크립트나 편집기에서 같은 모델을 부르고 싶을 때 선택할 이유가 있습니다. 매번 세부 실행 명령을 직접 관리하는 대신 모델 이름과 서버 주소를 중심으로 사용할 수 있습니다.
다만 OpenAI 호환이라는 표시는 모든 앱의 모든 기능이 된다는 뜻이 아닙니다. 일반 대화, 도구 호출, 이미지 입력은 서로 다른 확인 항목입니다. 연결할 앱이 요구하는 API와 모델 기능을 먼저 보고, 텍스트 한 문장이 정상적으로 돌아온 다음 필요한 기능을 더하세요.
같은 모델 이름에도 실행 위치가 다릅니다
로컬 체험에서는 내려받은 모델을 선택합니다. 클라우드 모델도 함께 제공되므로 앱 이름만 보고 모든 요청이 내 컴퓨터에서 처리된다고 생각하면 안 됩니다. 아래 예제는 클라우드 기능을 끄고 이 컴퓨터 안에서만 요청을 받도록 서버를 시작합니다.
Apple Silicon에서는 Metal 가속을 사용할 수 있습니다. NVIDIA·AMD PC는 GPU와 드라이버의 지원 조건도 확인해야 합니다. 이름이 같은 모델이라도 태그와 압축 형식이 다르면 필요한 메모리가 달라지므로, 다른 사람의 기록과 비교할 때 모델 이름만 적어 두지 마세요.
이미 켜진 서버부터 확인합니다
Ollama 앱이나 운영체제 서비스가 이미 실행 중이면 같은 포트에 서버를 하나 더 띄울 수 없습니다. 아래 명령은 기존 서버를 종료한 뒤 터미널에서 직접 시작할 때의 예제입니다. 앱이나 서비스 방식으로 계속 쓴다면 그 실행 환경에 설정을 적용하고 다시 시작해야 합니다.
문맥은 짧은 연결 확인용으로 4,096토큰을 지정했습니다. 이것이 모든 버전의 기본값이거나 코딩 에이전트에 충분한 길이라는 뜻은 아닙니다. 서버가 켜지면 다른 터미널에서 ollama ls를 실행해 이미 받은 로컬 모델의 이름과 태그를 확인합니다.
로컬 전용 서버 시작
OLLAMA_NO_CLOUD=1 OLLAMA_HOST=127.0.0.1:11434 OLLAMA_CONTEXT_LENGTH=4096 ollama serveOllama 설치 후 macOS·Linux 터미널에서 사용하는 예제입니다. Windows에서는 같은 환경 변수를 설정하고 앱을 다시 시작합니다. 모델을 내려받는 명령은 아닙니다.
연결 확인과 속도 측정을 나눕니다
YOUR_LOCAL_MODEL을 방금 확인한 이름으로 바꿉니다. 이 요청은 짧은 답이 돌아오는지만 확인합니다. stream을 끈 상태라 답 전체가 나온 뒤 표시되며, 화면에 보일 때까지의 시간을 첫 토큰 대기 시간으로 기록하면 안 됩니다.
답이 돌아오면 ollama ps의 PROCESSOR를 확인하세요. 일부가 CPU에 적재됐다면 GPU만 쓰는 기록과 바로 비교할 수 없습니다. 첫 실행의 모델 로딩 시간도 반복 실행과 분리합니다. 속도 기록을 남길 때는 준비 실행 후 입력·출력 길이와 설정을 맞춰 3회 이상 확인합니다.
로컬 모델에 짧은 요청 보내기
curl -sS http://127.0.0.1:11434/api/chat -H "Content-Type: application/json" -d '{"model":"YOUR_LOCAL_MODEL","messages":[{"role":"user","content":"Reply with one short sentence."}],"stream":false,"options":{"num_ctx":4096,"num_predict":128}}'YOUR_LOCAL_MODEL은 예시 자리표시자입니다. 설치된 모델의 정확한 태그로 바꾸고 실행하세요. 이 코드는 성능 측정이 아닌 연결 확인용입니다.
느리다는 이유로 전부 바꾸기 전에
짧은 질문은 괜찮은데 문서를 붙일 때 기다림이 길어진다면 먼저 입력 처리와 메모리를 봅니다. 문맥을 크게 잡거나 여러 요청을 동시에 받으면 필요한 공간도 늘어납니다. 작은 파일로 바꿨더니 빨라진 결과를 엔진 설정 하나의 효과로 해석하지 않는 것도 중요합니다.
원하는 모델이나 가속 방식이 현재 경로에서 지원되지 않을 때 다른 엔진을 검토하면 됩니다. GGUF 설정을 직접 조절하려면 llama.cpp, 맥에서 MLX 경로를 살펴보려면 oMLX나 MTPLX 가이드를 이어 보세요. 지금 작업이 충분히 된다면 익숙한 연결을 그대로 유지하는 것도 합리적인 선택입니다.
수정 내역
사이트의 안내가 바뀐 기록입니다. 설치된 엔진·모델 버전을 자동으로 확인한 결과는 아닙니다.
Ollama의 로컬 실행·상태 확인 안내 추가
로컬 모델로 서버를 시작하고 짧은 API 요청을 보내는 예제를 추가했습니다. 모델의 실행 위치와 문맥 설정을 확인하고, 요청 한 번의 완료 시간을 첫 토큰 속도로 읽지 않도록 설명했습니다.