실행 프로그램과 확장
Husky란? 맥에서 Woof를 빠르게 돌리는 엔진과 730 tok/s의 조건
맥에서 로컬 AI를 쓰다 보면 장비를 바꿔야 하나 싶어지는 순간이 있습니다. 그런데 Husky는 다른 쪽을 봅니다. 더 큰 컴퓨터를 고르는 대신, Woof라는 모델 하나에 실행 엔진을 맞췄습니다. 눈에 띄는 730 tok/s보다 먼저 볼 것은 그 속도가 나온 작업입니다.
핵심 내용
- 01
- Husky는 Woof용 Apple Silicon 추론 엔진입니다. 모든 LLM을 빠르게 만드는 공통 설정은 아닙니다.
- 02
- 730 tok/s는 M5 Max의 함수 수정 작업에서 나온 개발사 측정값입니다.
- 03
- 맥용 Underdog에서 사용합니다. 한국어 품질과 내 작업의 속도는 따로 확인해야 합니다.
Husky, Woof, Underdog은 각각 무엇인가
이름을 나누면 이해가 쉽습니다. Underdog은 사용자가 여는 앱이고, Woof는 그 안에서 답을 만드는 모델, Husky는 모델을 실행하는 엔진입니다. 2026년 9월 20일 발표의 비교 대상은 Woof 4B의 같은 4비트 가중치였습니다. 시험 장비는 M5 Max 40코어 GPU·메모리 128GB입니다.
집에 있는 책을 읽는다고 생각해 보세요. 책의 내용이 모델이라면, 책을 찾고 펼치고 다음 장을 넘기는 방법은 엔진에 가깝습니다. 책을 빨리 펼쳤다고 내용이 더 정확해지는 것은 아닙니다. Husky를 볼 때도 실행 속도와 모델의 답변 능력을 따로 판단해야 합니다.

730 tok/s가 나오는 작업, 그렇지 않은 작업
발표 표에서 함수 수정은 MLX 163, Husky 614, Flash를 켠 Husky 730 tok/s입니다. 반면 짧은 이메일 작성은 각각 151, 164, 260 tok/s였습니다. 둘 다 빨라졌지만 같은 배수는 아닙니다. 개발사는 동일 가중치·greedy decoding으로 작업별 3회 중앙값을 비교했습니다.
수정할 코드가 질문 안에 이미 들어 있다면 답변은 그 코드의 많은 부분을 다시 적게 됩니다. 반대로 빈 문서에서 새 글을 쓰는 작업에는 복사해 쓸 문장이 적습니다. 그래서 '내가 만드는 답변이 원문을 얼마나 되풀이하는가'가 유용한 질문입니다. 발표의 최대값을 긴 한국어 설명문이나 다른 모델의 예상 속도로 옮겨 적으면 이 차이가 사라집니다.
Flash는 작은 모델이 답을 대신 쓰는 기능일까
Husky는 입력에서 이어 쓸 수 있는 토큰을 찾거나, Woof에 맞춰 학습한 작은 draft가 다음 토큰 후보를 제안하게 합니다. 후보는 Woof가 확인합니다. 입력을 재사용하는 경로와 Flash의 제안 경로를 작업에 따라 고르는 방식입니다. 이름이 비슷한 다른 회사의 Flash 모델과는 구분해야 합니다.
교정할 문장을 먼저 적어 둔 뒤 틀린 부분만 고치는 일을 떠올리면 됩니다. 빈칸부터 매번 쓰는 것보다 유리할 수 있지만, 초안이 자꾸 틀리면 확인 비용이 남습니다. 토큰 수를 늘리는 설정 하나가 언제나 빠른 것은 아니라는 뜻입니다. 이 원리는 투기 디코딩을 이해할 때도 도움이 됩니다.

첫 답변까지의 시간도 같은 조건으로 봐야 합니다
대화를 이어가는 경우에는 앞서 읽은 내용을 기억해 두는 캐시가 중요합니다. 긴 문서를 처음 읽는 상황과 마지막 한 문장만 새로 읽는 상황은 다릅니다. 답변이 시작되는 시간, 시작된 뒤 글이 나오는 속도, 모델을 처음 불러오는 시간을 나눠 보세요.
실제로 비교한다면 같은 문서를 넣은 새 대화와, 그 대화에 질문을 하나 더 붙인 경우를 각각 기록하는 편이 좋습니다. '계속 대화할 때 빠르다'는 장점은 그대로 살리되, 새 PDF를 넣을 때도 똑같이 짧게 기다린다고 기대하지 않게 됩니다.

맥에서 어떻게 써 볼 수 있나
현재 안내된 경로는 맥용 Underdog 앱입니다. 다운로드한 앱의 요구 OS와 설치 안내를 확인하고, 연결하는 메일·캘린더의 권한은 필요한 범위만 허용하세요. 로컬 추론이라는 말이 연결된 외부 서비스의 모든 통신까지 없앤다는 뜻은 아닙니다.
첫 시험에는 실제 개인정보가 없는 짧은 글을 쓰세요. 오탈자만 고치기, 문체 바꾸기, 할 일 뽑기를 따로 요청하고 원문과 대조하면 됩니다. 빠른데 중요한 문장을 빼먹는지, 한국어 존댓말이 유지되는지까지 확인해야 내 작업에 쓸 수 있는지 알 수 있습니다.
Qwen·oMLX 사용자는 무엇을 바꾸면 될까
Husky 발표만 보고 기존 Qwen 서버의 엔진을 바꿀 이유는 없습니다. Woof 전용 최적화를 Qwen에 연결하는 공개 범용 설정이 확인된 것은 아닙니다. 여러 모델을 바꿔 쓰거나 기존 앱에 API로 연결하는 일이 중요하다면 그 기능을 제공하는 현재 실행 경로를 먼저 유지하세요.
이번 발표가 장비 구매에 주는 힌트는 오히려 소박합니다. 장비가 느리다고 느낄 때, 모델과 실행 방식이 내 작업에 맞는지 먼저 볼 여지가 있다는 것입니다. 아래 속도 체감은 다른 장비·모델을 고르는 도구입니다. Husky의 Woof 실측을 재현하거나 모든 모델에 4.5배를 곱하는 화면은 아닙니다.