답변 속도와 가속

MTP란? 다중 토큰 예측의 원리와 조건

여러 토큰을 미리 제안하되, 메인 모델의 검증을 통과한 토큰만 사용합니다.

쉽게 말하면

보통 LLM은 단어 조각을 하나씩 만듭니다. MTP는 다음에 나올 단어 조각을 몇 개 미리 제안하고, 본 모델이 맞는지 확인한 뒤 맞은 부분만 사용해 기다리는 시간을 줄이는 기술입니다.

장비를 고를 때

MTP는 모든 모델에서 되는 공통 기능이 아닙니다. 장비 광고의 최대 가속 수치보다 MTP를 끈 기본 속도를 먼저 확인하세요.

이 글에서 확인할 내용

  • MTP는 모델 학습 구조와 추론 가속을 함께 가리키는 말입니다.
  • MTP 헤드가 들어 있는 체크포인트와 지원 런타임이 모두 필요합니다.
  • 승인되는 토큰이 적거나 검증 비용이 크면 빨라지지 않습니다.

MTP를 한 문장으로

LLM은 문장을 토큰이라는 작은 단위로 나눠 다음 토큰 하나를 예상하며 답을 씁니다. MTP(Multi-Token Prediction)는 모델을 만들 때 두 번째, 세 번째 토큰도 함께 예상하도록 추가 예측 부분을 넣은 구조입니다.

이 추가 부분이 다음 토큰 후보를 미리 만들어 주면 생성 속도를 높이는 데 활용할 수 있습니다. 하지만 MTP로 학습된 모델이라고 해서 어떤 앱에서나 자동으로 빨라지는 것은 아닙니다.

왜 본 모델이 다시 확인하나

미리 만든 후보가 틀린 채로 답변에 들어가면 품질이 달라집니다. 그래서 본 모델이 후보 여러 개를 한꺼번에 확인하고, 앞에서부터 연속으로 맞은 부분만 답변에 사용합니다.

MTP를 켠다고 모델이 더 똑똑해지는 것은 아닙니다. 같은 본 모델이 확인하는 과정을 유지하면서, 답변을 만들기 위해 반복하던 계산 횟수를 줄이는 것이 목적입니다.

토큰을 하나씩 생성하는 기본 방식과 여러 후보 토큰을 제안한 뒤 승인된 토큰만 사용하는 가속 방식을 비교한 그림
위는 토큰을 하나씩 만드는 기본 방식, 아래는 여러 후보를 먼저 제안하고 맞은 부분만 받아들이는 가속 방식입니다.

모델 파일과 실행 앱이 모두 맞아야 합니다

먼저 내려받은 모델 파일에 MTP용 추가 가중치가 들어 있어야 합니다. 모델을 다른 형식으로 바꾸는 과정에서 이 부분이 빠진 파일은 일반 생성은 되더라도 MTP 가속은 쓸 수 없습니다.

다음으로 oMLX, vLLM 같은 실행 프로그램이 그 모델의 MTP 구조를 지원해야 합니다. 설정 화면에 MTP 버튼이 보이더라도 현재 모델과 양자화 조합에서 실제로 작동하는지는 따로 확인해야 합니다.

빨라지는 조건과 느려지는 조건

모델의 예측이 안정적이고 여러 후보 토큰이 연속 승인될수록 이득이 커집니다. 정형 코드, 반복 구조와 낮은 변동성의 문장은 승인 깊이가 길어지기 쉽습니다.

후보가 자주 거절되거나 추가 헤드의 메모리 접근과 검증 비용이 크면 기본 디코드보다 느릴 수 있습니다. 짧은 출력에서는 초기 준비 비용을 회수하지 못할 수도 있으므로 실제 작업으로 켜고 끈 결과를 비교해야 합니다.

장비 선택에 주는 의미

MTP는 부족한 메모리를 해결하는 기능이 아닙니다. 모델 본체와 MTP 가중치, KV 캐시가 먼저 메모리에 들어가야 하며 일부 구현은 추가 작업 공간도 사용합니다.

장비를 살 때 최대 가속 배율을 기본 성능처럼 계산하지 마세요. 지원이 없거나 이득이 없는 경우의 기본 디코드 속도를 바닥값으로 보고, MTP는 호환되는 모델에서 얻을 수 있는 추가 이점으로 보는 편이 안전합니다.