로컬 AI 기본기

LLM 프리필과 토큰 생성 속도 차이: 첫 답변까지의 기다림과 답변이 이어지는 속도는 다른 지표입니다.

로컬 LLM 벤치마크에서 프리필 속도, 첫 토큰 시간과 디코드 토큰 생성 속도를 구분해 실제 체감 성능을 읽는 방법입니다.

프리필

프리필은 사용자가 넣은 프롬프트와 문서를 한 번에 처리하는 단계입니다. 문서가 길수록 첫 토큰까지의 시간이 크게 늘어납니다.

디코드

디코드는 모델이 답변 토큰을 한 개씩 생성하는 단계입니다. 단일 사용자 환경에서는 메모리 대역폭과 활성 파라미터가 체감 속도에 큰 영향을 줍니다.

한 숫자로 합치지 않는 이유

짧은 채팅과 긴 문서 분석은 병목이 다릅니다. 그래서 이 사이트는 첫 토큰 시간, 프리필 처리량과 토큰 생성 속도를 따로 보여줍니다.