답변 속도와 가속

LLM 메모리 대역폭과 연산 성능 차이

같은 GPU 성능표라도 토큰을 하나씩 만들 때와 긴 입력을 읽을 때 병목이 다릅니다.

쉽게 말하면

LLM은 계산만 많이 하는 프로그램이 아니라, 큰 모델 파일을 메모리에서 계속 읽는 프로그램이기도 합니다. 그래서 그래픽 연산 점수가 높아도 메모리를 읽는 속도가 느리면 답변 생성이 기대만큼 빠르지 않을 수 있습니다.

장비를 고를 때

단일 사용자 채팅이 목적이면 GPU 코어 수와 AI TOPS만 보지 말고 메모리 대역폭과 같은 모델의 실제 생성 속도를 함께 보세요.

이 글에서 확인할 내용

  • 단일 사용자 디코드는 메모리 대역폭 병목이 되기 쉽습니다.
  • 프리필과 큰 배치는 연산 자원을 더 많이 활용합니다.
  • TOPS나 코어 수 하나로 전체 LLM 속도를 예측할 수 없습니다.

대역폭은 초당 읽을 수 있는 양입니다

디코드 단계에서는 새 토큰 하나를 만들 때 모델 가중치의 큰 부분을 반복해서 읽습니다. 계산 장치가 준비되어 있어도 가중치가 도착하지 않으면 기다려야 하므로 메모리 대역폭이 상한을 만들기 쉽습니다.

양자화로 가중치 크기를 줄이면 같은 대역폭으로 더 많은 토큰을 처리할 여지가 생깁니다. 다만 역양자화 연산과 커널 효율 때문에 파일 크기 비율만큼 정확히 빨라지지는 않습니다.

프리필은 행렬 연산을 묶습니다

프리필은 여러 입력 토큰을 한꺼번에 처리할 수 있어 큰 행렬 곱셈으로 계산 밀도를 높입니다. 긴 입력이나 여러 요청을 묶는 배치에서는 GPU 연산 유닛을 단일 토큰 디코드보다 더 잘 채울 수 있습니다.

따라서 연산 성능이 높은 GPU는 프리필과 처리량 중심 서버에서 강점을 보일 수 있습니다. 같은 장비도 입력 길이와 배치 크기가 달라지면 병목 위치가 바뀝니다.

단일 GPU와 서로 통신하는 듀얼 GPU에서 여러 길이의 요청을 캐시 블록에 배치하는 과정을 비교한 그림
GPU를 늘리면 메모리와 처리량을 키울 수 있지만 장비 사이 통신이 추가됩니다. 여러 요청은 빈 캐시 블록을 나눠 쓰며 처리됩니다.

이론 사양과 실효 성능

제조사가 표시하는 메모리 대역폭과 연산량은 하드웨어의 이론적 상한입니다. 런타임 커널, 양자화 형식, 메모리 접근 패턴과 냉각 상태가 실제 활용률을 결정합니다.

통합 메모리는 CPU와 GPU 사이 복사를 줄이는 장점이 있지만 전체 용량과 대역폭을 여러 작업이 공유합니다. 별도 GPU의 VRAM은 전용 대역폭이 높지만 모델이 넘치면 호스트 메모리 오프로딩 비용이 커집니다.

장비표를 읽는 순서

먼저 모델이 가용 메모리에 들어가는지 확인하고, 다음으로 단일 사용자 디코드가 중요하면 메모리 대역폭과 해당 양자화의 실측 범위를 봅니다. 긴 문서와 다중 사용자가 중요하면 프리필 및 배치 처리량도 따로 확인합니다.

서로 다른 모델의 tok/s는 가중치 크기와 구조가 달라 직접적인 하드웨어 순위가 아닙니다. 같은 모델, 같은 양자화, 같은 문맥과 런타임 조건으로 비교해야 합니다.