실행 프로그램과 확장
멀티 GPU·듀얼 GPU로 로컬 LLM 돌리기
VRAM은 더할 수 있어도 속도는 카드 수만큼 자동으로 늘지 않습니다.
쉽게 말하면
그래픽카드 두 장을 꽂아도 하나의 큰 카드처럼 자동 작동하지는 않습니다. 실행 프로그램이 모델을 두 장에 나눠 담고, 계산 중간 결과를 계속 주고받아야 합니다.
장비를 고를 때
큰 모델을 꼭 올려야 할 때는 도움이 되지만 설치·전력·발열이 늘어납니다. 관리 편의성을 우선하면 가능한 한 GPU 한 장에 모델이 들어가는 구성이 낫습니다.
이 글에서 확인할 내용
- 런타임이 모델과 캐시를 여러 GPU로 분할해야 합니다.
- 텐서 병렬은 매 레이어에서 GPU 간 통신이 필요합니다.
- 두 장 구성은 적재 용량 확대와 속도 향상을 따로 평가해야 합니다.
메모리가 자동으로 합쳐지지 않습니다
컴퓨터에 GPU가 두 장 보여도 하나의 큰 VRAM처럼 바로 쓸 수는 없습니다. 실행 프로그램이 모델의 앞뒤 부분이나 계산 조각을 나누고, 각 카드에 작업 공간과 대화용 캐시를 배치해야 합니다.
모델 나누기를 지원하지 않는 앱에서는 두 카드의 총 VRAM을 활용하지 못합니다. 지원하더라도 카드마다 계산에 필요한 여유 공간을 남겨야 합니다.
모델의 앞뒤를 나누는 방법
가장 이해하기 쉬운 방법은 모델의 앞쪽 층과 뒤쪽 층을 서로 다른 GPU에 담는 것입니다. 답변 토큰이 두 카드를 차례로 지나가며 계산되므로 중간 결과를 카드 사이에서 주고받습니다.
여러 요청을 동시에 넣으면 두 카드가 쉬는 시간을 줄일 수 있지만, 혼자 한 대화만 쓸 때는 한 카드가 다른 카드를 기다리는 시간이 생길 수 있습니다.

한 계산을 두 카드가 나누는 방법
텐서 병렬은 모델의 한 층에서 하는 큰 계산을 두 GPU가 동시에 나눠 맡는 방식입니다. 계산 뒤에는 두 카드의 결과를 매번 합쳐야 합니다.
NVLink처럼 빠른 연결이 없고 PCIe만 사용하면 결과를 주고받는 시간이 커질 수 있습니다. 그래서 GPU가 두 장이라고 답변 속도가 두 배가 되지는 않습니다.
같은 모델 복제는 다른 목적입니다
각 GPU에 모델 전체를 하나씩 복제해 요청을 나누는 데이터 병렬은 동시 사용자 처리량을 늘리는 방법입니다. 한 요청에 쓸 수 있는 모델 크기나 단일 응답 속도는 늘지 않습니다.
서비스 운영에서는 복제가 더 단순하고 안정적일 수 있습니다. 개인 사용에서 큰 모델 하나를 돌리는 목적이라면 모델 병렬 경로가 필요한지 구분해야 합니다.
구매 전에 확인할 것
런타임의 지원 방식, 모델 양자화 형식, GPU별 메모리 배치와 KV 캐시 위치를 확인하세요. 같은 카드 두 장의 실제 전력, 전원공급장치, 슬롯 간격과 냉각 비용도 합산해야 합니다.
단일 대용량 GPU와 듀얼 중급 GPU를 비교할 때는 적재 가능 모델, 단일 사용자 tok/s, 프리필 처리량과 전체 시스템 가격을 각각 봅니다. 중고 카드 두 장이 싸더라도 호스트 비용과 통신 병목이 결과를 바꿀 수 있습니다.