로컬 AI 기본기
로컬 LLM VRAM·통합 메모리 용량 계산 가이드: 표시 메모리보다 실제 사용 가능한 메모리가 중요합니다.
12B·27B·35B·70B급 로컬 LLM에 필요한 VRAM과 통합 메모리를 양자화, KV 캐시, 문맥 길이까지 포함해 판단하는 방법입니다.
가중치와 실행 여유
Q4 가중치는 대략적인 시작점일 뿐입니다. 런타임 오버헤드와 KV 캐시가 추가되므로 장비의 표시 용량을 전부 모델에 쓸 수는 없습니다.
긴 문맥의 비용
문맥 길이가 늘면 KV 캐시가 커지고 프리필 시간도 길어집니다. 모델이 겨우 적재되는 구성에서는 긴 문맥을 쓰는 순간 메모리 부족이나 오프로딩이 발생할 수 있습니다.
멀티 GPU 주의점
그래픽카드 두 장의 VRAM은 런타임이 모델을 분할할 때만 활용됩니다. PCIe 대역폭, 텐서 병렬 지원과 카드 간 통신이 실제 속도를 좌우합니다.