로컬 AI 기본기

로컬 LLM 장비 고르는 법: 메모리·속도·전력 기준: 모델이 들어가는지 먼저, 기다릴 만한 속도인지는 그다음입니다.

로컬 LLM 장비를 고를 때 VRAM과 통합 메모리, 프리필, 토큰 생성 속도, 전기요금과 TCO를 어떤 순서로 봐야 하는지 설명합니다.

1. 메모리 적재부터 확인

모델 가중치만 맞추면 끝이 아닙니다. 운영체제 예약분, 런타임, KV 캐시와 긴 문맥에 필요한 여유까지 남아야 합니다.

4비트 양자화는 입문 기준으로 유용하지만, 같은 파라미터 수라도 MoE와 밀도형 모델의 생성 속도는 다르게 봐야 합니다.

2. 프리필과 토큰 생성을 분리

프리필은 입력 문서를 읽는 속도이고 토큰 생성은 답변이 이어지는 속도입니다. 긴 문서 요약은 프리필, 대화와 코딩 보조는 토큰 생성 체감이 더 중요할 수 있습니다.

3. 본체 가격이 아닌 보유비용

GPU 단품은 호스트 PC와 전원공급장치가 필요합니다. 완제품은 초기 가격이 높아도 전력, 소음, 설치 시간과 중고 잔존가치를 함께 계산해야 합니다.