메모리와 모델

LLM 양자화란? Q4·Q8·FP16 선택 기준

비트를 줄이면 더 큰 모델이 들어가지만, 모든 Q4가 같은 크기와 품질은 아닙니다.

쉽게 말하면

양자화는 모델 숫자를 더 간단하게 저장해 용량을 줄이는 압축에 가깝습니다. Q4는 작고 가벼운 대신 일부 정확도를 잃을 수 있고, Q8은 더 크지만 원본에 가까운 편입니다.

장비를 고를 때

처음에는 Q4로 원하는 모델이 잘 돌아가는지 확인하세요. 중요한 코드나 계산에서 차이가 느껴질 때 Q8 또는 더 높은 정밀도를 검토하면 됩니다.

이 글에서 확인할 내용

  • 가중치 양자화와 KV 캐시 양자화는 별개입니다.
  • 같은 4비트 표기도 블록 크기와 혼합 정밀도가 다릅니다.
  • 품질 손실은 모델과 작업별로 직접 확인해야 합니다.

모델 숫자를 더 작게 저장합니다

모델은 아주 많은 숫자로 이루어져 있고 원본은 보통 FP16이나 BF16이라는 비교적 정밀한 방식으로 저장됩니다. 양자화는 이 숫자를 더 단순하게 표현해 파일 크기와 실행 메모리를 줄입니다.

8비트는 원본에 가까운 편이고 4비트는 훨씬 작아 로컬 LLM에서 많이 씁니다. 2~3비트까지 낮추면 더 큰 모델을 넣을 수 있지만 답변 정확도가 떨어질 가능성도 커집니다.

같은 Q4라도 결과가 다를 수 있습니다

Q4는 대략 4비트로 줄였다는 큰 분류일 뿐입니다. 어떤 숫자를 더 정밀하게 남길지, 얼마나 잘게 나눠 압축할지에 따라 실제 파일 크기와 품질이 달라집니다.

Q4_K_M, GPTQ 4-bit, AWQ 4-bit, MLX 4-bit는 서로 다른 실행 도구에 맞춘 방식입니다. 이름에 4비트가 들어가도 속도와 품질이 같다고 생각하면 안 됩니다.

촘촘한 모델 가중치를 몇 단계의 값으로 묶어 더 작은 격자로 줄이는 양자화 과정을 나타낸 그림
양자화는 촘촘한 가중치를 더 적은 단계로 묶어 파일과 메모리를 줄입니다. 많이 줄일수록 손실 가능성도 커집니다.

작은 파일이 항상 더 빠른 것은 아닙니다

모델 파일이 작아지면 메모리에서 읽어야 할 양이 줄어 답변 생성이 빨라질 수 있습니다. 하지만 압축된 숫자를 계산할 때 다시 풀어야 하고, 장비와 실행 프로그램이 그 형식을 얼마나 잘 처리하는지도 중요합니다.

Q4가 Q8보다 빠른 경우가 많지만 모든 장비에서 같은 차이가 나지는 않습니다. 파일 크기 비율을 그대로 속도 차이라고 계산하지 말고 같은 장비의 실제 결과를 보세요.

품질은 평균 점수보다 작업으로 확인

양자화 손실은 모델 크기, 레이어 민감도, 양자화 방법과 과제에 따라 달라집니다. 일반 지식 벤치마크 변화가 작아도 긴 문맥, 코드 정확성, 수치 계산이나 도구 호출 형식에서 차이가 날 수 있습니다.

대표 프롬프트를 고정하고 원본 또는 Q8 결과와 비교하세요. 같은 모델의 비트를 지나치게 낮추는 것보다 한 단계 작은 모델을 더 높은 정밀도로 쓰는 편이 나은 경우도 있습니다.

선택 순서

먼저 사용할 런타임이 지원하는 형식을 고르고, 장비 가용 메모리 안에서 KV 캐시 여유가 남는 정밀도를 찾습니다. 그다음 실제 작업의 품질과 프리필·디코드 속도를 비교합니다.

용량과 품질의 균형점으로 4비트를 우선 시험할 수 있지만 보편적인 정답은 아닙니다. 중요한 결과 검증이 필요하면 Q8이나 더 높은 정밀도와 나란히 평가하고, 장기 보관 파일은 변환 출처와 설정을 기록하세요.