메모리와 모델

MoE와 Dense LLM 차이: 총·활성 파라미터

일부 전문가만 계산해도 전체 전문가의 가중치는 메모리에 있어야 합니다.

쉽게 말하면

Dense 모델은 매 질문에 모델 대부분을 쓰고, MoE 모델은 여러 전문 영역 중 필요한 일부만 골라 계산합니다. 다만 어느 전문가가 선택될지 모르므로 전체 모델 파일은 메모리에 올려야 합니다.

장비를 고를 때

모델 이름의 “3B 활성”만 보고 3B 모델처럼 가볍다고 생각하면 안 됩니다. 장비를 고를 때는 실제 Q4 파일 크기와 총 파라미터를 먼저 보세요.

이 글에서 확인할 내용

  • Dense는 대부분의 가중치를 매 토큰 사용합니다.
  • MoE는 라우터가 일부 전문가만 선택해 계산합니다.
  • 활성 파라미터는 계산량 지표이지 필요한 메모리 용량이 아닙니다.

일반 모델과 전문가 모델의 차이

Dense 모델은 질문을 처리할 때 모델 안의 대부분을 사용합니다. 모델이 커질수록 저장 공간과 답변을 만들 때 필요한 계산도 함께 늘어나는 단순한 구조입니다.

MoE는 모델 안에 여러 전문가 영역을 두고 질문의 각 부분마다 필요한 일부만 골라 사용합니다. 전체 모델은 크지만 한 번에 계산하는 부분을 줄이려는 구조입니다.

총 파라미터와 활성 파라미터

총 파라미터는 모든 전문가와 공통 레이어를 합친 모델 전체 크기입니다. 활성 파라미터는 한 토큰을 처리할 때 선택된 전문가와 공통 부분에서 실제로 사용되는 규모를 뜻합니다.

예를 들어 활성 규모가 작다고 해서 그 크기만큼의 VRAM으로 실행할 수 있는 것은 아닙니다. 토큰마다 다른 전문가가 선택될 수 있어 전체 가중치를 빠르게 접근 가능한 메모리에 두는 것이 일반적입니다.

여러 전문가 모듈 가운데 입력 토큰에 맞는 일부 전문가만 선택해 통과시키는 MoE 라우팅 그림
MoE는 모든 전문가를 메모리에 올려두되, 각 토큰을 계산할 때는 선택된 일부 전문가만 사용합니다.

계산이 적어도 메모리 읽기는 남습니다

MoE는 한 토큰에 쓰는 계산을 줄일 수 있지만, 선택된 전문가 부분을 메모리에서 계속 읽어야 합니다. 메모리 속도와 실행 프로그램의 최적화가 좋지 않으면 활성 파라미터 숫자만큼 빠르게 느껴지지 않습니다.

특히 혼자 한 대화만 실행할 때는 GPU를 충분히 활용하지 못하는 경우가 있습니다. 여러 요청을 함께 처리하는 서버에서는 작업을 모아 효율을 높일 여지가 더 큽니다.

품질과 모델 크기 해석

MoE의 큰 총 파라미터는 더 많은 지식과 전문화를 담을 여지를 주지만 품질은 학습 데이터, 라우팅과 공통 레이어 설계에 달려 있습니다. 같은 활성 파라미터의 Dense 모델보다 항상 우수하다고 단정할 수 없습니다.

모델 비교표에서는 총 파라미터, 활성 파라미터, 실제 양자화 파일 크기와 벤치마크를 함께 봐야 합니다. 숫자 하나만으로 지능이나 속도를 대표시키면 구조 차이를 놓칩니다.

장비 선택 기준

먼저 전체 양자화 가중치와 KV 캐시가 메모리에 들어가는지 확인하세요. 그다음 해당 런타임이 모델의 전문가 구조와 양자화 커널을 최적화했는지 봅니다.

큰 통합 메모리는 대형 MoE 적재에 유리할 수 있지만 대역폭이 부족하면 생성이 느릴 수 있습니다. 반대로 빠른 GPU도 VRAM이 부족해 CPU 오프로딩이 많아지면 장점을 잃습니다.