실행 프로그램과 확장

GGUF와 MLX 모델 형식, 무엇이 다른가

형식은 파일 확장자보다 어떤 런타임과 커널로 실행할지를 정하는 선택입니다.

쉽게 말하면

GGUF와 MLX는 같은 원본 LLM을 서로 다른 실행 프로그램에서 쓰기 좋게 포장한 파일 형식입니다. GGUF는 여러 운영체제와 도구에서 널리 쓰이고, MLX 모델은 주로 Apple Silicon 맥에 맞습니다.

장비를 고를 때

윈도우·리눅스와 NVIDIA GPU라면 GGUF 지원 여부를, 맥이라면 MLX와 GGUF 중 실제 사용할 앱이 무엇을 지원하는지 먼저 확인하세요.

이 글에서 확인할 내용

  • GGUF는 GGML·llama.cpp 계열의 모델 배포 형식입니다.
  • MLX 모델은 Apple Silicon용 MLX 실행 생태계에 맞춰집니다.
  • 파일 형식과 양자화 정밀도는 같은 개념이 아닙니다.

GGUF는 모델과 사용 설명을 함께 담습니다

GGUF 파일에는 모델을 이루는 숫자와 구조 정보, 문장을 토큰으로 나누는 정보가 함께 들어갑니다. 한 파일로 배포하기 쉽고 llama.cpp를 사용하는 여러 앱에서 널리 열 수 있습니다.

Q4_K_M은 GGUF 파일에서 자주 보는 양자화 이름이지만 GGUF 자체가 4비트를 뜻하는 것은 아닙니다. 같은 GGUF 형식 안에도 FP16, Q8과 여러 Q4 방식이 있습니다.

MLX 모델은 Apple Silicon 맥에 맞습니다

MLX 모델은 애플의 MLX 실행 환경이 읽기 좋은 형태로 배포됩니다. 맥의 CPU와 GPU가 함께 쓰는 통합 메모리를 활용하고 MLX용 모델 코드와 양자화 방식을 사용합니다.

같은 원본 모델이라도 GGUF와 MLX 변환본은 압축 방식과 지원 기능이 다를 수 있습니다. 모델 이름이 같다고 답변 품질과 속도까지 완전히 같다고 보기는 어렵습니다.

촘촘한 모델 가중치를 몇 단계의 값으로 묶어 더 작은 격자로 줄이는 양자화 과정을 나타낸 그림
양자화는 촘촘한 가중치를 더 적은 단계로 묶어 파일과 메모리를 줄입니다. 많이 줄일수록 손실 가능성도 커집니다.

런타임 기능 호환성이 중요합니다

새 모델 아키텍처, 비전 입력, MTP 헤드와 특수 어텐션은 파일 안에 가중치가 있어도 런타임 코드가 이해해야 실행할 수 있습니다. 변환기가 새로운 텐서를 보존하는지도 확인해야 합니다.

특히 MTP가 포함된 체크포인트는 일반 변환 과정에서 추가 헤드가 빠질 수 있습니다. 기능을 쓸 계획이라면 해당 런타임이 권장하는 변환본과 버전을 선택해야 합니다.

운영체제와 도구 선택

Windows와 Linux, 다양한 GPU·CPU에서 폭넓게 쓰고 싶다면 llama.cpp를 지원하는 GGUF가 편리한 경우가 많습니다. Apple Silicon에서 MLX 전용 최적화와 서버 기능을 활용하려면 MLX 변환본이 자연스럽습니다.

그래픽 UI가 내부적으로 어떤 엔진을 쓰는지도 확인하세요. 같은 앱이 GGUF와 MLX를 모두 열더라도 실제 커널, 지원 옵션과 성능 경로는 달라질 수 있습니다.

다운로드 전 확인 목록

모델 아키텍처와 버전, 채팅 템플릿, 양자화 유형, 파일 전체 크기, 요구 런타임 버전을 먼저 봅니다. 분할 파일은 모든 조각이 필요하고 토크나이저 파일도 변환본과 맞아야 합니다.

가장 작은 파일보다 내 장비에서 검증된 형식을 고르는 편이 좋습니다. 대표 프롬프트로 출력 품질과 메모리, 프리필·디코드 속도를 확인한 뒤 장기 사용할 파일을 정하세요.