새로 나온 모델 · 2026.09.20
Bonsai 2 27B: 6GB라는 숫자보다 먼저 볼 것
27B 모델 하나를 6GB 안팎에 넣었다는 말을 들으면 오래된 노트북이나 작은 맥에서도 곧바로 돌아갈 것처럼 보입니다. Bonsai 2는 실제로 그만큼 과감하게 줄인 모델입니다. 하지만 5.95GB는 언어 가중치 파일 하나의 크기이고, 실행할 때는 KV 캐시와 런타임 공간이 더 필요합니다. 무엇보다 일반적인 Q2 GGUF와 계산 방식이 달라 전용 실행 파일이 맞지 않으면 느린 정도가 아니라 문장이 깨질 수 있습니다. 이 글은 숫자를 부풀리거나 깎지 않고, 지금 가진 장비에서 어디까지 기대할 수 있는지부터 살펴봅니다.
6GB에 들어간 것은 무엇인가
Bonsai 2 27B는 Qwen3.8-27B를 바탕으로 만든 모델입니다. 대부분의 가중치를 -1, 0, +1 세 값으로 표현하고, 128개 단위 그룹과 Hadamard 회전을 이용해 압축 오차를 줄입니다. 가장 작은 PTQ1_0 언어 가중치는 5.95GB이고, 기본 데모가 받는 PQ2_0은 7.21GB입니다. MLX 묶음은 비전 타워를 포함해 8.60GB입니다. 따라서 ‘27B가 6GB’라는 말은 틀리지 않지만, 전체 실행 공간이 6GB라는 뜻은 아닙니다. 긴 문서를 넣으면 KV 캐시가 늘고 운영체제와 실행 버퍼도 같은 메모리를 씁니다. 8GB 장비에서 파일이 내려받아진다는 사실과 편하게 대화할 수 있다는 판단을 분리해야 합니다.

일반 Q2 모델처럼 열면 안 되는 이유
압축한 가중치를 읽는 것만으로 계산이 끝나지 않습니다. Bonsai 2는 각 선형층에 들어가기 전 활성값을 회전시키는 과정이 있고, 이 변환을 아는 커널이 있어야 원래 의도한 출력을 냅니다. 현재 공식 데모의 setup 스크립트는 이 기능이 들어간 llama.cpp 실행 파일을 내려받습니다. 일반 llama.cpp는 파일을 거부할 수 있고, 일부 조합에서는 모델이 열린 뒤에도 의미 없는 문장을 낼 수 있습니다. MLX도 마찬가지로 Bonsai 대응 로더를 써야 합니다. 처음 실행할 때는 긴 문서나 비전 입력보다 짧은 텍스트 질문으로 답이 정상인지 확인하세요. 모델 파일을 의심하기 전에 실행 엔진과 체크포인트 짝이 맞는지를 보는 편이 빠릅니다.

실제로 기다리는 시간은 어느 정도인가
PrismML은 같은 PQ2_0 파일을 batch 1로 돌린 교차 플랫폼 수치를 공개했습니다. 128토큰 생성은 RTX 5090에서 129.9 tok/s, RTX 4090에서 81.2 tok/s, RTX PRO 6000 Blackwell에서 124.8 tok/s, Apple M5 Pro에서 28.1 tok/s였습니다. 512토큰 프롬프트 처리는 각각 3,893, 3,124, 4,020, 387 tok/s입니다. 비전 타워를 빼고 잰 제작사 결과라서 다른 프롬프트 길이, 운영체제와 동시 요청에서는 달라질 수 있습니다. 우리 속도 체감 화면은 이 측정점이 있는 장비에는 해당 값을 직접 기준으로 쓰고, 4K 이상 입력에서는 범위를 넓혀 보여줍니다. 숫자 하나를 복사하는 대신 첫 토큰과 이어지는 답변이 어떻게 느껴지는지 함께 확인할 수 있습니다.

PTQ1_0보다 PQ2_0부터 권하는 이유
PTQ1_0은 1.75 bits/weight로 더 작지만, 항상 더 빠르지는 않습니다. 압축을 더 세게 한 만큼 계산 중에 풀어내는 일이 늘어 장비에 따라 디코드가 비슷하거나 조금 빠른 정도이고, 프롬프트 처리는 PQ2_0이 공개된 모든 비교 장비에서 더 빨랐습니다. 긴 문서를 읽히거나 RAG를 쓴다면 1.26GB를 아끼는 대신 첫 응답을 더 오래 기다릴 수 있습니다. 그래서 여유 메모리가 8GB를 넘는 장비라면 PQ2_0을 먼저 권합니다. 메모리가 정말 빠듯할 때 PTQ1_0을 시험하되, 같은 질문 열 개를 두 포맷에 넣어 답의 일관성과 첫 토큰 시간을 함께 기록하는 편이 좋습니다.
작아졌다고 품질까지 그대로인 것은 아니다
제작사가 공개한 사고형 14개 평가 평균에서 Bonsai 2 PQ2_0은 84.78점, 원본 FP16 Qwen3.8-27B는 86.32점이었습니다. 합계로는 98.2%를 유지했다는 결과입니다. 꽤 인상적이지만 모든 한국어 질문과 코딩 작업에서 98.2%의 품질이 보장된다는 뜻은 아닙니다. 평균은 강한 항목과 약한 항목을 섞고, 내가 쓰는 프롬프트는 평가 세트와 다릅니다. 장비를 고르기 전 자주 쓰는 질문과 긴 문서, 코드 수정 예시를 모아 원본 또는 Q4 모델과 나란히 비교하세요. 작은 모델 파일이 지금 가진 장비를 다시 쓸 수 있게 해주는 순간이 Bonsai 2의 가장 큰 매력입니다. 그 매력을 지키는 방법은 새 장비부터 결제하는 것이 아니라, 내 작업에서 충분한지 먼저 확인하는 것입니다.
수정 내역
사이트의 안내가 바뀐 기록입니다. 설치된 엔진·모델 버전을 자동으로 확인한 결과는 아닙니다.
Bonsai 2 전용 실행 경로와 공개 속도 추가
일반 Q2 GGUF와 구분해 Ternary PQ2_0과 Hadamard 지원 런타임을 안내합니다. 제작사가 공개한 장비별 프리필·디코드 측정은 조건이 일치하는 속도 체감에만 연결했습니다.