먼저 읽기
Granite 4.2 3B·8B·30B, 내 장비에는 어느 크기가 맞을까
새 모델이 3B, 8B, 30B로 나오면 숫자부터 비교하게 됩니다. 30B가 더 똑똑할 것 같고, 3B는 너무 작아 보입니다. 하지만 손에 쥔 장비에서 어떤 질문을 얼마나 자주 할지 정하지 않으면 그 숫자는 구매 결정을 끝내주지 못합니다. Granite 4.2의 공식 제공 형태와 사용 조건을 확인하고, 지금 기기로 시험할 순서를 정리했습니다.
3B, 8B, 30B는 모두 같은 종류의 모델입니다
IBM의 공식 발표에서 Granite 4.2는 3B, 8B, 30B 세 크기의 밀집형 추론 모델입니다. MoE처럼 질문마다 일부 전문가만 불러 쓰는 구조가 아닙니다. 따라서 30B를 볼 때는 '활성 파라미터만 작으니 가볍겠지'라고 생각하면 안 됩니다. 세 모델은 사고 모드와 도구 호출을 지원하고 Apache 2.0으로 공개됐습니다. 다만 기능 이름이 같아도 결과의 질과 필요한 자원은 다릅니다. 특히 IBM은 8B와 30B에 추가적인 에이전트 작업 학습을 했다고 설명합니다. 어떤 모델이 우리 일에 충분한지는 공식 소개의 범용 점수보다 실제 업무 파일로 확인하는 것이 빠릅니다.

3B는 사양표보다 실제 질문에서 평가합니다
짧은 문서의 요지 파악, 반복 문장 다듬기, 간단한 코드 설명이라면 3B를 먼저 시도할 만합니다. 비용이 작은 시험을 건너뛰고 장비부터 올릴 이유는 없습니다. 같은 질문 열 개를 모아, 답에 필요한 사실이 빠지는지와 확신에 찬 오답이 나오는지를 표시해보세요. 빠른 응답이 나와도 자주 고쳐야 한다면 내 작업에는 작을 수 있습니다. 반대로 만족스러운 답이 꾸준하다면 큰 모델이 특정 공개 벤치마크에서 높다는 사실만으로 메모리를 증설할 필요는 없습니다. IBM 모델 카드에는 한국어가 시험 언어에 포함되지만, 내 문서의 용어와 말투까지 검증됐다는 뜻은 아닙니다.
8B에서 달라지는 것은 기대할 수 있는 작업입니다
IBM은 8B와 30B에 코드 수정, 터미널, 검색 같은 도구를 쓰는 에이전트 학습을 추가했다고 설명합니다. 그래서 3B에서 단계가 자주 끊기던 코드 작업이나 도구 호출은 8B로 다시 시험해볼 이유가 있습니다. 그렇다고 8B가 어떤 앱과도 자동으로 연결되는 것은 아닙니다. 실행 프로그램이 모델의 채팅 템플릿과 도구 호출 형식을 지원해야 하고, 실제 도구를 여는 권한도 별도로 설정해야 합니다. '작업을 해줘'라는 한 문장 대신 현재 쓰는 저장소의 작은 수정 한 건을 주고, 제안·실행·검증의 어느 단계에서 멈추는지 보세요. 그 기록이 30B로 넘어갈 근거가 됩니다.

30B는 파일이 들어가는지보다 여유를 봅니다
30B는 같은 계열의 가장 큰 밀집형 모델입니다. 가중치 300억 개를 단순히 2바이트 BF16으로 계산하면 약 60GB가 이론적 하한이고, 4비트라면 약 15GB가 최소 계산값입니다. 이것은 실행에 필요한 메모리 총량이 아닙니다. 파일 형식의 부가 정보, 실행 버퍼, 문맥에 따른 KV 캐시, 운영체제와 다른 앱의 사용량이 더해집니다. 24GB 장비에서 어떤 4비트 파일이 열린다는 말과 긴 문서에 계속 쓸 만큼 여유가 있다는 말은 다릅니다. 구매 후보의 실제 모델 파일, 실행기, 문맥 길이를 하나로 정해 메모리 압력과 입력·출력 대기를 모두 봐야 합니다.
128K 표기는 시작점이지 목표가 아닙니다
IBM 모델 카드에는 기본 지원 문맥 128K와 512K로의 확장이 적혀 있습니다. 하지만 긴 문서가 규격상 들어간다는 뜻이 내 장비에서 빨리 읽고 정확히 답한다는 뜻은 아닙니다. 입력이 길어질수록 첫 답변까지 처리할 토큰과 KV 캐시도 늘 수 있습니다. 먼저 실제 보고서 한 편으로 필요한 부분을 찾아 답하는 작업을 해보세요. 문서 전체를 한 번에 넣는 것보다 관련 대목만 골라 쓰는 편이 나을 수 있습니다. 비교할 때는 질문과 문서 길이를 고정하고 첫 토큰 대기와 이후 생성 속도를 따로 기록해야, 메모리를 더 살지 실행 방식을 바꿀지 구분할 수 있습니다.

사고 모드와 양자화를 바꾸면 다시 비교합니다
Granite 4.2에는 사고 모드, 비사고 모드, 짧게 생각하는 모드가 있습니다. 질문이 같아도 선택한 모드에 따라 답변까지의 대기와 출력 길이가 달라질 수 있습니다. 원본 BF16과 4비트 변환본 역시 메모리와 품질의 조건이 다릅니다. IBM의 원본 모델 이름을 확인하고, 변환본이라면 배포자·형식·양자화 방식을 기록하세요. 파일이 작다는 이유만으로 품질이 같거나 속도가 몇 배 빨라진다고 단정할 수는 없습니다. 같은 질문 묶음으로 정확도, 고쳐야 할 문장, 첫 토큰 대기와 생성 속도를 다시 측정해야 실사용 비교가 됩니다.
장비를 고를 때는 실패한 일을 기준으로
3B가 내 자료에서 자주 중요한 조건을 놓치고, 8B가 그 문제를 줄인다면 8B를 안정적으로 돌릴 구성을 찾습니다. 8B에서도 실제 도구 작업이 실패하고 30B에서 개선되는지 확인했다면 그때 30B용 메모리 비용을 계산할 수 있습니다. 어느 단계에서도 개선이 크지 않다면 장비보다 자료를 나누는 방식이나 지시문을 고치는 편이 먼저일 수 있습니다. 사이트의 다른 장비·메모리 글은 후보를 좁히는 용도로 쓰고, Granite 4.2 자체의 속도를 측정하지 않은 표를 이 모델의 실측치로 읽지 마세요. 마지막에는 판매 제품의 RAM·VRAM·SSD가 시험한 구성과 같은지 확인해야 합니다.