고속 35B · 로컬 AI 장비 구매 가이드 · 2026-09-01 업데이트
35B를 기다림 없이 쓰고 싶다면 속도 차이가 보입니다.
맥 스튜디오 M4 Max 64GB 로컬 LLM 속도
35B급 모델의 빠른 생성과 조용한 지속 부하 성능을 함께 원할 때 유리합니다.
핵심 사양
- 사용 가능 메모리
- 56GB
- 메모리 대역폭
- 546GB/s
- 로컬 LLM 지속 부하
- 약 120W
잘 맞는 사람
- 빠른 27B~35B 생성
- 장시간 추론
- 조용한 워크스테이션
이 경우에는 건너뛰기
64GB 한계 때문에 초대형 모델 적재보다 속도 중심으로 선택해야 합니다.
4K 문맥·Q4 모델별 예상 성능
| 모델 | 필요 메모리 | 토큰 생성 | 첫 토큰 | 프리필 |
|---|---|---|---|---|
| Gemma 4 12B | 8GB | 57.2 ~ 63.4 tok/s | 4.3 ~ 8.3초 | 496 ~ 959 tok/s |
| Qwen3.6 35B-A3B (MoE) | 21.28GB | 39.2 ~ 81.9 tok/s | 1.5 ~ 3.1초 | 1,316 ~ 2,751 tok/s |
표시 값은 단일 사용자 예상 범위이며 런타임, 냉각, 양자화 파일에 따라 달라질 수 있습니다.