대형 모델 · 로컬 AI 장비 구매 가이드 · 2026-09-01 업데이트
70B까지 한 대에. CUDA가 필요 없다면 가장 단순합니다.
맥 스튜디오 M4 Max 128GB 로컬 LLM 대형 모델 성능
단일 완제품에서 70B급과 고정밀 모델까지 넓게 비교하려는 사용자에게 맞습니다.
핵심 사양
- 사용 가능 메모리
- 114GB
- 메모리 대역폭
- 546GB/s
- 로컬 LLM 지속 부하
- 약 130W
잘 맞는 사람
- 70B급 Q4
- 여러 모델 동시 보관
- 대용량 통합 메모리
이 경우에는 건너뛰기
메모리는 넉넉하지만 CUDA 전용 도구가 필요한 작업에는 별도 확인이 필요합니다.
4K 문맥·Q4 모델별 예상 성능
| 모델 | 필요 메모리 | 토큰 생성 | 첫 토큰 | 프리필 |
|---|---|---|---|---|
| Gemma 4 12B | 8GB | 57.2 ~ 63.4 tok/s | 4.3 ~ 8.3초 | 496 ~ 959 tok/s |
| Qwen3.8-Flash-Next | 107.13GB | 22 ~ 42.9 tok/s | 4.4 ~ 8.6초 | 479 ~ 936 tok/s |
표시 값은 단일 사용자 예상 범위이며 런타임, 냉각, 양자화 파일에 따라 달라질 수 있습니다.