35B 안정권 · 공식 출시 제품 · 2026-09-01 업데이트
48GB VRAM과 696GB/s 대역폭, 실제 선택 기준을 확인하세요.
NVIDIA A40 48GB 로컬 LLM 속도·메모리·전기요금
696 GB/s 384비트 48GB ECC VRAM. 중고 워크스테이션 및 서버 환경에서 70B급 4비트 또는 27B~35B 고정밀 모델을 단일 카드에 적재할 수 있는 대용량 GPU입니다.
핵심 사양
- 사용 가능 메모리
- 46GB
- 메모리 대역폭
- 696GB/s
- 로컬 LLM 지속 부하
- 약 400W
- 현재 참고 범위
- 180–280만원
잘 맞는 사람
- 46GB 가용 메모리 활용
- CUDA 기반 로컬 추론
- DeepSeek-V4-Flash-0731 (MoE)급 고속 생성
구매 전 확인
표시 가격과 전력은 GPU 중심 비교입니다. 실제 시스템에서는 호스트 PC, 전원공급장치, 냉각과 슬롯 구성이 추가됩니다.
4K 문맥·Q4 모델별 예상 성능
| 모델 | 필요 메모리 | 토큰 생성 | 첫 토큰 | 프리필 |
|---|---|---|---|---|
| Gemma 4 12B | 8GB | 71 ~ 78.9 tok/s | 3.0 ~ 3.8초 | 1,091 ~ 1,388 tok/s |
| DeepSeek-V4-Flash-0731 (MoE) | 168.72GB | 3.4 ~ 3.4 tok/s | 10.5 ~ 13.3초 | 315 ~ 400 tok/s |
단일 사용자 예상 범위이며 런타임, 냉각, 양자화 파일에 따라 달라질 수 있습니다.
자주 묻는 질문
NVIDIA A40 48GB에서 어떤 로컬 LLM을 돌릴 수 있나요?
Gemma 4 12B, DeepSeek-V4-Flash-0731 (MoE) 등을 Q4·4K 조건에서 비교할 수 있습니다. 모델과 문맥 길이에 따라 필요한 메모리는 달라집니다.
NVIDIA A40 48GB의 로컬 LLM 전력은 어느 정도인가요?
지속 부하 기준 약 400W이며 실제 범위는 330–500W로 예상합니다.
표시된 토큰 속도는 실측값인가요?
공식 하드웨어 사양과 검증된 벤치마크 범위를 계산기에 맞춰 보정한 예상 범위입니다. 런타임, 냉각, 양자화 파일과 문맥 길이에 따라 달라질 수 있습니다.