멀티 장비 · 공식 제품 규격 · 2026-09-01 업데이트
256GB VRAM과 546GB/s 대역폭, 실제 선택 기준을 확인하세요.
2× NVIDIA DGX Spark 클러스터 256GB 로컬 LLM 속도·메모리·전기요금
ConnectX-7 200Gbps(25 GB/s) 링크로 연결된 2개 노드(총 256GB 분산 메모리, 546 GB/s 합산 로컬 대역폭). 분산 모델 샤딩을 통해 최대 405B급 모델 수용이 가능하나 투명 UMA가 아니며 노드 간 통신 오버헤드가 발생합니다.
핵심 사양
- 사용 가능 메모리
- 232GB
- 메모리 대역폭
- 546GB/s
- 로컬 LLM 지속 부하
- 약 380W
- 현재 참고 범위
- 1,400–1,750만원
잘 맞는 사람
- 232GB 가용 메모리 활용
- 두 장비 분산 추론
- GLM-5.3-Flash (MoE)급 모델 비교
구매 전 확인
장비를 두 대 연결해도 메모리가 자동으로 하나처럼 합쳐지지 않습니다. 분산 런타임 지원과 인터커넥트 병목을 함께 확인해야 합니다.
4K 문맥·Q4 모델별 예상 성능
| 모델 | 필요 메모리 | 토큰 생성 | 첫 토큰 | 프리필 |
|---|---|---|---|---|
| Gemma 4 12B | 8GB | 27.8 ~ 44.5 tok/s | 2.7 ~ 5.4초 | 770 ~ 1,518 tok/s |
| GLM-5.3-Flash (MoE) | 190.21GB | 18.5 ~ 29.6 tok/s | 6.4 ~ 12.6초 | 326 ~ 642 tok/s |
단일 사용자 예상 범위이며 런타임, 냉각, 양자화 파일에 따라 달라질 수 있습니다.
자주 묻는 질문
2× DGX Spark 256GB에서 어떤 로컬 LLM을 돌릴 수 있나요?
Gemma 4 12B, GLM-5.3-Flash (MoE) 등을 Q4·4K 조건에서 비교할 수 있습니다. 모델과 문맥 길이에 따라 필요한 메모리는 달라집니다.
2× DGX Spark 256GB의 로컬 LLM 전력은 어느 정도인가요?
지속 부하 기준 약 380W이며 실제 범위는 320–466W로 예상합니다.
표시된 토큰 속도는 실측값인가요?
공식 하드웨어 사양과 검증된 벤치마크 범위를 계산기에 맞춰 보정한 예상 범위입니다. 런타임, 냉각, 양자화 파일과 문맥 길이에 따라 달라질 수 있습니다.