マルチデバイス · 公式製品規格 · 2026-09-06 更新

2台のデバイスにモデルを分割して実行する構成 · メモリ総計256GB

NVIDIA DGX Spark 2台構成 256GB ローカル LLM 速度・メモリ・電気代

ConnectX-7 200Gbps(25GB/s) RoCEリンクで接続された2ノード(合計256GBの分散メモリ、546GB/sの合計ローカル帯域幅)。TP=2の最適化においては単一リクエストの処理速度が向上する可能性がありますが、モデルごとに実測経路を優先適用します。

主要仕様

使用可能なメモリ
232GB
メモリ帯域幅
546GB/s
ローカルLLMの継続的負荷
約380W
韓国の参考価格(ウォン)
1,420–1,740万ウォン

良い人

  • 232GBの利用可能なメモリを活用する
  • 分散推論ツール
  • GLM-5.3-Flash (MoE)クラスモデル比較

購入前に確認

2台のデバイスを接続しても、メモリが自動で1台のように統合されません。分散ランタイムサポートおよびインターフェイスのボトルネックを確認する必要があります。

4Kコンテキスト・Q4モデル別予想パフォーマンス

モデル必要なメモリトークン生成最初のトークンプリフィル
Gemma 4 12B
4ビット・2ノード推定
8GB27.8 ~ 44.5 tok/s2.3 ~ 4.4秒930 ~ 1,779 tok/s
GLM-5.3-Flash (MoE)
4ビット・2ノード推定
190.21GB18.5 ~ 29.6 tok/s5.5 ~ 10.5秒393 ~ 752 tok/s

単一ユーザーでの予想範囲であり、ランタイムや冷却、量子化ファイルによって異なる可能性があります。

よくある質問

2×DGX Spark 256GBでどのようなローカルLLMを実行できますか?

Gemma 4 12B、GLM-5.3-Flash(MoE)などについて、4K入力とデバイス別推奨フォーマットで比較可能です。モデルやコンテキスト長によって必要なメモリは異なります。

2× DGX Spark 256GBのローカルLLMパワーアップはどのくらいですか?

継続的な負荷基準では約380Wで、実際の範囲は320–466Wと予想されます。

表示されたトークン速度は実測値ですか?

公式ハードウェア仕様および検証済みベンチマーキング範囲に基づき、計算機に合わせて補正した予想範囲です。ランタイム、冷却、量子化ファイルおよび文脈長によって変化する可能性があります。