CUDA代替大容量 · 公式製品規格 · 2026-09-06 更新

大きなモデルを1ノードに収めるためのデバイスです。ゲーミングGPUの速度とは異なる選択です。

NVIDIA DGX Spark 128GB ローカル LLM選定基準

大規模ユニファイドメモリとNVIDIA開発環境が必要で、単一GPUの最高速度よりもモデルのロードを優先する場合に適します。

主要仕様

使用可能なメモリ
116GB
メモリ帯域幅
273GB/s
ローカルLLMの継続的負荷
約190W
韓国の参考価格(ウォン)
710–870万ウォン

良い人

  • 大規模モデルのロード
  • CUDAサーバー開発
  • Spark2台拡張検討

購入前に確認

128GBという数字だけを見てRTX 5090よりも速いと判断するのは誤りで、単一リクエスト速度とメモリ容量を分けて見なければなりません。

どのタスクに適するか

作業判断理由
大規模LLM快適128GBクラスのメモリ容量を単一ノードで受け入れる点が強みです。
サービス開発適切NVIDIA ランタイムおよびサーバーツールは使いやすいです。
画像生成条件付き可能ですが、同額の予算におけるGeForceの速度と比較が必要です。

基準:構成選択の基準

最初に衝突するボトルネック

大規模ロードは強くても、メモリ帯域幅の制約により、小型モデルの単一リクエスト速度は高性能GeForceよりも低い場合があります。

おすすめ購入構成

DGX Spark 128GB シングルノード · NVMe フリースペース · ウェイアーネットワーク

より多くのお金をかける基準

大型モデルとCUDAが同時に必要になる場合にのみ、その費用を支払う必要があります。32GB以内の生成速度だけが必要なら、RTX 5090が適しています。

4Kコンテキスト・Q4モデル別予想パフォーマンス

モデル必要なメモリトークン生成最初のトークンプリフィル
Gemma 4 12B
llama.cpp · Q4_K_M
8GB27.8 ~ 30.9 tok/s3.8 ~ 5.1秒802 ~ 1,084 tok/s
Qwen3.8-Flash-Next
llama.cpp · Q4_K_M
107.13GB16.7 ~ 23.4 tok/s3.1 ~ 4.2秒987 ~ 1,335 tok/s

単一ユーザーでの予想範囲であり、ランタイムや冷却、量子化ファイルによって異なる可能性があります。

よくある質問

DGX Spark 128GBでどのようなローカルLLMを実行できますか?

Gemma 4 12B、Qwen3.8-Flash-Nextなどを4K入力とデバイス別推奨フォーマットで比較できます。モデルおよびコンテキスト長によって必要なメモリは異なります。

DGX Spark 128GB のローカル LLM パワーアップはどのくらいですか?

継続的な負荷基準では約190Wで、実際の範囲は160–233Wと予想されます。

表示されたトークン速度は実測値ですか?

公式ハードウェア仕様および検証済みベンチマーキング範囲に基づき、計算機に合わせて補正した予想範囲です。ランタイム、冷却、量子化ファイルおよび文脈長によって変化する可能性があります。