CUDA代替大容量 · 公式製品規格 · 2026-09-06 更新
大きなモデルを1ノードに収めるためのデバイスです。ゲーミングGPUの速度とは異なる選択です。
NVIDIA DGX Spark 128GB ローカル LLM選定基準
大規模ユニファイドメモリとNVIDIA開発環境が必要で、単一GPUの最高速度よりもモデルのロードを優先する場合に適します。
主要仕様
- 使用可能なメモリ
- 116GB
- メモリ帯域幅
- 273GB/s
- ローカルLLMの継続的負荷
- 約190W
- 韓国の参考価格(ウォン)
- 710–870万ウォン
良い人
- 大規模モデルのロード
- CUDAサーバー開発
- Spark2台拡張検討
購入前に確認
128GBという数字だけを見てRTX 5090よりも速いと判断するのは誤りで、単一リクエスト速度とメモリ容量を分けて見なければなりません。
どのタスクに適するか
| 作業 | 判断 | 理由 |
|---|---|---|
| 大規模LLM | 快適 | 128GBクラスのメモリ容量を単一ノードで受け入れる点が強みです。 |
| サービス開発 | 適切 | NVIDIA ランタイムおよびサーバーツールは使いやすいです。 |
| 画像生成 | 条件付き | 可能ですが、同額の予算におけるGeForceの速度と比較が必要です。 |
基準:構成選択の基準
最初に衝突するボトルネック
大規模ロードは強くても、メモリ帯域幅の制約により、小型モデルの単一リクエスト速度は高性能GeForceよりも低い場合があります。
おすすめ購入構成
DGX Spark 128GB シングルノード · NVMe フリースペース · ウェイアーネットワーク
より多くのお金をかける基準
大型モデルとCUDAが同時に必要になる場合にのみ、その費用を支払う必要があります。32GB以内の生成速度だけが必要なら、RTX 5090が適しています。
4Kコンテキスト・Q4モデル別予想パフォーマンス
| モデル | 必要なメモリ | トークン生成 | 最初のトークン | プリフィル |
|---|---|---|---|---|
| Gemma 4 12B llama.cpp · Q4_K_M | 8GB | 27.8 ~ 30.9 tok/s | 3.8 ~ 5.1秒 | 802 ~ 1,084 tok/s |
| Qwen3.8-Flash-Next llama.cpp · Q4_K_M | 107.13GB | 16.7 ~ 23.4 tok/s | 3.1 ~ 4.2秒 | 987 ~ 1,335 tok/s |
単一ユーザーでの予想範囲であり、ランタイムや冷却、量子化ファイルによって異なる可能性があります。
よくある質問
DGX Spark 128GBでどのようなローカルLLMを実行できますか?
Gemma 4 12B、Qwen3.8-Flash-Nextなどを4K入力とデバイス別推奨フォーマットで比較できます。モデルおよびコンテキスト長によって必要なメモリは異なります。
DGX Spark 128GB のローカル LLM パワーアップはどのくらいですか?
継続的な負荷基準では約190Wで、実際の範囲は160–233Wと予想されます。
表示されたトークン速度は実測値ですか?
公式ハードウェア仕様および検証済みベンチマーキング範囲に基づき、計算機に合わせて補正した予想範囲です。ランタイム、冷却、量子化ファイルおよび文脈長によって変化する可能性があります。