マルチデバイス · 公式販売製品 · 2026-09-06 更新

2台のデバイスにモデルを分割して実行する構成 · メモリ総計48GB

2× NVIDIA GeForce RTX 3090 NVLink 48GB ローカル LLM 速度・メモリ・電気代

2×24GB VRAM(総計48GB、ローカル帯域幅1,872GB/s)を3世代NVLink(両方向112.5GB/s)で接続したダブルGPU構成です。テンソル/パイプライン並列化をサポートする場合、70Bクラスのモデルを完全にロードできます。

主要仕様

使用可能なメモリ
45GB
メモリ帯域幅
1872GB/s
ローカルLLMの継続的負荷
約780W
韓国の参考価格(ウォン)
330–440万ウォン

良い人

  • 45GBの利用可能なメモリを活用する
  • 分散推論ツール
  • Qwen3.8-Flash-Nextクラスモデル比較

購入前に確認

2台のデバイスを接続しても、メモリが自動で1台のように統合されません。分散ランタイムサポートおよびインターフェイスのボトルネックを確認する必要があります。

4Kコンテキスト・Q4モデル別予想パフォーマンス

モデル必要なメモリトークン生成最初のトークンプリフィル
Gemma 4 12B
llama.cpp CUDA · Q4_K_M · GPU2台分離
8GB129.8 ~ 180.3 tok/s1.6 ~ 2.7秒1,510 ~ 2,562 tok/s
Qwen3.8-Flash-Next
llama.cpp CUDA · Q4_K_M · GPU2台分離
77.01GB9.5 ~ 10.7 tok/s2.1 ~ 9.6秒433 ~ 2,003トー/s(NVMe クール~ウォーム)

単一ユーザーでの予想範囲であり、ランタイムや冷却、量子化ファイルによって異なる可能性があります。

よくある質問

2× RTX 3090 48GB (NVLink)で利用可能なローカルLLMはどのようなものがありますか?

Gemma 4 12B、Qwen3.8-Flash-Nextなどを4K入力とデバイス別推奨フォーマットで比較できます。モデルおよびコンテキスト長によって必要なメモリは異なります。

2× RTX 3090 48GB (NVLink)のローカルLLMの電力はどのくらいですか?

継続的な負荷基準では約780Wで、実際の範囲は650–920Wと予想されます。

表示されたトークン速度は実測値ですか?

公式ハードウェア仕様および検証済みベンチマーキング範囲に基づき、計算機に合わせて補正した予想範囲です。ランタイム、冷却、量子化ファイルおよび文脈長によって変化する可能性があります。