マルチデバイス · 公式販売製品 · 2026-09-06 更新
2台のデバイスにモデルを分割して実行する構成 · メモリ総計64GB
2× NVIDIA GeForce RTX 5090 PCIe 64GB ローカル LLM 速度・メモリ・電気代
2×32GB GDDR7 VRAM(合計64GB、合計ローカル帯域幅3,584GB/s)。RTX 5090はNVLinkをサポートせず、PCIe Gen5インターフェースのみで通信を行うため、All-Reduce通信のボトルネックによる並列効率の低下が発生する。
主要仕様
- 使用可能なメモリ
- 61GB
- メモリ帯域幅
- 3584GB/s
- ローカルLLMの継続的負荷
- 約1100W
- 韓国の参考価格(ウォン)
- 1,240–1,560万ウォン
良い人
- 61GBの可用メモリを活用する
- 分散推論ツール
- GLM-5.3-Flash (MoE)クラスモデル比較
購入前に確認
2台のデバイスを接続しても、メモリが自動で1台のように統合されません。分散ランタイムサポートおよびインターフェイスのボトルネックを確認する必要があります。
4Kコンテキスト・Q4モデル別予想パフォーマンス
| モデル | 必要なメモリ | トークン生成 | 最初のトークン | プリフィル |
|---|---|---|---|---|
| Gemma 4 12B llama.cpp CUDA · Q4_K_M · GPU2台分離 | 8GB | 198 ~ 305.6 tok/s | 0.89 ~ 1.4秒 | 2,893 ~ 4,622 tok/s |
| GLM-5.3-Flash (MoE) llama.cpp CUDA · Q4_K_M · GPU2台分離 | 190.21GB | 5.1 ~ 5.2 tok/s | 4.2 ~ 6.6秒 | 641 ~ 1,025 tok/s |
単一ユーザーでの予想範囲であり、ランタイムや冷却、量子化ファイルによって異なる可能性があります。
よくある質問
2× RTX 5090 64GB (PCIe)で利用可能なローカルLLMはどのようなものがありますか?
Gemma 4 12B、GLM-5.3-Flash(MoE)などについて、4K入力とデバイス別推奨フォーマットで比較可能です。モデルやコンテキスト長によって必要なメモリは異なります。
2× RTX 5090 64GB (PCIe)のローカルLLMの電力はどのくらいですか?
継続的な負荷基準では約1100Wで、実際の範囲は900–1350Wと予想されます。
表示されたトークン速度は実測値ですか?
公式ハードウェア仕様および検証済みベンチマーキング範囲に基づき、計算機に合わせて補正した予想範囲です。ランタイム、冷却、量子化ファイルおよび文脈長によって変化する可能性があります。