購入とコスト
GPUの電力制限でローカルAIはどれくらい遅くなる?RTX 3090・4090・5090・DGX Spark
メモリ容量を維持したまま、消費電力と発熱を抑える設定を探します。
電力制限(Power Limit)は、グラフィックカードが使える電力の上限を設定する機能です。たとえばRTX 3090を350Wではなく300Wで動かします。モデルを格納するVRAM1容量を維持しつつ、消費電力と発熱を減らせます。応答が遅くなる場合があるので、普段の作業にかかる時間も比較します。
300Wがすべての機器に適するわけではありません。3090と5090の公開測定では適切な上限が異なり、同じ5090でもMTP2を有効にすると電力制限の影響が大きくなりました。DGX SparkとMacでは調整方法も違います。機器に合う方法を選び、元に戻せるよう設定を記録して試します。
電力を下げても応答速度があまり変わらない理由
RTX 3090:300Wでも生成速度の大部分を維持
同じRTX 3090でQwen3.8 27Bを動かし、電力上限だけを変えた公開比較です。350Wから300Wにすると生成速度は約5%、測定GPU6電力は約14%減りました。275Wでは速度が約10%、電力が約21%減り、250Wでは速度低下が約26%に広がりました。
この構成では300Wが応答速度と省電力の折り合いをつけやすく、275Wで1Wあたりの生成速度が最高になりました。モデルと文書を用意してまず300Wを比較し、待ち時間を許容できれば275Wを試す順序で始められます。
| 電力上限 | 生成速度 | 測定GPU電力 |
|---|---|---|
| 350W | 68.9 tok/s | 347.7W |
| 300W | 65.3 tok/s | 298.7W |
| 275W | 62.3 tok/s | 274.0W |
| 250W | 51.0 tok/s | 249.5W |
RTX 3090 · Qwen3.8 27B · MTP n-max 3
350W
- 生成速度
- 68.9 tok/s
- 測定GPU電力
- 347.7W
300W
- 生成速度
- 65.3 tok/s
- 測定GPU電力
- 298.7W
275W
- 生成速度
- 62.3 tok/s
- 測定GPU電力
- 274.0W
250W
- 生成速度
- 51.0 tok/s
- 測定GPU電力
- 249.5W
RTX 3090 · Qwen3.8-27B UD-Q4_K_XL Dynamic 3.0
llama.cpp b10829 · CUDA 13.3 · NVIDIA 610.43.03
131,072 context capacity · Q4_0 KV · MTP n-max 3
thinking off · parallel 1 · median of 3 complete passes
RTX 5090:MTPを使うならもう一度比較
RTX 5090によるQwen3.8 27Bの公開比較では、600Wから500WにしてもMTPなしの生成速度はほぼ同じでした。MTP n-max 4では162.1から153.6 tok/sに約5%下がりました。同じカードでも追加の計算をする設定では、電力を下げたときの待ち時間が増えやすくなります。
400WではMTPなしで約5%、MTPありで約18%遅くなりました。省電力を優先するなら低い上限を、応答時間を大きく増やしたくなければ500W付近から比較できます。測定したASUS TUF 5090の既定値は600Wでした。自分のカードの既定値と設定可能範囲を先に確認してください。
| 電力上限 | MTPなし | MTP n-max 4 |
|---|---|---|
| 600W | 74.8 tok/s | 162.1 tok/s |
| 550W | 74.8 tok/s | 158.8 tok/s |
| 500W | 74.5 tok/s | 153.6 tok/s |
| 450W | 73.5 tok/s | 142.7 tok/s |
| 400W | 71.2 tok/s | 132.8 tok/s |
同じRTX 5090・Qwen3.8 27B・MTPの有無
600W
- MTPなし
- 74.8 tok/s
- MTP n-max 4
- 162.1 tok/s
550W
- MTPなし
- 74.8 tok/s
- MTP n-max 4
- 158.8 tok/s
500W
- MTPなし
- 74.5 tok/s
- MTP n-max 4
- 153.6 tok/s
450W
- MTPなし
- 73.5 tok/s
- MTP n-max 4
- 142.7 tok/s
400W
- MTPなし
- 71.2 tok/s
- MTP n-max 4
- 132.8 tok/s
ASUS TUF RTX 5090 32GB · Unsloth UD-Q4_K_XL
llama.cpp b10451 (10bf611e5) · Arch Linux 7.1.8 / CUDA
131K context capacity · q4_0 KV · parallel 1
thinking off · max output 400 · mean of 27 runs per cell
RTX 4090・5060 Ti・RTX PRO 6000はどこから始める?
別のRTX 4090比較では、Qwen3.6 27B Q3_K_XLの単一リクエスト生成速度が450Wで51.96、300Wで50.16、260Wで48.26 tok/sでした。この作業は300Wでも速度を約97%維持しました。3090・5090の表とはモデル・ファイル・試験が異なるため、この4090の電力別変化を比較します。
RTX 5060 TiなどのGeForceも調整機能が対応していれば同じ手順で試せます。既定の上限から約10%下げ、最初の応答と完了までの時間を比較してください。VRAM不足でモデルの一部をCPU7で処理しているなら、まず配置を確認します。電力制限でVRAM容量は増えません。
RTX PRO 6000 Blackwellはエディションを先に区別します。Workstation Editionは600W、Max-Qは300W、Server Editionは400〜600Wの仕様です。すべてを600Wの同じカードとして扱わず、取得した既定値とMin・Maxの範囲内で下げます。長い入力や同時リクエストも比較し、サーバー型のシステム冷却条件を維持してください。

Windows:元の値を記録してPower Limitだけを下げる
MSI Afterburnerを公式サイトから導入し、対象カードを選びます。現在のPower Limitを画面とともに保存し、100%なら90%程度に下げてApplyを押します。電圧・コアクロック・メモリクロックは変えず、速度差の原因を特定しやすくします。
同じ文書への回答を最後まで受け取り、待ち時間とファン音を比較します。100%が既定の350Wなら90%は約315Wです。割合をワットに換算するには既定値が必要です。スライダーが無効ならカードとドライバーの対応を確認し、復元時は記録した値に戻してApplyを押します。試験中は起動時の自動適用を無効にしておきます。
Linux:取得→変更→適用確認→復元
NVIDIAドライバーを入れたPCでは、対応カードをnvidia-smiで調整できます。GPU番号と名前を確認し、現在の上限とMin・Maxを記録します。以下の最初の2つのコマンドは取得だけです。上限がN/A、または変更非対応なら変更段階に進まないでください。
変更例はGPU 0のRTX 3090を300Wに下げるものです。自分のカードで300Wが許容範囲内の場合にだけ実行します。同じ取得コマンドで適用値を確認し、作業を比較してください。復元には変更前に記録したワット数を指定し、起動時サービスへの登録は正常動作と復元を確認してから検討します。
nvidia-smi -L
nvidia-smi -i 0 -q -d POWERsudo nvidia-smi -i 0 -pl 300
nvidia-smi -i 0 -q -d POWERsudo nvidia-smi -i 0 -pl ORIGINAL_WATTS
nvidia-smi -i 0 -q -d POWERDGX Spark:対応している調整から始める
DGX SparkのGB10はCPUとGPUを組み合わせたチップです。SoCのTDPは140W、付属アダプターは240Wです。nvidia-smiの電力はGPU部分なので、電気料金の計算にはコンセントで本体全体を測定します。
現在のSparkの公開例では、nvidia-smi -plによる電力上限の変更は非対応でした。上限情報がN/Aなら、3090用の300Wコマンドをそのまま使わないでください。まずDGX OSを更新し、付属アダプターを使います。未使用の高速ネットワークの省電力もOS更新で改善されており、使わないサーバー処理を止めることも余分な負荷を減らします。
発熱と突然の停止を減らすためクロック上限を下げたコミュニティ例もあります。GPUを300〜2,200MHzに制限すると、同じデュアルノード作業の生成速度は32.3から30.8 tok/sへ約5%下がりました。電気料金の節約測定ではなく、電源とメモリ設定も点検した例です。同じ症状があるならログと温度を残してサポートを求め、クロック調整は対応範囲と復元方法を確認したうえで別の試験として扱ってください。
MacとRadeonにも発熱を抑える方法がある
対応Macでは、システム設定のエネルギーまたはバッテリーで低電力モードを選び比較できます。Appleは対応するMac miniやMac Studioで消費電力とファン音を抑える機能として案内しています。モデル・文書・出力長を固定し、自動モードとの完了時間を比較してください。他のアプリまで遅くなるなら作業中は自動、軽い常時稼働は低電力と使い分けられます。
RadeonはNVIDIAのコマンドではなくメーカーの電力調整機能を使います。対応AMD Softwareのパフォーマンス・チューニング画面で電力上限を調整し、既定値を保存してください。項目がない、または管理されたPCでロックされているなら管理ポリシーを先に確認します。電圧変更と組み合わせる前に電力上限だけを試す原則は同じです。
GPU2枚・Spark2台は作業全体で比較
モデルを2枚のGPUに分割すると、カード間で計算結果を交換します。1枚だけ大きく制限すると、もう1枚が結果を待つ場合があります。番号・UUID・現在の上限を各カードで記録し、まず同じ割合で少し下げて応答全体を比較してください。別々のモデルを動かすなら作業ごとに調整できます。
Spark2台や複数PCでも同じです。分散処理が完了するまでの全ノードの電力量を合計すると実際の費用を計算できます。余ったノードに別の仕事がなければ作業後にサーバーを止め、利用予定に合わせて待機・終了時間を決めます。ネットワーク機器やスイッチを常時稼働させるならその電力も含めてください。
最初の応答・完了時間・電力量を記録
元の設定で同じ文書に回答させて基準を作り、上限を下げて同じ要求を3回送り中央値を比較します。プロンプトキャッシュのあるアプリでは、初回と続きの要求を別々に記録してください。別の要求やモデルのダウンロードを同時に動かすと、電力制限だけの差を見分けにくくなります。
GPUの1Wあたり生成速度は設定を選ぶ手掛かりです。電気料金が減ったかは回答完了までのPC全体の電力量で判断します。以下でGPUの電力と温度を観察し、コンセントの電力計に累積Whも記録してください。ファン音は同じ位置で比較します。
| 項目 | 記録する内容 |
|---|---|
| 実行条件 | モデル・量子化・エンジン・入力・出力・MTP・同時要求 |
| 最初の応答と完了 | 最初のトークンまでと回答終了までの秒数 |
| 電力と発熱 | 本体全体のWh・GPU電力・温度・ファン音 |
同じ作業で残す比較記録
実行条件
- 記録する内容
- モデル・量子化・エンジン・入力・出力・MTP・同時要求
最初の応答と完了
- 記録する内容
- 最初のトークンまでと回答終了までの秒数
電力と発熱
- 記録する内容
- 本体全体のWh・GPU電力・温度・ファン音
nvidia-smi -i 0 -q -d POWER,TEMPERATURE -l 1月の電気料金と夏の冷房費まで計算
平均電力に時間を掛け、1,000で割るとkWhになります。コンセントで測ったPC平均電力が450Wから400Wに減ると仮定します。毎日同じ4時間、30日使うなら54kWhから48kWhへ6kWh減ります。
同じ仕事が終わるまで使うなら、増えた時間も計算します。元の設定で4時間だった仕事が400Wで4.4時間なら1日1.76kWh、4.6時間なら1.84kWhです。元の1.8kWhより前者は少なく、後者は多くなります。遅くなりすぎると省電力の効果が小さくなるか消える理由です。
機器の電力は大部分が室内の熱になります。エアコンを使う時間には、この熱を外へ出す冷房電力も加わります。電気料金計算機に本体電力と時間を入力し、冷房電力を含めるオプションで比較してください。家庭の既存使用量と段階料金も反映すると月額で判断しやすくなります。
| 条件 | 1日の電力量 | 30日分 |
|---|---|---|
| 450W × 4h | 1.8kWh | 54kWh |
| 400W × 4h | 1.6kWh | 48kWh |
| 400W × 4.4h | 1.76kWh | 52.8kWh |
| 400W × 4.6h | 1.84kWh | 55.2kWh |
同じ時間と同じ仕事の完了の違い・説明用の仮定
450W × 4h
- 1日の電力量
- 1.8kWh
- 30日分
- 54kWh
400W × 4h
- 1日の電力量
- 1.6kWh
- 30日分
- 48kWh
400W × 4.4h
- 1日の電力量
- 1.76kWh
- 30日分
- 52.8kWh
400W × 4.6h
- 1日の電力量
- 1.84kWh
- 30日分
- 55.2kWh
許容できる待ち時間の範囲で下げる
まず現在の上限から約10%下げて同じ仕事を比較します。回答完了がほぼ同じで音や温度が下がるなら、さらに低い値を試せます。長い入力やMTPで待ち時間が大きく増えるなら一段戻してください。最低電力ではなく、毎日快適に使える設定を探します。
3090・4090・5090の測定値は開始点選びに使い、RTX PRO・Spark・Macはそれぞれ対応する調整方法で試してください。モデルとメモリが仕事に足りているなら、カード交換の前に設定で電力と発熱を減らせます。
用語の注釈
VRAM — グラフィックカードのGPUが使うメモリです。モデルの重みや計算途中の値を保存します。
本文に戻るMTP — 複数の将来トークンを一度に予測する学習目標、またはそれを行うモデル構成です。投機的デコーディングでは、その予測を候補トークンとして提案できます。
本文に戻るプリフィル — LLMが入力プロンプトを読み、各トークンの内部表現を計算する段階です。プロンプトが長いほど処理するトークンが増えます。
本文に戻るデコード — LLMでは入力処理後に出力トークンを生成する段階です。VAEやオーディオコーデックでは、圧縮表現や符号化データから元の形式を復元する処理を指すことがあります。
本文に戻るトークン — モデルが入力や出力を分けて処理する単位です。
本文に戻るGPU — 多くの計算を並列に処理するプロセッサーです。AIモデルの実行ではモデル計算を担います。
本文に戻るCPU — OSや一般的なプログラム命令を実行する中央処理装置です。AIでは前処理やデータ転送などの汎用処理も担います。
本文に戻る
