購入とコスト

GPUの電力制限でローカルAIはどれくらい遅くなる?RTX 3090・4090・5090・DGX Spark

メモリ容量を維持したまま、消費電力と発熱を抑える設定を探します。

電力制限(Power Limit)は、グラフィックカードが使える電力の上限を設定する機能です。たとえばRTX 3090を350Wではなく300Wで動かします。モデルを格納するVRAM1容量を維持しつつ、消費電力と発熱を減らせます。応答が遅くなる場合があるので、普段の作業にかかる時間も比較します。

300Wがすべての機器に適するわけではありません。3090と5090の公開測定では適切な上限が異なり、同じ5090でもMTP2を有効にすると電力制限の影響が大きくなりました。DGX SparkとMacでは調整方法も違います。機器に合う方法を選び、元に戻せるよう設定を記録して試します。

電力を下げても応答速度があまり変わらない理由

入力を読むプリフィル3では、多くの計算をまとめて処理します。回答を続けるデコード4では、モデルのデータを読み、次のトークン5を作る処理を繰り返します。メモリからの読み出しが律速なら、演算クロックを少し下げても全体の速度は大きく変わらないことがあります。

MTPを使うと、複数の候補トークンを検証する計算が加わります。同じモデルでも電力上限の影響を受けやすくなる理由です。上限を下げたら短い質問と長い文書の要約をそれぞれ試し、最初の応答までと回答完了までの時間を別々に記録します。

RTX 3090:300Wでも生成速度の大部分を維持

同じRTX 3090でQwen3.8 27Bを動かし、電力上限だけを変えた公開比較です。350Wから300Wにすると生成速度は約5%、測定GPU6電力は約14%減りました。275Wでは速度が約10%、電力が約21%減り、250Wでは速度低下が約26%に広がりました。

この構成では300Wが応答速度と省電力の折り合いをつけやすく、275Wで1Wあたりの生成速度が最高になりました。モデルと文書を用意してまず300Wを比較し、待ち時間を許容できれば275Wを試す順序で始められます。

RTX 3090 · Qwen3.8 27B · MTP n-max 3
電力上限生成速度測定GPU電力
350W68.9 tok/s347.7W
300W65.3 tok/s298.7W
275W62.3 tok/s274.0W
250W51.0 tok/s249.5W

RTX 3090 · Qwen3.8 27B · MTP n-max 3

350W

生成速度
68.9 tok/s
測定GPU電力
347.7W

300W

生成速度
65.3 tok/s
測定GPU電力
298.7W

275W

生成速度
62.3 tok/s
測定GPU電力
274.0W

250W

生成速度
51.0 tok/s
測定GPU電力
249.5W
測定条件
RTX 3090 · Qwen3.8-27B UD-Q4_K_XL Dynamic 3.0
llama.cpp b10829 · CUDA 13.3 · NVIDIA 610.43.03
131,072 context capacity · Q4_0 KV · MTP n-max 3
thinking off · parallel 1 · median of 3 complete passes
電力はGPU使用率90%以上の区間の中央値です。文脈値は設定上限で、PC全体の電力は別に測定します。
RTX 3090の上限別生成速度68.9・65.3・62.3・51.0 tok/sとGPU電力347.7・298.7・274.0・249.5Wの比較
RTX 3090は300Wで生成速度を約95%維持しました。

RTX 5090:MTPを使うならもう一度比較

RTX 5090によるQwen3.8 27Bの公開比較では、600Wから500WにしてもMTPなしの生成速度はほぼ同じでした。MTP n-max 4では162.1から153.6 tok/sに約5%下がりました。同じカードでも追加の計算をする設定では、電力を下げたときの待ち時間が増えやすくなります。

400WではMTPなしで約5%、MTPありで約18%遅くなりました。省電力を優先するなら低い上限を、応答時間を大きく増やしたくなければ500W付近から比較できます。測定したASUS TUF 5090の既定値は600Wでした。自分のカードの既定値と設定可能範囲を先に確認してください。

同じRTX 5090・Qwen3.8 27B・MTPの有無
電力上限MTPなしMTP n-max 4
600W74.8 tok/s162.1 tok/s
550W74.8 tok/s158.8 tok/s
500W74.5 tok/s153.6 tok/s
450W73.5 tok/s142.7 tok/s
400W71.2 tok/s132.8 tok/s

同じRTX 5090・Qwen3.8 27B・MTPの有無

600W

MTPなし
74.8 tok/s
MTP n-max 4
162.1 tok/s

550W

MTPなし
74.8 tok/s
MTP n-max 4
158.8 tok/s

500W

MTPなし
74.5 tok/s
MTP n-max 4
153.6 tok/s

450W

MTPなし
73.5 tok/s
MTP n-max 4
142.7 tok/s

400W

MTPなし
71.2 tok/s
MTP n-max 4
132.8 tok/s
測定条件
ASUS TUF RTX 5090 32GB · Unsloth UD-Q4_K_XL
llama.cpp b10451 (10bf611e5) · Arch Linux 7.1.8 / CUDA
131K context capacity · q4_0 KV · parallel 1
thinking off · max output 400 · mean of 27 runs per cell
表は生成速度の平均です。原資料の電力は1秒間隔の標本のp95を集計しています。
RTX 5090の600・550・500・450・400WでMTPなしとn-max 4の生成速度を比べたグラフ
同じRTX 5090でもMTPを有効にすると電力制限の影響が大きくなりました。

RTX 4090・5060 Ti・RTX PRO 6000はどこから始める?

別のRTX 4090比較では、Qwen3.6 27B Q3_K_XLの単一リクエスト生成速度が450Wで51.96、300Wで50.16、260Wで48.26 tok/sでした。この作業は300Wでも速度を約97%維持しました。3090・5090の表とはモデル・ファイル・試験が異なるため、この4090の電力別変化を比較します。

RTX 5060 TiなどのGeForceも調整機能が対応していれば同じ手順で試せます。既定の上限から約10%下げ、最初の応答と完了までの時間を比較してください。VRAM不足でモデルの一部をCPU7で処理しているなら、まず配置を確認します。電力制限でVRAM容量は増えません。

RTX PRO 6000 Blackwellはエディションを先に区別します。Workstation Editionは600W、Max-Qは300W、Server Editionは400〜600Wの仕様です。すべてを600Wの同じカードとして扱わず、取得した既定値とMin・Maxの範囲内で下げます。長い入力や同時リクエストも比較し、サーバー型のシステム冷却条件を維持してください。

RTX 4090の電力上限450・300・260Wで生成速度51.96・50.16・48.26 tok/sを比較
このRTX 4090の作業は300Wでも生成速度を約97%維持しました。

Windows:元の値を記録してPower Limitだけを下げる

MSI Afterburnerを公式サイトから導入し、対象カードを選びます。現在のPower Limitを画面とともに保存し、100%なら90%程度に下げてApplyを押します。電圧・コアクロック・メモリクロックは変えず、速度差の原因を特定しやすくします。

同じ文書への回答を最後まで受け取り、待ち時間とファン音を比較します。100%が既定の350Wなら90%は約315Wです。割合をワットに換算するには既定値が必要です。スライダーが無効ならカードとドライバーの対応を確認し、復元時は記録した値に戻してApplyを押します。試験中は起動時の自動適用を無効にしておきます。

Linux:取得→変更→適用確認→復元

NVIDIAドライバーを入れたPCでは、対応カードをnvidia-smiで調整できます。GPU番号と名前を確認し、現在の上限とMin・Maxを記録します。以下の最初の2つのコマンドは取得だけです。上限がN/A、または変更非対応なら変更段階に進まないでください。

変更例はGPU 0のRTX 3090を300Wに下げるものです。自分のカードで300Wが許容範囲内の場合にだけ実行します。同じ取得コマンドで適用値を確認し、作業を比較してください。復元には変更前に記録したワット数を指定し、起動時サービスへの登録は正常動作と復元を確認してから検討します。

GPUの選択と電力範囲の取得
nvidia-smi -L
nvidia-smi -i 0 -q -d POWER
GPU番号0を対象カードの番号に変え、Current・Default・Min・Maxを記録してください。
対応範囲内のRTX 3090で300Wを試す
sudo nvidia-smi -i 0 -pl 300
nvidia-smi -i 0 -q -d POWER
別のカードでは取得した範囲内の値を指定します。変更には権限が必要です。
変更前の上限に戻す
sudo nvidia-smi -i 0 -pl ORIGINAL_WATTS
nvidia-smi -i 0 -q -d POWER
ORIGINAL_WATTSを変更前に記録した数値に置き換えます。ドライバー再読み込みや管理アプリで値が変わることがあるので、再起動後も取得してください。

DGX Spark:対応している調整から始める

DGX SparkのGB10はCPUとGPUを組み合わせたチップです。SoCのTDPは140W、付属アダプターは240Wです。nvidia-smiの電力はGPU部分なので、電気料金の計算にはコンセントで本体全体を測定します。

現在のSparkの公開例では、nvidia-smi -plによる電力上限の変更は非対応でした。上限情報がN/Aなら、3090用の300Wコマンドをそのまま使わないでください。まずDGX OSを更新し、付属アダプターを使います。未使用の高速ネットワークの省電力もOS更新で改善されており、使わないサーバー処理を止めることも余分な負荷を減らします。

発熱と突然の停止を減らすためクロック上限を下げたコミュニティ例もあります。GPUを300〜2,200MHzに制限すると、同じデュアルノード作業の生成速度は32.3から30.8 tok/sへ約5%下がりました。電気料金の節約測定ではなく、電源とメモリ設定も点検した例です。同じ症状があるならログと温度を残してサポートを求め、クロック調整は対応範囲と復元方法を確認したうえで別の試験として扱ってください。

MacとRadeonにも発熱を抑える方法がある

対応Macでは、システム設定のエネルギーまたはバッテリーで低電力モードを選び比較できます。Appleは対応するMac miniやMac Studioで消費電力とファン音を抑える機能として案内しています。モデル・文書・出力長を固定し、自動モードとの完了時間を比較してください。他のアプリまで遅くなるなら作業中は自動、軽い常時稼働は低電力と使い分けられます。

RadeonはNVIDIAのコマンドではなくメーカーの電力調整機能を使います。対応AMD Softwareのパフォーマンス・チューニング画面で電力上限を調整し、既定値を保存してください。項目がない、または管理されたPCでロックされているなら管理ポリシーを先に確認します。電圧変更と組み合わせる前に電力上限だけを試す原則は同じです。

GPU2枚・Spark2台は作業全体で比較

モデルを2枚のGPUに分割すると、カード間で計算結果を交換します。1枚だけ大きく制限すると、もう1枚が結果を待つ場合があります。番号・UUID・現在の上限を各カードで記録し、まず同じ割合で少し下げて応答全体を比較してください。別々のモデルを動かすなら作業ごとに調整できます。

Spark2台や複数PCでも同じです。分散処理が完了するまでの全ノードの電力量を合計すると実際の費用を計算できます。余ったノードに別の仕事がなければ作業後にサーバーを止め、利用予定に合わせて待機・終了時間を決めます。ネットワーク機器やスイッチを常時稼働させるならその電力も含めてください。

最初の応答・完了時間・電力量を記録

元の設定で同じ文書に回答させて基準を作り、上限を下げて同じ要求を3回送り中央値を比較します。プロンプトキャッシュのあるアプリでは、初回と続きの要求を別々に記録してください。別の要求やモデルのダウンロードを同時に動かすと、電力制限だけの差を見分けにくくなります。

GPUの1Wあたり生成速度は設定を選ぶ手掛かりです。電気料金が減ったかは回答完了までのPC全体の電力量で判断します。以下でGPUの電力と温度を観察し、コンセントの電力計に累積Whも記録してください。ファン音は同じ位置で比較します。

同じ作業で残す比較記録
項目記録する内容
実行条件モデル・量子化・エンジン・入力・出力・MTP・同時要求
最初の応答と完了最初のトークンまでと回答終了までの秒数
電力と発熱本体全体のWh・GPU電力・温度・ファン音

同じ作業で残す比較記録

実行条件

記録する内容
モデル・量子化・エンジン・入力・出力・MTP・同時要求

最初の応答と完了

記録する内容
最初のトークンまでと回答終了までの秒数

電力と発熱

記録する内容
本体全体のWh・GPU電力・温度・ファン音
GPU状態を1秒ごとに取得
nvidia-smi -i 0 -q -d POWER,TEMPERATURE -l 1
Ctrl+Cで終了します。このコマンドは電力やクロックの設定を変更しません。

月の電気料金と夏の冷房費まで計算

平均電力に時間を掛け、1,000で割るとkWhになります。コンセントで測ったPC平均電力が450Wから400Wに減ると仮定します。毎日同じ4時間、30日使うなら54kWhから48kWhへ6kWh減ります。

同じ仕事が終わるまで使うなら、増えた時間も計算します。元の設定で4時間だった仕事が400Wで4.4時間なら1日1.76kWh、4.6時間なら1.84kWhです。元の1.8kWhより前者は少なく、後者は多くなります。遅くなりすぎると省電力の効果が小さくなるか消える理由です。

機器の電力は大部分が室内の熱になります。エアコンを使う時間には、この熱を外へ出す冷房電力も加わります。電気料金計算機に本体電力と時間を入力し、冷房電力を含めるオプションで比較してください。家庭の既存使用量と段階料金も反映すると月額で判断しやすくなります。

同じ時間と同じ仕事の完了の違い・説明用の仮定
条件1日の電力量30日分
450W × 4h1.8kWh54kWh
400W × 4h1.6kWh48kWh
400W × 4.4h1.76kWh52.8kWh
400W × 4.6h1.84kWh55.2kWh

同じ時間と同じ仕事の完了の違い・説明用の仮定

450W × 4h

1日の電力量
1.8kWh
30日分
54kWh

400W × 4h

1日の電力量
1.6kWh
30日分
48kWh

400W × 4.4h

1日の電力量
1.76kWh
30日分
52.8kWh

400W × 4.6h

1日の電力量
1.84kWh
30日分
55.2kWh

許容できる待ち時間の範囲で下げる

まず現在の上限から約10%下げて同じ仕事を比較します。回答完了がほぼ同じで音や温度が下がるなら、さらに低い値を試せます。長い入力やMTPで待ち時間が大きく増えるなら一段戻してください。最低電力ではなく、毎日快適に使える設定を探します。

3090・4090・5090の測定値は開始点選びに使い、RTX PRO・Spark・Macはそれぞれ対応する調整方法で試してください。モデルとメモリが仕事に足りているなら、カード交換の前に設定で電力と発熱を減らせます。

用語の注釈

  1. VRAM — グラフィックカードのGPUが使うメモリです。モデルの重みや計算途中の値を保存します。

    本文に戻る
  2. MTP — 複数の将来トークンを一度に予測する学習目標、またはそれを行うモデル構成です。投機的デコーディングでは、その予測を候補トークンとして提案できます。

    本文に戻る
  3. プリフィル — LLMが入力プロンプトを読み、各トークンの内部表現を計算する段階です。プロンプトが長いほど処理するトークンが増えます。

    本文に戻る
  4. デコード — LLMでは入力処理後に出力トークンを生成する段階です。VAEやオーディオコーデックでは、圧縮表現や符号化データから元の形式を復元する処理を指すことがあります。

    本文に戻る
  5. トークン — モデルが入力や出力を分けて処理する単位です。

    本文に戻る
  6. GPU — 多くの計算を並列に処理するプロセッサーです。AIモデルの実行ではモデル計算を担います。

    本文に戻る
  7. CPU — OSや一般的なプログラム命令を実行する中央処理装置です。AIでは前処理やデータ転送などの汎用処理も担います。

    本文に戻る