구매와 비용

GPU 전력 제한, 로컬 AI는 얼마나 느려질까? RTX 3090·4090·5090·DGX Spark

메모리 용량은 유지하면서 전력과 발열을 줄이는 설정을 찾아요.

전력 제한(Power Limit)은 그래픽카드가 사용할 전력의 상한을 정하는 기능이에요. RTX 3090을 350W 대신 300W로 쓰는 식이죠. 모델을 담을 VRAM1은 그대로 유지하면서 전력과 발열을 줄일 수 있어요. 대신 답변이 조금 늦어질 수 있으니, 내가 자주 하는 작업이 얼마나 더 걸리는지 함께 비교해야 해요.

300W가 모든 장비의 정답은 아니에요. 3090과 5090의 공개 실측에서는 적절한 상한이 달랐고, 같은 5090도 MTP2를 켜면 전력 제한의 영향이 커졌어요. DGX Spark와 Mac은 조정 방법부터 달라요. 먼저 내 장비에 맞는 방법을 고른 뒤, 원래 설정으로 돌아갈 수 있게 기록하면서 시험해볼게요.

전력을 줄여도 답변 속도가 비슷할 수 있는 이유

모델이 입력 문서를 읽는 프리필3에서는 많은 계산을 한꺼번에 처리해요. 답변을 이어 쓰는 디코드4에서는 모델 데이터를 읽고 다음 토큰5을 만드는 일을 반복하죠. 디코드가 메모리에서 데이터를 가져오는 속도에 막혀 있다면, 연산 클럭을 조금 낮춰도 전체 속도는 크게 달라지지 않을 수 있어요.

MTP를 켜면 여러 후보 토큰을 검증하는 계산도 추가돼요. 같은 모델이라도 전력 상한의 영향을 더 많이 받을 수 있는 이유예요. 전력을 낮춘 뒤에는 짧은 질문과 긴 문서 요약을 각각 보내보세요. 첫 답까지 걸린 시간과 답변 전체가 끝난 시간을 따로 적으면 어느 작업이 느려졌는지 알 수 있어요.

RTX 3090: 300W에서 생성 속도를 대부분 유지했어요

Qwen3.8 27B를 같은 RTX 3090에서 실행하면서 전력 상한만 바꾼 공개 비교예요. 350W에서 300W로 낮추자 생성 속도는 약 5% 줄고, 측정된 GPU6 전력은 약 14% 줄었어요. 275W에서는 속도가 약 10%, 전력은 약 21% 줄었죠. 250W까지 내리면 속도 손실이 약 26%로 커졌어요.

이 구성에서는 300W가 빠른 응답과 전력 절약 사이의 절충점이었고, 275W는 소비전력 1W당 생성 속도가 가장 높았어요. 모델과 문서를 준비해 300W부터 비교하고, 기다림이 괜찮을 때 275W를 시험하는 순서로 시작할 수 있어요.

RTX 3090 · Qwen3.8 27B · MTP n-max 3
전력 상한생성 속도측정 GPU 전력
350W68.9 tok/s347.7W
300W65.3 tok/s298.7W
275W62.3 tok/s274.0W
250W51.0 tok/s249.5W

RTX 3090 · Qwen3.8 27B · MTP n-max 3

350W

생성 속도
68.9 tok/s
측정 GPU 전력
347.7W

300W

생성 속도
65.3 tok/s
측정 GPU 전력
298.7W

275W

생성 속도
62.3 tok/s
측정 GPU 전력
274.0W

250W

생성 속도
51.0 tok/s
측정 GPU 전력
249.5W
측정 조건
RTX 3090 · Qwen3.8-27B UD-Q4_K_XL Dynamic 3.0
llama.cpp b10829 · CUDA 13.3 · NVIDIA 610.43.03
131,072 context capacity · Q4_0 KV · MTP n-max 3
thinking off · parallel 1 · median of 3 complete passes
전력은 GPU 사용률 90% 이상 구간의 중앙값이에요. 문맥 값은 설정 한도이고 PC 전체 소비전력은 따로 측정해요.
RTX 3090 전력 상한별 생성 속도 68.9·65.3·62.3·51.0 tok/s와 GPU 전력 347.7·298.7·274.0·249.5W 비교
RTX 3090의 300W 설정은 생성 속도를 약 95% 유지했어요.

RTX 5090: MTP를 켜뒀다면 한 번 더 비교하세요

RTX 5090의 Qwen3.8 27B 공개 비교에서는 600W에서 500W로 낮춰도 MTP를 끈 생성 속도는 거의 같았어요. MTP n-max 4를 켠 경우에는 162.1에서 153.6 tok/s로 약 5% 줄었죠. 같은 카드라도 추가 계산을 하는 설정에서는 전력을 줄인 만큼 기다림이 더 늘 수 있어요.

400W까지 내리면 MTP를 끈 속도는 약 5%, 켠 속도는 약 18% 줄었어요. 전기 절약이 우선이면 낮은 상한을, 응답 시간을 크게 늘리고 싶지 않다면 500W 부근부터 비교할 수 있어요. 이 시험의 ASUS TUF 5090은 기본 상한이 600W였어요. 내 카드의 기본값과 허용 범위부터 확인하세요.

같은 RTX 5090 · Qwen3.8 27B · MTP 사용 여부 비교
전력 상한MTP 끔MTP n-max 4
600W74.8 tok/s162.1 tok/s
550W74.8 tok/s158.8 tok/s
500W74.5 tok/s153.6 tok/s
450W73.5 tok/s142.7 tok/s
400W71.2 tok/s132.8 tok/s

같은 RTX 5090 · Qwen3.8 27B · MTP 사용 여부 비교

600W

MTP 끔
74.8 tok/s
MTP n-max 4
162.1 tok/s

550W

MTP 끔
74.8 tok/s
MTP n-max 4
158.8 tok/s

500W

MTP 끔
74.5 tok/s
MTP n-max 4
153.6 tok/s

450W

MTP 끔
73.5 tok/s
MTP n-max 4
142.7 tok/s

400W

MTP 끔
71.2 tok/s
MTP n-max 4
132.8 tok/s
측정 조건
ASUS TUF RTX 5090 32GB · Unsloth UD-Q4_K_XL
llama.cpp b10451 (10bf611e5) · Arch Linux 7.1.8 / CUDA
131K context capacity · q4_0 KV · parallel 1
thinking off · max output 400 · mean of 27 runs per cell
표는 생성 속도 평균이에요. 원문의 전력은 1초 간격 표본의 p95를 집계해요.
RTX 5090의 600·550·500·450·400W 상한에서 MTP 끈 속도와 n-max 4 속도를 나란히 비교한 그래프
같은 RTX 5090도 MTP를 켜면 전력 제한의 영향이 더 커졌어요.

RTX 4090·5060 Ti·RTX PRO 6000은 어디서 시작할까요?

RTX 4090의 별도 공개 비교에서는 Qwen3.6 27B Q3_K_XL의 단일 요청 생성 속도가 450W에서 51.96, 300W에서 50.16, 260W에서 48.26 tok/s였어요. 이 작업에서는 300W에서도 속도를 약 97% 유지했죠. 3090·5090 표와 모델·파일·시험이 다르므로, 여기서는 4090 내부의 전력별 차이만 비교하면 돼요.

RTX 5060 Ti나 다른 GeForce도 조정 기능을 지원하면 같은 절차로 시험할 수 있어요. 기본 상한에서 10% 정도 낮춰 첫 답과 완료 시간을 비교하세요. 메모리가 부족해 모델 일부를 CPU7에서 처리한다면 먼저 적재 구성을 점검해요. 전력 제한만으로 부족한 VRAM을 늘릴 수는 없으니까요.

RTX PRO 6000 Blackwell은 에디션을 먼저 구분하세요. Workstation Edition은 600W, Max-Q는 300W, Server Edition은 400~600W 사양이에요. 서로 다른 에디션을 같은 600W 카드로 놓고 조정하면 안 돼요. 조회된 기본값과 Min·Max 안에서 낮추고, 긴 입력과 여러 요청을 함께 처리할 때도 비교하세요. 서버형 카드는 시스템이 제공하는 냉각 조건도 유지해야 해요.

RTX 4090 전력 상한 450·300·260W의 생성 속도 51.96·50.16·48.26 tok/s 비교
RTX 4090의 이 작업은 300W에서도 생성 속도의 약 97%를 유지했어요.

Windows: 원래 값을 기록한 뒤 Power Limit만 낮춰요

MSI Afterburner를 공식 사이트에서 설치하고 조정할 카드를 선택해요. 현재 Power Limit 값과 화면을 캡처한 뒤, 100%였다면 90% 정도로 낮추고 Apply를 누르세요. 전압·코어 클럭·메모리 클럭은 그대로 둬요. 여러 값을 동시에 바꾸면 속도가 달라진 이유를 찾기 어려워요.

같은 문서의 답을 끝까지 받은 뒤, 기다림과 팬 소리를 비교해요. 100%가 기본 350W인 카드라면 90%는 약 315W예요. 원하는 와트로 맞추려면 카드의 기본 상한을 알아야 하죠. 슬라이더가 잠겨 있으면 현재 카드·드라이버의 지원부터 확인하세요. 원복할 때는 기록한 값으로 돌리고 Apply를 눌러요. 시험이 끝나기 전에는 부팅 시 자동 적용을 켜지 마세요.

Linux: 조회 → 변경 → 적용 확인 → 원복

NVIDIA 드라이버가 설치된 PC에서는 nvidia-smi로 조정할 수 있어요. 먼저 GPU 번호와 이름을 확인하고, 해당 카드의 현재 상한과 Min·Max를 적어두세요. 아래 두 명령은 값을 읽기만 해요. 전력 상한이 N/A이거나 조정을 지원하지 않는다는 오류가 나오면 변경 단계로 넘어가지 마세요.

변경 예시는 GPU 0의 RTX 3090을 300W로 낮추는 경우예요. 내 카드에서 300W가 허용 범위 안에 있을 때만 실행하세요. 적용 후 같은 조회 명령으로 값이 바뀌었는지 확인하고 작업을 비교해요. 되돌릴 때는 변경 전 기록한 와트를 지정하세요. 처음부터 시스템 시작 서비스에 넣지 말고, 정상 실행과 복구를 확인한 뒤 자동 적용을 검토해요.

GPU 선택과 전력 범위 조회
nvidia-smi -L
nvidia-smi -i 0 -q -d POWER
GPU 번호 0을 조정할 카드 번호로 바꿔요. Current·Default·Min·Max를 기록하세요.
허용 범위 내 RTX 3090의 300W 시험
sudo nvidia-smi -i 0 -pl 300
nvidia-smi -i 0 -q -d POWER
다른 카드에는 앞서 조회한 범위 안의 값을 넣어요. 설정 권한이 필요해요.
변경 전 상한으로 복구
sudo nvidia-smi -i 0 -pl ORIGINAL_WATTS
nvidia-smi -i 0 -q -d POWER
ORIGINAL_WATTS를 변경 전 기록한 숫자로 바꿔요. 드라이버 재로드나 관리 앱이 값을 다시 적용할 수 있으니 재시작 뒤에도 조회하세요.

DGX Spark: 와트 상한보다 지원되는 조정부터

DGX Spark의 GB10은 CPU와 GPU가 함께 들어간 칩이에요. SoC TDP는 140W이고 기본 전원 어댑터는 240W예요. nvidia-smi에 보이는 전력은 GPU 부분의 값이므로, 전기요금을 계산할 때는 콘센트에서 본체 전체를 측정하세요.

현재 Spark의 공개 사례에서는 nvidia-smi -pl로 전력 상한을 바꾸는 기능이 지원되지 않았어요. 전력 정보가 N/A이면 3090의 300W 명령을 옮겨 실행하지 마세요. 먼저 DGX OS를 업데이트하고 공급된 어댑터를 사용해요. 쓰지 않는 고속 네트워크 장치의 절전은 OS 업데이트와 함께 개선됐고, 사용하지 않는 서버 작업을 끄는 것도 불필요한 부하를 줄여요.

클럭 상한을 낮춰 발열과 갑작스러운 종료를 줄였다는 커뮤니티 사례도 있어요. 해당 구성에서는 GPU 클럭 범위를 300~2,200MHz로 제한한 뒤 같은 듀얼 노드 작업의 생성 속도가 32.3에서 30.8 tok/s로 약 5% 줄었어요. 전기요금 절감 실측은 아니며, 전력 공급·메모리 설정도 함께 점검한 사례예요. 내 Spark에서 같은 증상이 있다면 로그와 온도부터 남겨 지원을 요청하고, 클럭 조정은 지원 범위와 원복 방법을 확인한 뒤 별도 시험으로 다루세요.

Mac과 Radeon도 발열을 줄이는 방법이 있어요

지원되는 Mac에서는 시스템 설정의 에너지 또는 배터리에서 저전력 모드를 선택해 비교할 수 있어요. Apple은 Mac mini와 Mac Studio를 포함한 지원 모델에서 전력과 팬 소음을 줄이는 기능으로 안내해요. 모델·문서·출력 길이를 유지한 채 자동 모드와 저전력 모드의 완료 시간을 비교하세요. 다른 앱까지 함께 느려진다면 작업 중에는 자동 모드, 오래 켜두는 가벼운 작업에는 저전력 모드처럼 나눠 쓸 수 있어요.

Radeon은 NVIDIA 명령 대신 카드 제조사가 제공하는 전력 조정 기능을 사용해요. 지원되는 AMD Software의 성능·튜닝 화면에서 전력 제한을 조정하고 기본값을 저장해둬요. 제조사 앱에 항목이 없거나 회사 장비에서 설정이 잠겨 있다면 시스템의 관리 정책을 먼저 확인하세요. 전압 조정과 전력 제한을 함께 바꾸기보다 전력 상한 하나부터 시험하는 원칙은 같아요.

GPU 두 장·Spark 두 대는 전체 작업으로 비교해요

모델을 GPU 두 장에 나눠 실행하면 두 카드가 계산 결과를 주고받아요. 카드 하나의 상한만 크게 낮추면 다른 카드가 그 결과를 기다릴 수 있어요. GPU 번호·UUID·현재 상한을 카드마다 적어두고, 먼저 작은 폭으로 같은 비율을 낮춰 전체 응답 시간을 비교하세요. 각 카드가 서로 다른 모델을 실행한다면 작업별로 따로 조정하면 돼요.

Spark 두 대나 여러 PC도 같은 원리예요. 분산 실행이 끝날 때까지 모든 노드의 전력량을 더해야 실제 비용을 알 수 있어요. 남는 노드에서 별도 일을 하지 않는다면, 작업이 끝난 뒤 서버를 정지하거나 사용 계획에 맞춰 대기·종료하는 시간을 정해요. 통신 장치와 스위치까지 켜두는 구성이라면 그 전력도 포함하세요.

비교 기록은 첫 답·완료 시간·전력량 세 가지로

먼저 기본 설정으로 같은 문서에 답을 받아 기준을 만들어요. 전력 상한을 낮춘 뒤 똑같은 요청을 세 번 보내고 중앙값을 비교해요. 프롬프트 캐시가 있는 앱에서는 처음 보낸 요청끼리, 이어서 보낸 요청끼리 나눠 기록하세요. 다른 요청이나 모델 다운로드를 함께 실행하면 전력 제한만의 차이를 찾기 어려워요.

생성 속도와 GPU 전력의 비율은 설정을 고르는 단서예요. 전기요금을 줄였는지는 PC 전체가 답변을 마칠 때까지 사용한 전력량으로 판단해요. GPU 전력·온도는 아래 명령으로 관찰하고, 콘센트 전력계에는 본체 전체의 누적 Wh도 남겨두세요. 팬 소음은 같은 위치에서 비교해야 변화가 잘 드러나요.

같은 작업으로 남길 비교 기록
항목기록할 내용
실행 조건모델·양자화·엔진·입력·출력·MTP·동시 요청
첫 답과 완료요청 후 첫 토큰·답변 종료까지 각각 몇 초
전력과 발열본체 전체 Wh·GPU 전력·온도·팬 소리

같은 작업으로 남길 비교 기록

실행 조건

기록할 내용
모델·양자화·엔진·입력·출력·MTP·동시 요청

첫 답과 완료

기록할 내용
요청 후 첫 토큰·답변 종료까지 각각 몇 초

전력과 발열

기록할 내용
본체 전체 Wh·GPU 전력·온도·팬 소리
GPU 상태 1초마다 조회
nvidia-smi -i 0 -q -d POWER,TEMPERATURE -l 1
Ctrl+C로 끝내요. 이 명령은 전력이나 클럭 설정을 바꾸지 않아요.

한 달 전기요금과 여름 냉방비까지 계산해요

평균 전력에 사용 시간을 곱하고 1,000으로 나누면 kWh가 돼요. 예를 들어 콘센트에서 잰 PC 평균 전력이 450W에서 400W로 줄었다고 가정해볼게요. 매일 같은 4시간씩 한 달 30일 쓰면 54kWh에서 48kWh로 6kWh 줄어요.

하지만 같은 작업이 끝날 때까지 기다린다면 늘어난 시간도 계산해야 해요. 기본 설정으로 4시간 걸리던 작업이 400W에서 4.4시간이면 하루 1.76kWh, 4.6시간이면 1.84kWh예요. 기본 설정의 1.8kWh보다 앞의 경우는 적고 뒤의 경우는 많아요. 전력을 낮춰도 시간이 너무 늘면 절약이 작아지거나 사라지는 이유예요.

장비가 사용하는 전기는 대부분 방 안의 열이 돼요. 에어컨을 켜는 시간에는 그 열을 빼내는 냉방 전력도 더해져요. 전기요금 계산기에 측정한 본체 전력과 시간을 넣고 냉방 전력 포함 옵션을 켜 비교하세요. 집의 기존 사용량과 누진 구간까지 함께 반영하면 월 비용으로 판단하기 쉬워요.

같은 시간 사용과 같은 작업 완료의 차이 · 설명용 가정
조건하루 사용량30일 사용량
450W × 4h1.8kWh54kWh
400W × 4h1.6kWh48kWh
400W × 4.4h1.76kWh52.8kWh
400W × 4.6h1.84kWh55.2kWh

같은 시간 사용과 같은 작업 완료의 차이 · 설명용 가정

450W × 4h

하루 사용량
1.8kWh
30일 사용량
54kWh

400W × 4h

하루 사용량
1.6kWh
30일 사용량
48kWh

400W × 4.4h

하루 사용량
1.76kWh
30일 사용량
52.8kWh

400W × 4.6h

하루 사용량
1.84kWh
30일 사용량
55.2kWh

내가 기다릴 수 있는 만큼만 낮추면 돼요

처음에는 현재 상한에서 10% 정도만 낮춰 같은 작업을 비교하세요. 답변이 거의 같은 시간에 끝나고 팬 소리나 온도가 줄었다면 더 낮은 값을 시험해볼 만해요. 긴 입력이나 MTP에서 기다림이 크게 늘면 한 단계 되돌려요. 최저 전력보다 매일 편하게 쓸 수 있는 설정을 찾는 게 목적이에요.

3090·4090·5090의 실측은 출발점을 고르는 데 활용하고, RTX PRO·Spark·Mac은 자기 장비의 지원되는 조정 방법으로 시험하세요. 작업을 마치는 데 필요한 모델과 메모리가 이미 충분하다면, 카드 교체 전에 이런 설정으로 전기와 발열을 줄여볼 수 있어요.

용어 각주

  1. VRAM — 그래픽카드의 GPU가 사용하는 메모리입니다. 모델 가중치와 계산 중간값을 저장합니다.

    본문으로 돌아가기
  2. MTP — 한 번에 여러 미래 토큰을 예측하도록 학습하는 목표 또는 이를 수행하는 모델 구성입니다. 추측 디코딩에서는 이 예측을 후보 토큰으로 제안할 수 있습니다.

    본문으로 돌아가기
  3. 프리필 — LLM이 입력 프롬프트를 읽고 각 토큰의 내부 표현을 계산하는 단계입니다. 입력이 길수록 처리할 토큰이 많아집니다.

    본문으로 돌아가기
  4. 디코드 — LLM에서는 입력 처리 뒤 출력 토큰을 생성하는 단계를 뜻합니다. VAE나 오디오 코덱에서는 압축 표현이나 인코딩 데이터를 원래 형식으로 복원하는 처리를 가리킬 수 있습니다.

    본문으로 돌아가기
  5. 토큰 — 모델이 입력이나 출력을 나누어 처리하는 단위입니다.

    본문으로 돌아가기
  6. GPU — 많은 계산을 병렬로 처리하는 프로세서입니다. AI 모델 실행에서는 모델 계산을 맡습니다.

    본문으로 돌아가기
  7. CPU — 운영체제와 일반 프로그램 명령을 실행하고, AI에서는 전처리·데이터 이동 등 범용 연산을 맡는 중앙 처리 장치입니다.

    본문으로 돌아가기