실행 프로그램과 확장

로컬 AI에 NVIDIA 그래픽카드와 CUDA가 꼭 필요할까

CUDA 설치 안내를 봤다면, 먼저 앱이 실제로 요구하는지 확인하세요.

로컬 언어 모델 앱에 문서를 넣으려는데 설정에는 CPU1만 보인다고 해 보겠습니다. 이때 CUDA2 툴킷부터 설치하기보다 앱이 지원하는 GPU3와 실행 방법을 먼저 확인하세요. 완성된 앱은 필요한 실행 구성요소를 함께 제공할 수 있어 툴킷이 필요하지 않을 수 있습니다. PyTorch4를 직접 설치할 때는 CUDA 빌드와 호환 드라이버를 확인하고, CUDA 코드를 컴파일할 때는 툴킷이 필요할 수 있습니다. NVIDIA가 없어도 CPU, Mac의 Metal5, AMD용 ROCm6·Vulkan, 브라우저의 로컬 WebGPU7 경로를 지원하는 앱으로 실행할 수 있습니다.

실행 조건과 핵심 내용
  • 앱·프레임워크·CUDA 툴킷·드라이버는 서로 다른 역할을 하며, 앱 사용과 CUDA 개발에는 필요한 설치가 다릅니다.
  • nvidia-smi가 보여 주는 CUDA 지원 수준, nvcc 툴킷 버전, 프레임워크 런타임은 서로 다른 값일 수 있습니다.
  • Mac과 AMD 시스템은 CUDA가 아닌 다른 백엔드를 사용합니다. GPU가 인식되어도 모델 전체가 VRAM에 들어가거나 필요한 연산이 모두 지원된다는 보장은 없습니다.

문서 요약 앱에 CPU만 표시될 때

문서를 요약하려고 로컬 언어 모델 앱을 열었는데 실행 장치에 CPU만 보입니다. 노트북에 그래픽칩이 있어도 CUDA가 없으면 GPU를 쓸 수 없는 걸까요? 먼저 이 앱이 어떤 GPU와 실행 방식을 지원하는지 확인하세요. CUDA는 NVIDIA GPU용 경로입니다. 앱을 실행하는 일과 CUDA 코드를 개발하는 일은 필요한 구성이 다릅니다.

회사의 문서 요약이 이 글의 사례입니다. 앱 설정에 CUDA가 없거나 CPU라고 표시되어도 바로 툴킷을 설치할 이유는 없습니다. 앱의 공식 안내에서 지원 장치와 GPU 실행 옵션을 찾고, 설정이나 로그에 선택된 장치가 표시되는지 확인합니다. 앱이 CUDA를 지원하는지와 PC에 CUDA 개발 도구가 설치됐는지는 서로 다른 확인 항목입니다.

밝은색 화면의 모니터, 그래픽카드가 장착된 데스크톱, 닫힌 공구 상자가 놓인 책상
완성 앱은 자체 런타임을 쓸 수 있고 CUDA 툴킷은 주로 CUDA 코드를 빌드할 때 필요합니다.

앱에서 CUDA가 필요한 경우를 구분합니다

문서 요약 앱은 모델을 불러오고 실행 장치를 고르는 화면을 제공합니다. Ollama 같은 도구와 데스크톱 앱은 실행에 필요한 라이브러리를 함께 설치하거나 내부에서 관리할 수 있습니다. 이런 앱은 프로젝트의 설치 안내를 따르세요. 개발자가 아니라면 CUDA Toolkit을 별도로 설치할 필요가 없는 구성이 많습니다.

직접 PyTorch 코드로 문서를 처리한다면 설치 구성이 달라집니다. 공식 설치 선택기에서 운영체제, 설치 방식, 언어, 컴퓨팅 플랫폼을 고르면 그 조합의 설치 명령을 받을 수 있습니다. 패키지에 CUDA 실행 라이브러리가 포함되는 경우 시스템 Toolkit은 필요하지 않을 수 있지만, 드라이버와 PyTorch CUDA 빌드가 해당 GPU와 운영체제에 호환되어야 합니다.

CUDA 코드를 직접 컴파일하거나 CUDA 확장 모듈을 빌드할 때는 CUDA Toolkit이 필요할 수 있습니다. 그 안의 nvcc가 CUDA C/C++ 코드를 컴파일합니다. NVIDIA 드라이버는 운영체제가 GPU를 인식하고 CUDA 작업을 실행하도록 연결합니다. 따라서 앱이 GPU를 보지 못한다면 Toolkit 추가보다 드라이버와 장치 인식을 먼저 확인해야 합니다.

확인 명령도 보는 값이 다릅니다. nvidia-smi의 CUDA Version은 보통 드라이버가 지원하는 수준이고, nvcc --version은 PATH에서 실행되는 개발 Toolkit의 컴파일러 버전입니다. PyTorch 패키지 안의 CUDA 런타임8은 또 다를 수 있습니다. 숫자가 다르면 각 도구가 무엇을 보고하는지 비교하고, 숫자 차이만으로 설치 실패라고 판단하지 마세요.

딥러닝용 cuDNN, 선형대수용 cuBLAS처럼 CUDA 앱은 목적에 맞는 라이브러리를 함께 사용합니다. 이 라이브러리들을 연결하는 일은 보통 프레임워크나 앱이 맡습니다. 그래서 문서 요약 앱을 쓰는 사람은 앱 설치 안내를 따르면 되지만, 직접 GPU 소프트웨어를 개발하는 사람은 CUDA-X 구성요소까지 살펴볼 수 있습니다. 아래 자료는 생태계의 관계를 이해하는 데 참고하고, 내 GPU 호환 여부는 해당 앱의 지원표에서 확인하세요.

앱이 GPU를 쓴다는 것은 어디서 확인할까요

앱 장치 목록에 GPU가 보여도 문서 요약 전체가 GPU에서 처리된다는 뜻은 아닙니다. 앱이 그 GPU 백엔드와 모델 형식을 지원해야 합니다. 일부 앱은 모델 층의 일부만 GPU에 올리고 나머지는 CPU로 처리합니다. 설정에서 GPU 오프로딩9을 확인하고, 앱 로그에 장치와 GPU에 배치한 층 정보가 제공된다면 같은 문서 요약 실행에서 해당 기록을 살펴보세요.

GPU에 올릴 수 있는 양은 모델 파일 크기만으로 계산할 수 없습니다. VRAM10에는 가중치 외에도 대화 문맥을 담는 KV 캐시11와 실행 버퍼가 필요합니다. 공간이 모자라면 앱이 일부를 시스템 RAM12이나 CPU로 넘길 수 있고, 그러면 답변 속도와 동시에 처리할 수 있는 요청 수가 바뀝니다. 앱 로그에서 모델 배치와 남은 메모리를 확인하세요.

앱이 GPU를 인식해도 모델의 모든 연산을 지원하는지는 별도 문제입니다. GPU 세대와 컴퓨트 기능, 운영체제, 드라이버, 앱 빌드, 모델의 데이터 형식과 커널이 맞아야 합니다. 오래된 GPU는 최신 기능이나 일부 정밀도 연산을 지원하지 않을 수 있습니다. NVIDIA 호환성 안내에서 최소 드라이버와 기능 제한을 확인하고, 앱 지원표에서 사용하는 GPU와 모델이 포함되는지 대조하세요.

데스크톱 그래픽카드 옆 모델 크기의 블록 더미 중 일부만 카드 가까이에 놓인 장면
GPU가 감지되어도 모델과 문맥, 런타임을 VRAM에 모두 담을 수 있다는 뜻은 아닙니다.

이 노트북에 맞는 로컬 실행 경로를 고릅니다

이 문서 요약 앱이 NVIDIA CUDA를 지원하지 않는 노트북에서도 작동할 수 있습니다. AMD GPU라면 그 카드와 운영체제를 지원하는 ROCm, Vulkan 또는 다른 백엔드가 앱에 있는지 확인하세요. AMD 카드가 있다고 ROCm이 자동으로 지원되는 것은 아닙니다. 앱마다 지원 GPU 세대, 모델, 운영체제와 드라이버가 다르고, 같은 앱도 백엔드별 기능이 다를 수 있습니다.

Apple Silicon Mac도 CUDA를 실행하지 않습니다. Mac에 CUDA Toolkit을 설치한다고 CUDA용 PC로 바뀌는 것은 아닙니다. Mac에서 로컬 모델을 돌리려면 Metal 또는 Apple Silicon용 MLX13 같은 경로를 지원하는 앱을 확인합니다. CUDA 전용 라이브러리 개발에는 그 라이브러리가 지원하는 NVIDIA GPU와 운영체제 구성이 필요합니다.

NVIDIA가 아니어도 CPU, Apple Silicon의 Metal, AMD 백엔드, 브라우저의 로컬 WebGPU로 실행할 수 있습니다. 다만 브라우저 앱이 모두 로컬 계산을 하는 것은 아닙니다. 모델 계산을 원격 서버로 보내면 내 컴퓨터에서 실행하는 것이 아닙니다. CPU 경로는 큰 모델이나 긴 문맥에서 더 오래 걸릴 수 있으니, 앱이 지원하는 모델과 원하는 작업을 먼저 맞춰 보세요.

서로 다른 실행 경로를 가진 그래픽카드 데스크톱 두 대와 노트북 한 대
로컬 모델은 여러 컴퓨팅 백엔드를 쓸 수 있으며 CUDA는 NVIDIA GPU를 위한 경로입니다.

공식 안내와 작은 요약 작업으로 확인합니다

문서 요약 앱의 공식 지원표에서 운영체제, GPU 모델, 백엔드와 최소 드라이버를 확인합니다. 노트북 GPU는 이름이 비슷한 데스크톱 카드와 전력·메모리 구성이 다를 수 있으니 실제 노트북 사양으로 대조하세요. 모델 카드의 권장 사양은 앱 지원표를 대신하지 않습니다.

CUDA가 필요한 NVIDIA 앱이라면 먼저 nvidia-smi로 드라이버가 GPU를 인식하는지 확인하고 앱의 설치 안내를 따릅니다. 운영체제가 카드를 보지 못하면 앱 패키지보다 드라이버와 시스템 설정을 해결해야 합니다. PyTorch를 직접 설치할 때는 공식 선택기에서 현재 환경에 맞는 명령을 받으세요. 오래된 글의 고정 cuXXX 주소는 Python이나 드라이버 조건이 달라 맞지 않을 수 있습니다.

마지막으로 작은 작업 하나로 실행 경로를 확인합니다. 앱의 장치 정보, 프레임워크의 CUDA 가용성, 작업 중 GPU 사용량을 함께 보면 설치만 된 상태와 실제로 GPU에서 계산되는 상태를 구분하는 데 도움이 됩니다. 짧은 작업은 사용률이 낮게 보일 수 있고 VRAM 점유량만으로 GPU 계산을 증명할 수도 없습니다. 프레임워크 진단과 앱 로그를 함께 읽으세요.

요약 결과에 따라 설치나 장비를 결정합니다

앱이 GPU를 인식하고 같은 문서를 문제없이 요약한다면 CUDA Toolkit을 추가할 필요는 없습니다. 앱이 CUDA를 요구하는데 GPU나 드라이버가 지원 조건을 충족하지 않는다면 해당 앱의 안내에 맞춰 환경을 준비합니다. PyTorch 코드를 개발할 때는 공식 선택기에서 프레임워크와 드라이버를 고르고, CUDA 코드를 컴파일할 때 Toolkit과 nvcc를 준비합니다.

요약 속도가 충분하고 앱에서 원하는 모델을 실행할 수 있다면 지금 장비를 쓰면 됩니다. 앱이 필요한 GPU 경로를 지원하지 않거나 모델과 문맥이 메모리를 넘어 작업을 할 수 없다면, 앱의 지원 조건을 확인한 뒤 장비 변경을 비교하세요. CUDA라는 안내만으로 새 GPU나 툴킷을 살 필요는 없습니다.

용어 각주

  1. CPU — 컴퓨터에서 일반적인 프로그램 명령을 실행하는 중앙 처리 장치입니다. AI 작업에서는 GPU 등 다른 프로세서와 역할을 나누기도 합니다.

    본문으로 돌아가기
  2. CUDA — NVIDIA GPU에서 범용 계산을 실행하기 위한 소프트웨어 플랫폼입니다. CUDA용으로 만든 프로그램은 다른 GPU에서 그대로 동작한다고 보장되지 않습니다.

    본문으로 돌아가기
  3. GPU — 많은 계산을 병렬로 처리하는 프로세서입니다. AI 모델 실행에서는 모델 계산을 맡습니다.

    본문으로 돌아가기
  4. PyTorch — AI 모델을 만들고 실행하는 소프트웨어 프레임워크입니다. 모델과 함께 호환되는 PyTorch 버전 및 하드웨어 지원도 확인해야 합니다.

    본문으로 돌아가기
  5. Metal — Apple 기기에서 그래픽과 GPU 병렬 계산을 실행하는 저수준 기술입니다. 모델을 골라 대화하는 앱 자체와는 다릅니다.

    본문으로 돌아가기
  6. ROCm — AMD GPU에서 AI와 고성능 계산을 실행하는 소프트웨어 플랫폼입니다. 지원 여부는 GPU 모델뿐 아니라 운영체제·드라이버·프레임워크 버전의 조합으로 확인합니다.

    본문으로 돌아가기
  7. WebGPU — 웹 브라우저에서 그래픽과 범용 GPU 계산을 수행하기 위한 웹 표준 API입니다. 브라우저와 기기별 지원 기능은 다를 수 있습니다.

    본문으로 돌아가기
  8. 런타임 — 프로그램이 실행될 때 필요한 기능을 제공하는 소프트웨어 환경입니다. 로컬 AI에서는 모델을 실행하는 엔진을 가리키기도 하며, GPU 런타임 라이브러리와 완성된 서빙 앱은 서로 다른 구성요소입니다.

    본문으로 돌아가기
  9. 오프로딩 — 메모리가 부족할 때 모델 데이터 일부를 GPU 메모리에서 시스템 RAM이나 저장장치로 옮겨 처리하는 방식입니다. 데이터 이동이 추가됩니다.

    본문으로 돌아가기
  10. VRAM — 그래픽카드의 GPU가 사용하는 메모리입니다. 모델 가중치와 계산 중간값을 저장하며 시스템 RAM과 구분됩니다.

    본문으로 돌아가기
  11. KV 캐시 — 어텐션에서 이전 토큰의 키·값을 저장해 다음 토큰 생성 때 재사용하는 메모리입니다. 문맥 길이와 배치 크기에 따라 용량이 달라집니다.

    본문으로 돌아가기
  12. 시스템 RAM — 프로그램이 실행되는 동안 데이터를 임시로 보관하는 시스템 메모리입니다. 저장장치나 독립 GPU의 VRAM과는 다릅니다.

    본문으로 돌아가기
  13. MLX — Apple이 개발하는 머신러닝 프레임워크입니다. Apple silicon에서는 통합 메모리와 Metal을 활용하며, 별도로 Linux 실행 경로도 제공합니다. 지원 모델과 기능은 MLX 기반 도구마다 다릅니다.

    본문으로 돌아가기