로컬 음성 인식·합성
로컬 AI 음성 인식 가이드: 내 PC에서 받아쓰기
강의나 인터뷰를 다시 들으며 받아쓰는 일은 시간이 오래 걸립니다. 로컬 음성 인식은 녹음 파일을 내 컴퓨터에서 처리해 텍스트로 바꾸는 방법입니다. 필요한 언어, 실행 프로그램1, 현재 컴퓨터에서 처리하는 시간을 먼저 확인하세요. 공개된 속도 수치도 측정 조건을 함께 읽어야 내 작업에 맞는지 판단할 수 있습니다.
어떤 음성을 글로 바꾸고 싶나요?
먼저 실제로 쓸 음성을 하나 고릅니다. 짧은 메모, 잡음이 있는 인터뷰, 영어와 한국어가 섞인 강의는 난도가 다릅니다. 시험에는 사용하는 언어와 녹음 환경에 가까운 소재, 기준 문장을 준비하세요. 짧은 음성만으로 긴 회의에서도 정확하다고 보장할 수 없습니다.
두세 번 반복되는 고유명사와 숫자를 기준 문장에 넣으면 인식 오류를 찾기 쉽습니다. 결과가 틀린 위치뿐 아니라 원인이 소음인지, 억양인지, 말이 겹친 것인지 메모하세요. 모델을 바꿀 때도 같은 음성을 다시 써야 변화가 실행 프로그램 때문인지 입력 때문인지 구분할 수 있습니다.

모델 이름보다 언어 범위를 읽기
Whisper Large-v3-Turbo는 한국어·영어·일본어를 포함한 99개 언어 모델로 표시됩니다. Qwen3-ASR2는 한국어 외에 아랍어, 힌디어, 인도네시아어, 베트남어, 페르시아어 등을 명시합니다. 공식 지원 목록은 쓸 수 있다는 출발점이지, 모든 억양과 전문용어에서 같은 품질이라는 보증은 아닙니다.
프로그램마다 맥과 GPU 지원이 다릅니다
whisper.cpp는 Apple Silicon의 Metal·Core ML, CPU3, NVIDIA CUDA4를 문서화합니다. faster-whisper는 CPU와 NVIDIA CUDA 실행을 지원하며 공식 Metal 경로는 확인되지 않았습니다. Qwen3-ASR는 vLLM GPU5 경로를 빠른 서버 실행으로 권장합니다.
모델이 Mac에서 실행된다는 사실과 공식 Mac 가속 지원은 구분해야 합니다.
처음 설치할 때 모델 가중치와 Python 패키지를 내려받고, 로컬 파일을 명시적으로 선택하는지 확인합니다. 앱에 클라우드 전사, 계정 동기화, 오류 보고가 함께 들어 있을 수도 있습니다. 민감한 기록을 다룬다면 마이크 입력부터 저장된 전사문까지 네트워크 요청과 저장 위치를 점검한 뒤 사용하세요.

짧은 파일로 설치 확인하기
faster-whisper는 Python 가상환경6에 설치해 짧은 WAV 파일부터 시험할 수 있습니다. CPU 전용에서는 `compute_type="int8"`를 선택합니다.
아래 예제의 파일 이름을 내 WAV 경로로 바꾸세요. 첫 실행은 모델 가중치를 내려받으므로 인터넷 연결이 필요합니다.
NVIDIA GPU를 쓸 때는 CUDA 12용 cuBLAS와 cuDNN 9가 필요하며, 원본 Whisper 설치에는 FFmpeg가 필요합니다.
python3 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip
python -m pip install faster-whisperfrom faster_whisper import WhisperModel
model = WhisperModel("small", device="cpu", compute_type="int8")
segments, info = model.transcribe("sample.wav", language="ko", beam_size=5)
for segment in segments:
print(f"{segment.start:.2f}–{segment.end:.2f} {segment.text}")공개 속도 수치의 조건 읽기

정확도는 내 언어와 녹음으로 확인하기
영어는 주로 단어 오류율(WER), 한국어와 일본어는 글자 오류율(CER)로 비교합니다. 띄어쓰기, 숫자, 문장부호의 정규화 방식도 적어두세요. 공개 벤치마크는 특정 데이터셋의 결과입니다. 이름, 제품명, 여러 언어가 섞이는 상황처럼 내 작업의 중요 항목을 짧은 시험 음성에 포함해 직접 오류를 살펴보세요.
터보라는 이름은 긴 원본 모델과 다른 실행 특성을 가리키지만, 작은 모델이 언제나 더 정확하거나 더 빠르다는 뜻은 아닙니다. 받아쓰기 정확도와 자동 번역 정확도도 다른 작업입니다. 특히 Whisper Turbo는 음성을 원어 텍스트로 옮기는 용도로 보고, 다른 언어로 번역하려면 공식 안내에서 Large나 Medium을 확인하세요.
용어 각주
실행 프로그램 — 모델 파일을 읽고 연산을 실행하는 소프트웨어입니다. 지원 형식, 하드웨어와 최적화 기능은 런타임마다 다릅니다.
본문으로 돌아가기자동 음성 인식 — 음성에서 발화를 인식해 텍스트로 변환하는 기술입니다. 인식 결과는 발화 내용을 나타내며 음향 자체를 복원하는 것은 아닙니다.
본문으로 돌아가기CPU — 컴퓨터에서 일반적인 프로그램 명령을 실행하는 중앙 처리 장치입니다. AI 작업에서는 GPU 등 다른 프로세서와 역할을 나누기도 합니다.
본문으로 돌아가기CUDA — NVIDIA GPU에서 범용 계산을 실행하기 위한 소프트웨어 플랫폼입니다. CUDA용으로 만든 프로그램은 다른 GPU에서 그대로 동작한다고 보장되지 않습니다.
본문으로 돌아가기GPU — 많은 계산을 병렬로 처리하는 프로세서입니다. AI 모델 실행에서는 모델 계산을 맡습니다.
본문으로 돌아가기Python 가상환경 — 프로젝트별로 Python 패키지를 분리해 설치하는 공간입니다. 패키지 버전 충돌을 줄이며 가상 머신과는 다릅니다.
본문으로 돌아가기FP16 — 16비트 부동소수점 수치 형식입니다. BF16과 비트 수는 같지만 지수부와 유효숫자 배분이 다릅니다.
본문으로 돌아가기VRAM — 그래픽카드의 GPU가 사용하는 메모리입니다. 모델 가중치와 계산 중간값을 저장하며 시스템 RAM과 구분됩니다.
본문으로 돌아가기양자화 — 모델의 수치를 더 적은 비트로 표현하는 방법입니다. 메모리 사용량과 함께 정확도나 실행 속도도 달라질 수 있으며, 영향은 형식과 구현에 따릅니다.
본문으로 돌아가기