로컬 음성 인식·합성

로컬 AI 음성 인식 가이드: 내 PC에서 받아쓰기

강의나 인터뷰를 다시 들으며 받아쓰는 일은 시간이 오래 걸립니다. 로컬 음성 인식은 녹음 파일을 내 컴퓨터에서 처리해 텍스트로 바꾸는 방법입니다. 필요한 언어, 실행 프로그램1, 현재 컴퓨터에서 처리하는 시간을 먼저 확인하세요. 공개된 속도 수치도 측정 조건을 함께 읽어야 내 작업에 맞는지 판단할 수 있습니다.

실행 조건과 핵심 내용
  • Qwen3-ASR는 ‘52개 언어’라고 단순화하지 마세요. 공식 표의 52는 30개 언어와 중국어 방언을 합친 수입니다.
  • faster-whisper의 공개 속도는 RTX 3070 Ti에서 Large-v2로 잰 13분 음성의 전체 처리시간입니다. Turbo 결과가 아닙니다.
  • 오프라인 사용도 최초 설치와 모델 다운로드에는 인터넷이 필요할 수 있습니다. 내려받은 뒤 연결을 끊어 다시 확인하세요.

어떤 음성을 글로 바꾸고 싶나요?

먼저 실제로 쓸 음성을 하나 고릅니다. 짧은 메모, 잡음이 있는 인터뷰, 영어와 한국어가 섞인 강의는 난도가 다릅니다. 시험에는 사용하는 언어와 녹음 환경에 가까운 소재, 기준 문장을 준비하세요. 짧은 음성만으로 긴 회의에서도 정확하다고 보장할 수 없습니다.

두세 번 반복되는 고유명사와 숫자를 기준 문장에 넣으면 인식 오류를 찾기 쉽습니다. 결과가 틀린 위치뿐 아니라 원인이 소음인지, 억양인지, 말이 겹친 것인지 메모하세요. 모델을 바꿀 때도 같은 음성을 다시 써야 변화가 실행 프로그램 때문인지 입력 때문인지 구분할 수 있습니다.

녹음기와 미니 컴퓨터, 펼친 노트가 놓인 나무 책상
내 작업에 가까운 음성으로 먼저 짧게 시험합니다.

모델 이름보다 언어 범위를 읽기

Whisper Large-v3-Turbo는 한국어·영어·일본어를 포함한 99개 언어 모델로 표시됩니다. Qwen3-ASR2는 한국어 외에 아랍어, 힌디어, 인도네시아어, 베트남어, 페르시아어 등을 명시합니다. 공식 지원 목록은 쓸 수 있다는 출발점이지, 모든 억양과 전문용어에서 같은 품질이라는 보증은 아닙니다.

프로그램마다 맥과 GPU 지원이 다릅니다

whisper.cpp는 Apple Silicon의 Metal·Core ML, CPU3, NVIDIA CUDA4를 문서화합니다. faster-whisper는 CPU와 NVIDIA CUDA 실행을 지원하며 공식 Metal 경로는 확인되지 않았습니다. Qwen3-ASR는 vLLM GPU5 경로를 빠른 서버 실행으로 권장합니다.

모델이 Mac에서 실행된다는 사실과 공식 Mac 가속 지원은 구분해야 합니다.

처음 설치할 때 모델 가중치와 Python 패키지를 내려받고, 로컬 파일을 명시적으로 선택하는지 확인합니다. 앱에 클라우드 전사, 계정 동기화, 오류 보고가 함께 들어 있을 수도 있습니다. 민감한 기록을 다룬다면 마이크 입력부터 저장된 전사문까지 네트워크 요청과 저장 위치를 점검한 뒤 사용하세요.

접힌 담요 위의 녹음기와 헤드폰, 창가의 노트
같은 모델도 실행 프로그램에 따라 가속 경로가 다릅니다.

짧은 파일로 설치 확인하기

faster-whisper는 Python 가상환경6에 설치해 짧은 WAV 파일부터 시험할 수 있습니다. CPU 전용에서는 `compute_type="int8"`를 선택합니다.

아래 예제의 파일 이름을 내 WAV 경로로 바꾸세요. 첫 실행은 모델 가중치를 내려받으므로 인터넷 연결이 필요합니다.

NVIDIA GPU를 쓸 때는 CUDA 12용 cuBLAS와 cuDNN 9가 필요하며, 원본 Whisper 설치에는 FFmpeg가 필요합니다.

CPU int8 환경 설치
python3 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip
python -m pip install faster-whisper
macOS/Linux 셸 예시입니다. Windows에서는 가상환경의 Scripts\Activate.ps1을 실행하세요.
짧은 WAV 전사
from faster_whisper import WhisperModel

model = WhisperModel("small", device="cpu", compute_type="int8")
segments, info = model.transcribe("sample.wav", language="ko", beam_size=5)
for segment in segments:
    print(f"{segment.start:.2f}–{segment.end:.2f}  {segment.text}")
sample.wav를 준비하세요. language=ko는 한국어를 지정합니다. 다른 언어는 ko를 en 또는 ja 등으로 바꾸세요. 첫 실행의 모델 다운로드 시간은 전사시간과 따로 보세요.

공개 속도 수치의 조건 읽기

SYSTRAN은 RTX 3070 Ti 8GB, CUDA 12.4에서 13분 음성을 처리한 faster-whisper 측정을 공개했습니다. Large-v2 FP167은 batch 1에서 63초·4,525MB VRAM8, batch 8에서 17초·6,090MB였습니다. batch 8은 분할 음성 묶음의 설정이지 실시간 사용자 8명의 연결이 아닙니다.

입력과 양자화9, 모델 버전이 바뀌면 결과도 달라집니다.

선반 위의 미니 컴퓨터와 데스크톱, 그 사이에 놓인 헤드폰
모델, 입력, batch 조건을 측정시간과 함께 적습니다.

정확도는 내 언어와 녹음으로 확인하기

영어는 주로 단어 오류율(WER), 한국어와 일본어는 글자 오류율(CER)로 비교합니다. 띄어쓰기, 숫자, 문장부호의 정규화 방식도 적어두세요. 공개 벤치마크는 특정 데이터셋의 결과입니다. 이름, 제품명, 여러 언어가 섞이는 상황처럼 내 작업의 중요 항목을 짧은 시험 음성에 포함해 직접 오류를 살펴보세요.

터보라는 이름은 긴 원본 모델과 다른 실행 특성을 가리키지만, 작은 모델이 언제나 더 정확하거나 더 빠르다는 뜻은 아닙니다. 받아쓰기 정확도와 자동 번역 정확도도 다른 작업입니다. 특히 Whisper Turbo는 음성을 원어 텍스트로 옮기는 용도로 보고, 다른 언어로 번역하려면 공식 안내에서 Large나 Medium을 확인하세요.

용어 각주

  1. 실행 프로그램모델 파일을 읽고 연산을 실행하는 소프트웨어입니다. 지원 형식, 하드웨어와 최적화 기능은 런타임마다 다릅니다.

    본문으로 돌아가기
  2. 자동 음성 인식음성에서 발화를 인식해 텍스트로 변환하는 기술입니다. 인식 결과는 발화 내용을 나타내며 음향 자체를 복원하는 것은 아닙니다.

    본문으로 돌아가기
  3. CPU컴퓨터에서 일반적인 프로그램 명령을 실행하는 중앙 처리 장치입니다. AI 작업에서는 GPU 등 다른 프로세서와 역할을 나누기도 합니다.

    본문으로 돌아가기
  4. CUDANVIDIA GPU에서 범용 계산을 실행하기 위한 소프트웨어 플랫폼입니다. CUDA용으로 만든 프로그램은 다른 GPU에서 그대로 동작한다고 보장되지 않습니다.

    본문으로 돌아가기
  5. GPU많은 계산을 병렬로 처리하는 프로세서입니다. AI 모델 실행에서는 모델 계산을 맡습니다.

    본문으로 돌아가기
  6. Python 가상환경프로젝트별로 Python 패키지를 분리해 설치하는 공간입니다. 패키지 버전 충돌을 줄이며 가상 머신과는 다릅니다.

    본문으로 돌아가기
  7. FP1616비트 부동소수점 수치 형식입니다. BF16과 비트 수는 같지만 지수부와 유효숫자 배분이 다릅니다.

    본문으로 돌아가기
  8. VRAM그래픽카드의 GPU가 사용하는 메모리입니다. 모델 가중치와 계산 중간값을 저장하며 시스템 RAM과 구분됩니다.

    본문으로 돌아가기
  9. 양자화모델의 수치를 더 적은 비트로 표현하는 방법입니다. 메모리 사용량과 함께 정확도나 실행 속도도 달라질 수 있으며, 영향은 형식과 구현에 따릅니다.

    본문으로 돌아가기