로컬 음성 인식·합성

Qwen3-ASR와 Whisper 비교: 어떤 로컬 받아쓰기를 고를까?

지원 언어가 많다고 내 녹음도 더 정확해지는 것은 아닙니다. 모델 이름이 비슷해도 체크포인트1실행 프로그램2은 다를 수 있습니다. 여기서는 언어 범위, 하드웨어 경로, 공개 속도 수치의 측정 조건을 나눠 봅니다. 검증되지 않은 숫자는 순위에 넣지 않고 어떤 작업에 적합한지 비교합니다.

실행 조건과 핵심 내용
  • Whisper Turbo는 99개 언어를 표기하고 약 6GB VRAM 안내가 있습니다. 음성 번역에는 multilingual Large·Medium을 확인하세요.
  • Qwen3-ASR의 공식 52는 30개 언어와 중국어 방언을 합친 수입니다. 언어와 방언 목록을 따로 읽습니다.
  • Nemotron 3.5의 40 locale 가운데 32개는 즉시 전사 가능, 8개는 추가 적응이 필요합니다. 한국어는 ready tier입니다.

언어 목록과 품질을 구분하기

Whisper Turbo 모델 카드는 99개 언어를 표시합니다. Qwen3-ASR3의 52개는 중국어 방언까지 합친 수입니다. Nemotron 3.5는 40 locale을 준비 단계별로 나눕니다. 숫자만 비교하면 바로 쓸 수 없는 언어까지 같은 수준처럼 보입니다. 필요한 언어가 어떤 tier에 속하는지 확인하세요.

벤치마크를 읽을 때는 대상 데이터, 정규화 규칙과 측정 지표를 함께 확인하세요. 문장 길이와 화자 겹침에 따라 오류율이 달라지고, 같은 언어의 뉴스 낭독 결과가 회의 대화의 정확도를 대신하지 않습니다. 내 용도와 비슷한 평가인지 이 조건으로 판단하면 공개 점수를 실제 녹음 시험과 연결하기 쉽습니다.

두 음성 파형을 띄운 노트북과 마이크, 창가의 책
지원 언어 수와 실제 전사 품질은 다른 주장입니다.

한국어·영어·일본어 밖의 선택

Qwen3-ASR는 아랍어, 인도네시아어, 힌디어, 말레이어, 필리핀어, 페르시아어, 태국어와 베트남어 등을 지원 목록에 둡니다. Nemotron의 바로 쓸 수 있는 tier에는 우크라이나어와 터키어, 아랍어, 힌디어가 있고 broad-coverage에는 폴란드어·스웨덴어·노르웨이어가 있습니다. 그리스어·히브리어·태국어는 Nemotron에서 추가 적응이 필요한 tier입니다.

Whisper는 로컬 실행 선택지가 넓습니다

Whisper 가중치는 MIT로 배포됩니다. whisper.cpp는 Apple Silicon Metal·Core ML, CPU4, NVIDIA CUDA5를 지원합니다. faster-whisper는 CTranslate2 기반으로 CUDA, CPU, int8을 제공하지만 upstream Metal 지원은 확인되지 않았습니다. 같은 모델이어도 런타임에 따라 파일 변환, 메모리, 속도가 달라질 수 있습니다.

faster-whisper의 설치와 CUDA 의존성은 공식 README에 적힌 현재 버전을 따릅니다. 이전 환경에서 복사한 CUDA·cuDNN 조합은 충돌을 만들 수 있으므로 새 가상환경6에서 설치하는 편이 낫습니다. whisper.cpp는 모델을 GGML 형식으로 변환해 쓰기 때문에 원래 Hugging Face 체크포인트 파일과 저장 크기를 바로 비교하지 마세요.

미니 컴퓨터에 연결된 녹음기와 메모 카드
모델과 런타임의 조건을 따로 확인합니다.

Qwen3-ASR의 작은 모델과 공식 한계

Qwen3-ASR 0.6B와 1.7B는 Apache-2.0 모델이며 한국어를 포함합니다. 공식 구현은 오프라인과 streaming 예시를 제공합니다. 빠른 GPU7 서버에는 vLLM을 권하지만 일반 Mac 가속 앱을 뜻하지 않습니다. 0.6B의 Hugging Face 파일은 1.88GB이고 이는 실행 중 필요한 메모리가 아닙니다. 공식 기기별 속도 자료는 확인되지 않았습니다.

커뮤니티 `qwen3-asr-rs`는 Qwen 가중치를 Rust/Candle과 Metal로 실행하는 제3자 포트입니다. M4 Mac mini 16GB의 짧은 영어·중국어 측정은 공식 Python 구현이나 한국어 결과가 아닙니다.

사이트의 Mac 속도 체험은 이 제3자 Metal 포트에서 관찰된 값을 조건부로 환산한 참고치이므로, 공식 모델 사용 시 같은 시간을 기대하지 말고 직접 시험하세요.

Nemotron과 Parakeet의 입력 방식

Nemotron 3.5는 한국어 등 40 locale에서 cache-aware streaming을 지원하고 19개 locale은 transcription-ready, 13개는 broad-coverage, 8개는 adaptation-ready입니다. Parakeet TDT v3는 25개 유럽 언어를 전체 발화 방식으로 처리하며 이 런타임에서 cache-aware streaming은 없습니다.

Parakeet CTC 1.1B는 영어 전용입니다.

공개 속도는 서로 다른 질문에 답합니다

faster-whisper RTX 3070 Ti 수치는 13분 파일의 처리 완료시간과 VRAM8입니다. NVIDIA Nemotron의 H100 수치는 설정별 동시 실시간 stream 수입니다. 하나는 파일 하나가 끝나는 데 걸린 시간이고, 다른 하나는 서버가 동시에 처리한 연결 수이므로 구매나 작업 방식에 맞는 지표를 골라 비교하세요.

RTF9는 추론시간을 오디오 길이로 나눈 값이라 1보다 작으면 파일 길이보다 빨리 끝났다는 뜻입니다. 처음 모델을 내려받고 불러오는 시간은 보통 이 비율에 포함되지 않으므로 실제 첫 작업 시간과 구분하세요. 실시간 음성에서는 첫 글자가 보이기까지의 지연과 파일 전체 완료시간을 함께 확인해야 사용감을 판단할 수 있습니다.

전사문을 검토하는 돋보기와 녹음기, 헤드폰
클립 처리시간과 서버 동시성은 다른 척도입니다.

용어 각주

  1. 체크포인트학습된 모델의 가중치 등을 저장한 파일입니다. 같은 모델 계열도 버전이나 용도에 따라 다른 체크포인트를 쓸 수 있습니다.

    본문으로 돌아가기
  2. 실행 프로그램모델 파일을 읽고 연산을 실행하는 소프트웨어입니다. 지원 형식, 하드웨어와 최적화 기능은 런타임마다 다릅니다.

    본문으로 돌아가기
  3. 자동 음성 인식음성에서 발화를 인식해 텍스트로 변환하는 기술입니다. 인식 결과는 발화 내용을 나타내며 음향 자체를 복원하는 것은 아닙니다.

    본문으로 돌아가기
  4. CPU컴퓨터에서 일반적인 프로그램 명령을 실행하는 중앙 처리 장치입니다. AI 작업에서는 GPU 등 다른 프로세서와 역할을 나누기도 합니다.

    본문으로 돌아가기
  5. CUDANVIDIA GPU에서 범용 계산을 실행하기 위한 소프트웨어 플랫폼입니다. CUDA용으로 만든 프로그램은 다른 GPU에서 그대로 동작한다고 보장되지 않습니다.

    본문으로 돌아가기
  6. Python 가상환경프로젝트별로 Python 패키지를 분리해 설치하는 공간입니다. 패키지 버전 충돌을 줄이며 가상 머신과는 다릅니다.

    본문으로 돌아가기
  7. GPU많은 계산을 병렬로 처리하는 프로세서입니다. AI 모델 실행에서는 모델 계산을 맡습니다.

    본문으로 돌아가기
  8. VRAM그래픽카드의 GPU가 사용하는 메모리입니다. 모델 가중치와 계산 중간값을 저장하며 시스템 RAM과 구분됩니다.

    본문으로 돌아가기
  9. 실시간 계수생성에 걸린 시간을 출력의 재생 시간으로 나눈 값입니다. 조건을 맞춰 비교할 때 값이 작을수록 생성이 빠릅니다.

    본문으로 돌아가기