로컬 음성 인식·합성
Qwen3-TTS 로컬 실행: 사전 음색부터 음성 설계까지
녹음 없이 제공 화자로 원고를 읽고 싶다면 CustomVoice, 설명문으로 목소리를 설계하고 싶다면 1.7B VoiceDesign, 허락받은 참조 음성에 맞추고 싶다면 Base를 살펴보세요. 먼저 목표 언어와 작업을 고르고, 그 경로를 지원하는 실행기를 확인한 다음 짧은 문장을 생성해 발음과 말투를 들어보는 순서로 시작합니다.
세 가지 생성 경로 중 내 작업 고르기
공식 공개 목록을 보면 CustomVoice는 0.6B와 1.7B, Base는 0.6B와 1.7B로 제공되며 VoiceDesign은 1.7B만 확인됩니다. CustomVoice는 제공 화자 중에서 고르고, VoiceDesign은 자연어 지시로 목소리 특징을 정합니다.
Base는 참조 오디오로 화자를 맞춥니다. 한국어 원고를 읽을 때는 공식 화자 목록에서 한국어 화자인 Sohee를 선택할 수 있습니다.
Base 예제의 짧은 참조 음성은 모델 입력의 한 조건이지, 결과 품질의 보증이 아닙니다. 다른 사람의 목소리를 다룰 때는 명시적 동의를 확인하세요. 처음 시험할 때는 모델 제공 화자를 먼저 써보고, 참조 파일을 넣는 기능은 본인 또는 허락받은 녹음에만 사용합니다.

언어와 모델 크기 확인
공식 목록은 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어 등 10개 언어를 듭니다. 한국어가 필요하면 Qwen3-TTS1의 CustomVoice·Base 또는 한국어를 포함하는 Chatterbox Multilingual V3를 우선 시험할 수 있습니다.
Kokoro의 공식 언어 목록에는 한국어가 없으므로 한국어 낭독용 후보로 보지 마세요. 언어 포함 여부와 내 문장에서의 발음 품질은 별개입니다.
작은 모델과 큰 모델 가운데 무엇이 적합한지는 발표된 언어 목록만으로 결정할 수 없습니다. 내 문장과 화자 설정에서 발음 정확성, 자연스러운 쉼, 수정 횟수를 비교하세요. 모델이 내 컴퓨터에 로드되는 것과 장시간 원고를 안정적으로 만들 수 있는 것도 다른 조건입니다.
공식 Python·CUDA 경로 설치
공식 quick start는 격리된 Python 3.12 환경에서 `pip install -U qwen-tts`를 실행하도록 안내합니다. 소스 수정이 필요 없다면 저장소를 복제해 editable 설치를 하기보다 패키지 설치로 시작할 수 있습니다. 설치는 가중치 다운로드와 첫 모델 로드까지 포함해 상당한 대기가 생길 수 있으므로, 이를 합성 시간과 별도 기록하세요.
CUDA2 예제는 `device_map="cuda:0"`, `dtype=torch.bfloat163`, 선택적 `attn_implementation="flash_attention_2"`를 사용합니다. FlashAttention4 2는 호환되는 GPU5와 정밀도가 필요하다고 README가 명시하므로 무조건 켜지 않습니다.
Windows/Linux NVIDIA 경로에 관한 예제이며, 이 내용만으로 RTX 모델별 시간이나 최소 메모리를 주장할 수는 없습니다.
qwen-tts-demo Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice --ip 127.0.0.1 --port 8000
Mac이나 CPU만 있는 장비에서 가능한지
Apple Silicon에서 Qwen3-TTS를 시험하려면 별도 MLX6 실행기인 MLX-Audio의 community 변환본을 사용할 수 있습니다. 0.6B와 1.7B CustomVoice 변환 체크포인트7가 안내되어 있으며, 이는 Qwen upstream의 원본 가중치·공식 CUDA 실행기와 다른 배포 경로입니다. 설치 전 배포자, 변환 시점, 지원 화자와 옵션을 확인하고, 공식 빠른 시작은 Python/CUDA 경로와 구분해서 보세요.
Mac을 구매할지 결정하기 전, 현재 Apple Silicon에서 MLX-Audio의 Qwen 변환본이나 Kokoro·Chatterbox의 문서화된 경로를 직접 시험해 보세요. 특히 변환본은 설치와 생성이 되는지, 한국어 화자·기능이 필요한 수준인지 먼저 확인합니다. overview 가이드의 MLX-Audio 예제는 0.6B CustomVoice로 짧게 시작하는 절차를 보여줍니다.
97ms와 스트리밍 측정 읽기
README의 97ms는 한 글자 입력 뒤 첫 오디오 패킷을 낼 수 있다는 낮은 지연 설명과 함께 나옵니다. 이 수치에 장치, 텍스트 길이, batch, 정밀도, 반복 횟수, 측정 경계가 함께 공개되어 있지 않습니다. 그래서 짧은 대화 턴에서의 첫 응답성을 설명하는 주장으로만 읽고, 전체 문장이 끝나는 속도나 장문 합성 시간으로 옮겨 쓰지 않습니다.
직접 잴 때는 첫 음성이 도착한 시각과 마지막 음성 조각이 도착한 시각을 따로 기록합니다. 필요하면 모델 로드, 전처리, 생성, 디코드8, WAV 저장도 나누어 측정합니다. 모델 준비 후 요청은 콜드 스타트와 별도 열에 두고, 같은 문장·화자·설정으로 여러 번 반복합니다.

복제 음성과 공개할 결과물 다루기
참조 음성은 본인 목소리나 명시적으로 동의받은 녹음만 사용합니다. 동의를 얻었더라도 생성물이 원화자의 발언이나 승인을 받은 것처럼 오해되지 않도록 맥락을 밝혀야 할 수 있습니다. 참조 오디오는 공개 서버에 올리지 말고, 처음에는 제공 화자로 로컬에서 시험하세요.
저장소의 Apache-2.0 표시는 코드 라이선스를 말합니다. 다운로드할 특정 모델 카드에도 같은 조건이 적혀 있는지 확인하고, 음성·텍스트 자료의 권리와 배포 조건도 따로 검토하세요. 생성 모델 라이선스가 입력 녹음이나 출력물의 모든 권리 문제를 대신 해결해주지는 않습니다.
용어 각주
음성 합성 — 텍스트를 발음과 운율을 가진 음성 신호로 변환하는 기술입니다. 출력 음성의 특성은 모델과 설정에 따라 다릅니다.
본문으로 돌아가기CUDA — NVIDIA GPU에서 범용 계산을 실행하기 위한 소프트웨어 플랫폼입니다. CUDA용으로 만든 프로그램은 다른 GPU에서 그대로 동작한다고 보장되지 않습니다.
본문으로 돌아가기BF16 — 모델의 수를 저장하고 계산하는 16비트 부동소수점 형식입니다. 사용 가능 여부는 하드웨어와 실행 프로그램에 달려 있습니다.
본문으로 돌아가기FlashAttention — 어텐션 계산에서 메모리 접근을 효율화하는 구현입니다. 사용 가능 여부와 효과는 하드웨어, 모델, 실행 환경에 따라 다릅니다.
본문으로 돌아가기GPU — 많은 계산을 병렬로 처리하는 프로세서입니다. AI 모델 실행에서는 모델 계산을 맡습니다.
본문으로 돌아가기MLX — Apple silicon용 머신러닝 프레임워크입니다. Apple silicon의 통합 메모리 구조를 활용하며, 지원 모델과 기능은 MLX 도구별로 다릅니다.
본문으로 돌아가기체크포인트 — 학습된 모델의 가중치 등을 저장한 파일입니다. 같은 모델 계열도 버전이나 용도에 따라 다른 체크포인트를 쓸 수 있습니다.
본문으로 돌아가기디코드 — LLM에서는 입력 처리 뒤 출력 토큰을 생성하는 단계를 뜻합니다. VAE나 오디오 코덱에서는 압축 표현이나 인코딩 데이터를 원래 형식으로 복원하는 처리를 가리킬 수 있습니다.
본문으로 돌아가기