ローカル音声認識・音声合成
Qwen3-TTSをローカルで使う:プリセット音声から声の設計まで
参照録音を使わず付属話者で読むならCustomVoice、文章で声を設計するなら1.7B VoiceDesign、許諾済みの参照音声に合わせるならBaseを検討します。必要な言語と用途を決め、対応する実行環境を確認してから短文を生成し、発音や話し方を聴いて確かめます。
三つの生成経路から用途に合うものを選ぶ
公式の公開一覧ではCustomVoiceとBaseは0.6B・1.7B、VoiceDesignは1.7Bのみです。CustomVoiceは付属話者を選び、VoiceDesignは自然言語で声の特徴を指定し、Baseは参照音声で話者を合わせます。韓国語原稿では、公式話者一覧にある韓国語話者Soheeを選べます。
Base例にある短い参照音声は入力条件であり、出力品質の保証ではありません。他人の声を使う際は明確な許諾を得てください。最初は付属話者で試し、参照音声機能は自分の録音か許諾を得た素材だけに使います。

言語とモデルサイズを確認する
公式一覧には韓国語を含む10言語が記載されています。韓国語が必要ならQwen3-TTS1 CustomVoice・Base、または韓国語を掲げるChatterbox Multilingual V3を試します。Kokoroの公式言語一覧には韓国語がないため、韓国語読み上げ用には選ばないでください。対応表記と自分の文章での発音品質は別です。
言語一覧だけでは小さい版と大きい版のどちらが適するか決められません。自分の文章と話者設定で発音、間、修正回数を比べます。一度読み込めることと、長い原稿を安定して作れることも別の条件です。
公式Python・CUDA経路を準備する
公式クイックスタートは隔離したPython 3.12環境で`pip install -U qwen-tts`を実行します。ソースを変更しないなら、編集可能なソース導入ではなくパッケージから始められます。依存関係、重みの取得、初回ロードは待ち時間になるため、合成時間とは分けて記録します。
CUDA2例は`device_map="cuda:0"`、`dtype=torch.bfloat163`、任意の`attn_implementation="flash_attention_2"`を使います。READMEはFlashAttention4 2に対応機材と精度が必要と記載しているため、無条件に有効化しません。これはNVIDIA経路の例であり、RTX各機種の時間や最低メモリの保証ではありません。
qwen-tts-demo Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice --ip 127.0.0.1 --port 8000
MacやCPUのみの機材で使えるか
Apple SiliconでQwen3-TTSを試す場合は、別のMLX5実行環境であるMLX-Audioを通じてコミュニティ変換版を利用できます。0.6B・1.7B CustomVoiceの変換チェックポイント6が案内されていますが、Qwen upstreamの重みや公式CUDA実行環境とは別の配布経路です。導入前に配布元、変換時期、話者やオプションを確認し、公式Python・CUDAクイックスタートとは区別してください。
Macを購入するか決める前に、手元のApple SiliconでMLX-AudioのQwen変換版、またはKokoro・Chatterboxの案内された経路を試してください。導入と合成が動くか、変換版に必要な韓国語話者や機能が含まれるかも確認します。概要ガイドのMLX-Audio例は0.6B CustomVoiceで短く試す手順です。
97msの主張を正しく読む
READMEの97msは、一文字入力後に最初の音声パケットを出せるという低遅延の説明に添えられています。機材、文章長、バッチ、精度、反復回数、計測範囲は併記されていません。ストリーミングの初回応答に関する主張として読み、文全体や長文の完了速度に置き換えません。
自分で測る場合は、最初の音声と最終チャンクの到着時刻を別々に記録します。必要ならモデルロード、前処理、生成、デコード7、WAV保存も分けます。ウォーム状態のリクエストはコールドスタートと別欄にし、同じ文章・話者・設定を複数回試します。

複製音声と公開音声を慎重に扱う
参照音声は自分の声、または明示的な許諾を得た録音だけを使います。許諾があっても、生成音声が本人の実際の発言や推薦と誤解されないよう文脈を示す必要がある場合があります。参照音声を公開サーバーへアップロードせず、まず付属話者をローカルで試してください。
リポジトリのApache-2.0表記はコードのライセンスです。取得するチェックポイントのカードも確認し、録音・文章・配布の権利は別途検討します。モデルのライセンスが入力音声や生成音声の権利問題をすべて解決するわけではありません。
用語の注釈
音声合成 — テキストを発音や韻律を伴う音声信号に変換する技術です。出力音声の特性はモデルや設定によって異なります。
本文に戻るCUDA — NVIDIA GPUで汎用計算を行うソフトウェア基盤です。CUDA向けのプログラムが他のGPUでそのまま動くとは限りません。
本文に戻るBF16 — モデルの数値を保存・計算する16ビット浮動小数点形式です。利用可否はハードウェアと実行環境によります。
本文に戻るFlashAttention — Attention計算のメモリアクセスを効率化する実装です。利用可否や効果はハードウェア、モデル、実行環境によって異なります。
本文に戻るMLX — Apple silicon向けの機械学習フレームワークです。統合メモリ構造を活用し、対応モデルや機能はMLXの各ツールで異なります。
本文に戻るチェックポイント — 学習済みモデルの重みなどを保存したファイルです。同じモデル系列でも、版や用途によって異なるチェックポイントを使うことがあります。
本文に戻るデコード — LLMでは入力処理後に出力トークンを生成する段階です。VAEやオーディオコーデックでは、圧縮表現や符号化データから元の形式を復元する処理を指すことがあります。
本文に戻る