録音を文字に、文章を声に。
機器と実行方法を変えて、待ち時間を比べましょう。
qwen3-asr-rs · Metal · BF16
モデルの対応言語: KO · EN · JA +
入力音声 · 共通の英語サンプル
10.2 秒 · English · Qwen3-TTS 1.7B CustomVoice · Aiden
推定処理時間
≈ 2.4 秒
再生時間に対する処理速度
4.3×
推定時間に基づく体験 · モデルの実行ではありません。
開始すると処理の流れを確認できます。0.0 秒 / 2.4 秒
0%
生成済みの共通サンプルです。選択したモデルの音質や認識精度を比較するものではありません。
時間の計算方法と実行条件
公開された処理比率をサンプルの長さに適用しています。ダウンロードとモデル読み込みは含まず、短い音声の固定処理時間や言語・文章の違いで実際の時間は変わります。
M4 · Metal · BF16 · EN/ZH · 3–36s · 3 runs/sample · model already loaded
RTF = 0.230 · 10.2 秒 × 0.230 ≈ 2.4 秒
字幕の表示順は体験用の演出で、単語ごとの実測時刻ではありません。
サンプル音声の利用案内長い音声の場合
1 分の音声
≈ 13.8 秒
10 分の音声
≈ 138.0 秒
60 分の音声
≈ 828.0 秒
同じ処理比率を用いた単純な推定です。
用途に合う音声モデルは?
ガイドではWhisper turbo、Parakeet、Kokoro、Chatterboxの言語と実行条件も比較できます。速度体験は処理時間の根拠がある構成に限っています。