ローカル音声認識・音声合成

Qwen3-ASRとWhisperを比較:どのローカル文字起こしを選ぶ?

対応言語が多いモデルだからといって、録音をより正確に文字にできるとは限りません。似たモデル名でもチェックポイント1や実行ソフトが異なります。言語、実行環境、公開速度の測定条件を分けて見て、未検証の順位を避けながら用途に合うモデルを比べます。

実行条件と要点
  • Whisper Turboは99言語と約6GB VRAMを掲げます。音声翻訳には多言語Large・Mediumを確認します。
  • Qwen3-ASRの公式な52は30言語と中国語の方言を合計した数です。言語と方言の一覧を分けて読みましょう。
  • Nemotron 3.5の40ロケールのうち32はすぐに文字起こしでき、8は追加適応が必要です。韓国語は対応済みの層です。

言語対応と品質を分けて考える

Whisper Turboのモデルカードは99言語を挙げます。Qwen3-ASR2の52には中国語の方言も含まれます。Nemotron 3.5は40ロケールを対応段階に分けます。数だけでは未対応に近い言語まで同等に見えるため、必要な言語の段階を確かめましょう。

ベンチマークは対象データ、正規化規則、指標と一緒に確認します。文の長さや発話の重なりで誤り率は変わり、同じ言語のニュース音声も会議の精度を示すものではありません。こうした条件から公開スコアが自分の録音試験に役立つか判断しましょう。

二つの音声波形を表示するノートパソコンとマイク、窓辺の本
対応言語数と文字起こし品質は別の主張です。

韓国語・英語・日本語以外の選択肢

Qwen3-ASRはアラビア語、インドネシア語、ヒンディー語、マレー語、フィリピン語、ペルシャ語、タイ語、ベトナム語などを挙げます。Nemotronの対応済み層はウクライナ語、トルコ語、アラビア語、ヒンディー語、広範囲対応層はポーランド語、スウェーデン語、ノルウェー語です。ギリシャ語、ヘブライ語、タイ語は追加適応が必要です。

Whisperはローカル実行環境を選びやすい

Whisperの重みはMITで公開されています。whisper.cppはApple SiliconのMetal・Core ML、CPU3、NVIDIA CUDA4に対応します。faster-whisperはCTranslate2でCUDA・CPU・int8を提供しますが、公式Metal対応は確認できませんでした。実行ソフトによって変換、メモリ、速度が変わります。

faster-whisperの導入やCUDA依存関係は公式READMEの現行手順に従います。以前のCUDA・cuDNN構成を流用すると競合する場合があるため、新しい仮想環境5が便利です。whisper.cppはGGML変換モデルを使うので、Hugging Faceの元チェックポイントとダウンロード容量を直接比べないでください。

小型コンピューターにつないだ録音機とメモカード
モデルと実行ソフトの条件を別々に確認します。

Qwen3-ASRの小型モデルと注意点

Qwen3-ASR 0.6Bと1.7Bは韓国語を含むApache-2.0モデルで、公式にオフラインとstreamingの例があります。高速GPU6サーバーにはvLLMを推奨しますが、Mac用高速化アプリという意味ではありません。0.6Bのファイルは1.88GBで、実行時メモリとは別です。公式の端末別速度値は確認できませんでした。

コミュニティの`qwen3-asr-rs`はQwenの重みをRust/CandleとMetalで動かす第三者ポートです。M4 Mac miniでの短い英語・中国語の測定は、公式Python実装や韓国語音声の結果ではありません。サイトのMac速度体験は第三者Metalポートでの観測値を条件付きで換算した参考です。公式実装で同じ時間になると考えず、ご自身の環境で試してください。

NemotronとParakeetの入力方式

Nemotron 3.5は40ロケールでcache-aware streamingに対応し、19は対応済み、13は広範囲対応、8は追加適応が必要です。Parakeet TDT v3は25の欧州言語を発話全体で処理し、この実行環境ではcache-aware streamingに対応しません。Parakeet CTC 1.1Bは英語専用です。

公開速度は異なる問いに答える

faster-whisperのRTX 3070 Ti値は13分ファイル一本の完了時間とVRAM7です。NVIDIAのH100値は設定別の同時リアルタイムstream数です。一方は一つのジョブ、他方はサーバーの処理能力なので、作業や購入の目的に合う指標を選びましょう。

RTF8は推論時間を音声の長さで割った値で、1未満なら再生時間より速く処理できたことを示します。初回のモデル取得やロードは通常この比率に含まれないため、最初に結果を得るまでの時間と分けて考えます。ライブ音声では最初の文字までの遅延と全体の完了時間の両方を確認しましょう。

文字起こし用紙を確認する拡大鏡と録音機、ヘッドホン
クリップ時間とサーバー同時処理数は別の尺度です。

用語の注釈

  1. チェックポイント学習済みモデルの重みなどを保存したファイルです。同じモデル系列でも、版や用途によって異なるチェックポイントを使うことがあります。

    本文に戻る
  2. 自動音声認識音声中の発話を認識してテキストに変換する技術です。認識結果は発話内容を示すもので、音響そのものを復元するものではありません。

    本文に戻る
  3. CPUコンピューターで汎用のプログラム命令を実行する中央処理装置です。AI処理ではGPUなど他のプロセッサーと役割を分けることがあります。

    本文に戻る
  4. CUDANVIDIA GPUで汎用計算を行うソフトウェア基盤です。CUDA向けのプログラムが他のGPUでそのまま動くとは限りません。

    本文に戻る
  5. Python仮想環境プロジェクトごとにPythonパッケージを分けて導入する環境です。版の衝突を減らすもので、仮想マシンとは異なります。

    本文に戻る
  6. GPU多くの計算を並列に処理するプロセッサーです。AIモデルの実行ではモデル計算を担います。

    本文に戻る
  7. VRAMグラフィックカードのGPUが使うメモリです。モデルの重みや計算途中の値を置き、システムRAMとは区別されます。

    本文に戻る
  8. リアルタイム係数生成にかかった時間を出力の再生時間で割った値です。条件をそろえて比べる場合、値が小さいほど生成が速いことを示します。

    本文に戻る