ローカル音楽生成

ローカル音楽生成モデル比較:歌もの・インスト・効果音

歌詞から曲を作るのか、短いBGMや効果音を作るのかで、選ぶモデルは変わります。用途と公開性能データを見ながら、実行環境と商用利用条件もモデルごとに確認します。

実行条件と要点

ACE-Step 1.5とHeartMuLaは歌詞・タグ条件の曲生成に近く、現行YuEリポジトリのYuE2は歌詞から譜面プランを作り、カバーや編集可能な曲を合成します。Stable Audio Openは最大47秒のステレオ音声で効果音や音楽素材を対象にします。MusicGenはテキスト・メロディ条件の研究向けモデルで、リアルなボーカルには限界があります。万能の順位は作れません。ハードウェアとライセンスは各版の公式資料で確認してください。

  • 歌詞付き曲はACE-Step・HeartMuLa・YuE2の歌詞と曲構成機能を比べます。
  • 短い効果音・音楽素材では最大47秒が明記されたStable Audio Openも候補です。
  • YuE2とMusicGenの重みはCC BY-NC 4.0、Stable Audio OpenはCommunity Licenseで商用条件を別途確認します。

曲と短い音声生成を分ける

ボーカル曲・伴奏ループ・背景音・効果音では入出力要件が異なります。歌詞曲は歌詞条件と構成、効果音は長さ制限・テキスト入力・音声形式を確認します。同じ文章だけで順位を付けず、公式の入出力を合わせて比べてください。

ローカルとはコードと重みを自分の端末で動かすことです。初回取得にはネット接続が必要で、サーバー公開は別の選択です。容量とライセンスを確認し、出力を案件別に整理します。

歌詞とボーカルのある曲

ACE-Step 1.5は説明と歌詞から生成し、カバー・編集機能も案内しています。50以上の言語や最大10分は能力の説明で、言語品質や全端末での動作保証ではありません。

HeartMuLa 3Bは歌詞とタグのファイルを受け付け、既定の最大長は240,000msです。公式リポジトリの現行推論速度はRTF1約1.0で、数分の曲が数秒という根拠にはなりません。lazy loadはメモリ節約であり速度保証ではありません。

YuE2は歌詞から譜面を計画し、48kHzステレオを合成します。譜面編集やカバーにも対応します。

公式の基本環境はLinux・Python 3.12以上・BF162対応NVIDIA GPU3 24GBです。モデルカードの通常生成表では、RTX 4090 24GBで214.85秒の音声を71.04秒で生成し、32回のウォーム実行4平均でピークVRAM5は11.18GiBでした。

量子化6なしのPyTorch7 2.10で、生成時間は音声長の約0.33倍です。初期読み込みを除外し、1曲ずつ処理しています。

以下の数値はYuE公式WildSongBench資料とYuE2モデルカードが2026年9月12日に公開した自動評価です。同じ192プロンプトを対象としますが、人の好みの評価でも計算量をそろえた比較でもありません。

標準YuE2と公開モデルの基準値は候補を2つ生成し、各候補を4回ASR8評価してPER9の低い方を選びます。best-of-810は音楽性・プロンプト制御・PERで選ぶため、標準設定と直接比べられません。

参考のbest-of-8スコア(SongBench Avg 6.9632、PER 9.79%)は別の選択手順による値です。ベンチマークはYuE2-Vae11-legacyを使用し、通常の既定値は知覚音質が高いYuE2-Vaeです。

いずれも自動指標であり、人による普遍的な音質評価ではありません。

WildSongBenchの192プロンプト自動評価:ローカル候補のSongBench平均と歌詞誤り率
モデル設定SongBench平均 ↑音素誤り率(PER) ↓読み方の注意
YuE2(2候補のうちPERが低い曲)6.73168.44%標準YuE2設定。ベンチマークはYuE2-Vae-legacyを使用。
HeartMuLa6.248310.71%同じ192プロンプト表の自動評価値。
ACE-Step 1.56.01187.46%SongBench平均は高いほど良く、PERは低いほど良い指標です。
YuE 1(従来モデル)4.916536.38%現行YuE2とは異なる旧世代モデル。

WildSongBenchの192プロンプト自動評価:ローカル候補のSongBench平均と歌詞誤り率

YuE2(2候補のうちPERが低い曲)

SongBench平均 ↑
6.7316
音素誤り率(PER) ↓
8.44%
読み方の注意
標準YuE2設定。ベンチマークはYuE2-Vae-legacyを使用。

HeartMuLa

SongBench平均 ↑
6.2483
音素誤り率(PER) ↓
10.71%
読み方の注意
同じ192プロンプト表の自動評価値。

ACE-Step 1.5

SongBench平均 ↑
6.0118
音素誤り率(PER) ↓
7.46%
読み方の注意
SongBench平均は高いほど良く、PERは低いほど良い指標です。

YuE 1(従来モデル)

SongBench平均 ↑
4.9165
音素誤り率(PER) ↓
36.38%
読み方の注意
現行YuE2とは異なる旧世代モデル。
歌詞譜とボーカル波形を比べる作業台
歌詞付き曲は歌詞入力と曲構成で比べます。

インスト素材と効果音

Stable Audio Open 1.0はテキストから最大47秒、44.1kHzのステレオを生成します。モデルカードは効果音や音楽素材向けとし、英語プロンプトを指定します。効果音やインストの一節には候補ですが、歌詞付き完成曲の代わりではありません。取得にはHugging Faceの条件同意が必要です。

MusicGenは300M・1.5B・3.3Bとテキスト・メロディ対応版があります。モデルカードはリアルなボーカルが難しく、英語以外では性能が下がる可能性を記載しています。AudioCraft資料はmediumに16GB以上のVRAMを挙げます。背景音の案や研究実験に向いています。

短いインストと効果音の波形を扱う画面
短い素材はフル曲生成とは異なる基準で選びます。

ハードウェア数値を同じ条件と見なさない

ACE-Stepは標準2B DiT12の4/6GB目安に加えてXL 4B DiTがあります。現行NVIDIA表はXLについて16–20GBでCPU13オフロード14、20GB以上でオフロードなし、24GB以上で4B LMも推奨します。Apple SiliconにはMPSに加えて専用MLX15起動スクリプトがあります。YuE2はLinux・NVIDIA 24GB BF16、MusicGen mediumはVRAM 16GB以上を明記します。

Stable Audio OpenとHeartMuLaの公式資料には全設定共通の最低VRAM値がありません。不明値を低性能対応や高性能必須と言い換えず、チェックポイント16別手順を確認してください。Apple SiliconではMLX経路を短く試し、NVIDIA区分とは直接比べないでください。

コードと重みを分けてライセンス確認

現行YuE2 READMEはコード・文書をApache 2.0、YuE2-3B/VAE重みをCC BY-NC 4.0と追加条件に分けています。旧YuEの告知を適用しないでください。MusicGenのMITコードライセンスはCC BY-NC 4.0の重みには適用されません。

Stable Audio OpenはStability AI Community Licenseで、商用利用は別条件を案内しています。HeartMuLaはコードと関連重みをApache 2.0、ACE-Step 1.5はMITと記載します。対象チェックポイントの条件を再確認してください。

学習データ・参照歌詞や音源・声の模倣・投稿先規則はモデルライセンスとは別のことがあります。収益化や配信の前に条件原文を確認してください。

用途で候補を絞る

ボーカル曲はACE-Step、歌詞・タグファイルの実験はHeartMuLa、24GB Linux/NVIDIAで譜面制御ならYuE2を先に見ます。47秒以内の効果音や音楽素材はStable Audio Open、テキスト・メロディ条件の背景音実験はMusicGenが候補です。用途別の選び方であり音質順位ではありません。

実際に比べるなら長さとジャンルを近づけ、各モデルの入力条件を記録します。時間・メモリ・韓国語歌詞の聞きやすさ・サンプルレート・編集の手間を比べ、公式にない数値は未記載とします。

歌もの・インスト・効果音を分けたモデル選びのメモ
用途・ハードウェア・ライセンスを合わせて候補を絞ります。

短い比較セッションを再現できるよう記録する

導入負担を抑えるため、まず同じ目的のモデルを二つだけ選びます。歌ものなら同じ短い歌詞とジャンル、効果音なら同じ音の説明と目標時間を使い、各モデルの入力形式に合わせて変換します。初回はダウンロードと初期化を含む場合があるので、生成時間とは分けて記録し、出力ファイルが保存されることも確認してください。

比較ノートにはモデル・チェックポイント、コード版、実行端末、設定、出力長、生成時間、最大メモリ、聴いた印象を記録します。公開値と自分の計測を分け、未計測項目を推測で埋めません。公開する音源ならライセンスと入力素材の確認も記録します。

用語の注釈

  1. リアルタイム係数生成にかかった時間を出力の再生時間で割った値です。条件をそろえて比べる場合、値が小さいほど生成が速いことを示します。

    本文に戻る
  2. BF16モデルの数値を保存・計算する16ビット浮動小数点形式です。利用可否はハードウェアと実行環境によります。

    本文に戻る
  3. GPU多くの計算を並列に処理するプロセッサーです。AIモデルの実行ではモデル計算を担います。

    本文に戻る
  4. ウォーム実行モデルの読み込みと初期化を終えた後の測定です。初回実行時の読み込み時間を含まないことがあります。

    本文に戻る
  5. VRAMグラフィックカードのGPUが使うメモリです。モデルの重みや計算途中の値を置き、システムRAMとは区別されます。

    本文に戻る
  6. 量子化モデルの数値を少ないビット数で表す方法です。メモリ使用量のほか、精度や実行速度も変わることがあり、影響は形式と実装によります。

    本文に戻る
  7. PyTorchAIモデルを作成・実行するソフトウェアフレームワークです。モデルと合わせて、対応するPyTorchの版やハードウェアも確認します。

    本文に戻る
  8. 自動音声認識音声を認識してテキストに変換する技術です。明瞭さの確認に使えますが、音質や自然さ全体を表すものではありません。

    本文に戻る
  9. 音素誤り率認識された音の単位と正解文を比べる誤り指標です。低いほど一致しますが、音質全体や聴き心地を測るものではありません。

    本文に戻る
  10. 8候補から選択8つの候補を生成し、決められた基準で1つを選ぶ評価方式です。1回だけ生成する場合より計算量が増えます。

    本文に戻る
  11. VAEVariational Autoencoderの略です。入力を圧縮した潜在表現に変換したり、その表現から出力を復元したりします。

    本文に戻る
  12. DiTDiffusion Transformerの略です。Transformer構造を使い、拡散過程でノイズを含む表現を段階的に整えるモデル構造です。

    本文に戻る
  13. CPUコンピューターで汎用のプログラム命令を実行する中央処理装置です。AI処理ではGPUなど他のプロセッサーと役割を分けることがあります。

    本文に戻る
  14. オフロード容量が足りないとき、モデルデータの一部をGPUメモリからシステムRAMやストレージへ移して処理する方法です。データ転送が追加されます。

    本文に戻る
  15. MLXApple silicon向けの機械学習フレームワークです。統合メモリ構造を活用し、対応モデルや機能はMLXの各ツールで異なります。

    本文に戻る
  16. チェックポイント学習済みモデルの重みなどを保存したファイルです。同じモデル系列でも、版や用途によって異なるチェックポイントを使うことがあります。

    本文に戻る