ローカル音楽生成

ローカルAI音楽生成:自分のパソコンで歌やBGMを作る

動画の編集は終わったのにBGMが合わない。書き留めた歌詞にメロディーを付けてみたい。ローカル音楽生成は、そんな素材を自分のパソコンで何度も試す方法です。一曲の歌を作るモデルと、短い演奏や効果音に向くモデルは異なります。まず作りたいものと言語を決め、手元の機材で動くソフトを選ぶ順番で始めましょう。

実行条件と要点
  • YuE2と従来のYuEは実行経路と利用条件が異なります。導入前に版を確認します。
  • 歌・演奏・効果音を同じ性能表で順位付けしません。必要な出力に合うモデルから選びます。
  • 最初は短い出力で歌詞と雰囲気を確認し、気に入った設定を保存してから長さを伸ばします。

仕上げたい場面から考える

最初にモデル名を覚える必要はありません。商品紹介動画の下に流す穏やかな演奏なのか、自作の歌詞を歌う声なのかを決めます。前者ではナレーションを邪魔しない楽器と繰り返せる流れ、後者では発音や歌詞の順序、サビへの展開が重要です。同じ長さの音源でも、成功の基準は違います。

最初の作業は小さく具体的なものにします。「良い音楽」より「語りの下に流す30秒のアコースティック演奏、歌声なし」と書いてみましょう。これは制作の目標で、どのモデルもその長さを扱えるという設定例ではありません。選んだモデルの対応時間を確認して調整します。短い作業を一つ終えると、長い曲のために何を学ぶかも見えてきます。

パソコン、小さな鍵盤、ヘッドホンのある自宅の音楽机
ローカル音楽生成は、自分のパソコンで候補を作り、選ぶ作業です。

歌を作るモデルと音を作るモデル

YuE2は歌詞とスタイルから曲を作り、メロディーとコードの計画を確認・修正できる流れが特徴です。ACE-Stepにはローカルでの音楽生成と編集の実行方法があり、HeartMuLaも歌詞と音楽タグを使う歌の生成候補です。似た名前の音声合成ソフトは文章を読み上げるだけの場合もあるので、音楽モデルとは区別しましょう。

短い演奏や効果音が目的なら、Stable Audio OpenやMusicGenなどの別系統も候補です。ただし、長さや歌声の扱い、利用条件は同じではありません。比較ガイドでは作れるものと実行できる環境を分けて整理しました。有名な一つのモデルを、あらゆる音楽作業の正解にする必要はありません。

自分のパソコンで動くための条件

ブラウザーでボタンを押すからといって、必ずクラウドで生成するわけではありません。ローカルソフトもブラウザーを操作画面にして、計算は自分のGPU1で行えます。初回はモデルや必要なパッケージの取得にインターネットが必要な場合があります。その後の通信は、選ぶソフトと有効にする外部機能で変わります。

Macの統合メモリ32GBとグラフィックスカードのVRAM32GBは、同じ実行条件ではありません。CUDA2専用コードは、メモリに余裕のあるMacでもそのままでは動きません。一方、Apple Silicon向けの経路があるソフトなら、別のNVIDIA PCを買わずに始められる場合もあります。モデル、実行ソフト、OS、メモリを合わせて確認しましょう。

歌詞と曲調を分けると直しやすい

歌詞欄には歌う文章を、スタイル欄にはジャンル、楽器、雰囲気、声の特徴を書きます。歌詞に「悲しく歌って」といった指示を混ぜると、その言葉まで歌われるかもしれません。曲の区切りの指定もモデルごとに違うため、別ソフトの形式をそのまま持ち込まないようにします。最初はそのモデルの例から始めると、問題を切り分けやすくなります。

韓国語の歌詞は特に短い区間から聴いてみましょう。入力できること、対応言語に含まれること、求める発音で歌うことは別です。単語の欠落や語尾の不明瞭さ、一行に音節を詰め込みすぎていないかを確認します。発音の問題が出ても、大きなGPUを買えば解決するわけではありません。

音の波形画面のそばに歌詞ノートと構成カードを広げた机
歌詞とスタイル説明を分けると、直したい部分に集中できます。

最初の曲では一度に一つずつ変える

最初の結果が気に入らないと、歌詞、ジャンル、長さ、シード、ステップ数を全部変えたくなります。それでは何が効いたか分かりません。歌詞を残して楽器構成だけ変える、同じスタイルでシードだけ変えるなどして比較します。シードは再試行の条件を残すものですが、ソフトの版や機材が違っても同じ波形になる保証ではありません。

気に入った候補は音源だけでなく、プロンプト、歌詞、モデル名、設定も保存します。導入部は良いのにサビが不自然なら、原本を残して別版を作りましょう。選んだ区間を修正できるモデルと、一曲全体を新しい演奏として生成するモデルは異なります。「編集できる」という言葉より、何が保たれ何が作り直されるかが重要です。

数秒で作れるという数字の読み方

1分の音楽を10秒で作る場合と、10秒の音楽を10秒で作る場合は、待ち時間だけが同じです。出力時間が違うので、速度の意味は異なります。モデルを読み込み済みか、ダウンロードやファイル保存まで含むかも確認します。このサイトのLLM3トークン4生成速度を音楽の長さへ換算することはしません。

最短の生成記録だけでなく、何回直せば使える結果になるかも重要です。素早く作った十個の候補が全部用途に合わなければ、作業が速くなったとは言いにくいでしょう。生成時間と一緒に、歌詞の欠落、途中の途切れ、自然な終わり方を短く記録します。機材の速度と出力品質を別の欄に残すと、次の選択に役立ちます。

二つの候補曲をスピーカーで聴き比べる静かな作業場
生成の速さと作品に合う音楽かどうかは、分けて判断します。

良い部分を残し、作品に合わせて整える

生成した音源がそのまま納品ファイルになる必要はありません。使える区間を選び、始まりと終わりを整え、説明の声を覆わない音量にすることも制作の一部です。BGMでは歌声の魅力より説明を邪魔しないことが優先される場合があります。原本と編集版を分けておけば、後から別の長さが必要になっても戻れます。

歌声と伴奏を別々に扱うなら、選んだソフトが実際に分離出力を出すか確認します。完成音源を後から分離する作業と、最初から別トラックで生成する作業は違います。声だけ替えたい場合も、その機能が元の伴奏を保つかは結果を比較して確かめましょう。

曲を公開する前に確認すること

モデルを無料で取得できることと、あらゆる商用利用が許されることは同じではありません。コード、モデルの重み、生成結果の条件を分けて確認します。同じプロジェクトでも版によって条件が変わる場合があります。使用した版と当時の条件を保存し、受託作業なら依頼元のAI利用方針も先に確認しましょう。

参考音源や歌詞は、自分が利用できる素材で準備するのが無難です。特定の歌手名や他人の未公開音源を使わなくても、楽器、リズム、感情、声の質感で方向を伝えられます。最初の目標は有名な誰かの完全な再現ではなく、自分の動画や歌詞に合う作品を最後まで仕上げることで十分です。

用語の注釈

  1. GPU多くの計算を並列に処理するプロセッサーです。AIモデルの実行ではモデル計算を担います。

    本文に戻る
  2. CUDANVIDIA GPUで汎用計算を行うソフトウェア基盤です。CUDA向けのプログラムが他のGPUでそのまま動くとは限りません。

    本文に戻る
  3. 大規模言語モデル大量のテキストデータで学習し、テキストを処理・生成する言語モデルです。機能や対応入力はモデルごとに異なります。

    本文に戻る
  4. トークンモデルが入力や出力を分けて処理する単位です。1トークンが1文字や一定の時間に相当するわけではありません。

    本文に戻る