ローカル音楽生成
ACE-Step 1.5をローカルで使う:導入から最初の曲まで
歌詞を書き、ジャンルや楽器を説明して、まず自分のコンピューターで一曲生成してみましょう。このガイドでは公式ACE-Step 1.5リポジトリを準備してローカル画面を開き、短い歌詞で発音やサビの構成を確認し、長さ・seed・設定を記録しながら音源を整える手順を追います。導入目安はPython 3.11または3.12と約10GBの保存領域です。NVIDIA向けの標準2BとXL 4Bでは必要メモリが異なります。Apple Silicon Macには専用MLX1起動スクリプトがあります。公開速度の数値は曲の長さや詳細条件がなく、自分の端末での結果の代わりにはなりません。
ACE-StepとACE Studioは別製品
ACE-Step 1.5は公開コードと重みを自分で動かすモデルプロジェクトです。ACE StudioはAIシンガー・楽器・ボーカル編集・生成機能を備えた商用制作ソフトです。資料にはVerse25などの製品モデルやAI Creditを使う機能があります。モデルを直接扱うならACE-Step、統合ワークステーションならACE Studioを検討してください。
公式UIの言語一覧は英語・中国語・ヘブライ語・日本語です。モデルカードは50以上の言語を掲げますが、品質が同じという意味ではありません。韓国語は短い歌詞で発音と音節を確認しましょう。

端末に合わせてモデルサイズを選ぶ
公式導入資料はPython 3.11–3.12と約10GBの保存領域を挙げています。標準2B DiT2の開始目安はDiTのみ約4GB、LM+DiT約6GBです。XLは別の4B DiTで、READMEはオフロード3・量子化4ありで12GB以上、オフロードなしで20GB以上と区別しています。他アプリ用の余裕も必要です。
現行NVIDIA表は6GB以下で2B turboのDiTのみ、6–8GBで0.6B LM、8–16GBで0.6B/1.7B LM、16–20GBで2B SFTまたはXL turbo(XLはCPU5オフロード必須)、20–24GBでXL turbo/SFT(オフロードなし、1.7B LM、4B LM利用可)、24GB以上でXL SFTと4B LMを推奨します。XLと通常の2Bを混同しないでください。
UIの推奨値であり、長さ・バッチ上限はGPU6 Compatibility Guideで確認します。
Apple Siliconでは専用のstart_gradio_ui_macos.shがMLXを設定します。導入資料はM1/M2/M3/M4を対象とし、NVIDIA VRAM7表とは別の実行経路です。CPUモードも可能ですが大幅に遅いと説明されています。
公式リポジトリからローカルUIを起動
公式Quick Startはリポジトリ取得、uv同期、UI起動の順です。初回は重みをダウンロードするため時間と容量が余分にかかります。既定UIは127.0.0.1:7860にバインドされます。個人利用では既定値を維持し、公開共有を無効にしてください。
git clone https://github.com/ACE-Step/ACE-Step-1.5.git
cd ACE-Step-1.5
uv sync
uv run acestep歌詞とタグを分けて最初の曲を作る
プロンプトにはジャンル・雰囲気・楽器・ボーカルの特徴、Lyrics欄には歌詞を入れます。項目は版によって変わるので実際のUIに従ってください。「明るいインディーポップ、温かいエレピ、柔らかなボーカル、サビでドラムを強く」のように音を具体化します。
[Verse]や[Chorus]のタグが必ず意図通りになるとは限りません。短いAメロとサビで発音・繰り返し・構成を確認し、長さは段階的に増やします。最大10分という説明は、全端末で実用的な10分曲を保証しません。

シードと設定を記録して修正する
UIにseedがあれば値を保存して似た条件を比べます。モデルやコードの版が変われば同じ結果とは限りません。項目が見当たらない場合は未確認のCLI8引数を作らず、プロンプトと設定を保存します。
一度に一つだけ変更します。発音が曖昧なら歌詞を短くし、編曲が混み合うなら楽器指定を減らします。使える結果とモデル名・長さ・seed・プロンプトを一緒に記録すると比較しやすくなります。

公開速度を自分の端末で確かめる
モデルカードはA100で2秒未満、RTX 3090で10秒未満、VRAM 4GB未満を掲げます。曲の長さ・設定・精度・ウォームアップ・計測コード・実測VRAMは記載されていません。統制されたモデル比較やユーザーへの保証ではありません。
同じ短い歌詞・タグ・長さで複数回生成し、初回のモデル読み込みと生成時間を分けて記録します。メモリ・出力長・MPSまたはCUDA9も記録してください。Apple Siliconの公式生成時間は確認できませんでした。
ライセンスと入力素材を確認する
ACE-Step 1.5のモデルカードはMITと記載しています。コードと重みは別配布の場合があるため取得版のLICENSEとモデルカードを確認してください。ACE Studioの規約や入力歌詞・参照音源の権利とは別です。
公開・商用利用前に入力歌詞・参照ボーカル・特定アーティストを指定するプロンプトの権利を確認してください。ローカル実行は生成物の無制限利用許可ではありません。
用語の注釈
MLX — Apple silicon向けの機械学習フレームワークです。統合メモリ構造を活用し、対応モデルや機能はMLXの各ツールで異なります。
本文に戻るDiT — Diffusion Transformerの略です。Transformer構造を使い、拡散過程でノイズを含む表現を段階的に整えるモデル構造です。
本文に戻るオフロード — 容量が足りないとき、モデルデータの一部をGPUメモリからシステムRAMやストレージへ移して処理する方法です。データ転送が追加されます。
本文に戻る量子化 — モデルの数値を少ないビット数で表す方法です。メモリ使用量のほか、精度や実行速度も変わることがあり、影響は形式と実装によります。
本文に戻るCPU — コンピューターで汎用のプログラム命令を実行する中央処理装置です。AI処理ではGPUなど他のプロセッサーと役割を分けることがあります。
本文に戻るGPU — 多くの計算を並列に処理するプロセッサーです。AIモデルの実行ではモデル計算を担います。
本文に戻るVRAM — グラフィックカードのGPUが使うメモリです。モデルの重みや計算途中の値を置き、システムRAMとは区別されます。
本文に戻るCLI — Command-Line Interfaceの略です。ターミナルにコマンドを入力してプログラムを操作する方式です。
本文に戻るCUDA — NVIDIA GPUで汎用計算を行うソフトウェア基盤です。CUDA向けのプログラムが他のGPUでそのまま動くとは限りません。
本文に戻る