로컬 음악 생성

로컬 음악 생성 모델 비교: 노래, 연주곡, 효과음

가사로 노래를 만들지, 짧은 배경음이나 효과음을 만들지에 따라 선택할 모델이 달라집니다. 용도와 공개 성능 자료를 함께 살펴보되, 실행 환경과 상업적 이용 조건도 모델별로 확인합니다.

실행 조건과 핵심 내용

ACE-Step 1.5과 HeartMuLa는 가사·태그 기반 곡 생성에 가깝고, YuE 저장소의 최신 YuE2는 가사에서 악보 계획을 만들고 커버·편집 가능한 곡을 합성합니다. Stable Audio Open은 최대 47초의 스테레오 오디오와 효과음·음악 조각에 초점을 둡니다. MusicGen은 텍스트·멜로디 조건의 연구 지향 모델이고 현실적인 보컬 생성에는 한계가 있습니다. 모든 모델이 하나의 순위에서 경쟁하는 것은 아닙니다. 하드웨어와 라이선스는 버전별 공식 문서에서 확인하세요.

  • 가사곡은 ACE-Step·HeartMuLa·YuE2의 가사 및 곡 구조 지원부터 비교합니다.
  • 짧은 효과음과 음악 조각은 최대 47초가 문서화된 Stable Audio Open을 별도 후보로 둡니다.
  • YuE2와 MusicGen 가중치는 CC BY-NC 4.0, Stable Audio Open은 Community License이며 상업 조건을 따로 확인해야 합니다.

곡 생성과 짧은 오디오 생성을 나누기

보컬이 있는 전곡, 반주 루프, 배경음, 효과음은 입력과 출력 요구가 다릅니다. 가사 중심이라면 가사 조건과 섹션 전개를 확인하고, 장면 효과음이라면 시간 제한·텍스트 프롬프트·오디오 형식을 확인하세요. 같은 문장만 넣어 품질 순위를 매기기보다 각 모델의 공식 입출력을 맞춰 비교합니다.

로컬은 코드와 가중치를 받아 내 장치에서 추론한다는 뜻입니다. 최초 다운로드에는 인터넷이 필요하고, 서버를 다른 사람에게 공개하는 일은 별개입니다. 체크포인트1 크기와 파일 라이선스를 확인하고 결과 파일을 프로젝트별로 보관하세요.

가사와 보컬이 있는 곡

ACE-Step 1.5는 설명과 가사로 곡을 만들고 커버·편집 기능을 소개합니다. 50개 이상 언어, 최대 10분은 모델 카드의 범위 설명이며 언어별 품질이나 모든 장치의 실행 보장은 아닙니다.

HeartMuLa 3B는 가사와 태그 파일을 사용하며 기본 최대 길이는 240,000ms입니다. 공식 저장소가 현재 추론 속도를 RTF2 약 1.0으로 설명하므로 긴 곡을 몇 초에 만든다고 볼 근거는 없습니다. lazy load는 메모리 사용을 낮추는 방법이지 속도 보장이 아닙니다.

YuE2는 가사에서 악보를 계획하고 48kHz 스테레오를 합성하며 악보 수정과 커버 예가 있습니다. 공식 기본 경로는 Linux, Python 3.12, BF163 지원 NVIDIA GPU4 24GB입니다.

공식 모델 카드의 일반 생성 속도 표에서는 RTX 4090 24GB로 3분 35초 오디오를 평균 32회 웜 실행5해 71.04초에 생성했고 피크 VRAM6은 11.18GiB였습니다. 양자화7 없는 PyTorch8 2.10 실행이며 오디오 길이 대비 약 0.33배 시간이 걸린 수치입니다.

초기 로딩은 제외됐고 한 번에 한 곡씩 처리합니다.

아래 점수는 YuE 공식 WildSongBench 문서와 YuE2 모델 카드의 2026년 9월 12일 자동 평가입니다. 같은 192개 프롬프트 결과를 다루지만 사람의 취향 평가나 연산량을 맞춘 비교는 아닙니다.

표준 YuE2와 공개 모델 기준선은 각 2개 후보를 생성해, 후보마다 네 차례 ASR9 평가로 계산한 PER10가 낮은 쪽을 고르는 절차를 사용합니다. best-of-811은 음악성·프롬프트 제어·PER로 선택하므로 기본 설정과 직접 견주지 않습니다. 참고로 best-of-8 수치(SongBench Avg 6.9632, PER 9.79%)는 별도 선택 절차의 결과입니다.

벤치마크는 YuE2-Vae12-legacy 디코더를 썼고, 평소 기본값은 지각 음질이 나은 YuE2-Vae입니다. 지표는 모두 자동 평가이며 사람의 보편적인 음질 판단으로 볼 수 없습니다.

WildSongBench 192개 프롬프트 자동 평가: 로컬 후보의 SongBench 평균과 가사 오류율
모델 설정SongBench 평균 ↑음소 오류율(PER) ↓비교 시 주의
YuE2 (2개 후보 중 PER 낮은 곡 선택)6.73168.44%기본 YuE2 설정. 벤치마크는 YuE2-Vae-legacy 사용.
HeartMuLa6.248310.71%같은 192개 프롬프트 표의 자동 평가값.
ACE-Step 1.56.01187.46%SongBench 평균은 낮을수록이 아니라 높을수록 좋고, PER는 낮을수록 좋습니다.
YuE 1 (원본 모델)4.916536.38%현재 YuE2와 구분되는 이전 세대 모델.

WildSongBench 192개 프롬프트 자동 평가: 로컬 후보의 SongBench 평균과 가사 오류율

YuE2 (2개 후보 중 PER 낮은 곡 선택)

SongBench 평균 ↑
6.7316
음소 오류율(PER) ↓
8.44%
비교 시 주의
기본 YuE2 설정. 벤치마크는 YuE2-Vae-legacy 사용.

HeartMuLa

SongBench 평균 ↑
6.2483
음소 오류율(PER) ↓
10.71%
비교 시 주의
같은 192개 프롬프트 표의 자동 평가값.

ACE-Step 1.5

SongBench 평균 ↑
6.0118
음소 오류율(PER) ↓
7.46%
비교 시 주의
SongBench 평균은 낮을수록이 아니라 높을수록 좋고, PER는 낮을수록 좋습니다.

YuE 1 (원본 모델)

SongBench 평균 ↑
4.9165
음소 오류율(PER) ↓
36.38%
비교 시 주의
현재 YuE2와 구분되는 이전 세대 모델.
가사 악보와 보컬 파형을 비교하는 음악 작업대
가사곡은 입력 가사와 곡 구조를 기준으로 비교합니다.

연주곡 조각과 효과음

Stable Audio Open 1.0은 최대 47초 길이의 44.1kHz 스테레오를 텍스트로 생성합니다. 모델 카드는 효과음과 음악 소재를 의도된 사용으로 설명하며 프롬프트 언어는 영어입니다. 효과음과 인스트 한 구간에는 후보지만 가사 중심 완성곡을 대체하지는 않습니다. 가중치 접근 전에 Hugging Face 라이선스 조건 동의가 필요합니다.

MusicGen은 300M·1.5B·3.3B와 텍스트·멜로디 조건 변형이 있습니다. 공식 모델 카드는 현실적인 보컬이 어렵고 영어 외 언어에서 성능이 낮을 수 있다고 적습니다. AudioCraft 문서는 medium 모델에 VRAM 16GB 이상을 안내합니다. 배경음 아이디어나 연구 실험에 더 어울립니다.

짧은 연주 구간과 효과음 파형을 다루는 화면
짧은 오디오 조각은 전곡 생성과 다른 기준으로 고릅니다.

하드웨어 조건을 같은 숫자로 오해하지 않기

ACE-Step은 표준 2B DiT13의 4GB/6GB 시작 기준 외에 XL 4B DiT를 제공합니다. 최신 NVIDIA 표에서 XL은 16–20GB 구간 CPU14 오프로딩15, 20GB 이상은 오프로딩 없이 권장되며, 24GB 이상은 4B LM도 권장됩니다.

Apple Silicon은 MPS 외에 전용 MLX16 시작 스크립트가 있습니다. YuE2는 Linux와 NVIDIA 24GB BF16, MusicGen medium은 VRAM 16GB 이상을 공식 문서에 명시합니다.

Stable Audio Open와 HeartMuLa 공식 문서에는 모든 설정에 공통인 최소 VRAM 수치가 없습니다. 모르는 사양을 저사양 지원 또는 고사양 필수로 바꾸지 말고 체크포인트별 실행 안내를 확인하세요. Apple Silicon은 MLX 경로를 짧게 시험하되 NVIDIA VRAM 표와 직접 비교하지 마세요.

라이선스는 코드와 가중치를 따로 확인하기

YuE2의 현행 README는 코드·문서를 Apache 2.0, YuE2-3B/VAE 가중치를 CC BY-NC 4.0과 추가 creator permission으로 구분합니다. 과거 YuE 라이선스 발표를 현재 YuE2에 적용하지 마세요. MusicGen 코드의 MIT는 가중치에 적용되지 않으며, 가중치는 CC BY-NC 4.0입니다.

Stable Audio Open은 Stability AI Community License를 쓰며 카드에서 상업 사용 시 별도 라이선스를 안내합니다. HeartMuLa 저장소는 코드와 관련 가중치를 Apache 2.0으로 명시하고 ACE-Step 1.5 카드에는 MIT가 적혀 있습니다. 정확한 체크포인트의 조건을 다시 확인하세요.

학습 데이터, 참조 가사·음원, 목소리 모방과 게시 플랫폼의 정책은 모델 라이선스와 별개일 수 있습니다. 수익화나 음원 공개 전에 관련 조건을 원문으로 확인하세요.

작업 목적별로 후보 좁히기

보컬곡 입문은 ACE-Step, 가사·태그 파일 기반 실험은 HeartMuLa, 24GB Linux/NVIDIA와 악보 제어는 YuE2를 먼저 보세요. 47초 이내 효과음과 음악 요소는 Stable Audio Open, 텍스트·멜로디 기반 배경 음악 실험은 MusicGen이 후보입니다. 이는 기능·환경을 기준으로 한 선택 경로이며 음질 순위가 아닙니다.

직접 비교한다면 비슷한 길이와 장르 조건을 맞추고, 각 모델이 지원하는 입력도 기록하세요. 생성 시간, 메모리, 한국어 가사 가독성, 샘플레이트, 편집 난이도를 비교합니다. 공식 문서에 없는 메모리나 시간은 미확인으로 남기세요.

보컬곡·연주곡·효과음 작업을 나눠 적은 모델 선택 노트
작업 유형과 하드웨어, 라이선스를 함께 보고 후보를 좁힙니다.

짧은 비교 세션을 재현 가능하게 기록하기

먼저 같은 목표를 가진 두 모델만 골라 설치 부담을 줄입니다. 가사곡은 같은 짧은 가사와 장르, 효과음은 같은 소리 묘사와 목표 길이를 사용하되, 각 모델이 요구하는 입력 방식에 맞게 변환합니다. 첫 실행은 다운로드와 모델 초기화가 포함될 수 있으므로 본 생성 시간과 별도로 적고, 오류 없이 파일이 저장되는지 확인하세요.

비교 노트에는 모델·체크포인트, 코드 버전, 장치, 설정, 출력 길이, 생성 시간, 최대 메모리, 청취 인상을 기록합니다. 공개 주장과 직접 측정은 구분하고 미측정 항목을 추정값으로 채우지 마세요. 배포할 오디오라면 적용 라이선스와 입력 자료 검토 결과도 남깁니다.

용어 각주

  1. 체크포인트학습된 모델의 가중치 등을 저장한 파일입니다. 같은 모델 계열도 버전이나 용도에 따라 다른 체크포인트를 쓸 수 있습니다.

    본문으로 돌아가기
  2. 실시간 계수생성에 걸린 시간을 출력의 재생 시간으로 나눈 값입니다. 조건을 맞춰 비교할 때 값이 작을수록 생성이 빠릅니다.

    본문으로 돌아가기
  3. BF16모델의 수를 저장하고 계산하는 16비트 부동소수점 형식입니다. 사용 가능 여부는 하드웨어와 실행 프로그램에 달려 있습니다.

    본문으로 돌아가기
  4. GPU많은 계산을 병렬로 처리하는 프로세서입니다. AI 모델 실행에서는 모델 계산을 맡습니다.

    본문으로 돌아가기
  5. 웜 실행모델 로딩과 초기 준비를 마친 뒤 실행하는 측정입니다. 첫 실행의 로딩 대기 시간은 포함하지 않을 수 있습니다.

    본문으로 돌아가기
  6. VRAM그래픽카드의 GPU가 사용하는 메모리입니다. 모델 가중치와 계산 중간값을 저장하며 시스템 RAM과 구분됩니다.

    본문으로 돌아가기
  7. 양자화모델의 수치를 더 적은 비트로 표현하는 방법입니다. 메모리 사용량과 함께 정확도나 실행 속도도 달라질 수 있으며, 영향은 형식과 구현에 따릅니다.

    본문으로 돌아가기
  8. PyTorchAI 모델을 만들고 실행하는 소프트웨어 프레임워크입니다. 모델과 함께 호환되는 PyTorch 버전 및 하드웨어 지원도 확인해야 합니다.

    본문으로 돌아가기
  9. 자동 음성 인식음성을 인식해 글자로 바꾸는 기술입니다. 결과는 음성의 명료도를 살피는 데 쓸 수 있지만, 음질이나 자연스러움 전체를 나타내지는 않습니다.

    본문으로 돌아가기
  10. 음소 오류율인식된 발음 단위와 기준 문장을 비교한 오류 지표입니다. 낮을수록 일치도가 높지만, 전체 음질이나 듣기 좋은 정도를 측정하지는 않습니다.

    본문으로 돌아가기
  11. 8개 후보 중 선택후보 8개를 생성한 뒤 정해진 기준으로 하나를 선택하는 평가 방식입니다. 한 번 생성하는 평가보다 계산량이 더 듭니다.

    본문으로 돌아가기
  12. VAEVariational Autoencoder의 약자입니다. 입력을 압축된 잠재 표현으로 바꾸거나, 그 표현에서 결과를 복원하는 데 쓰입니다.

    본문으로 돌아가기
  13. DiTDiffusion Transformer의 약자입니다. 트랜스포머 구조를 이용해 확산 과정에서 노이즈가 있는 표현을 단계적으로 다듬는 모델 구조입니다.

    본문으로 돌아가기
  14. CPU컴퓨터에서 일반적인 프로그램 명령을 실행하는 중앙 처리 장치입니다. AI 작업에서는 GPU 등 다른 프로세서와 역할을 나누기도 합니다.

    본문으로 돌아가기
  15. 오프로딩메모리가 부족할 때 모델 데이터 일부를 GPU 메모리에서 시스템 RAM이나 저장장치로 옮겨 처리하는 방식입니다. 데이터 이동이 추가됩니다.

    본문으로 돌아가기
  16. MLXApple silicon용 머신러닝 프레임워크입니다. Apple silicon의 통합 메모리 구조를 활용하며, 지원 모델과 기능은 MLX 도구별로 다릅니다.

    본문으로 돌아가기