로컬 음악 생성

로컬 AI 음악 생성: 내 컴퓨터로 노래와 배경음악 만들기

영상은 다 편집했는데 배경음악이 어울리지 않거나, 적어둔 가사에 멜로디를 붙여보고 싶을 때가 있습니다. 로컬 음악 생성은 이런 재료를 내 컴퓨터에서 여러 번 바꿔볼 수 있는 방법입니다. 노래 한 곡을 만드는 모델과 짧은 연주·효과음에 맞는 모델은 다릅니다. 먼저 결과물과 사용할 언어를 정하고, 현재 장비에서 실행할 수 있는 프로그램을 고르는 순서로 시작해보겠습니다.

실행 조건과 핵심 내용
  • YuE2와 예전 YuE는 실행 경로와 이용 조건이 다릅니다. 설치할 버전을 먼저 확인합니다.
  • 노래·연주·효과음을 같은 성능표로 비교하지 않습니다. 결과물에 맞는 모델을 먼저 고릅니다.
  • 처음에는 짧은 결과로 가사 전달과 분위기를 확인하고, 마음에 드는 설정을 저장한 뒤 길이를 늘립니다.

완성하고 싶은 장면에서 출발하기

음악 생성 모델의 이름부터 외울 필요는 없습니다. 예를 들어 제품 소개 영상의 뒤에 깔 잔잔한 연주가 필요한지, 직접 쓴 가사를 부르는 목소리가 필요한지부터 정합니다. 전자는 말소리를 방해하지 않는 악기와 반복 가능한 흐름이 중요하고, 후자는 발음과 가사 순서, 후렴으로 이어지는 구성이 중요합니다. 같은 길이의 음원이라도 성공했다고 판단하는 기준은 달라집니다.

첫 작업은 구체적이고 작을수록 좋습니다. ‘좋은 음악’보다는 ‘말소리 아래에 깔 30초 길이의 어쿠스틱 연주, 보컬 없음’처럼 적어보세요. 이것은 특정 모델의 지원 길이를 뜻하는 설정 예제가 아니라 작업 목표입니다. 고른 모델이 그 길이를 지원하는지 확인한 뒤 맞춰야 합니다. 짧은 작업 하나를 끝내보면 긴 곡을 위해 무엇을 더 배워야 할지도 분명해집니다.

컴퓨터와 작은 키보드, 헤드폰을 놓은 가정용 음악 작업 공간
로컬 음악 생성은 내 컴퓨터에서 여러 후보를 만들고 고르는 작업입니다.

노래를 만드는 모델과 소리를 만드는 모델

YuE2는 가사와 스타일에서 곡을 만들고, 멜로디와 코드 계획을 확인하거나 바꾸는 흐름이 특징입니다. ACE-Step은 로컬 음악 생성과 편집을 위한 여러 실행 경로를 제공하고, HeartMuLa도 가사와 음악 태그를 쓰는 노래 생성 후보입니다. 이름이 비슷한 음성 합성 프로그램은 말소리를 읽어주는 도구일 수 있으니, 음악 모델과 혼동하지 않는 것이 좋습니다.

짧은 연주나 효과음이 목적이면 Stable Audio Open이나 MusicGen 같은 다른 계열도 살펴볼 만합니다. 다만 길이, 보컬 처리, 이용 조건이 같지는 않습니다. 모델 비교 글에서는 무엇을 만들 수 있는지와 어디에서 실행할 수 있는지를 나눠 정리했습니다. 유명한 모델 하나를 모든 음악 작업의 정답으로 삼지 않아도 됩니다.

내 컴퓨터에서 실행된다는 말의 조건

웹 화면에서 버튼을 누른다고 반드시 클라우드에서 생성하는 것은 아닙니다. 로컬 프로그램도 브라우저를 조작 화면으로 쓰고, 계산은 내 GPU1에서 할 수 있습니다. 처음에는 모델 파일과 실행에 필요한 패키지를 내려받으므로 인터넷이 필요할 수 있습니다. 그다음 작업의 네트워크 사용 여부는 선택한 프로그램과 외부 기능을 확인해야 합니다.

맥의 통합 메모리2 32GB와 그래픽카드 VRAM3 32GB를 같은 실행 조건으로 볼 수는 없습니다. CUDA4 전용 코드라면 메모리가 넉넉한 맥에서도 그대로 돌아가지 않습니다.

반대로 Apple Silicon 경로를 제공하는 프로그램이라면 별도 NVIDIA PC 없이 시작할 수도 있습니다. 모델 이름, 실행 프로그램5, 운영체제, 메모리 순으로 확인해야 장비를 잘못 고르는 일을 줄일 수 있습니다.

가사와 분위기는 따로 준비하면 고치기 쉽습니다

가사에는 실제로 불러야 할 문장을, 스타일에는 장르·악기·분위기와 보컬의 성격을 적습니다. 가사 칸에 ‘슬프게 불러줘’ 같은 지시를 섞으면 그 말까지 노래가 되는지 확인해야 합니다. 곡의 구간을 표시하는 방식도 모델마다 다르므로 한 프로그램의 형식을 다른 프로그램에 그대로 옮기지 마세요. 첫 실행은 해당 모델이 제공하는 예제에서 출발하는 편이 문제를 찾기 쉽습니다.

한국어 가사는 특히 짧은 구간부터 들어보세요. 한국어를 입력할 수 있는 것, 지원 언어에 포함되는 것, 내가 원하는 발음으로 부르는 것은 각각 다릅니다. 조사나 받침이 뭉개지거나 단어가 빠지는지 확인하고, 한 줄에 너무 많은 음절을 몰아넣지 않았는지도 살핍니다. 발음 문제가 생겼을 때 바로 더 큰 GPU를 사는 것은 해결책이 아닙니다.

음악 파형 화면 곁에 가사 노트와 구간 카드를 펼친 책상
가사와 스타일 설명을 나눠두면 원하는 부분만 바꾸기 쉽습니다.

첫 곡에서는 한 번에 하나씩 바꿉니다

첫 결과가 마음에 안 들면 가사, 장르, 길이, 시드와 단계 수를 한꺼번에 바꾸고 싶어집니다. 그러면 어느 변화가 도움이 됐는지 남지 않습니다. 가사를 유지한 채 악기 구성만 바꾸거나, 같은 스타일에서 시드만 바꿔 몇 가지 후보를 비교해보세요. 시드는 다시 시험할 조건을 기록하는 도구이지, 프로그램 버전이나 장치가 달라도 파형을 완전히 보장하는 번호는 아닙니다.

마음에 드는 후보는 음원만 저장하지 말고 프롬프트, 가사, 모델 이름과 설정도 함께 남기세요. 도입부는 좋은데 후렴이 어색하다면 원본을 보존하고 새 버전을 만듭니다. 부분 수정 기능이 있는 모델과 곡 전체를 다시 녹음하듯 생성하는 모델은 다릅니다. ‘편집 가능’이라는 한마디보다 어디가 유지되고 어디가 새로 만들어지는지 아는 것이 중요합니다.

몇 초 만에 만든다는 숫자는 어떻게 읽을까

1분 음악을 10초에 만들었다는 기록과 10초짜리 음악을 10초에 만들었다는 기록은 기다린 시간만 같습니다. 출력 길이가 다르니 속도의 의미는 다릅니다. 모델을 이미 올린 상태인지, 처음 내려받는 시간과 파일 저장까지 포함했는지도 확인해야 합니다. 이 사이트의 LLM6 토큰7 생성 속도를 음악 길이로 환산하는 방식은 사용하지 않습니다.

작업에서는 한 곡의 최단 기록보다 몇 번 고쳐서 쓸 만한 결과를 얻는지도 중요합니다. 빨리 만든 후보 열 개가 모두 용도에 맞지 않는다면 작업이 빨라졌다고 하기 어렵습니다. 생성 시간과 함께 가사가 빠졌는지, 음악이 중간에 끊기는지, 마지막이 자연스럽게 끝나는지를 짧게 적어보세요. 장비 속도와 결과 품질을 다른 칸에 남겨야 다음 선택에 도움이 됩니다.

두 가지 음악 파형을 보며 스피커로 들어볼 수 있는 조용한 작업실
빨리 끝나는지와 쓰고 싶은 음악인지는 따로 들어보고 판단합니다.

좋은 부분을 남기고, 영상이나 곡에 맞게 다듬기

생성한 음원이 바로 최종 납품 파일이 될 필요는 없습니다. 편집기에서 좋은 구간을 고르고, 시작과 끝을 정리하고, 영상의 말소리를 덮지 않도록 음량을 맞추는 일도 제작의 일부입니다. 배경음악이라면 보컬이 멋진지보다 설명을 방해하지 않는지가 먼저일 수 있습니다. 원본 파일은 따로 보관하고 편집본을 만들어두면 뒤늦게 다른 길이가 필요해도 돌아갈 수 있습니다.

보컬과 반주를 따로 다루려면 선택한 프로그램이 실제로 분리된 출력을 주는지 확인합니다. 완성된 음원을 나중에 분리하는 작업과 모델이 처음부터 나눠 출력하는 작업은 다릅니다. 반주가 마음에 드는데 목소리만 바꾸고 싶은 경우에도, 해당 기능이 원래 반주를 그대로 보존하는지는 직접 비교해야 합니다.

공개할 곡이라면 마지막으로 확인할 것

모델 파일을 무료로 받을 수 있다는 사실만으로 모든 상업적 이용이 허용되는 것은 아닙니다. 코드, 모델 가중치, 생성 결과에 적용되는 조건을 나눠 확인해야 합니다. 같은 프로젝트도 버전이 바뀌면 조건이 달라질 수 있습니다. 사용한 버전과 당시의 이용 조건을 함께 보관하고, 의뢰받은 작업이라면 발주처의 AI 사용 기준도 먼저 확인하세요.

참조 음원과 가사는 내가 사용할 수 있는 재료로 준비하는 편이 안전합니다. 특정 가수의 이름이나 타인의 미공개 음원을 넣지 않아도 악기, 리듬, 감정과 보컬의 질감으로 원하는 방향을 설명할 수 있습니다. 첫 목표는 유명한 누군가를 그대로 흉내 내는 것보다, 내가 만든 영상이나 가사에 어울리는 결과를 끝까지 완성해보는 것으로 잡아도 충분합니다.

용어 각주

  1. GPU많은 계산을 병렬로 처리하는 프로세서입니다. AI 모델 실행에서는 모델 계산을 맡습니다.

    본문으로 돌아가기
  2. 통합 메모리CPU와 GPU가 같은 물리 메모리 풀을 공유하는 구조입니다. 메모리 용량이 자동으로 늘어나는 것은 아니며, 실제 사용 가능량은 시스템에 따라 다릅니다.

    본문으로 돌아가기
  3. VRAM그래픽카드의 GPU가 사용하는 메모리입니다. 모델 가중치와 계산 중간값을 저장하며 시스템 RAM과 구분됩니다.

    본문으로 돌아가기
  4. CUDANVIDIA GPU에서 범용 계산을 실행하기 위한 소프트웨어 플랫폼입니다. CUDA용으로 만든 프로그램은 다른 GPU에서 그대로 동작한다고 보장되지 않습니다.

    본문으로 돌아가기
  5. 실행 프로그램모델 파일을 읽고 연산을 실행하는 소프트웨어입니다. 지원 형식, 하드웨어와 최적화 기능은 런타임마다 다릅니다.

    본문으로 돌아가기
  6. 대규모 언어 모델대량의 텍스트 데이터로 학습해 텍스트를 처리하고 생성하는 언어 모델입니다. 기능과 지원 입력은 모델마다 다릅니다.

    본문으로 돌아가기
  7. 토큰모델이 입력이나 출력을 나누어 처리하는 단위입니다. 토큰 하나가 글자 하나나 일정한 시간 길이에 해당하지는 않습니다.

    본문으로 돌아가기