로컬 음성 인식·합성

로컬 회의록 만들기: 전사·타임스탬프·화자분리

회의 녹음을 다시 들으며 발언자와 결정 사항을 찾는 일은 번거롭습니다. 로컬 전사는 음성을 글자로 바꾸고 시간 위치와 화자 정보를 더해 검토를 돕습니다. 받아쓰기, 화자분리, 요약은 서로 다른 단계입니다. 짧은 파일로 기능을 하나씩 확인한 뒤 민감한 회의에 적용하면 개인정보와 오류를 함께 관리하기 쉽습니다.

실행 조건과 핵심 내용
  • 회의 전체 처리와 실시간 자막은 다른 파이프라인입니다. Nemotron 3.5는 cache-aware streaming, Parakeet TDT v3는 전체 발화 처리입니다.
  • 화자분리는 음성 구간을 나누는 과정이지 목소리만으로 사람 이름을 아는 기능은 아닙니다.
  • 로컬 서비스는 기본 주소 `127.0.0.1`에만 둡니다. `0.0.0.0`은 다른 기기에서 접근할 수 있습니다.

먼저 회의록에 필요한 결과 고르기

검색 가능한 전문이 필요한지, 발언 시간과 화자 구분이 필요한지 정합니다. 회의 중에 따라가는 자막은 녹음 파일을 나중에 처리하는 것보다 낮은 지연이 필요합니다. 요구 결과를 적어두면 스트리밍 모델과 일괄 전사 모델 중 어느 쪽을 시험할지 정하기 쉽습니다.

빈 회의실의 원탁 중앙에 놓인 마이크와 노트북
전문인지 실시간 자막인지 필요한 결과를 먼저 정합니다.

전사와 화자분리를 따로 확인

ASR1은 발언을 글자로 바꾸고 화자분리는 누가 언제 말했는지 구간을 나눕니다. 오디오만으로 사람 이름을 알 수 없으므로 화자 1, 화자 2처럼 표시한 뒤 참석자와 연결해야 합니다. NeMo-Speech.cpp의 Sortformer v2는 최대 네 화자를 지원한다고 문서화되어 있습니다. 겹쳐 말한 부분과 마이크가 바뀐 구간은 사람이 다시 들어보세요.

세 가지 색의 음성 파형을 띄운 �노트북과 색깔별 노트
자동 화자 표식을 참석자와 연결할 때 사람이 검수합니다.

로컬 실행 프로그램과 모델 준비

NVIDIA NeMo-Speech.cpp는 Apple Silicon의 Metal, NVIDIA CUDA2, CPU3 실행 경로를 안내합니다. 설치는 공식 명령 `curl -fsSL https://github.com/NVIDIA/NeMo-Speech.cpp/raw/main/scripts/install.sh | sh`로 시작할 수 있습니다.

모델은 따로 내려받아야 합니다. 처음 설치할 때 인터넷이 필요하지만 모델을 받은 뒤 네트워크 연결 없이 처리할 수 있습니다.

짧은 녹음에서 자막과 화자 붙이기

짧은 WAV로 전사만 실행해 결과를 듣고 읽어봅니다. 다음으로 자막과 화자분리를 켜고 JSON이나 SRT가 필요한지 확인하세요. NeMo CLI4는 `nemo-speech transcribe meeting.wav --diarize --json`과 같은 흐름을 문서화합니다. 회의 이름과 제품 용어가 자주 나오면 모델에서 단어 힌트를 지원하는지도 확인합니다.

회의가 끝난 뒤 결정 사항을 검수하기

긴 파일에서는 전체 처리시간과 첫 결과를 따로 재고, 회의가 끝난 뒤 검색할 수 있는 기록으로 정리합니다. 아래는 실제 회의 전사나 모델 측정이 아닌 검수 형식 예시입니다.

발언 예: “초안은 금요일까지 공유하고, 공개 일정은 법무 확인 뒤 정하죠.” → 전사 초안: ‘초안 금요일까지 공유. 공개 일정 법무 확인 후 결정.’ → 사람이 확정할 항목: 초안 담당자, 금요일의 날짜·시간, 법무 확인 담당자, 공개 일정 확정 시점.

요약은 결론처럼 보여도 녹음과 대조해 승인하기 전에는 확정 기록으로 취급하지 마세요.

문이 닫힌 저녁 작업실의 녹음기와 전사 화면
첫 결과 지연과 파일 전체 완료시간을 각각 기록합니다.

음성 파일과 전사문을 안전하게 다루기

처음에는 공개해도 되는 음성을 시험에 쓰고, 민감한 회의는 권한과 보관 정책을 확인하세요. 로컬 서버를 쓴다면 주소를 `127.0.0.1`로 제한하고 외부 네트워크에 열지 않습니다. 자동 결과에서 결정, 숫자, 이름은 원본과 대조해 사람이 확인해야 합니다. 오프라인 실행만으로 전사문 보관이 자동으로 안전해지지는 않습니다.

용어 각주

  1. 자동 음성 인식음성에서 발화를 인식해 텍스트로 변환하는 기술입니다. 인식 결과는 발화 내용을 나타내며 음향 자체를 복원하는 것은 아닙니다.

    본문으로 돌아가기
  2. CUDANVIDIA GPU에서 범용 계산을 실행하기 위한 소프트웨어 플랫폼입니다. CUDA용으로 만든 프로그램은 다른 GPU에서 그대로 동작한다고 보장되지 않습니다.

    본문으로 돌아가기
  3. CPU컴퓨터에서 일반적인 프로그램 명령을 실행하는 중앙 처리 장치입니다. AI 작업에서는 GPU 등 다른 프로세서와 역할을 나누기도 합니다.

    본문으로 돌아가기
  4. CLICommand-Line Interface의 약자입니다. 터미널에 명령어를 입력해 프로그램을 조작하는 방식입니다.

    본문으로 돌아가기