로컬 음성 인식·합성

로컬 음성 비서 만들기: ASR·LLM·MCP·TTS 연결 가이드

말을 알아듣는 것과 컴퓨터를 움직이는 것은 다른 단계입니다

로컬 음성 비서는 ASR1, LLM2, 도구 실행, TTS3를 차례로 연결합니다. 각 단계의 지연과 권한을 따로 봐야 빠르고 안전하게 만들 수 있습니다.

실행 조건과 핵심 내용
  • ASR·판단·도구·TTS 지연을 따로 잽니다.
  • MCP 서버는 설치한 프로그램과 같은 수준으로 신뢰해야 합니다.
  • 읽기 전용 도구부터 연결합니다.
  • 확인 질문과 취소 경로를 둡니다.

한 문장을 네 단계로 나눠 봅니다

마이크 입력을 ASR이 글로 바꾸고, LLM이 요청 의도를 판단합니다. 파일 검색이나 일정 조회가 필요하면 MCP4 도구를 호출하고, 완성된 답을 TTS가 다시 음성으로 읽습니다. 어느 단계든 늦으면 전체 대화가 끊겨 보입니다.

처음에는 스트리밍 ASR, 짧은 시스템 프롬프트, 작은 판단 모델, 짧은 음성 답변으로 왕복 시간을 줄입니다. 긴 설명이 필요할 때만 더 큰 모델이나 긴 TTS 출력을 쓰는 계층형 구성이 실용적입니다.

마이크와 로컬 AI 장비와 도구와 스피커가 이어진 음성 비서
음성 인식, 판단, 도구 실행, 음성 합성의 시간을 따로 재야 느린 구간을 찾을 수 있습니다.

속도는 첫 부분 응답이 나오는 시간으로 봅니다

ASR이 문장 끝까지 기다리는 시간, LLM의 첫 토큰5, 도구 실행, TTS의 첫 오디오를 각각 기록합니다. 전체 완료시간만 보면 어느 부분을 바꿔야 할지 알기 어렵습니다.

말이 끝나기 전에 부분 전사를 넘기고, LLM 답의 첫 문장이 완성되면 TTS를 시작하면 체감 대기를 줄일 수 있습니다. 다만 중간 결과가 바뀔 수 있으므로 명령 실행은 최종 전사나 사용자 확인 뒤에 진행합니다.

MCP 서버는 로컬 앱을 설치하듯 검토합니다

로컬 MCP 서버는 실행 계정이 가진 파일과 프로그램 권한을 사용할 수 있습니다. 출처와 코드를 확인하고 필요한 디렉터리만 접근시키며, 공개 네트워크에 노출하는 서버에는 인증을 둡니다.

처음에는 검색과 조회처럼 되돌리기 쉬운 도구만 연결합니다. 파일 삭제, 결제, 외부 메시지 전송은 실행 전 확인을 받고, 요청과 결과를 사용자가 읽을 수 있는 형태로 남깁니다.

로컬 AI가 서로 다른 권한의 도구 모듈에 연결된 장면
조회처럼 되돌리기 쉬운 도구부터 열고 전송과 변경 권한은 별도로 제한합니다.

첫 버전은 하나의 안전한 일을 끝까지 연결합니다

‘회의 녹음을 전사하고 오늘 할 일을 읽어 주기’처럼 입력과 출력이 분명한 한 가지 흐름을 정합니다. ASR 정확도, 도구 성공률, 첫 음성 응답시간을 같은 시나리오로 반복 측정합니다.

그 흐름이 안정된 뒤 캘린더, 문서 검색, 홈 자동화처럼 권한이 다른 도구를 하나씩 추가합니다. 기능 수보다 실패했을 때 멈추고 사용자에게 무엇이 안 됐는지 말할 수 있는지가 먼저입니다.

마이크와 로컬 AI 컴퓨터와 스피커가 놓인 실제 서재
첫 버전은 회의 기록이나 일정 조회처럼 하나의 흐름을 끝까지 안정시키는 데 집중합니다.

용어 각주

  1. 자동 음성 인식 — 음성에서 발화를 인식해 텍스트로 변환하는 기술입니다. 인식 결과는 발화 내용을 나타내며 음향 자체를 복원하는 것은 아닙니다.

    본문으로 돌아가기
  2. 대규모 언어 모델 — 대량의 텍스트 데이터로 학습해 텍스트를 처리하고 생성하는 언어 모델입니다. 기능과 지원 입력은 모델마다 다릅니다.

    본문으로 돌아가기
  3. 음성 합성 — 텍스트를 발음과 운율을 가진 음성 신호로 변환하는 기술입니다. 출력 음성의 특성은 모델과 설정에 따라 다릅니다.

    본문으로 돌아가기
  4. MCP — 모델이 사용할 도구와 데이터 소스를 클라이언트에 연결하기 위한 프로토콜입니다. 연결이 가능하다는 사실과 해당 도구를 실행할 권한은 따로 설정해야 합니다.

    본문으로 돌아가기
  5. 토큰 — 모델이 입력이나 출력을 나누어 처리하는 단위입니다. 토큰 하나가 글자 하나나 일정한 시간 길이에 해당하지는 않습니다.

    본문으로 돌아가기