로컬 음성 인식·합성
Orukeet 로컬 전사 가이드: 영어·유럽어 음성을 Mac에서 받아쓰기
Orukeet은 영어·유럽어 중심의 음성 파일을 전사하는 로컬 ASR이에요.
Orukeet은 녹음을 글로 옮기는 0.6B급 ASR1 모델이에요. 영어와 유럽어 중심의 25개 언어를 지원하고, 약 714MB의 Q8 GGUF2로 Mac의 Metal3에서도 실행할 수 있어요. 자동 설치기로 모델과 실행기를 준비한 뒤 짧은 WAV 파일을 전사해봐요.
Orukeet이 전사하는 언어와 결과
Orukeet은 녹음 파일을 받아 인식한 문장을 텍스트로 돌려주는 자동 음성 인식(ASR) 모델이에요. 2026년 9월 11일 공개된 0.6B급 모델이며, 모델 카드에 따르면 NVIDIA Parakeet TDT 0.6B v3를 바탕으로 구성했어요. 주 용도는 전사이고, 화자 감정 분석이나 화자 분리4를 위한 diarization 도구는 아니에요.
모델 카드의 25개 언어는 불가리아어, 크로아티아어, 체코어, 덴마크어, 네덜란드어, 영어, 에스토니아어, 핀란드어, 프랑스어, 독일어, 그리스어, 헝가리어, 이탈리아어, 라트비아어, 리투아니아어, 몰타어, 폴란드어, 포르투갈어, 루마니아어, 러시아어, 슬로바키아어, 슬로베니아어, 스페인어, 스웨덴어, 우크라이나어예요. 한국어와 일본어는 목록에 없어요. 한국어 녹음이 주 작업이라면 한국어를 지원하는 ASR을 고르세요.

Mac에서는 작은 Q8 GGUF부터 시작해요
NeMo 원본은 재학습과 공식 평가 경로에 가깝고, 로컬 전사 앱이나 Mac에서 쓰려면 native GGUF가 간단한 출발점이에요. native Q8 파일은 714,456,704 bytes(약 714 MB)이고 F16 파일은 약 1.30 GB이에요. ONNX INT8 압축 파일은 약 487 MB이며 풀면 약 672 MB이에요. 다운로드 파일 크기는 실행 중 RAM/VRAM 사용량이 아니므로 이를 메모리 요구량으로 옮겨 쓰면 안 됩니다.
Apple Silicon의 native 패키지는 Metal 실행기를 선택할 수 있고, NVIDIA 장치가 감지되면 CUDA5 경로를 택하며, 그 밖에는 CPU6 실행을 시도해요. 다만 설치기는 시스템에서 쓸 수 있는 런타임7에 따라 선택 결과가 달라질 수 있으니 설치 결과 JSON의 `device`, `model`, `runtime` 값을 보관해 두면 다음 실행에서 환경을 확인하기 쉽습니다.
| 경로 | 대략적인 배포 파일 | 주요 조건 |
|---|---|---|
| NeMo | 2,509,342,720 bytes | 공식 평가·NeMo 설치 필요 |
| native Q8 GGUF | 714,456,704 bytes | Metal·CUDA·CPU 런타임 |
| ONNX INT8 | 압축 486,807,585 bytes; 해제 약 672 MB | sherpa-onnx 경로 |
다운로드 파일과 실제 사용권은 모델 코드와 분리해 확인합니다
NeMo
- 대략적인 배포 파일
- 2,509,342,720 bytes
- 주요 조건
- 공식 평가·NeMo 설치 필요
native Q8 GGUF
- 대략적인 배포 파일
- 714,456,704 bytes
- 주요 조건
- Metal·CUDA·CPU 런타임
ONNX INT8
- 대략적인 배포 파일
- 압축 486,807,585 bytes; 해제 약 672 MB
- 주요 조건
- sherpa-onnx 경로
Python 3.12 이상에서 녹음 파일을 글로 옮겨봐요
공식 모델 카드는 Python 3.12 이상과 v0.1.1 휠을 안내해요. 활성화한 가상환경8에 휠을 설치하고 `orukeet install`로 Q8 가중치와 native 런타임을 내려받아요. 한 번 불러온 모델을 녹음마다 다시 로드하지 않도록, 실제 앱에서는 `Orukeet` 객체를 유지한 채 파일마다 `transcribe()`를 호출해요.
먼저 짧은 WAV 파일로 시험하고, 반환된 `text` 필드와 설치 JSON을 함께 확인해요. 단어가 빠지면 녹음 언어가 지원 목록에 있는지, 입력 파일이 열리는지, 선택한 runtime이 설치됐는지 차례로 점검해요. 전사가 나오면 긴 파일로 넘어가기 전에 원본과 대조해 누락을 살펴봐요.
python -m pip install --upgrade \
https://github.com/Oruk-AI/orukeet/releases/download/v0.1.1/orukeet-0.1.1-py3-none-any.whl
orukeet install --device auto --cache ./orukeet-cache --output installation.jsonimport json
from pathlib import Path
from orukeet import Orukeet
config = json.loads(Path("installation.json").read_text(encoding="utf-8-sig"))
with Orukeet(config["model"], config["runtime"], device=config["device"]) as asr:
result = asr.transcribe("recording.wav")
print(result["text"])

공식 평가에서 단어 오류율이 11.01%에서 9.85%로 줄었어요
Oruk AI는 25개 언어 FLEURS에서 pooled WER 11.01%의 기준값이 Orukeet에서 9.85%가 됐다고 보고했어요. 평가는 총 20,146개 음성 녹음으로 구성되며 같은 NeMo greedy-batch TDT 경로, FP329 가중치, CUDA BF1610 autocast 조건을 썼습니다. 따라서 9.85%는 해당 집계와 추론 조건에 대한 모델 카드의 결과이지 모든 오디오에서 보장하는 오류율은 아닙니다.
논문은 추가 학습과 체크포인트11 선택에 LibriSpeech test-other를 사용했다고 밝혔어요. 이 평가 자료는 모델 개발에도 쓰였으므로 점수를 읽을 때 함께 고려해야 해요. 내 녹음에서는 같은 파일과 실행 설정을 유지한 채 누락하거나 잘못 적은 단어를 비교해보세요.
| 모델 | 단어 오류율(WER) | 평가 조건 |
|---|---|---|
| Parakeet TDT 0.6B v3 | 11.01% | 20,146개 녹음, greedy-batch TDT, FP32 가중치·CUDA BF16 autocast |
| Orukeet | 9.85% | 같은 조건 |
동일한 NeMo 평가 경로의 FLEURS 25개 언어 집계예요.
Parakeet TDT 0.6B v3
- 단어 오류율(WER)
- 11.01%
- 평가 조건
- 20,146개 녹음, greedy-batch TDT, FP32 가중치·CUDA BF16 autocast
Orukeet
- 단어 오류율(WER)
- 9.85%
- 평가 조건
- 같은 조건
가중치를 배포할 때는 CC BY-SA 4.0을 확인해요
저장소의 코드는 MIT로, Hugging Face 모델 카드의 가중치와 fitted kernels는 CC BY-SA 4.0으로 표기되어 있어요. 모델을 변형해 배포하거나 가중치를 재배포한다면 코드 라이선스만 확인해서는 부족합니다. 출처 표시와 동일조건변경허락을 포함해 가중치 조건을 따로 검토하세요.
영어·유럽어 녹음의 로컬 전사가 목적이고 전사문과 구간 시각이 필요하다면 native 출력 형식을 확인한 뒤 짧은 샘플로 평가할 만합니다. 화자 식별, 감정 분석, 한국어 지원이 핵심이면 이 모델의 공개 범위와 맞지 않으므로 다른 도구를 고르는 편이 낫습니다.
전사문이 나오지 않으면 언어·파일·실행기를 확인해요
설치 명령 뒤 다운로드 검증이나 runtime 선택이 실패하면 `installation.json`이 만들어졌는지 확인하고, 오류가 가리키는 `device`와 `runtime` 경로가 현재 OS에 맞는지 살펴보세요. 모델 파일을 찾지 못한다면 `--cache`에 지정한 폴더의 쓰기 권한과 내려받은 Q8 파일을 확인해요. native 패키지는 모델과 런타임을 설치기가 함께 확인하므로, 이 단계를 건너뛰고 파이썬 코드부터 고치지 않습니다.
전사문이 비어 있으면 먼저 녹음 언어가 지원 목록에 있는지, 파일 형식과 오디오 트랙이 열리는지 확인해요. 텍스트는 나오지만 단어가 빠질 때는 짧은 구간을 다시 들으며 녹음 상태와 전사 결과를 비교해요. 다른 언어 성능은 실제 사용할 언어의 음성 샘플로 따로 확인해요.
용어 각주
자동 음성 인식 — 음성에서 발화를 인식해 텍스트로 변환하는 기술입니다.
본문으로 돌아가기GGUF — 모델 정보를 담는 파일 형식으로 llama.cpp 계열 도구에서 널리 사용됩니다.
본문으로 돌아가기Metal — Apple 기기에서 그래픽과 GPU 병렬 계산을 실행하는 저수준 기술입니다.
본문으로 돌아가기화자 분리 — 녹음에서 누가 언제 말했는지 구간을 나누고 화자별로 표시하는 작업입니다.
본문으로 돌아가기CUDA — NVIDIA GPU에서 범용 계산을 실행하기 위한 소프트웨어 플랫폼입니다.
본문으로 돌아가기CPU — 컴퓨터에서 일반적인 프로그램 명령을 실행하는 중앙 처리 장치입니다. AI 작업에서는 GPU 등 다른 프로세서와 역할을 나누기도 합니다.
본문으로 돌아가기런타임 — 프로그램이 실행될 때 필요한 기능을 제공하는 소프트웨어 환경입니다. 로컬 AI에서는 모델을 실행하는 엔진을 가리키기도 합니다.
본문으로 돌아가기Python 가상환경 — 프로젝트별로 Python 패키지를 분리해 설치하는 공간입니다. 패키지 버전 충돌을 줄이는 데 쓰입니다.
본문으로 돌아가기FP32 — 32비트 부동소수점 수치 형식입니다. BF16보다 값 하나에 더 많은 메모리를 쓰며 수치를 더 세밀하게 표현할 수 있습니다.
본문으로 돌아가기BF16 — 모델의 수를 저장하고 계산하는 16비트 부동소수점 형식입니다. 사용 가능 여부는 하드웨어와 실행 프로그램에 달려 있습니다.
본문으로 돌아가기체크포인트 — 학습된 모델의 가중치 등을 저장한 파일입니다. 같은 모델 계열도 버전이나 용도에 따라 다른 체크포인트를 쓸 수 있습니다.
본문으로 돌아가기
