본문으로 건너뛰기

Windows용 로컬 음성 입력 앱 Dictata

Dictata가 whisper.cpp와 ONNX backend로 Windows 음성 전사를 로컬 처리합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Dictata는 Rust로 작성된 Windows용 로컬 음성 입력 애플리케이션으로, 전역 단축키로 음성을 받아 whisper.cpp 또는 선택한 ONNX backend에서 전사한 뒤 현재 앱에 붙여 넣습니다. Continuous mode는 pause 단위로 텍스트를 스트리밍하고, VAD는 침묵을 건너뛰며, 마이크·시스템 오디오·혼합 입력과 파일 전사를 지원합니다. ggml 및 ONNX 모델을 내장 카탈로그와 HuggingFace 검색으로 설치할 수 있고, 결과는 로컬 OpenAI-compatible LLM으로 정리할 수 있습니다. 현재 release는 v0.1.0이며 Windows 전용이고, cargo test 기준 83개 unit test가 포함되어 있습니다.

섹션별 상세

01
Dictata는 Windows 10/11에서 실행되는 Rust 기반 로컬 음성 입력 애플리케이션으로, 전사 데이터가 기기 밖으로 나가지 않는 구조를 채택했습니다. 전역 단축키를 누르고 말한 뒤 다시 누르면 선택한 음성 모델이 텍스트를 만들고 현재 애플리케이션에 자동으로 붙여 넣습니다. 기본 backend는 whisper.cpp이며 Parakeet, SenseVoice, Moonshine, Zipformer를 ONNX backend로 선택할 수 있어 로컬 전사 방식과 모델 선택 폭을 넓혔습니다.
02
일반 받아쓰기에서는 음성이 끝난 뒤 전사하고, Continuous mode에서는 감지된 pause를 기준으로 오디오를 나눠 말하는 중에도 텍스트를 점진적으로 삽입합니다. 선택적 VAD는 약 2MB 모델로 침묵 구간을 걸러내 계산량과 무음에서 발생하는 hallucination을 줄이며, 마이크와 WASAPI loopback 또는 두 입력의 혼합을 지원합니다. 따라서 문서 입력뿐 아니라 시스템 오디오가 포함된 회의 전사와 파일 기반 audio/video 전사까지 하나의 기록 흐름으로 처리할 수 있습니다.
03
전사 결과는 원문 그대로 붙여 넣거나 로컬 OpenAI-compatible LLM을 거쳐 cleanup, email, message, list 같은 형식으로 후처리할 수 있습니다. 사용자는 custom vocabulary와 replacements를 initial prompt에 넣고 언어, 단축키, GPU 설정, 모델을 조정할 수 있으며, 모델 페이지에서 ggml 모델과 검증된 ONNX bundle을 내려받을 수 있습니다. HuggingFace 검색은 직접 URL, 저장소 owner/name, 키워드로 모델을 찾도록 구성되어 모델 설치 경로를 애플리케이션 안으로 통합합니다.
04
프로젝트는 main.rs의 상태·단축키·전사 스레드 조정, audio.rs의 16kHz resampling과 ffmpeg decoding, engine 모듈의 backend 감지로 기능을 분리했습니다. GPU 설정은 auto, cpu, vulkan, cuda를 지원하고, 기본 Vulkan 빌드와 CPU 전용 빌드를 Cargo feature로 나누며 ONNX backend는 빌드 시 선택합니다. cargo test 기준 83개 unit test가 설정, 오디오 혼합, 모델 다운로드 안전성, backend 감지, ONNX bundle 처리 등을 검사하지만, 현재 release는 Windows 전용이고 Linux 스크립트는 아직 실행되지 않았습니다.

용어 해설

음성 활동 감지(VAD)
VAD는 오디오에서 사람이 말하는 구간과 침묵을 구분하는 기술입니다. Dictata는 침묵 구간의 처리를 건너뛰어 계산량과 무음에서 발생하는 오인식을 줄입니다.
WASAPI 루프백(WASAPI loopback)
WASAPI loopback은 Windows에서 시스템이 재생하는 오디오를 입력으로 캡처하는 방식입니다. Dictata는 이를 마이크 입력과 섞어 회의 음성을 전사할 수 있습니다.
Vulkan
Vulkan은 그래픽 프로세서에서 연산을 실행하기 위한 저수준 API입니다. Dictata는 Vulkan 지원 whisper-rs를 사용해 AMD, Intel, NVIDIA GPU에서 전사를 실행합니다.
ONNX
ONNX는 학습된 모델을 여러 실행 환경에서 사용할 수 있도록 표현하는 형식입니다. Dictata는 ONNX bundle의 구조를 확인해 Parakeet, SenseVoice, Moonshine, Zipformer backend를 자동 선택합니다.
자동 음성 인식(ASR)
ASR은 음성 신호를 텍스트로 변환하는 기술입니다. Dictata의 AsrEngine trait는 whisper.cpp와 여러 ONNX backend를 하나의 전사 인터페이스 아래에서 연결합니다.

기술

  • Rust
  • whisper.cpp
  • whisper-rs
  • ONNX
  • Parakeet
  • SenseVoice
  • Moonshine
  • Zipformer
  • Vulkan
  • WASAPI
  • ffmpeg
  • Cargo
  • HuggingFace

활용 사례

  • 키보드 입력을 대신하는 시스템 전역 음성 받아쓰기
  • 회의 중 마이크와 시스템 오디오를 함께 기록하는 전사
  • 오디오·비디오 파일의 로컬 텍스트 변환
  • 전사 결과를 이메일, 메시지, 목록 형식으로 정리하는 후처리
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 23.수집 2026. 08. 23.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.