본문으로 건너뛰기

Windows용 로컬 음성 받아쓰기 Dictata

whisper.cpp 기반 Dictata가 Windows 전역 단축키 음성 받아쓰기와 로컬 LLM 후처리를 제공합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Dictata는 Windows에서 whisper.cpp와 whisper-rs를 사용해 음성을 기기 안에서 텍스트로 바꾸고 현재 애플리케이션에 붙여 넣는 Rust 기반 받아쓰기 도구입니다. 단축키 입력, 스트리밍 받아쓰기, VAD 기반 침묵 제거, 마이크와 시스템 오디오 혼합, 파일 전사, 로컬 OpenAI-compatible LLM 후처리를 제공합니다. Vulkan GPU 또는 CPU 실행을 선택할 수 있으며 ggml 모델 라이브러리와 HuggingFace 검색으로 모델을 관리합니다. v0.1.0 기준 Linux는 지원되지 않고, MIT License와 Commons Clause에 따라 소프트웨어 판매 및 유료 서비스 제공에는 제한이 있습니다.

섹션별 상세

01
Dictata는 Windows 10/11에서 전역 단축키로 음성을 받아쓰고 결과를 현재 활성 애플리케이션에 붙여 넣는 Rust 기반 로컬 애플리케이션입니다. 사용자가 단축키를 누르고 말한 뒤 다시 누르면 whisper.cpp가 기기 안에서 음성을 텍스트로 변환하고 자동 붙여넣기를 수행합니다. 모든 처리가 로컬에서 이뤄져 음성 데이터가 외부로 전송되지 않는 점이 핵심 사용 이유입니다.
02
일반 받아쓰기 외에도 일시정지마다 텍스트를 삽입하는 Continuous mode와 음성이 없는 구간을 건너뛰는 whisper.cpp VAD가 제공됩니다. VAD는 표준 비스트리밍 받아쓰기에서 침묵 구간을 분리하고, 첫 사용 때 약 2MB 모델을 내려받아 연산량과 무음 구간의 환각을 줄입니다. 출력은 원문 그대로 남기거나 로컬 OpenAI-compatible LLM을 거쳐 이메일, 메시지, 목록 형식으로 정리할 수 있습니다.
03
오디오 입력은 마이크, WASAPI loopback을 통한 시스템 오디오, 두 입력의 혼합으로 구성할 수 있어 회의 모드에 대응합니다. 파일 변환 기능은 History 페이지에서 오디오와 비디오 파일을 받고 ffmpeg가 처리할 수 있는 형식을 모두 다룹니다. 사용자는 custom vocabulary와 replacements를 initial prompt에 주입해 특정 단어의 인식과 후처리 결과를 조정할 수 있습니다.
bash
cargo build --release

Rust 프로젝트를 최적화된 Release 바이너리로 빌드합니다.

toml
[build]
target-dir = "C:/wt" # any short path

Windows의 MAX_PATH 제한을 피하기 위해 Cargo 빌드 산출물을 짧은 경로에 저장합니다.

bash
VsDevCmd.bat -arch=amd64 && set CMAKE_GENERATOR=Ninja && set CMAKE_GENERATOR_INSTANCE= && set VULKAN_SDK=<SDK path> && cargo build

Visual Studio 개발 환경과 Vulkan SDK를 설정한 뒤 Ninja 생성기로 GPU 지원 빌드를 수행합니다.

bash
cargo build --release --no-default-features

Vulkan SDK 없이 CPU 전용 Release 빌드를 생성합니다.

04
음성 인식은 CPU 또는 Vulkan GPU에서 실행되며 AMD, Intel, NVIDIA GPU를 지원합니다. 내장 ggml 모델 라이브러리는 모델 다운로드와 삭제를 제공하고, Vulkan 실행 시 GPU와 VRAM을 감지하며 CPU 실행 시 RAM을 기준으로 하드웨어에 맞는 모델을 추천합니다. HuggingFace에서는 직접 URL, 저장소 이름, 키워드 검색으로 ggml .bin 모델을 설치할 수 있습니다.
05
프로젝트는 Rust 모듈로 오디오 캡처, 16kHz 리샘플링, 모델 로딩, 스트리밍 청크 분할, 설정 화면, 트레이 아이콘, 전역 단축키와 이력 관리를 나눕니다. 64개 unit test가 설정, 오디오 혼합, 모드, 하드웨어 평가, HuggingFace 쿼리 파싱, 다운로드 안전성 등을 검증합니다. 현재 릴리스는 v0.1.0이며 Linux 지원은 정식 기능이 아니라 LINUX.md에 제한 사항과 미실행 패키징 스크립트가 따로 기록돼 있습니다.
bash
cargo run --example transcribe -- <file.wav> # DICTATA_GPU=1 for GPU

CLI 예제로 오디오 파일을 변환하며 DICTATA_GPU=1 설정으로 GPU 사용을 지정할 수 있습니다.

용어 해설

whisper.cpp
OpenAI Whisper 계열 음성 인식 모델을 C++로 실행하는 구현체입니다. Dictata는 이를 통해 음성을 로컬에서 텍스트로 변환하며, 네트워크 전송 없이 Windows 환경에서 받아쓰기 기능을 처리합니다.
음성 활동 감지(Voice Activity Detection)
오디오에서 실제 음성이 발생한 구간과 침묵 구간을 구분하는 처리입니다. Dictata는 침묵을 건너뛰어 불필요한 연산과 무음 구간의 오인식을 줄이는 데 활용합니다.
Vulkan
GPU 연산을 위한 저수준 그래픽·컴퓨트 API입니다. Dictata는 Vulkan 기능을 활성화하면 AMD, Intel, NVIDIA GPU를 사용해 Whisper 음성 인식을 실행할 수 있습니다.
WASAPI 루프백(WASAPI loopback)
Windows 오디오 시스템에서 컴퓨터가 재생하는 시스템 오디오를 입력으로 캡처하는 방식입니다. Dictata는 마이크와 함께 사용하거나 둘을 섞어 회의 음성을 받아쓸 수 있습니다.
ggml 모델(ggml model)
ggml 형식으로 저장된 로컬 추론용 모델 파일입니다. Dictata는 내장 모델 목록과 HuggingFace 검색을 통해 모델을 내려받고, GPU 메모리나 시스템 RAM에 맞는 모델을 고를 수 있게 합니다.

기술

  • Rust
  • whisper.cpp
  • whisper-rs
  • Vulkan
  • CUDA
  • ffmpeg
  • WASAPI loopback
  • cpal
  • egui
  • HuggingFace
  • ggml

활용 사례

  • 전역 단축키 기반 음성 받아쓰기
  • 회의 음성 받아쓰기
  • 활성 애플리케이션에 실시간 텍스트 입력
  • 오디오·비디오 파일 전사
  • 로컬 LLM을 이용한 이메일·메시지·목록 정리
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 15.수집 2026. 08. 15.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.