TL;DR
Dictata는 Windows에서 whisper.cpp와 whisper-rs를 사용해 음성을 기기 안에서 텍스트로 바꾸고 현재 애플리케이션에 붙여 넣는 Rust 기반 받아쓰기 도구입니다. 단축키 입력, 스트리밍 받아쓰기, VAD 기반 침묵 제거, 마이크와 시스템 오디오 혼합, 파일 전사, 로컬 OpenAI-compatible LLM 후처리를 제공합니다. Vulkan GPU 또는 CPU 실행을 선택할 수 있으며 ggml 모델 라이브러리와 HuggingFace 검색으로 모델을 관리합니다. v0.1.0 기준 Linux는 지원되지 않고, MIT License와 Commons Clause에 따라 소프트웨어 판매 및 유료 서비스 제공에는 제한이 있습니다.
섹션별 상세
cargo build --releaseRust 프로젝트를 최적화된 Release 바이너리로 빌드합니다.
[build]
target-dir = "C:/wt" # any short pathWindows의 MAX_PATH 제한을 피하기 위해 Cargo 빌드 산출물을 짧은 경로에 저장합니다.
VsDevCmd.bat -arch=amd64 && set CMAKE_GENERATOR=Ninja && set CMAKE_GENERATOR_INSTANCE= && set VULKAN_SDK=<SDK path> && cargo buildVisual Studio 개발 환경과 Vulkan SDK를 설정한 뒤 Ninja 생성기로 GPU 지원 빌드를 수행합니다.
cargo build --release --no-default-featuresVulkan SDK 없이 CPU 전용 Release 빌드를 생성합니다.
cargo run --example transcribe -- <file.wav> # DICTATA_GPU=1 for GPUCLI 예제로 오디오 파일을 변환하며 DICTATA_GPU=1 설정으로 GPU 사용을 지정할 수 있습니다.
용어 해설
- whisper.cpp
- — OpenAI Whisper 계열 음성 인식 모델을 C++로 실행하는 구현체입니다. Dictata는 이를 통해 음성을 로컬에서 텍스트로 변환하며, 네트워크 전송 없이 Windows 환경에서 받아쓰기 기능을 처리합니다.
- 음성 활동 감지(Voice Activity Detection)
- — 오디오에서 실제 음성이 발생한 구간과 침묵 구간을 구분하는 처리입니다. Dictata는 침묵을 건너뛰어 불필요한 연산과 무음 구간의 오인식을 줄이는 데 활용합니다.
- Vulkan
- — GPU 연산을 위한 저수준 그래픽·컴퓨트 API입니다. Dictata는 Vulkan 기능을 활성화하면 AMD, Intel, NVIDIA GPU를 사용해 Whisper 음성 인식을 실행할 수 있습니다.
- WASAPI 루프백(WASAPI loopback)
- — Windows 오디오 시스템에서 컴퓨터가 재생하는 시스템 오디오를 입력으로 캡처하는 방식입니다. Dictata는 마이크와 함께 사용하거나 둘을 섞어 회의 음성을 받아쓸 수 있습니다.
- ggml 모델(ggml model)
- — ggml 형식으로 저장된 로컬 추론용 모델 파일입니다. Dictata는 내장 모델 목록과 HuggingFace 검색을 통해 모델을 내려받고, GPU 메모리나 시스템 RAM에 맞는 모델을 고를 수 있게 합니다.
기술
- Rust
- whisper.cpp
- whisper-rs
- Vulkan
- CUDA
- ffmpeg
- WASAPI loopback
- cpal
- egui
- HuggingFace
- ggml
활용 사례
- 전역 단축키 기반 음성 받아쓰기
- 회의 음성 받아쓰기
- 활성 애플리케이션에 실시간 텍스트 입력
- 오디오·비디오 파일 전사
- 로컬 LLM을 이용한 이메일·메시지·목록 정리
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.