온디바이스 AI로 즉시 타이핑하는 macOS 딕테이션 앱
FluidVoice는 macOS에서 온디바이스 음성인식과 선택적 로컬 AI 후처리를 결합해 즉시 전사와 앱 내 자동 타이핑을 제공하는 딕테이션 애플리케이션이다. 이 앱은 Parakeet·Nemotron·Whisper 등 여러 모델을 지원하고 접근성 API를 통해 포커스된 텍스트 필드에 자동 입력을 수행한다. 모든 음성 데이터와 전사 내용은 사용자가 클라우드 AI를 선택하지 않는 한 기기를 떠나지 않는다.
TL;DR
FluidVoice는 macOS에서 온디바이스 음성 인식과 선택적 로컬 AI 후처리를 결합한 딕테이션 애플리케이션이다. 여러 네이티브 및 외부 모델(Parakeet, Nemotron, Whisper 등)을 지원해 사용자가 정확도와 지연 사이에서 선택할 수 있고 접근성 API를 통해 포커스된 앱에 자동으로 전사 내용을 입력한다. 로컬 우선 아키텍처와 별도의 Fluid Intelligence 런타임은 데이터가 기기를 벗어나지 않도록 설계되어 개인정보 보호와 낮은 지연을 동시에 추구한다. 단점으로는 macOS 15 이상 및 Apple Silicon 권장 등의 하드웨어 요구사항과 Fluid Intelligence 모델을 위한 추가 디스크 공간이 필요하다는 점이 있다.
주요 기능
- 온디바이스 실시간 전사와 라이브 미리보기를 제공한다. 사용자는 전사 결과를 즉시 화면에서 확인할 수 있고 노치 인지를 포함한 오버레이 크기와 위치를 조정할 수 있다. 라이브 프리뷰는 대기 시간을 최소화하도록 Parakeet 네이티브 구현을 사용해 실시간 반응을 목표로 한다.
- 애플리케이션 제어를 위한 커맨드 모드를 지원한다. 음성으로 앱 실행, 단축어 트리거, 시스템 액션을 호출할 수 있으며 별도 키보드 조작 없이 워크플로 자동화가 가능하다. 커맨드 모드는 접근성 권한을 통해 안정적으로 다른 앱과 상호작용한다.
- 텍스트 필드에 직접 쓰는 쓰기 모드를 제공한다. 선택한 텍스트를 재작성하거나 새 텍스트를 인라인으로 삽입할 수 있고 접근성 API를 이용해 다양한 앱에 일관된 입력을 수행한다. 앱 간 입력 호환성은 macOS 접근성 권한 설정에 의해 보장된다.
- 로컬 AI 기반 후처리인 Fluid Intelligence를 선택적으로 적용할 수 있다. 이 옵션은 스마트 포맷팅, 문맥 기반 대문자화, 후처리 정제를 로컬에서 수행해 데이터가 외부로 전송되지 않도록 설계되어 있다. Fluid Intelligence 모델은 별도 다운로드를 통해 온디바이스에서 실행된다.
- 음성 모델 선택과 오디오 기록, 통계 기능을 제공한다. 여러 크기와 지연 특성의 모델을 사용자가 선택할 수 있으며 로컬 기록의 용량과 보관 방식은 사용자가 제어할 수 있다. 통계 헤더와 일별 사용량 요약으로 사용 패턴을 한눈에 파악할 수 있다.
어떻게 동작하는가
앱은 로컬 음성 모델(Parakeet, Nemotron, Whisper 등)을 사용해 입력된 음성을 실시간으로 텍스트로 변환하고, 접근성 API를 통해 포커스된 애플리케이션에 해당 텍스트를 자동으로 입력한다. 선택적 후처리 단계인 Fluid Intelligence는 로컬에서 작동하며 전사 결과에 스마트 포맷팅과 문맥 기반 수정 작업을 적용한다. 모델 다운로드와 실행은 기기 자원(디스크, Apple Silicon)을 기준으로 구성되며 사용자가 클라우드 제공자를 명시적으로 등록할 경우에만 네트워크 기반 보조 처리가 이루어진다.
해결 문제
마이크로폰에서 입력한 음성을 네트워크 전송 없이 즉시 전사하고 원하는 앱 텍스트 필드에 자동으로 삽입하는 불편을 해소한다. 음성 인식과 후처리를 로컬에서 끝내어 개인정보 노출 우려와 네트워크 지연을 줄인다. 또한 다양한 모델을 선택해 언어·지연 요구사항에 맞춘 전사 품질과 속도 균형을 맞출 수 있다.
지금 주목받는 이유
해당 리포지토리는 macOS용 로컬 딕테이션 대안이라는 포지셔닝과 5867개의 스타를 통해 빠르게 관심을 모았다. 로컬 AI 후처리와 즉시 입력이라는 실용적 조합이 커뮤니티에서 주목을 받는 배경으로 작용했다. 또한 Parakeet 네이티브 성능 개선과 멀티모델 지원이 사용성 측면에서 화제를 불러일으켰다.
차별점
- 로컬 우선 아키텍처와 별도 로컬 후처리 런타임인 Fluid Intelligence를 통합했다. 이 구성은 클라우드로 데이터를 보내지 않고도 스마트 포맷팅과 문맥 기반 정제를 수행하게 설계되어 있다. 결과적으로 개인정보 보호와 낮은 지연을 동시에 달성하는 점이 주요 차별점이다.
- Parakeet의 네이티브 구현을 통해 발화와 화면 사이의 지연을 거의 제거한 빠른 실시간 전사를 목표로 한다. README에서 'Insanely fast Parakeet'를 명시하며 네이티브 최적화를 강조하고 있다. 이로 인해 라이브 오버레이에서 즉시 단어가 표시되는 사용자 경험이 개선된다.
- 시스템 접근성 API를 이용한 앱 간 직접 타이핑과 노치 인지 오버레이 같은 사용자환경 통합 기능을 제공한다. 접근성 권한을 통해 다양한 앱에 일관된 입력을 자동화하고 노치가 있는 디바이스에서도 시각적 방해를 최소화하도록 UI를 조정한다. 이러한 통합성은 일반적인 클립보드 기반 워크플로보다 더 신뢰성 있는 입력을 보장한다.
사용 사례
- 회의나 인터뷰를 실시간으로 전사해 다른 애플리케이션에 바로 붙여넣는 상황에서 유용하다. 오버레이로 발화 내용을 확인하면서 바로 문서, 메모, 채팅 입력란에 자동으로 삽입할 수 있다. 로컬 전사와 선택적 로컬 후처리 옵션으로 민감한 녹음 자료도 외부 전송 없이 처리할 수 있다.
- 개발자나 파워유저가 음성으로 시스템 명령을 실행해 반복 작업을 자동화하는 워크플로에 적합하다. 커맨드 모드를 통해 앱 실행, 단축어 호출, 스크립트 트리거 등을 음성으로 수행할 수 있으며 키보드 사용을 최소화한다. 접근성 API 기반의 신뢰성 있는 입력으로 복잡한 워크플로도 안정적으로 제어할 수 있다.
- 언어별·지연 요구가 다른 환경에서 모델을 교체해 최적의 전사 경험을 찾는 실험적 사용에 적합하다. 사용자는 Nemotron, Parakeet, Whisper 등 모델을 선택해 정확도와 실시간성 사이의 균형을 조정할 수 있다. 멀티모델 지원은 다양한 언어와 하드웨어(Apple Silicon vs Intel)에서 유연한 운영을 가능하게 한다.
시작하기
Homebrew를 통해 간단히 설치하거나 릴리스 페이지에서 수동으로 다운로드할 수 있다. 설치 후 마이크와 접근성 권한을 허용하고 설정에서 글로벌 핫키를 지정하면 어디서든 음성 캡처가 가능하다. 온보딩에서 원하는 음성 모델을 선택하고(로컬 Fluid Intelligence는 선택적 다운로드) 필요에 따라 클라우드 AI 키를 등록하면 추가 후처리를 활성화할 수 있다.
요구사항
- macOS 15.0(Sequoia) 이상이 필요하다.
- Apple Silicon Mac이 권장되며 대부분의 모델이 Apple Silicon에서 실행되도록 안내되어 있다.
- Intel Mac은 Whisper 모델을 통해 제한적으로 지원되며 특정 모델은 Apple Silicon 전용이다.
- ~1 GB의 모델 저장 공간이 필요하며 Fluid Intelligence는 선택 시 약 3.5 GB의 추가 디스크 용량이 요구된다.
- 마이크 접근 권한과 접근성(타 입력 앱에 텍스트 입력 권한)이 반드시 필요하다.
이미지 분석


7.4k
Stars
462
Forks
+206
Trending
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.