오프라인 BYOK 기반 실시간 인터뷰와 미팅 AI 오버레이
로컬 실행과 BYOK를 지원해 실시간 전사, 로컬 RAG, 스텔스 오버레이로 인터뷰와 미팅을 보조하는 무료 개인용 데스크톱 애플리케이션이다.
TL;DR
Natively는 데스크톱에서 실시간 전사, 화면 OCR, 로컬 RAG를 결합해 인터뷰와 회의를 보조하도록 설계된 무료 개인용 소스 공개 애플리케이션이다. 내부 설계는 Rust 기반 제로카피 오디오 캡처로 낮은 지연을 확보하고 시스템 오디오와 마이크를 분리해 전사 품질을 높이며, SQLite+sqlite-vec로 과거 회의를 로컬 인덱싱해 컨텍스트를 제공한다. BYOK와 Ollama 연동으로 클라우드 의존도를 낮추고 데이터가 기기를 벗어나지 않도록 하며 대시보드에서 세션 관리와 내보내기를 지원한다. 다만 Linux 지원이 아직 제한적이고 초기 설정에 API 키 입력이나 로컬 모델 설치 과정이 필요하며 내장된 모의면접 모드는 제공되지 않는다.
주요 기능
- 실시간 전사 파이프라인을 제공한다. Rust 기반의 제로카피 오디오 캡처와 하드웨어 가속된 Whisper 온디바이스 모델을 사용해 회의 음성을 낮은 지연으로 텍스트화한다. 이 과정은 시스템 오디오와 마이크를 분리 처리하는 듀얼 채널 구조로 잡음과 발화 혼선을 줄인다.
- 로컬 RAG 메모리를 제공한다. 회의 녹음과 업로드한 문서를 SQLite + sqlite-vec로 임베딩하고 색인해 과거 회의 내용을 문맥으로 즉시 검색해 프롬프트에 주입한다. 이 설계로 모든 데이터와 키가 사용자의 기기에 머물러 프라이버시 노출을 방지한다.
- 투명한 스텔스 오버레이와 프로세스 디스가이즈 기능을 제공한다. 오버레이는 화면 공유 시 시각적으로 노출되지 않도록 동작하고 프로세스 이름 및 UI를 유사 유틸리티로 위장해 탐지 가능성을 낮춘다. 사용자가 원하는 경우 오프라인 Ollama 모델로 완전한 로컬 실행이 가능하다.
- 회의 대시보드와 검색·내보내기 기능을 제공한다. 모든 세션의 전사와 요약을 관리 가능한 아카이브로 보관하고 Markdown, JSON, 텍스트로 내보낼 수 있다. 토큰 사용량과 지연 추적 같은 운영 메트릭을 대시보드에서 확인할 수 있다.
어떻게 동작하는가
오디오 캡처의 입력 층은 Rust로 작성된 네이티브 모듈이 OS 오디오를 제로카피로 읽어 V8 가비지 컬렉션을 우회하는 방식으로 동작해 낮은 CPU 사용률과 짧은 지연을 구현한다. 캡처된 시스템 오디오와 마이크는 별도 파이프라인으로 전사되어 각 채널에 특화된 VAD와 전처리기를 적용한 뒤 ONNX 기반 Whisper 계열 또는 클라우드 STT에 전송된다. 전사 결과와 스크린샷 OCR, 업로드한 문서들은 로컬에서 임베딩되어 sqlite-vec 인덱스로 색인되고 질의 시 관련 세그먼트가 RAG로 병합되어 LLM 프롬프트의 컨텍스트로 주입된다.
해결 문제
온라인 실시간 코딩 테스트와 화상 미팅에서 발화와 화면 정보를 즉시 텍스트화하고 문맥을 유지하는 일이 어려웠다. 이 레포는 로컬에서 음성 전사, 화면 OCR, 과거 회의 검색을 결합해 면접 진행 중 즉시 답변 후보와 요약을 생성하는 솔루션을 제공한다. 또한 외부 서버로 민감한 전사나 스크린샷이 전송되는 것을 차단해 데이터 유출 위험을 줄인다.
지금 주목받는 이유
오픈소스 기반의 개인용 무료 대안으로서 BYOK와 로컬 실행을 결합하고 실시간 전사 지연을 낮춘다는 점이 주목을 받았다.
차별점
- 완전한 로컬 실행 옵션을 지원해 API 키와 전사 데이터가 사용자의 기기를 벗어나지 않도록 설계되었다. 이로 인해 상용 클라우드 중심 대안들이 수반하는 중앙집중형 데이터 저장과 비교해 프라이버시 노출 리스크가 감소한다. 로컬 Ollama 연동으로 네트워크 없이도 기능을 활용할 수 있다.
- 제로카피 Rust 오디오 모듈과 듀얼 채널 전송 구조로 실시간 지연을 500ms 미만으로 유지하는 것을 목표로 설계되었다. 이 구조는 전사 파이프라인의 핵심 병목인 오디오 복사와 V8 가비지 컬렉션 비용을 제거해 낮은 지연과 안정적인 동작을 확보한다. 경쟁 제품의 웹 오디오 방식과 비교해 현저히 낮은 엔드투엔드 지연을 달성한다는 점을 내세운다.
- 로컬 RAG, 대시보드 기반 히스토리 관리, 스킬 기반 커스텀 페르소나를 결합해 단순 오버레이 이상의 상태 기반 지능형 어시스턴트를 구현했다. 회의 문맥을 지속적으로 유지하고 페르소나에 맞춘 템플릿을 적용해 응답 형식을 제어한다. 또한 스크린샷 OCR과 코드 실행 검증을 통해 인터뷰 과정에서 실용적인 피드백을 제공한다.
사용 사례
- 온라인 코딩 인터뷰에서 문제 화면을 캡처해 OCR로 문제를 추출하고 즉시 솔루션 설명과 코드 스니펫을 받는 용도로 활용된다. 이 과정은 오버레이를 통해 화면 공유에는 노출되지 않는 방식으로 동작해 시험 환경의 시각적 노출을 최소화한다. 또한 다중 스크린샷을 연속으로 처리해 복합 문제를 지원한다.
- 회의 도중 핵심 액션 아이템과 의사결정을 자동 요약해 회의 후 바로 공유 가능한 회의록을 생성하는 데 사용된다. 로컬 RAG를 통해 과거 회의의 관련 발언을 참조해 연속성 있는 결론과 follow-up을 도출할 수 있다. 대시보드에서 세션별 검색과 내보내기를 수행해 협업 툴로 전송한다.
- 강의나 세미나에서 실시간 번역과 요약을 제공하고, 녹음한 강의 내용을 로컬 인덱스로 저장해 시간에 따른 질의응답을 가능하게 하는 학습 보조 도구로 사용된다. 페르소나 모드를 통해 학습 목적에 맞춘 요약 스타일을 적용할 수 있다. 오프라인 모드에서도 동작해 네트워크 제약 환경에서 유용하다.
시작하기
개발 환경에서는 레포지토리를 클론한 뒤 npm install로 의존성을 설치하고 npm run build:native로 Rust 네이티브 모듈을 빌드해야 한다. 환경변수 파일(.env)에 사용하려는 클라우드 키나 USE_OLLAMA 같은 로컬 모델 설정을 입력한 뒤 npm start로 개발 빌드를 실행하면 데스크톱 애플리케이션이 실행된다. 배포 패키지가 필요하면 npm run dist를 실행해 프로덕션용 패키지를 생성한다.
요구사항
- Node.js 20 이상과 Git, Rust 툴체인이 필요하다. Rust는 네이티브 오디오 캡처 모듈 빌드에 필수이며 npm run build:native 단계에서 사용된다. 운영체제는 macOS 12 이상(Apple Silicon 및 Intel) 또는 Windows 10/11을 공식적으로 지원한다.
- 로컬 Ollama 모델을 사용하려면 로컬 inference 엔진과 충분한 메모리 자원이 필요하다. 권장 메모리는 8GB 이상이며 로컬 LLM이나 대형 모델을 운용하려면 16GB 이상을 권장한다. 클라우드 STT나 LLM을 병행하면 해당 서비스의 API 키와 계정, 요금제가 필요하다.
- 마이크와 시스템 오디오 캡처를 위한 권한 설정이 필요하다. macOS에서는 오디오 캡처와 화면 녹화 권한을 애플리케이션에 부여해야 정상 동작한다. 일부 고성능 실시간 전사 기능은 하드웨어 가속(CoreML/Metal 또는 DirectML)을 활용하므로 해당 드라이버의 지원 여부가 성능에 영향을 준다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Real-time latency | latency | <500ms | vs Cluely: 5–90s lag reported in README |
| User base | users | 9,000+ users | — |
| Daily active users | DAU | 700+ DAU | — |
| Data breach history | breaches | 0 data breaches | Cluely: 83,000 users breached (README claim) |
이미지 분석


1.9k
Stars
433
Forks
+207
Trending
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.