TL;DR
Speakr는 음성 녹음을 전사하고 검색 가능한 AI 요약 노트로 정리하는 무료 오픈소스 Self-Hosted 플랫폼으로, Docker를 통해 Linux, macOS, Windows에서 실행됩니다. OpenAI, AssemblyAI, Deepgram 같은 API 백엔드는 분당 사용료가 들지만 설정이 간단하고, WhisperX는 GPU에서 로컬로 실행해 외부 전송과 지속적인 API 비용을 없애며 화자 분리와 음성 프로필을 지원합니다. 브라우저 녹음, 파일 업로드, 감시 폴더 자동 수집 뒤에 타임스탬프 전사, 요약, 화자별 발화, 제목 생성이 이어지고, 태그별 AI 프롬프트·보존 정책·시맨틱 검색·Webhook·자동 내보내기로 업무 흐름을 확장할 수 있습니다. 다만 WhisperX에는 Nvidia GPU가 필요하고, 팀 배포에서는 관리자 자격 증명 변경과 최신 보안 패치 적용이 필수입니다.
섹션별 상세
mkdir speakr && cd speakr
wget https://raw.githubusercontent.com/murtaza-nasir/speakr/master/config/docker-compose.example.yml -O docker-compose.yml
wget https://raw.githubusercontent.com/murtaza-nasir/speakr/master/config/env.transcription.example -O .envSpeakr용 디렉터리를 만들고 Docker Compose 설정 파일과 환경 변수 예시 파일을 내려받습니다.
nano .env관리자 계정과 API 키를 입력하기 위해 환경 변수 파일을 엽니다.
ADMIN_USERNAME=your-username
[email protected]
ADMIN_PASSWORD=a-strong-password
TRANSCRIPTION_API_KEY=sk-your-openai-key
TEXT_MODEL_API_KEY=your-openrouter-or-openai-key첫 실행 전에 관리자 계정과 전사·텍스트 모델 API 인증 정보를 설정합니다.
docker compose up -dDocker 컨테이너를 백그라운드에서 시작해 Speakr를 실행합니다.
TRANSCRIPTION_API_KEY=sk-your-openai-key
TRANSCRIPTION_MODEL=gpt-4o-transcribe-diarizeOpenAI 전사 connector를 사용할 때 환경 변수에 API 키와 Speakr 내부 모델 별칭을 지정합니다.
이미지 분석

이미지는 음성 입력이 외부 서버가 아닌 로컬 장비에서 처리되고, 결과가 화자별 문서·검색 화면으로 정리되는 구조를 시각화합니다. 중앙의 노트북과 하단 장치, 보안 방패는 Self-Hosted 방식의 데이터 통제와 보안 맥락을 나타내며, 오른쪽의 문서·검색 요소는 전사 후 정리와 탐색 기능을 연결합니다. 기사에서 설명한 녹음·업로드, 로컬 처리, 전사 라이브러리 관리의 관계를 요약하는 보조 자료입니다.
마이크와 오디오 파일이 로컬 컴퓨터와 저장 장치를 거쳐 화자별 전사·검색 결과로 이어지는 Speakr의 자체 호스팅 음성 처리 흐름을 그린 일러스트입니다.
용어 해설
- 자체 호스팅 음성 전사(Self-Hosted Transcription)
- — 음성 파일을 외부 서비스로 보내지 않고 사용자의 하드웨어에서 직접 문자로 변환하는 방식입니다. Speakr에서는 WhisperX 백엔드가 로컬 GPU에서 음성을 처리하므로 데이터 통제권을 유지하고 API 사용료를 없앨 수 있지만, Docker와 GPU를 직접 구성해야 합니다.
- 화자 분리(Speaker Diarization)
- — 전사된 음성을 발화자별로 나누어 누가 어떤 문장을 말했는지 표시하는 기술입니다. Speakr는 지원 백엔드의 화자 분리 결과를 활용하며, WhisperX에서는 화자 embedding을 저장해 여러 녹음에서 같은 화자를 식별하는 음성 프로필로 확장합니다.
- 화자 임베딩(Speaker Embeddings)
- — 사람의 음성 특징을 벡터 표현으로 변환한 데이터입니다. Speakr의 WhisperX 백엔드는 이 벡터를 데이터베이스에 저장해 세션이 바뀌어도 화자 정보를 유지하고, 반복 회의에서 수동 라벨링을 줄이는 데 활용합니다.
- 시맨틱 검색(Semantic Search)
- — 단순한 키워드 일치가 아니라 문장의 의미를 벡터 표현으로 비교해 관련 내용을 찾는 검색 방식입니다. Speakr의 Inquire Mode는 여러 전사본을 대상으로 자연어 질문을 받아 관련 구절을 검색하며, lite 이미지에서는 기본 텍스트 검색으로 대체됩니다.
- 프로그레시브 웹 앱(Progressive Web App)
- — 웹 브라우저에서 실행되면서 모바일 애플리케이션처럼 사용할 수 있는 웹 애플리케이션 형식입니다. Speakr는 PWA 인터페이스를 제공해 별도 모바일 앱 설치 없이 휴대전화 브라우저에서 전사 라이브러리에 접근하게 합니다.
- OpenID Connect
- — 기존 identity provider를 통해 사용자를 인증하는 표준 프로토콜입니다. Speakr는 OIDC를 지원해 Keycloak, Azure Active Directory, Google, Auth0 같은 인증 제공자와 Single Sign-On을 연결할 수 있습니다.
기술
- Speakr
- Docker
- Docker Compose
- WhisperX
- OpenAI Whisper
- OpenAI Transcribe
- AssemblyAI
- Deepgram
- FFmpeg
- Inquire Mode
- REST API
- Swagger UI
- OpenID Connect
- Keycloak
- Azure Active Directory
- Auth0
- n8n
- Zapier
- Make
- Obsidian
- Logseq
- AWS S3
- MinIO
- Backblaze B2
- Cloudflare R2
- Wasabi
활용 사례
- 민감한 연구 인터뷰와 NDA 대화의 자체 호스팅 전사
- 회의 녹음의 전사·요약·할 일 추출
- 강의 노트와 음성 메모의 자동 정리
- 감시 폴더를 이용한 다량 녹음 일괄 처리
- 반복 회의에서 WhisperX 음성 프로필을 활용한 화자 식별
- Webhook과 n8n을 이용한 프로젝트 관리 도구 연동
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.