본문으로 건너뛰기
KDNugget조회 1

Speakr로 구축하는 자체 호스팅 음성 전사

Speakr는 Docker와 여러 전사 백엔드를 묶어 음성을 로컬 또는 API로 처리하는 오픈소스 플랫폼입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Speakr는 음성 녹음을 전사하고 검색 가능한 AI 요약 노트로 정리하는 무료 오픈소스 Self-Hosted 플랫폼으로, Docker를 통해 Linux, macOS, Windows에서 실행됩니다. OpenAI, AssemblyAI, Deepgram 같은 API 백엔드는 분당 사용료가 들지만 설정이 간단하고, WhisperX는 GPU에서 로컬로 실행해 외부 전송과 지속적인 API 비용을 없애며 화자 분리와 음성 프로필을 지원합니다. 브라우저 녹음, 파일 업로드, 감시 폴더 자동 수집 뒤에 타임스탬프 전사, 요약, 화자별 발화, 제목 생성이 이어지고, 태그별 AI 프롬프트·보존 정책·시맨틱 검색·Webhook·자동 내보내기로 업무 흐름을 확장할 수 있습니다. 다만 WhisperX에는 Nvidia GPU가 필요하고, 팀 배포에서는 관리자 자격 증명 변경과 최신 보안 패치 적용이 필수입니다.

섹션별 상세

01
상용 전사 서비스는 편리하지만 무료 요금제의 월별 분량 제한과 외부 서버의 음성 처리·저장 문제가 민감한 인터뷰나 NDA 대화에 제약으로 작용합니다. Speakr는 사용자의 인프라에서 실행되며 WhisperX를 선택하면 오디오가 장비 밖으로 나가지 않고 하드웨어가 감당하는 범위에서 분량 제한도 사라집니다. 다만 Speakr 자체가 무료라는 사실과 모든 전사가 무료라는 사실은 다르며, OpenAI·AssemblyAI·Deepgram 백엔드는 API 사용료를 발생시킵니다.
02
Speakr를 실행하려면 Docker Desktop에 포함된 Docker Engine과 Docker Compose를 준비한 뒤 설정 파일을 내려받고 `.env`에 관리자 계정과 인증 정보를 입력해야 합니다. `docker compose up -d`로 컨테이너를 시작하면 `http://localhost:8899`에서 접근할 수 있으며, 기본 관리자 계정인 `admin / changeme`를 그대로 두면 네트워크에 노출된 환경에서 보안 위험이 생깁니다. 대역폭이 제한된 사용자는 약 725 MB의 `learnedmachine/speakr:lite` 이미지를 선택할 수 있지만, Inquire Mode의 시맨틱 검색은 기본 텍스트 검색으로 바뀝니다.
bash
mkdir speakr && cd speakr
wget https://raw.githubusercontent.com/murtaza-nasir/speakr/master/config/docker-compose.example.yml -O docker-compose.yml
wget https://raw.githubusercontent.com/murtaza-nasir/speakr/master/config/env.transcription.example -O .env

Speakr용 디렉터리를 만들고 Docker Compose 설정 파일과 환경 변수 예시 파일을 내려받습니다.

bash
nano .env

관리자 계정과 API 키를 입력하기 위해 환경 변수 파일을 엽니다.

text
ADMIN_USERNAME=your-username
[email protected]
ADMIN_PASSWORD=a-strong-password
TRANSCRIPTION_API_KEY=sk-your-openai-key
TEXT_MODEL_API_KEY=your-openrouter-or-openai-key

첫 실행 전에 관리자 계정과 전사·텍스트 모델 API 인증 정보를 설정합니다.

bash
docker compose up -d

Docker 컨테이너를 백그라운드에서 시작해 Speakr를 실행합니다.

03
Speakr의 connector 구조는 애플리케이션 사용 방식을 바꾸지 않고 전사 엔진을 교체하게 합니다. OpenAI Transcribe는 API 키만으로 시작하기 쉽고 화자 분리를 지원하지만 사용량에 따른 비용이 들며, WhisperX는 GPU와 컨테이너가 필요하고 로컬 처리 뒤 지속적인 API 비용이 없습니다. WhisperX는 화자 embedding을 저장해 음성 프로필을 만들고 반복 녹음의 화자를 식별하므로, 최소 6~8 GB VRAM의 Nvidia GPU를 준비해야 메모리 부족을 피할 수 있습니다.
text
TRANSCRIPTION_API_KEY=sk-your-openai-key
TRANSCRIPTION_MODEL=gpt-4o-transcribe-diarize

OpenAI 전사 connector를 사용할 때 환경 변수에 API 키와 Speakr 내부 모델 별칭을 지정합니다.

04
오디오는 브라우저 마이크·시스템 오디오 녹음, 기존 오디오·비디오 파일 업로드, 서버의 감시 폴더 자동 수집으로 들어갑니다. Speakr는 FFmpeg로 일반적인 형식을 내부 변환한 뒤 클릭 가능한 타임스탬프가 있는 전문, AI 요약, 화자별 발화, 자동 제목을 생성합니다. 이 입력 경로는 실시간 회의, 인터뷰, 음성 메모, 일괄 녹음 처리처럼 서로 다른 업무를 하나의 라이브러리로 모으게 합니다.
05
폴더와 태그가 전사 라이브러리의 기본 정리 단위이며, 태그에는 별도 AI 프롬프트와 전사 설정을 연결할 수 있습니다. 예를 들어 `Research Interview` 태그는 방법론·핵심 발견·참가자 인용을, `Team Standup` 태그는 장애물·결정·할 일을 요약 대상으로 삼고, 여러 태그를 겹쳐 적용해 클라이언트 요구사항과 법적 영향을 함께 추출할 수 있습니다. 태그·폴더별 자동 삭제 정책과 개별 녹음 보호 기능은 보존 기간이 다른 기록을 관리하게 하며, Inquire Mode는 여러 전사본에 자연어 질문을 보내 관련 구절을 찾게 합니다.
06
Speakr는 그룹 작업공간, 개별 녹음의 보기 전용·편집 권한, 계정이 없는 외부 협력자를 위한 보안 공개 링크를 제공합니다. OIDC 기반 Single Sign-On은 Keycloak, Azure Active Directory, Google, Auth0와 연결되고, REST API와 Swagger UI 및 서명된 Webhook은 외부 자동화를 가능하게 합니다. 녹음 처리가 끝났을 때 Webhook이 n8n을 호출해 요약의 할 일을 프로젝트 관리 도구에 등록하거나 Slack 알림을 보내는 흐름을 구성할 수 있습니다.
07
고급 설정에서는 사용자 지정 vocabulary와 hotword로 이름·전문 용어·약어의 인식 방향을 조정하고, 템플릿 기반 자동 내보내기로 Obsidian이나 Logseq의 vault에 완성된 전사본을 기록할 수 있습니다. 로컬 디스크 대신 AWS S3, MinIO, Backblaze B2, Cloudflare R2, Wasabi 같은 S3 호환 저장소를 선택할 수 있으며, 관리자는 사용자별 언어 모델 토큰과 전사 분량 예산을 제한할 수 있습니다. 팀 환경에서는 저장된 오디오 업로드를 처리하는 특성 때문에 stored cross-site scripting, Webhook server-side request forgery, 번들 FFmpeg 취약점 CVE-2026-8461을 포함한 최신 보안 패치를 적용해야 합니다.
08
Speakr는 2026년 중반 기준 GitHub stars 3,700개 이상과 forks 300개 이상을 확보했지만, Docker에 익숙하지 않다면 초기 설정에 한두 시간이 걸릴 수 있습니다. OpenAI나 AssemblyAI connector를 쓰면 Otter.ai의 구독료 대신 API 사용료를 내는 구조이므로 녹음량에 따라 경제성이 달라지고, GPU에서 WhisperX를 실행할 때 비용 구조가 유리해집니다. 동시에 교체 가능한 추론 엔진, REST API, 이벤트 기반 Webhook, embedding 기반 시맨틱 검색을 한 플랫폼에서 경험하게 해 응용 AI 아키텍처를 익히는 실습 환경으로도 활용할 수 있습니다.

이미지 분석

마이크와 오디오 파일이 로컬 컴퓨터와 저장 장치를 거쳐 화자별 전사·검색 결과로 이어지는 Speakr의 자체 호스팅 음성 처리 흐름을 그린 일러스트입니다.
Diagram

이미지는 음성 입력이 외부 서버가 아닌 로컬 장비에서 처리되고, 결과가 화자별 문서·검색 화면으로 정리되는 구조를 시각화합니다. 중앙의 노트북과 하단 장치, 보안 방패는 Self-Hosted 방식의 데이터 통제와 보안 맥락을 나타내며, 오른쪽의 문서·검색 요소는 전사 후 정리와 탐색 기능을 연결합니다. 기사에서 설명한 녹음·업로드, 로컬 처리, 전사 라이브러리 관리의 관계를 요약하는 보조 자료입니다.

마이크와 오디오 파일이 로컬 컴퓨터와 저장 장치를 거쳐 화자별 전사·검색 결과로 이어지는 Speakr의 자체 호스팅 음성 처리 흐름을 그린 일러스트입니다.

용어 해설

자체 호스팅 음성 전사(Self-Hosted Transcription)
음성 파일을 외부 서비스로 보내지 않고 사용자의 하드웨어에서 직접 문자로 변환하는 방식입니다. Speakr에서는 WhisperX 백엔드가 로컬 GPU에서 음성을 처리하므로 데이터 통제권을 유지하고 API 사용료를 없앨 수 있지만, Docker와 GPU를 직접 구성해야 합니다.
화자 분리(Speaker Diarization)
전사된 음성을 발화자별로 나누어 누가 어떤 문장을 말했는지 표시하는 기술입니다. Speakr는 지원 백엔드의 화자 분리 결과를 활용하며, WhisperX에서는 화자 embedding을 저장해 여러 녹음에서 같은 화자를 식별하는 음성 프로필로 확장합니다.
화자 임베딩(Speaker Embeddings)
사람의 음성 특징을 벡터 표현으로 변환한 데이터입니다. Speakr의 WhisperX 백엔드는 이 벡터를 데이터베이스에 저장해 세션이 바뀌어도 화자 정보를 유지하고, 반복 회의에서 수동 라벨링을 줄이는 데 활용합니다.
시맨틱 검색(Semantic Search)
단순한 키워드 일치가 아니라 문장의 의미를 벡터 표현으로 비교해 관련 내용을 찾는 검색 방식입니다. Speakr의 Inquire Mode는 여러 전사본을 대상으로 자연어 질문을 받아 관련 구절을 검색하며, lite 이미지에서는 기본 텍스트 검색으로 대체됩니다.
프로그레시브 웹 앱(Progressive Web App)
웹 브라우저에서 실행되면서 모바일 애플리케이션처럼 사용할 수 있는 웹 애플리케이션 형식입니다. Speakr는 PWA 인터페이스를 제공해 별도 모바일 앱 설치 없이 휴대전화 브라우저에서 전사 라이브러리에 접근하게 합니다.
OpenID Connect
기존 identity provider를 통해 사용자를 인증하는 표준 프로토콜입니다. Speakr는 OIDC를 지원해 Keycloak, Azure Active Directory, Google, Auth0 같은 인증 제공자와 Single Sign-On을 연결할 수 있습니다.

기술

  • Speakr
  • Docker
  • Docker Compose
  • WhisperX
  • OpenAI Whisper
  • OpenAI Transcribe
  • AssemblyAI
  • Deepgram
  • FFmpeg
  • Inquire Mode
  • REST API
  • Swagger UI
  • OpenID Connect
  • Keycloak
  • Azure Active Directory
  • Google
  • Auth0
  • n8n
  • Zapier
  • Make
  • Obsidian
  • Logseq
  • AWS S3
  • MinIO
  • Backblaze B2
  • Cloudflare R2
  • Wasabi

활용 사례

  • 민감한 연구 인터뷰와 NDA 대화의 자체 호스팅 전사
  • 회의 녹음의 전사·요약·할 일 추출
  • 강의 노트와 음성 메모의 자동 정리
  • 감시 폴더를 이용한 다량 녹음 일괄 처리
  • 반복 회의에서 WhisperX 음성 프로필을 활용한 화자 식별
  • Webhook과 n8n을 이용한 프로젝트 관리 도구 연동
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 01.수집 2026. 09. 02.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.