resemble-ai/DramaBox
Python0 / 0
LTX-2.3 기반의 표현력 높은 프롬프트 중심 TTS와 LoRA 학습 파이프라인
TL;DR
DramaBox는 LTX-2.3 오디오 분기를 LoRA로 파인튜닝한 프롬프트 주도형 expressive TTS 스택으로, 인퍼런스 서버·CLI·Gradio 데모·학습 파이프라인을 함께 제공합니다. 프롬프트와 선택적 10초 음성 레퍼런스만으로 스피커 음색·감정·웃음·일시정지 같은 세밀한 발화 제어가 가능하며 출력에는 자동 워터마킹이 기본 적용됩니다. 고품질 결과를 얻으려면 약 24GB VRAM과 H100 급 성능을 권장하며 RE-USE denoising 같은 선택적 의존성은 설치 난이도를 증가시킬 수 있으니 환경을 먼저 확인하시는 편이 좋습니다.
핵심 포인트
- 이 레포는 Lightricks의 LTX-2.3 오디오 분기를 IC-LoRA로 파인튜닝한 expressive TTS 모델과 실행·학습 도구를 통합한 저장소입니다. 인퍼런스 서버(src/inference_server), CLI(src/inference.py), Gradio 앱(app.py), 전처리·학습 스크립트(src/preprocess.py, src/train.py)를 함께 제공하여 모델 다운로드부터 음성 생성, LoRA 학습까지 한 흐름으로 동작하도록 구성되어 있습니다. 빠르게 프로토타입을 돌려보고 자체 LoRA로 스타일·스피커를 추가하려는 개발자에게 실전용 워크플로를 제공합니다.
- 프롬프트 기반 제어가 핵심 설계 철학이며 프롬프트 내부 인용부는 실제 음성 이벤트(웃음, 신음 등)를, 인용 외부는 무대 지시(한숨, 긴 정지 등)를 모델이 다르게 처리하도록 훈련되어 있습니다. 서버 API는 prompt, voice_ref(선택적 10초 이상), cfg-scale, stg-scale 같은 제어 파라미터를 받아 입력→생성→파일 출력의 흐름으로 결과를 만듭니다. 이 구조 덕분에 감정·발화 스타일·사이사이 소리 효과를 프롬프트만으로 재현할 수 있어 연극·오디오드라마·게임 내 다이얼로그 제작에 적합합니다.
- 실행 요구사항과 성능 제약이 README에 명시되어 있어서 자원 계획을 곧장 세울 수 있습니다. 모델 파일들이 자동으로 HF에서 받아지며 DiT(6.6GB)·audio components(1.9GB)·text encoder(~8GB) 합계로 메모리·스토리지 부담이 크고, VRAM 피크가 약 24GB이며 warm 서버에서 생성 속도는 약 2.5초/샘플(H100 기준)입니다. 따라서 개인 노트북이나 저사양 GPU로는 실용성이 떨어지며 프로덕션 배포나 반복 실험에는 고메모리 GPU가 필요합니다.
- 추가 기능으로 음성 참조의 노이즈 제거(RE-USE), 긴 텍스트 자동 청킹 및 출력에 대한 Perth 기반 신뢰성 워터마킹을 제공합니다. RE-USE는 선택적 의존성으로 설치 난이도가 있고 빌드 실패 시 느린 PyTorch 대체 루트로 동작하므로 환경 제약을 미리 점검해야 합니다. 워터마킹은 기본 활성화로 결과물 출처 추적이 가능하므로 상업적·법적 요구사항이 있는 프로젝트에서 유용합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| VRAM | Peak memory | ≈24 GB | — |
| Latency | Generation time | ~2.5 s / generation (warm server, H100) | — |
| Model storage | Checkpoint sizes | dramabox-dit 6.6 GB + dramabox-audio-components 1.9 GB + text encoder ≈ 8 GB | — |
이미지 분석

475
Stars
71
Forks
+204
Trending
0
조회수
475 watchers14 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.