hexgrad/Kokoro-82M
Kokoro는 텍스트를 자연스러운 파형으로 변환하는 text-to-speech 태스크를 수행한다. 모델은 입력 텍스트를 IPA 음소 라벨로 변환한 뒤 멜-스펙트로그램 예측과 ISTFT 기반 디코더를 통해 파형을 생성한다. 다수의 언어와 음색을 지원하며 미리 제공된 음성들(릴리스 표의 8개 및 54개 음성 항목)을 통해 다양한 보이스 옵션을 합성할 수 있다.82Mapache-2.0
Kokoro는 StyleTTS2와 ISTFTNet 기반의 82M 파라미터 경량 TTS로 다국어·다음성 합성을 빠르고 저비용으로 제공한다.
학습 방식 · StyleTTS2 계열 아키텍처 기반으로 설계되어 permissive/non-copyrighted 오디오와 IPA 음소 라벨을 사용해 수백 시간 규모로 학습했고 전체 학습 비용은 A100 80GB 기준 약 1000달러 수준으로 보고되었다.
TL;DR
Kokoro는 StyleTTS2 계열 설계를 채택한 82M 파라미터 경량 TTS로, misaki G2P와 IPA 음소 라벨을 결합해 다국어·다음성 합성을 수행하며 ISTFTNet 기반 디코더로 빠른 파형 생성을 달성한다. 학습은 퍼미시브·퍼블릭 도메인 오디오 중심의 수백 시간 규모 데이터로 이루어졌고 전체 학습 비용은 A100 80GB 기준 약 1000달러로 보고되었다. 모델은 Apache-2.0 라이선스 하에 공개되어 상업 배포와 통합이 용이하며 README와 외부 출처를 통해 API 서비스 단가가 백만 문자당 1달러 미만으로 제시되어 비용 효율성을 강조한다. 이러한 설계는 대형 모델과 유사한 품질을 목표로 하면서도 실무 배포에서 낮은 지연과 비용을 확보하려는 사용 사례에 적합하지만 공개된 정량적 벤치마크는 제공되지 않는다.
핵심 포인트
- 82M의 경량 파라미터 예산으로 설계되어 대형 TTS 모델 대비 추론 비용과 지연이 낮다.
- 학습 데이터는 퍼미시브·퍼블릭 도메인 오디오와 IPA 라벨로 구성되어 라이선스 위험을 낮춘 점이 특징이다.
- Apache-2.0 라이선스와 오픈 소스 코드, 데모 스페이스를 통해 상용 배포와 빠른 통합이 가능하다는 실무적 이점이 있다.
- 경량 모델(82M)임에도 README에서 '대형 모델과 유사한 품질'을 주장하여 동일 품질 대비 연산·메모리 비용 절감이 가능함을 내세웠다.
6.5k
LIKES
10.9M
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.