본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

phasefield-audio/Irodori-TTS-v4.1-Anime

일본어 텍스트를 애니메이션 스타일 음성으로 변환하는 text-to-speechMIT

애니메이션 스타일 음성 데이터로 Fine-tuning한 일본어 TTS 모델

학습 방식 · Aratako/Irodori-TTS-v4.1-Small에 애니메이션 스타일 음성 데이터를 독립적으로 annotation해 Fine-tuning했습니다.

TL;DR

Irodori-TTS-v4.1-Anime는 Aratako/Irodori-TTS-v4.1-Small을 애니메이션 스타일 음성 데이터로 Fine-tuning한 일본어 text-to-speech 모델입니다. 기본 모델의 annotation pipeline이 공개되지 않아 학습 데이터는 별도로 annotation됐으며, 이 과정에서 caption conditioning과 emoji control 동작이 기본 모델과 달라질 수 있습니다. 저장소 루트에는 full-precision checkpoint가 있고, int8·int4·float8 기반 양자화 변형도 제공되어 추론 환경에 맞춘 선택이 가능합니다.

핵심 포인트

  • Aratako/Irodori-TTS-v4.1-Small을 기반으로 애니메이션 스타일 음성 데이터에 맞춰 Fine-tuning했습니다.
  • 기본 모델의 annotation pipeline이 비공개라 학습 데이터는 별도 annotation 방식으로 구성했습니다.
  • caption conditioning과 emoji control은 기본 모델과 동작이 다를 수 있어 기존 제어 입력의 호환성을 확인해야 합니다.
  • full-precision 외에 int8·int4·float8 양자화 checkpoint를 제공해 추론 자원에 맞게 선택할 수 있습니다.

제한사항

  • 기본 모델의 annotation pipeline이 공개되지 않아 caption conditioning과 emoji control이 기본 모델과 다르게 동작할 수 있습니다.
  • README에 음질·지연 시간·벤치마크 수치가 없어 성능을 정량 비교할 근거가 없습니다.

83

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.