본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

stabilityai/stable-audio-3-medium

텍스트 기반 오디오 생성 및 편집stable-audio-community

가변 길이 오디오 생성과 인페인팅 편집을 지원하는 트랜스포머 기반 잠재 확산 모델로, 고품질 음악 및 음향 효과를 효율적으로 생성함.

학습 방식 · 트랜스포머 기반 잠재 확산 모델 아키텍처에 의미론적-음향적 오토인코더를 결합하고, 적대적 사후 학습을 적용하여 추론 효율성을 최적화함.

핵심 포인트

  • H200 GPU 기준 2초 미만의 빠른 생성 속도
  • 가변 길이 생성 지원으로 불필요한 전체 길이 생성 비용 제거
  • 소비자용 하드웨어에서 구동 가능한 효율적 추론 파이프라인
  • 가변 길이 오디오 생성

145

LIKES

26.4k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.