stabilityai/stable-audio-3-medium
텍스트 기반 오디오 생성 및 편집stable-audio-community
가변 길이 오디오 생성과 인페인팅 편집을 지원하는 트랜스포머 기반 잠재 확산 모델로, 고품질 음악 및 음향 효과를 효율적으로 생성함.
학습 방식 · 트랜스포머 기반 잠재 확산 모델 아키텍처에 의미론적-음향적 오토인코더를 결합하고, 적대적 사후 학습을 적용하여 추론 효율성을 최적화함.
핵심 포인트
- H200 GPU 기준 2초 미만의 빠른 생성 속도
- 가변 길이 생성 지원으로 불필요한 전체 길이 생성 비용 제거
- 소비자용 하드웨어에서 구동 가능한 효율적 추론 파이프라인
- 가변 길이 오디오 생성
145
LIKES
26.4k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.