GAIR-NLP/daVinci-MagiHuman
Python3 / 0
단일 스트림 트랜스포머로 텍스트와 시청각 데이터를 통합 처리하여 고품질 인간 영상을 초고속으로 생성하는 모델이다.
핵심 포인트
- 150억 파라미터 규모의 단일 스트림 트랜스포머 아키텍처로 텍스트와 시청각 데이터를 통합 처리한다
- H100 GPU 기준 5초 분량의 256p 영상을 2초, 1080p 영상을 38초 내에 생성하는 고속 추론을 지원한다
- DMD-2 증류 기법을 적용하여 단 8단계의 노이즈 제거만으로 고품질 영상을 생성한다
- 한국어, 영어, 중국어 등 6개 국어 이상의 다국어 음성 및 입모양 동기화를 지원한다
753
STARS
52
FORKS
+510
TRENDING
3
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.