단일 스트림 트랜스포머로 구현한 초고속 오디오-비디오 생성 모델 daVinci-MagiHuman
AI Tool·Python0 / 0
단일 스트림 트랜스포머로 텍스트와 시청각 데이터를 통합 처리하여 고품질 인간 영상을 초고속으로 생성하는 모델이다.
주요 기능
- 150억 파라미터 규모의 단일 스트림 트랜스포머 아키텍처로 텍스트와 시청각 데이터를 통합 처리한다
- H100 GPU 기준 5초 분량의 256p 영상을 2초, 1080p 영상을 38초 내에 생성하는 고속 추론을 지원한다
- DMD-2 증류 기법을 적용하여 단 8단계의 노이즈 제거만으로 고품질 영상을 생성한다
- 한국어, 영어, 중국어 등 6개 국어 이상의 다국어 음성 및 입모양 동기화를 지원한다
- 잠재 공간 기반의 초해상도 기술과 경량화된 VAE 디코더로 메모리 효율적인 고해상도 출력을 구현한다
어떻게 동작하는가
중간 32개 레이어의 파라미터를 모든 모달리티가 공유하는 샌드위치 구조를 사용하며, 입력 잠재값에서 직접 노이즈 제거 상태를 추론하는 타임스텝 프리 방식을 적용했다. MagiCompiler를 통한 전체 그래프 컴파일로 연산 속도를 1.2배 향상시켰다. (README Architecture 및 Efficient Inference Techniques 섹션 근거
사용 사례
- 실시간 대화형 AI 아바타 서비스에서 사용자 입력에 따른 즉각적인 영상 및 음성 응답 생성
- 다국어 콘텐츠 제작 환경에서 텍스트 프롬프트를 기반으로 한 자연스러운 입모양의 디지털 휴먼 영상 합성
- 고성능 GPU 서버 기반의 영상 편집 도구에서 저해상도 초안 생성 후 1080p 고해상도 정밀 렌더링
753
Stars
52
Forks
+510
Trending
0
조회수
753 watchers9 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.