본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

GAIR-NLP/daVinci-MagiHuman

Python3 / 0

단일 스트림 트랜스포머로 텍스트와 시청각 데이터를 통합 처리하여 고품질 인간 영상을 초고속으로 생성하는 모델이다.

핵심 포인트

  • 150억 파라미터 규모의 단일 스트림 트랜스포머 아키텍처로 텍스트와 시청각 데이터를 통합 처리한다
  • H100 GPU 기준 5초 분량의 256p 영상을 2초, 1080p 영상을 38초 내에 생성하는 고속 추론을 지원한다
  • DMD-2 증류 기법을 적용하여 단 8단계의 노이즈 제거만으로 고품질 영상을 생성한다
  • 한국어, 영어, 중국어 등 6개 국어 이상의 다국어 음성 및 입모양 동기화를 지원한다

753

STARS

52

FORKS

+510

TRENDING

3

조회수

watchers 753open issues 9

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.