본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

GAIR/daVinci-MagiHuman

이미지/텍스트 조건으로 오디오와 비디오를 동시에 생성(image-to-video, text+image→video+audio)하고 저해상도 잠재에서 초해상화를 수행하는 멀티모달 생성15Bapache-2.0

텍스트·참조 이미지로부터 동영상과 오디오를 공동 복원하는 15B 단일 스트림 Transformer 기반의 오픈소스 멀티모달 생성 모델이다.

학습 방식 · 기반 아키텍처는 15B 단일 스트림 Transformer이며 flow-matching 계열의 복원 설정을 사용한 것으로 표기되고, 이후 DMD-2 증류로 적은 denoising 스텝(8 steps, no CFG)에서도 동등한 품질을 내도록 압축했다.

TL;DR

daVinci-MagiHuman은 텍스트와 참조 이미지로부터 비디오 프레임 잠재와 동반 오디오를 공동 생성하는 15B 파라미터의 단일 스트림 멀티모달 생성 모델이다. 모델은 텍스트·비디오·오디오 토큰을 하나의 연속된 시퀀스로 입력해 전층 self-attention으로 공동 디노이징하며 교차-어텐션 구조를 배제해 아키텍처를 단순화했다. 핵심 설계는 Sandwich 구조(첫·마지막 4개 레이어에 모달리티별 투영, 중간 32개 레이어는 파라미터 공유), 타임스텝-프리 디노이징, 헤드별 게이팅, 그리고 latent-space super-resolution을 결합한 두 단계 파이프라인이다. 효율화 측면에서는 Turbo VAE Decoder와 MagiCompiler(연산 퓨전)를 사용해 디코딩 및 연산 오버헤드를 줄였고, DMD-2 증류로 8 스텝 설정에서도 고품질을 유지하도록 압축했다. 리포트된 성능은 인간 평가에서 Ovi 1.1 대비 80.0% 승률, LTX 2.3 대비 60.9% 승률을 기록하고 시제품 추론 속도는 단일 H100에서 5초 분량 256p 영상을 2.0초에 생성하는 수준이다. 이러한 구성은 실시간성·오픈소스 가용성·사람 중심 표현력에서 장점을 제공하되, 공개된 수치는 단일 하드웨어(H100)와 특정 설정에 근거하므로 다른 환경에서의 동일한 성능 보장은 본문이 명시한 조건에 의존한다.

핵심 포인트

  • 모달리티를 하나의 토큰 시퀀스에서 공동 복원하는 Single-Stream 접근으로 구조적 단순성과 연산 융합을 통한 추론 속도를 확보했다.
  • 타임스텝 임베딩을 제거한 Timestep-Free Denoising 설계로 conditioning 경로를 최소화했다.
  • Sandwich 레이어 분할로 모달리티 특수화와 중간 파라미터 공유를 병행해 성능과 효율성 균형을 맞췄다.
  • Latent-space Super-Resolution과 Turbo VAE Decoder를 결합해 고해상도 복원 시 디코딩 비용을 절감했다.

벤치마크

벤치마크지표비교
Quantitative Quality - Visual Qualityscore4.80OVI 1.1: 4.73, LTX 2.3: 4.76
Quantitative Quality - Text Alignmentscore4.18OVI 1.1: 4.10, LTX 2.3: 4.12
Quantitative Quality - Physical Consistencyscore4.52OVI 1.1: 4.41, LTX 2.3: 4.56
Quantitative Quality - WERword error rate14.60%OVI 1.1: 40.45%, LTX 2.3: 19.23%
Human Evaluation vs Ovi 1.1pairwise win rate80.0%2,000 comparisons (README 표)
Human Evaluation vs LTX 2.3pairwise win rate60.9%2,000 comparisons (README 표)
Inference Speed - 5s video (256p)total time (s)2.0H100, base+decode (README 표)
Inference Speed - 5s video (540p)total time (s)8.0H100, base+SR+decode (README 표)
Inference Speed - 5s video (1080p)total time (s)38.4H100, base+SR+decode (README 표)

이미지 분석

전체 파이프라인 및 Single-Stream Transformer 블록 다이어그램. 텍스트 토큰·참조 이미지 잠재·노이즈화된 비디오·오디오 토큰을 하나의 시퀀스로 입력해 공동 디노이징하고 출력 잠재를 생성하는 흐름을 보여준다.
이미지는 15B·40레이어 Transformer 기반의 단일 스트림 처리 흐름을 시각화하고 있다. 왼쪽 패널은 텍스트 토큰과 이미지 잠재를 입력으로 받고 비디오·오디오 잠재를 출력한 뒤 latent-space super-resolution을 거쳐 고해상도 잠재를 얻는 파이프라인을 제시한다. 오른쪽 블록은 각 Transformer 레이어의 내부 구조를 보여주며 RMSNorm, Self-Attention(GQA·RoPE·Head Gating), Feed-Forward의 연쇄와 잔차 연결을 명시해 모델이 전층 self-attention으로 모달리티를 공동 처리함을 뒷받침한다. 도식에 'Flow Matching'·'No cross-attention' 등 키워드가 표시되어 본문 기술과 일관되게 단일 스트림·타임스텝-프리 복원 설계를 강조한다.

293

LIKES

767

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.