본문으로 건너뛰기
HF Daily Papers조회 5

DreamX-Creator 1.0의 네이티브 음향·영상 생성

7B dual-stream generator가 audio와 video를 함께 denoising하고, gated 양방향 Attention과 1-step 2K Refiner로 동기화된 고해상도 출력을 구성합니다.

용어 해설

Cross-Modal Attention
서로 다른 modality의 표현을 연결하는 Attention입니다. 한 스트림의 Query가 다른 스트림의 Key·Value를 참조해 정보를 가져오며, DreamX-Creator에서는 audio와 video의 시간 대응을 유지한 채 양방향 상호작용을 수행하는 데 쓰입니다.
Flow Matching
무작위 noise에서 실제 데이터 latent로 이동하는 방향, 즉 velocity field를 학습하는 생성 학습 방식입니다. 깨끗한 latent와 Gaussian noise를 섞은 입력에서 목표 이동 방향을 예측하고, 예측 방향과 정답 방향의 차이를 줄여 denoising 경로를 학습합니다.
Knowledge Distillation
여러 단계의 계산을 수행하는 teacher 모델의 출력 분포나 행동을 더 작은 student 모델에 전달하는 방식입니다. 이 논문에서는 다단계 2K Refiner의 refinement 분포를 student가 한 번의 denoising 평가로 재현하도록 학습해 추론 비용을 줄입니다.
Flow Matching
latent에 noise를 주입한 뒤 원래 데이터로 이동하는 벡터를 맞히도록 모델을 훈련하는 방법입니다. DreamX-Creator는 audio와 video에 서로 독립적인 noise를 적용하고 두 modality의 예측 손실을 가중합해 공동 생성 경로를 최적화합니다.
Autoregressive Refinement
전체 영상을 한 번에 복원하지 않고 시간 순서에 따른 chunk를 차례로 고해상도로 변환하는 방식입니다. 각 chunk는 저해상도 video와 앞서 복원한 고해상도 chunk를 조건으로 사용하므로, 계산량을 낮추면서 시간적 연속성을 유지합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 31.수집 2026. 09. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.