본문으로 건너뛰기

Wan-Streamer v0.3: 세계(world)와 이벤트 스트림(event stream) 분해로 실시간 풀-듀플렉스 오디오·비주얼 상호작용을 확장한 프레임워크

Wan-Streamer v0.3은 비디오를 지속적 세계와 시간적 이벤트 스트림으로 분해하여 160ms 스트리밍 단위에서 640×368@25FPS 실시간 오디오·비주얼 응답을 약 200ms 모델 지연으로 생성하는 사전학습 프레임워크이다.

용어 해설

세계-이벤트 분해(World–Event Decomposition)
비디오를 '지속적 세계(context)'와 그 안에서 시간에 따라 발생하는 '이벤트 스트림'으로 분리하는 개념이다. 세계는 장면, 환경, 등장인물, 음향 특성 같은 장기간 불변 정보로 구성되고 이벤트 스트림은 행동, 발화, 카메라 이동 등의 시간적 변화를 기록한다. 이 분해는 한 번만 주입되는 세계 정보를 조건으로 하여 연속 단위 단위로 다음 이벤트를 예측하는 사전학습 목표를 정형화하는 데 중요하다.
블록 인과적 어텐션(Block-Causal Attention)
스트리밍 단위로 입력과 출력을 블록으로 나누어 각 블록 내·간의 인과적 토큰 흐름을 유지하면서 연산을 제한하는 어텐션 패턴이다. 개별 블록은 과거 블록의 요약이나 프리필(prefill)된 세계 정보를 조건으로 삼아 효율적으로 시퀀스를 확장한다. 실시간 지연과 계산 비용을 제어하면서 긴 컨텍스트를 처리하기 위해 사용된다.
조건부 플로우 매칭(Conditional Flow Matching)
연속적 오디오·비디오 잠재벡터를 생성하기 위해 사용되는 확률적 복원 기법으로, 조건(context)에 맞춘 노이즈-데노이즈 과정을 학습한다. 이 방식은 연속 신호의 시간적 진화와 동기화된 영상·음성 샘플 생성을 가능하게 한다. 본 논문에서는 음성·비디오 잠재 생성에 대해 discrete 토큰 예측과 함께 결합되어 사용된다.
컨텍스트-병렬 퍼포머(Context-Parallel Performer)
긴 컨텍스트를 여러 병렬 단위로 분할하여 고해상도 스트리밍 비디오에 대해 실시간 응답성을 유지하도록 설계된 실행 패턴이다. 컨텍스트 병렬화는 계산적으로 비싼 잠재 생성 단계를 분산하고 모델 사이드 지연을 일정 수준으로 유지한다. Wan-Streamer v0.2/ v0.3에서 높은 해상도(640×368)와 낮은 지연을 동시 달성하는 핵심 구현 요소 중 하나이다.
풀-듀플렉스 오디오-비주얼 상호작용(Full-Duplex Audio-Visual Interaction)
사용자와 에이전트가 동시에 발화와 시각적 행위를 주고받는 쌍방향 실시간 인터랙션 모드이다. 스트리밍 입력(텍스트, 오디오, 비디오)을 연속 단위로 처리하고 모델은 동시적으로 오디오·비디오 응답을 생성하여 타이밍과 동기화를 보장한다. 본 논문은 이 모드에서 낮은 모델 사이드 지연과 동시적 행동·발화 생성을 목표로 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 16.수집 2026. 07. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.