본문으로 건너뛰기
HF Daily Papers조회 2

Wan-Streamer v0.1: 실시간 엔드투엔드 상호작용형 파운데이션 모델

단일 모델이 텍스트·오디오·비디오를 입력과 출력으로 동시에 처리해 모듈 경계에서 발생하는 대기 시간과 동기화 오류를 제거한다. 그 결과 모델 측 응답 약 200ms, 네트워크 포함 총 약 550ms의 서브초(미드 레이턴시) 풀-듀플렉스 상호작용을 달성한다.

용어 해설

블록-인과 어텐션(Block-Causal Attention)
Transformer 내부에서 입력·출력 토큰을 인과적 블록 단위로 구분해, 동일 블록 내에서는 과거 토큰만 참조하도록 제한하는 어텐션 방식이다. 각 스트리밍 유닛(예: 160ms) 단위로 KV-cache를 유지해 이전 블록의 문맥을 보존하면서 현재 블록의 토큰만 계산하므로 실시간 누적 컨텍스트를 유지하며 N² 연산 폭발을 완화한다.
플로우-매칭(Flow-Matching)
연속 잠재공간에서 노이즈 변수를 깨끗한 목표 잠재로 되돌리는 속도(velocity) 필드를 학습하는 생성 기법이다. 노이즈 섞인 z_τ를 입력으로 받아 f_θ가 ∂z_τ/∂τ(=ϵ−z0)을 예측하도록 MSE로 학습하면, 디노이징 과정을 통해 오디오·비디오 잠재를 생성한다. 연속적 잠재 생성에 적합해 실시간 latent generation에 활용된다.
인과적 VAE(Causal VAE)
스트리밍 환경에서 사용하도록 설계된 변분 오토인코더로, 인코딩과 디코딩이 인과성(causality)을 지키도록 구조화된다. 즉, 현재 시점 이전의 정보만 사용해 잠재를 생성·재구성하므로 실시간 인코딩·디코딩 시점에 맞춰 즉시 사용 가능한 잠재 표현을 제공한다.
KV 캐시(KV-Cache)
Transformer의 키-값(Key-Value) 누적 표현을 저장하는 메모리 구조로, 이전 스트리밍 유닛에서 계산한 attention 키·값을 보존한다. thinker와 performer 사이에 KV 슬라이스를 교환하면 전체 대화·장면 이력을 유지하면서 계산을 중복하지 않아도 된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 23.수집 2026. 06. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.