본문으로 건너뛰기

SolarWM: 장기 비디오 월드 모델을 위한 공개 데이터와 확장형 학습

SolarWM은 10개 데이터셋의 143만 클립과 backbone별 적응·자기회귀·분포 증류를 결합해 5초 학습만으로 수분에서 수시간의 비디오 롤아웃을 구현합니다.

용어 해설

비디오 월드 모델(Video World Model)
카메라 움직임, 플레이어 행동, 언어 지시를 입력으로 받아 앞으로의 시각 관측을 생성하는 모델입니다. 짧은 영상 생성을 넘어 상호작용 가능한 환경과 장기 롤아웃을 구성하는 데 사용됩니다.
자기회귀 적응(Autoregressive Adaptation)
이전 프레임이나 생성 결과를 조건으로 다음 영상을 순차적으로 생성하도록 기존 비디오 생성 모델을 조정하는 단계입니다. 짧은 클립 학습과 장기 롤아웃 사이의 차이를 줄이는 역할을 합니다.
분포 일치 증류(Distribution Matching Distillation)
학생 모델의 생성 분포가 교사 모델의 분포를 따르도록 학습하는 증류 방식입니다. SolarWM에서는 자기회귀 적응 뒤 적은 최적화 단계로 추론 가능한 인과 모델을 만드는 데 사용됩니다.
카메라 조건화(Camera Conditioning)
카메라의 움직임과 기하 정보를 비디오 생성 과정에 입력해 시점 변화에 맞는 미래 프레임을 생성하는 방식입니다. 서로 다른 데이터와 backbone에 공통 인터페이스를 제공하는 핵심 요소입니다.
표준 클립(Canonical Clip)
서로 다른 데이터셋의 영상을 시각 관측, 프레임 정렬, 카메라 기하, 캡션, 품질 메타데이터, 출처 정보가 같은 형식으로 기록된 학습 단위로 변환한 클립입니다.
장기 롤아웃(Long-Horizon Rollout)
모델이 이전에 생성한 영상과 새로운 카메라 조건을 다시 입력으로 사용하면서 미래 영상을 계속 생성하는 과정입니다. SolarWM은 5초 시퀀스 학습만으로 수분에서 수시간 범위의 롤아웃을 지원합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.