본문으로 건너뛰기

OpenWAM: 월드-액션 모델의 설계 원리

OpenWAM은 비디오 생성 지식과 로봇 행동을 분리·조합해 검증하는 공개 월드-액션 모델 연구 스택이다.

용어 해설

월드-액션 모델(World-Action Models)
비디오 생성 모델이 학습한 세계 지식을 바탕으로 환경의 시각적 상태와 변화 가능성을 파악하고, 이를 로봇이 실행할 수 있는 제어 신호로 변환하는 모델입니다. 비디오 기반 사전 지식과 실제 신체 경험을 결합해 시뮬레이션과 현실 환경에서 행동을 생성하는 데 사용됩니다.
비디오 생성 사전 지식(Video-Generative Priors)
대규모 비디오 생성 과정에서 학습한 장면의 구조와 시간적 변화를 나타내는 지식입니다. World-Action Model은 이 지식을 생성 backbone과 latent space를 통해 물리적 환경의 예측과 로봇 행동 학습에 전달합니다.
잠재 공간(Latent Space)
이미지나 비디오의 고차원 관측을 모델이 처리하기 쉬운 압축 표현으로 바꾼 공간입니다. OpenWAM의 원칙에 따르면 충분히 작으면서 정보가 풍부한 latent space가 upstream 비디오 지식의 전달 통로가 됩니다.
공동 디노이징(Joint Denoising)
세계 상태와 행동 표현에 포함된 잡음을 서로 연결된 방식으로 동시에 제거하는 학습 과정입니다. OpenWAM은 전용 action capacity와 명시적인 world-to-action 정보 흐름을 함께 사용해 두 학습 신호의 상호작용을 동기화합니다.
자기중심 시점 사전학습(Egocentric Pretraining)
사람이나 로봇이 직접 경험하는 시점의 데이터를 사용해 환경 변화와 행동의 관계를 미리 학습하는 방식입니다. OpenWAM-α는 사람 및 로봇의 egocentric 데이터 약 6,400시간을 활용해 새로운 embodiment와 환경으로 지식을 확장합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 07.수집 2026. 09. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.