용어 해설
- 월드-액션 모델(World-Action Models)
- — 비디오 생성 모델이 학습한 세계 지식을 바탕으로 환경의 시각적 상태와 변화 가능성을 파악하고, 이를 로봇이 실행할 수 있는 제어 신호로 변환하는 모델입니다. 비디오 기반 사전 지식과 실제 신체 경험을 결합해 시뮬레이션과 현실 환경에서 행동을 생성하는 데 사용됩니다.
- 비디오 생성 사전 지식(Video-Generative Priors)
- — 대규모 비디오 생성 과정에서 학습한 장면의 구조와 시간적 변화를 나타내는 지식입니다. World-Action Model은 이 지식을 생성 backbone과 latent space를 통해 물리적 환경의 예측과 로봇 행동 학습에 전달합니다.
- 잠재 공간(Latent Space)
- — 이미지나 비디오의 고차원 관측을 모델이 처리하기 쉬운 압축 표현으로 바꾼 공간입니다. OpenWAM의 원칙에 따르면 충분히 작으면서 정보가 풍부한 latent space가 upstream 비디오 지식의 전달 통로가 됩니다.
- 공동 디노이징(Joint Denoising)
- — 세계 상태와 행동 표현에 포함된 잡음을 서로 연결된 방식으로 동시에 제거하는 학습 과정입니다. OpenWAM은 전용 action capacity와 명시적인 world-to-action 정보 흐름을 함께 사용해 두 학습 신호의 상호작용을 동기화합니다.
- 자기중심 시점 사전학습(Egocentric Pretraining)
- — 사람이나 로봇이 직접 경험하는 시점의 데이터를 사용해 환경 변화와 행동의 관계를 미리 학습하는 방식입니다. OpenWAM-α는 사람 및 로봇의 egocentric 데이터 약 6,400시간을 활용해 새로운 embodiment와 환경으로 지식을 확장합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

