용어 해설
- 체현 인지(Embodied Cognition)
- — 에이전트가 고수준의 과제 추론을 물리적 상태와 연결하여 목표를 달성하는 능력으로, 언어적 계획과 감각적 예측을 결합해 행동을 설계하고 실행하는 점에서 중요하다. 본 논문 맥락에서는 언어로 서술된 계획 구조와 시각적 상상이 결합되어 단계별 물리 상태 예측을 생성하는 것을 의미한다. 이런 결합은 로봇의 연속 행동 생성과 중간 하위목표 검증 과정에서 실용적 가치를 가진다.
- 시각적 상상(Visual Imagination)
- — 모델이 현재 관찰에서 출발해 미래의 시각적 상태를 예측하는 능력으로, 시뮬레이션 없이도 가능한 미래 장면의 시각적 표현을 생성한다. 본 논문에서는 언어로 구성된 계획 단계와 짝지어져 각 계획 단계의 예상 물리 상태를 제공하는 역할을 한다. 이는 계획의 실행 가능성 검토와 하위목표 설정을 위해 구체적인 세계 상태 예측을 제공한다.
- 공동 텍스트-시각 계획(Joint Text-Visual Planning)
- — 언어적 계획 구조와 시각적 상태 예측을 하나의 계획 시퀀스로 통합해 각 단계에 대해 텍스트와 이미지(또는 비디오)로 표현된 하위목표와 상태 변화를 동시에 생성하고 정렬하는 접근법이다. 본 논문에서는 영상에서 계획 단계를 자동 분해하고 각 단계에 대응하는 시각적 상태 전이를 정렬해 감독 신호를 구성하는 데 사용되었다. 이 방식은 단일 모델이 이해와 생성 모두에서 계획의 텍스트적·시각적 구성요소를 함께 유지하게 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
