본문으로 건너뛰기

Hy-Embodied-RxBrain: 언어와 시각적 상상을 결합한 체현 인지 파운데이션 모델

RxBrain은 언어 기반 계획 구조와 시각적 상상을 단일 계획 시퀀스로 결합해 단계별 물리 상태 예측과 공동 하위목표 계획을 수행하는 멀티모달 Mixture-of-Transformers 기반 파운데이션 모델이다.

용어 해설

체현 인지(Embodied Cognition)
에이전트가 고수준의 과제 추론을 물리적 상태와 연결하여 목표를 달성하는 능력으로, 언어적 계획과 감각적 예측을 결합해 행동을 설계하고 실행하는 점에서 중요하다. 본 논문 맥락에서는 언어로 서술된 계획 구조와 시각적 상상이 결합되어 단계별 물리 상태 예측을 생성하는 것을 의미한다. 이런 결합은 로봇의 연속 행동 생성과 중간 하위목표 검증 과정에서 실용적 가치를 가진다.
시각적 상상(Visual Imagination)
모델이 현재 관찰에서 출발해 미래의 시각적 상태를 예측하는 능력으로, 시뮬레이션 없이도 가능한 미래 장면의 시각적 표현을 생성한다. 본 논문에서는 언어로 구성된 계획 단계와 짝지어져 각 계획 단계의 예상 물리 상태를 제공하는 역할을 한다. 이는 계획의 실행 가능성 검토와 하위목표 설정을 위해 구체적인 세계 상태 예측을 제공한다.
공동 텍스트-시각 계획(Joint Text-Visual Planning)
언어적 계획 구조와 시각적 상태 예측을 하나의 계획 시퀀스로 통합해 각 단계에 대해 텍스트와 이미지(또는 비디오)로 표현된 하위목표와 상태 변화를 동시에 생성하고 정렬하는 접근법이다. 본 논문에서는 영상에서 계획 단계를 자동 분해하고 각 단계에 대응하는 시각적 상태 전이를 정렬해 감독 신호를 구성하는 데 사용되었다. 이 방식은 단일 모델이 이해와 생성 모두에서 계획의 텍스트적·시각적 구성요소를 함께 유지하게 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.