TL;DR
체현 인지는 고수준 계획과 실제 물리 상태를 연계해야만 실용적 로봇 행동으로 이어진다. 기존의 vision-language 모델은 주로 장면 이해와 텍스트 결정에 집중했고, 생성적 world model은 주로 시각 상태 예측에 집중해 계획과 물리 상태 간 결합이 약했다. Hy-Embodied-RxBrain은 언어가 계획의 구조를 제공하고 시각적 상상이 각 단계의 물리 상태를 구체화하도록 결합함으로써 계획의 텍스트 구성과 세계 상태 예측을 동시에 유지할 수 있게 했다.
왜 중요한가
체현 인지는 고수준 계획과 실제 물리 상태를 연계해야만 실용적 로봇 행동으로 이어진다. 기존의 vision-language 모델은 주로 장면 이해와 텍스트 결정에 집중했고, 생성적 world model은 주로 시각 상태 예측에 집중해 계획과 물리 상태 간 결합이 약했다. Hy-Embodied-RxBrain은 언어가 계획의 구조를 제공하고 시각적 상상이 각 단계의 물리 상태를 구체화하도록 결합함으로써 계획의 텍스트 구성과 세계 상태 예측을 동시에 유지할 수 있게 했다.
핵심 기여
언어적 계획 구조와 시각적 상상을 하나의 계획 시퀀스로 통합한 표상
논문은 계획을 단일 시퀀스로 표상해 각 단계에 언어적 프리미티브와 대응하는 시각적 상태 예측을 짝지었다. 이 표상은 텍스트가 과제 분해·제약·순서·결정 논리를 제공하는 반면 시각적 상상은 각 단계의 중간 및 최종 물리 상태를 구체화하도록 설계되었다. 결과적으로 모델이 텍스트적 추론과 시각적 세계 예측을 결합해 공동 하위목표를 계획하도록 유도한다.
멀티모달 Mixture-of-Transformers 아키텍처로 이해와 생성을 단일 모델에서 지원
모델 구조는 언어, 이미지, 비디오의 이해 및 생성을 하나의 Mixture-of-Transformers 프레임워크로 처리하도록 구성되었다. 이 아키텍처는 서로 다른 모달리티의 입력을 통합하고 필요에 따라 모달리티별 생성 출력을 생산할 수 있게 설계되었다. 따라서 이해(분석적 추론)와 생성(시각적 상상 및 행동 출력)을 같은 파라미터 공간에서 수행할 수 있다.
비디오를 자동으로 분해해 텍스트-시각 계획 감독을 생성하는 파이프라인 구축
저자들은 체현 영상에서 계획 단계를 자동 분해하고 각 단계의 시각적 상태 전이와 정렬된 텍스트 레이블을 생성하는 자동화 파이프라인을 구축했다. 이 파이프라인은 영상의 시퀀스를 계획 단계로 변환해 다중모달 학습 신호를 제공하므로 수작업 레이블링 부담을 줄인다. 이를 통해 모델은 실세계 시나리오에서 언어와 시각 상태의 정렬을 학습할 수 있다.
계획 표상 능력을 평가하는 RxBrain-Bench와 연속적 로봇 행동 확장
연구진은 모델이 텍스트와 시각 요소가 결합된 계획을 얼마나 잘 표상하는지 평가하기 위해 RxBrain-Bench를 도입했다. 실험에서 모델은 텍스트적 추론, 세계 상태 예측, 공동 하위목표 계획을 결합한 계획을 생성하면서 이해와 생성 능력을 유지했다는 결과가 보고되었다. 또한 대규모 행동 데이터 사전학습 없이도 연속적 로봇 행동 생성을 적용해 실제 로봇에서 유망한 성과를 보였다.
핵심 아이디어 이해하기
문제의 출발점은 고수준 과제 추론과 물리적 세계 상태 간의 격차로, 언어는 추상적 계획 구조를 제공하지만 그 자체로 물리적 실행 가능성을 보장하지 못하고, 반대로 생성적 world model은 미래 시각 상태 예측에는 강하나 추상적 계획 논리를 포함하지 못하는 경우가 많았다. 이 논문은 계획을 하나의 연속된 시퀀스로 표상해 언어적 프리미티브(과제 분해·제약·순서·결정 논리)와 시각적 상상(세계 상태 예측·중간 하위목표)을 각 시퀀스 스텝에서 결합하도록 설계했다. 구체적으로 언어는 단계의 구조와 제약을 제공해 무슨 일을 언제 해야 하는지를 규정하고, 시각적 상상은 그 단계에서 기대되는 물리적 상태와 전이를 예측해 계획의 실행 가능성을 검증한다. 이러한 결합으로 모델은 텍스트적 계획 논리와 시각적 세계 모델을 동시에 보유하여 하위목표가 물리적으로 타당한지 판단하고 연속적 행동으로 변환할 수 있다.
방법론
전체 접근 방식은 하나의 멀티모달 Mixture-of-Transformers 아키텍처를 중심으로 언어·이미지·비디오의 입력과 출력을 통합하는 것이다. 이 아키텍처는 각 모달리티의 토큰화 및 표현 공간을 공통 또는 연동 가능한 방식으로 처리해 언어적 계획 토큰과 시각적 상태 토큰이 같은 시퀀스 내에서 상호작용하도록 구성되었다. 학습 신호를 얻기 위해 저자들은 체현 비디오를 자동으로 분해해 순차적 계획 단계와 각 단계에 대응하는 시각적 상태 전이를 정렬하는 파이프라인을 구축했다. 이 파이프라인은 비디오 프레임 시퀀스를 하위 단계로 분할하고 각 하위단계에 텍스트적 설명과 시각적 목표를 매핑해 다중모달 교사 신호를 생성함으로써 모델이 공동 텍스트-시각 계획을 학습하게 했다. 추가적으로 모델은 이해와 생성 양쪽을 모두 학습하도록 구성되어 텍스트 기반 추론 출력과 시각적 상상 출력을 동시에 생성하는 능력을 확보했다. 로봇 행동 확장을 위해 학습된 표상에서 연속적 액션 시퀀스를 추출하는 방식으로 실제 로봇 제어에 연결하는 절차를 채택했다.
주요 결과
논문은 RxBrain이 텍스트적 추론, 세계 상태 예측, 공동 하위목표 계획을 결합한 계획을 생성하는 능력을 유지한다고 보고했다. RxBrain-Bench 평가에서 모델은 텍스트와 시각 구성요소가 결합된 계획 표상 능력을 입증했으며 이해와 생성 양면에서 기능을 보존했다는 결과가 제시되었다. 또한 저자들은 대규모 행동 데이터에 대한 사전학습 없이도 연속적 로봇 행동 생성을 통해 실제 로봇에서 유망한 성능을 확인했다고 기술했다.
기술 상세
전체 아키텍처는 Mixture-of-Transformers라는 구조를 통해 서로 다른 모달리티의 입력과 출력을 하나의 모델에서 처리하도록 구성되었다. 이 구조는 모달리티별 전문화를 유지하면서도 공통의 시퀀스 표상에서 언어 토큰과 시각 상태 토큰이 상호작용하도록 설계되어 텍스트 기반 계획과 시각적 상상 간의 정렬을 가능하게 한다. 감독 신호 생성은 체현 영상을 단계별로 분해하고 각 단계의 시각 상태 전이와 텍스트 설명을 정렬하는 자동 파이프라인을 통해 수행되며, 이 과정이 모델에 다중모달 순차 예측 학습 신호를 제공한다. 학습 목적은 언어적 계획 구조의 생성과 시각적 미래 상태의 예측을 동시에 최소화하는 방식으로 설정되어 모델이 공동 계획 시퀀스를 출력하도록 유도한다. 로봇 액션 확장에서는 학습된 시퀀스 표상에서 연속적 제어 명령을 생성하는 절차를 적용해 대규모 행동 사전학습 없이도 실제 로봇에서 동작을 생성하도록 연결했다.
실무 활용
이 논문은 로봇과 에이전트 시스템에서 언어적 계획을 물리적 상태로 연결하는 실무적 기반을 제공할 가능성이 있다. 자동 파이프라인으로부터 생성된 다중모달 감독 신호는 현실 비디오를 활용한 학습을 용이하게 하므로 시나리오별 레이블링 비용을 낮출 잠재력이 있다. 공개된 코드 저장소가 존재하므로 연구 결과를 재현하고 실험 환경에 통합할 수 있는 출발점이 제공된다.
- 서비스 로봇의 작업 계획에서 자연어 지침을 단계별 물리 상태 예측으로 변환해 안전성과 실행 가능성을 검증하는 데 활용할 수 있다.
- 시뮬레이션 없이도 실제 비디오 기반 데이터를 이용해 언어-시각 결합 계획을 학습시켜 특정 작업 도메인에 맞춘 파인튜닝 데이터셋을 자동 구축할 때 활용할 수 있다.
- 멀티모달 에이전트 연구에서 텍스트적 추론과 시각적 미래 예측을 동시에 학습시키는 벤치마크로 RxBrain-Bench를 사용해 모델 비교와 진단을 수행할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Embodied Cognition
- — 에이전트가 고수준의 과제 추론을 물리적 상태와 연결하여 목표를 달성하는 능력으로, 언어적 계획과 감각적 예측을 결합해 행동을 설계하고 실행하는 점에서 중요하다. 본 논문 맥락에서는 언어로 서술된 계획 구조와 시각적 상상이 결합되어 단계별 물리 상태 예측을 생성하는 것을 의미한다. 이런 결합은 로봇의 연속 행동 생성과 중간 하위목표 검증 과정에서 실용적 가치를 가진다.
- Visual Imagination
- — 모델이 현재 관찰에서 출발해 미래의 시각적 상태를 예측하는 능력으로, 시뮬레이션 없이도 가능한 미래 장면의 시각적 표현을 생성한다. 본 논문에서는 언어로 구성된 계획 단계와 짝지어져 각 계획 단계의 예상 물리 상태를 제공하는 역할을 한다. 이는 계획의 실행 가능성 검토와 하위목표 설정을 위해 구체적인 세계 상태 예측을 제공한다.
- Joint Text-Visual Planning
- — 언어적 계획 구조와 시각적 상태 예측을 하나의 계획 시퀀스로 통합해 각 단계에 대해 텍스트와 이미지(또는 비디오)로 표현된 하위목표와 상태 변화를 동시에 생성하고 정렬하는 접근법이다. 본 논문에서는 영상에서 계획 단계를 자동 분해하고 각 단계에 대응하는 시각적 상태 전이를 정렬해 감독 신호를 구성하는 데 사용되었다. 이 방식은 단일 모델이 이해와 생성 모두에서 계획의 텍스트적·시각적 구성요소를 함께 유지하게 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
