본문으로 건너뛰기

GigaWorld-Policy: 효율적인 동작 중심 세계-동작 모델

기존의 로봇 제어 모델은 미래 영상을 생성하며 학습하지만, 실제 동작 시에도 영상을 생성하느라 속도가 매우 느린 한계가 있었다. 이 논문은 학습 시에는 영상 데이터를 활용해 물리적 이해도를 높이되, 실제 로봇을 움직일 때는 영상 생성 없이 동작만 빠르게 출력하는 구조를 제안한다. 이를 통해 실시간성이 중요한 로봇 환경에서 고성능과 저지연 제어를 동시에 구현했다.

용어 해설

세계 모델(World Model)
로봇이 자신의 행동에 따른 환경 변화를 예측하는 내부 시뮬레이션 지능이다. 시각적 변화를 미리 계산하여 물리적 인과관계를 이해하고 복잡한 작업을 계획하는 데 필수적인 역할을 한다.
비전-언어-동작 모델(VLA)
시각 정보와 언어 명령을 입력받아 로봇의 제어 동작을 직접 출력하는 통합 인공지능 모델이다. 인지, 이해, 실행 과정을 하나의 신경망으로 처리하여 로봇의 범용성을 높이는 핵심 기술이다.
플로우 매칭(Flow Matching)
확률 분포 사이의 변환 경로를 직접 학습하여 데이터를 생성하는 기법이다. 기존 Diffusion 모델보다 학습이 안정적이고 추론 속도가 빨라 실시간 로봇 제어에 적합한 생성 방식이다.
인과적 마스크(Causal Mask)
시퀀스 데이터 처리 시 특정 시점의 토큰이 미래의 정보를 참조하지 못하도록 가리는 행렬 연산이다. 모델이 과거와 현재 정보만을 바탕으로 다음 동작을 결정하도록 강제하여 인과 관계를 유지한다.
확산 트랜스포머(Diffusion Transformer)
Transformer 아키텍처를 활용해 고품질의 이미지나 영상을 생성하는 확산 모델 구조이다. 대규모 데이터 학습에 유리하며 로봇의 복잡한 시각적 역동성을 정밀하게 모델링하는 데 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 18.수집 2026. 03. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.