본문으로 건너뛰기

GigaBrain-0.7의 3체계 로봇 지능 확장

GigaBrain-0.7은 이해·미래 예측·연속 제어를 3체계로 묶고 37,256.98시간의 이기종 로봇 데이터로 다중 embodiment 일반화를 학습합니다.

용어 해설

시각-언어-행동 모델(Vision-Language-Action Model)
Vision-Language-Action Model은 이미지와 언어 지시를 입력받아 로봇이 실행할 행동을 출력하는 모델이다. 시각·언어 표현을 연속적인 모터 제어와 연결해 물리적 작업을 수행하며, GigaBrain-0.7에서는 이해·예측·제어를 하나의 학습 체계로 결합하는 기반이 된다.
Flow Matching
Flow Matching은 잡음이 섞인 행동 표현을 목표 행동으로 이동시키는 벡터장을 학습하는 생성 방식이다. 입력 행동 청크와 Gaussian noise 사이의 중간 상태를 만들고, 모델이 두 상태의 차이를 예측하도록 최적화해 연속적인 로봇 궤적을 생성한다.
World Model
World Model은 현재 관찰과 행동 맥락에서 이후의 시각 상태나 작업 진행도를 예측하는 모델이다. GigaBrain-0.7의 System 3은 미래 영상을 생성해 subgoal image를 만들고, 별도의 value 경로로 현재 상태의 작업 진척도를 추정해 행동 생성에 조건으로 전달한다.
Soft Knowledge Insulation
Soft Knowledge Insulation은 연속 행동 학습의 gradient가 사전학습된 Vision-Language Model에 미치는 영향을 완전히 차단하지 않고 계수로 줄이는 방식이다. Action Expert에는 전체 gradient를 전달하고 VLM에는 α KI를 곱한 gradient만 전달해 embodied control 적응과 일반 시각·언어 능력 보존을 함께 조정한다.
Advantage-Weighted Regression
Advantage-Weighted Regression은 오프라인 경험에서 예상되는 이득이 큰 행동 구간에 더 큰 학습 가중치를 주는 정책 최적화 방식이다. GigaBrain-0.7은 성공하거나 진척도가 높은 rollout에는 높은 가중치를, 실패하거나 진척도가 낮은 구간에는 낮은 가중치를 부여해 온라인 탐색 전에 정책을 보정한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 16.수집 2026. 08. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.