용어 해설
- 시각-언어-행동 모델(Vision-Language-Action Model)
- — Vision-Language-Action Model은 이미지와 언어 지시를 입력받아 로봇이 실행할 행동을 출력하는 모델이다. 시각·언어 표현을 연속적인 모터 제어와 연결해 물리적 작업을 수행하며, GigaBrain-0.7에서는 이해·예측·제어를 하나의 학습 체계로 결합하는 기반이 된다.
- Flow Matching
- — Flow Matching은 잡음이 섞인 행동 표현을 목표 행동으로 이동시키는 벡터장을 학습하는 생성 방식이다. 입력 행동 청크와 Gaussian noise 사이의 중간 상태를 만들고, 모델이 두 상태의 차이를 예측하도록 최적화해 연속적인 로봇 궤적을 생성한다.
- World Model
- — World Model은 현재 관찰과 행동 맥락에서 이후의 시각 상태나 작업 진행도를 예측하는 모델이다. GigaBrain-0.7의 System 3은 미래 영상을 생성해 subgoal image를 만들고, 별도의 value 경로로 현재 상태의 작업 진척도를 추정해 행동 생성에 조건으로 전달한다.
- Soft Knowledge Insulation
- — Soft Knowledge Insulation은 연속 행동 학습의 gradient가 사전학습된 Vision-Language Model에 미치는 영향을 완전히 차단하지 않고 계수로 줄이는 방식이다. Action Expert에는 전체 gradient를 전달하고 VLM에는 α KI를 곱한 gradient만 전달해 embodied control 적응과 일반 시각·언어 능력 보존을 함께 조정한다.
- Advantage-Weighted Regression
- — Advantage-Weighted Regression은 오프라인 경험에서 예상되는 이득이 큰 행동 구간에 더 큰 학습 가중치를 주는 정책 최적화 방식이다. GigaBrain-0.7은 성공하거나 진척도가 높은 rollout에는 높은 가중치를, 실패하거나 진척도가 낮은 구간에는 낮은 가중치를 부여해 온라인 탐색 전에 정책을 보정한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







