챕터별 상세
기존 VLA 모델의 한계와 문제 의식
기존 VLA 모델들이 주로 사용하는 Behavior Cloning 방식의 취약점을 분석했다. 성공적인 데모 데이터만을 학습하기 때문에 훈련 분포를 벗어나는 순간 성능이 급격히 저하되며 실패 상황에서 스스로 회복할 수 있는 능력이 결여되어 있다. 또한 행동이 누적됨에 따라 발생하는 미세한 오차가 증폭되어 장기적인 태스크 수행 시 시스템이 붕괴되는 현상이 빈번하게 발생했다.
π*0.6의 핵심 솔루션: RECAP 프레임워크
π*0.6이 제안하는 RECAP(RL with Experience and Corrections via Advantage-conditioned Policies) 프레임워크의 구조를 설명했다. VLA 모델을 고정된 사전 훈련 모델로 보지 않고 로봇의 자율 실행 데이터와 인간의 실시간 교정 데이터를 학습 루프에 통합하는 방식을 취했다. 이를 통해 로봇이 자신의 행동이 잘된 것인지 잘못된 것인지 스스로 판단하고 개선할 수 있는 Experience-aware 구조를 구현했다.
가치 함수와 이득 신호를 활용한 학습 구조
RECAP 알고리즘의 상세 작동 원리를 분석했다. 먼저 가치 함수(Value Function)를 학습시켜 현재 상태에서 특정 행동을 했을 때 태스크 성공까지 얼마나 효율적인지를 수치화했다. 이 가치 정보를 바탕으로 '이득(Advantage)' 신호를 산출하고 이를 정책 네트워크의 입력 조건으로 주입하여 로봇이 더 나은 행동을 선택하도록 유도했다. 인간의 교정 데이터는 항상 긍정적인 이득 신호로 간주하여 전문가의 의도를 효과적으로 반영했다.
정책 아키텍처와 액션 표현 방식 설계
π*0.6의 내부 신경망 구조와 액션 출력 방식을 상세히 다뤘다. SigLIP-400M과 Gemma-2B를 백본으로 사용하며 시각 정보, 언어 지시, 메타데이터와 함께 이진화된 이득 신호를 입력받는다. 특히 연속적인 로봇 관절 제어를 위해 Flow Matching 기반의 Action Expert를 도입하여 확률 분포 상에서 최적의 행동 시퀀스를 샘플링함으로써 물리적 환경 변화에 대한 강인함을 확보했다.
실험 결과 및 실무적 시사점
세탁물 접기, 박스 조립, 에스프레소 제조 등 복잡한 실세계 태스크에서의 성능 평가 결과를 공유했다. π*0.6은 기존 VLA 모델 대비 시간당 작업 성공 횟수인 처리량(Throughput)이 2배 이상 향상되었으며 실패율은 절반 수준으로 감소했다. 특히 로봇이 실수했을 때 멈추지 않고 다시 시도하여 성공시키는 회복 탄력성이 가치 함수를 통해 시각적으로 확인되었다.
용어 해설
- 시각-언어-행동 모델(VLA)
- — 시각적 입력과 자연어 명령을 동시에 처리하여 로봇의 구체적인 행동 제어 신호를 직접 출력하는 멀티모달 인공지능 아키텍처이다. 별도의 모듈 분리 없이 엔드투엔드로 학습되어 복잡한 조작 태스크를 수행하는 데 유리하다.
- 행동 모방 학습(Behavior Cloning)
- — 전문가가 수행한 성공적인 데모 데이터를 신경망이 그대로 복제하도록 학습시키는 지도 학습 방식이다. 초기 성능 확보에는 유리하지만 훈련 데이터 분포를 벗어난 상황에서는 로봇이 대처하지 못하는 취약점이 있다.
- 가치 함수(Value Function)
- — 강화학습에서 특정 상태나 행동이 미래에 가져올 누적 보상의 기대치를 수치화한 함수이다. π*0.6에서는 현재 로봇의 상태가 태스크 성공까지 얼마나 효율적으로 이어질지를 판단하는 척도로 사용된다.
- 플로우 매칭(Flow Matching)
- — 노이즈 상태에서 목표 데이터 분포로 이동하는 확률적 흐름을 학습하는 생성 모델 기법이다. 로봇의 연속적인 관절 움직임을 생성할 때 정답 하나만을 예측하는 대신 가능한 행동의 분포를 학습하여 물리적 오차에 강인하게 대응한다.
- 이득 조건부 정책(Advantage-conditioned Policy)
- — 현재 행동이 평균적인 기대치보다 얼마나 더 나은지를 나타내는 이득(Advantage) 신호를 입력 조건으로 받아 행동을 결정하는 방식이다. 이를 통해 로봇은 학습된 경험 중 더 우수한 행동을 선택적으로 수행할 수 있다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 01. 26.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

