챕터별 상세
π0.7 논문 개요
Physical Intelligence가 공개한 π0.7은 기존 VLA 모델의 구조를 넘어선 로봇 파운데이션 모델이다. 이 모델은 로봇 데이터의 품질, 속도, 실수, 제어 방식 등 다양한 맥락 정보를 함께 학습한다. 이를 통해 로봇이 처음 보는 작업도 언어 코칭과 subgoal image를 통해 수행할 수 있는 범용성을 갖춘다.
VLA(Vision-Language-Action) 모델은 카메라 이미지와 언어 명령을 입력받아 로봇의 액션을 출력하는 모델 구조를 의미한다.
맥락 기반 데이터 학습 철학
로봇 데이터는 사람의 시연, 로봇의 자율 실행, 실패 사례 등 다양한 품질을 가진다. π0.7은 이러한 데이터를 단순히 섞지 않고, 각 데이터에 품질, 속도, 실수 여부, 제어 모드 등의 메타데이터를 프롬프트로 추가하여 학습한다. 이 방식은 모델이 데이터의 의미를 구분하고 상황에 맞는 행동을 선택하게 한다.
고난도 조작 성능 분석
π0.7은 별도의 task-specific post-training 없이도 빨래 접기, 에스프레소 만들기 등 고난도 조작 작업을 수행한다. 비교 실험 결과, 특정 작업에 특화된 specialist 모델과 유사하거나 더 높은 성능을 보였다. 특히 시간당 성공 횟수인 throughput 지표에서 우수한 결과를 나타냈다.
코칭과 작업 조합 능력
π0.7은 compositional task generalization을 통해 처음 보는 작업을 수행한다. 사용자가 단계별로 언어 코칭을 제공하면 모델은 이를 하위 작업으로 분해하고, subgoal image를 통해 중간 목표를 시각적으로 확인하며 작업을 완수한다. 이는 로봇에게 새로운 작업을 가르치는 비용을 크게 절감하는 방식이다.
Compositional task generalization은 기존에 배운 작은 기술들을 새롭게 조합하여 처음 보는 작업을 수행하는 능력을 뜻한다.
로봇 데이터의 미래
로봇 학습의 핵심은 깨끗한 데이터만 모으는 것이 아니라, 실패, 실수, 사람이 개입한 데이터 등 현실의 다양한 데이터를 구조화하는 것이다. π0.7은 메타데이터를 활용하여 이러한 다양한 품질의 데이터를 학습 가능한 신호로 변환한다. 이는 향후 Physical AI와 로봇 데이터 플랫폼의 중요한 방향성을 제시한다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 03.수집 2026. 06. 03.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

