본문으로 건너뛰기

EmbodiedSkills: VLA 로봇을 폐루프 에이전트로 전환

EmbodiedSkills는 Skill 호출을 runtime 검증과 행동 후 확인으로 감싸 VLA를 폐루프 로봇 에이전트로 구성합니다.

용어 해설

비전-언어-행동 모델(Vision-Language-Action Model)
이미지와 자연어 지시를 입력받아 로봇 행동을 생성하는 모델입니다. EmbodiedSkills에서는 고수준 subgoal과 현재 관측, 로봇 상태를 바탕으로 제한된 action chunk를 출력하며, 실행 전 검증과 실행 후 확인을 거쳐 물리적 행동으로 연결됩니다.
실행 가능한 Skill 인터페이스(Executable Skill Interface)
Skill의 입력·출력 형식, 사전 조건, 실행 방식, 상태 갱신, 실패 정보를 하나의 계약으로 묶은 구조입니다. 모델의 Skill 호출을 즉시 행동으로 간주하지 않고 runtime이 형식과 증거를 확인한 뒤 typed artifact로 기록합니다.
제한된 행동 청크(Bounded Action Chunk)
저수준 VLA 정책이 한 번에 생성하고 실행하는 길이가 제한된 명령 시퀀스입니다. 실행 뒤 새 관측을 수집하고 verifier가 계속 실행할지, subgoal을 진행할지 결정하므로 긴 작업을 고정된 단일 horizon으로 처리하지 않습니다.
행동 후 검증(Post-Action Verification)
행동 청크가 끝난 뒤 새로 얻은 관측과 active subgoal을 비교해 진행 상태를 판단하는 절차입니다. 결과에 따라 다음 subgoal로 이동하거나, 같은 subgoal을 계속 수행하거나, 재관측·재계획·복구 단계로 전환합니다.
Artifact 최신성(Artifact Freshness)
관측, 계획, 행동 결과가 현재 task state와 여전히 연결되는지 나타내는 정보입니다. 관측이나 active subgoal이 바뀌면 의존하는 artifact를 무효화해 오래된 예측이 새로운 물리적 행동을 승인하지 못하게 합니다.
구조화된 궤적(Structured Trajectory)
모델 입력, Skill 결정, 실행 결과, runtime 오류, 검증 신호, 상태 전이를 시간 순서로 저장한 기록입니다. planner, low-level VLA, verifier를 각 인터페이스에 맞춰 학습시키고 선택적 online adaptation에 활용할 수 있습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 01.수집 2026. 09. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.