TL;DR
로봇의 산업·상업적 적용은 동일 작업을 오랜 기간 안정적으로 수행해야 하며, Variational Automation은 객체 기하와 자세 변동이 큰 반복 작업을 대상으로 한다. GaP는 모듈화된 계산 그래프와 에이전트 기반 저수준 스킬을 결합하여 모델프리 정책이 취약한 분포 이동 상황에서 안정적 실행을 달성하는 방법을 제시한다. 이 접근은 시뮬레이션 리허설을 통해 그래프를 자동으로 재구성하고 파라미터를 조정함으로써 수동 튜닝 비용을 줄이고 현실 전이 가능성을 높였다.
왜 중요한가
로봇의 산업·상업적 적용은 동일 작업을 오랜 기간 안정적으로 수행해야 하며, Variational Automation은 객체 기하와 자세 변동이 큰 반복 작업을 대상으로 한다. GaP는 모듈화된 계산 그래프와 에이전트 기반 저수준 스킬을 결합하여 모델프리 정책이 취약한 분포 이동 상황에서 안정적 실행을 달성하는 방법을 제시한다. 이 접근은 시뮬레이션 리허설을 통해 그래프를 자동으로 재구성하고 파라미터를 조정함으로써 수동 튜닝 비용을 줄이고 현실 전이 가능성을 높였다.
핵심 기여
Variational Automation(VA) 작업군 정형화와 8개 공개 벤치마크 제공
연구는 Variational Automation을 VA로 정의하고 물체 기하와 자세 변동이 큰 반복 작업을 표준화했다. 논문은 시뮬레이션·실물 포함 8개의 공개 벤치마크를 제시하여 다른 방법과 직접 비교할 수 있는 기준을 마련했다. 이 벤치마크들은 실제 작업조건(포지션·오리엔테이션 변동, 장기 반복성 등)을 반영하였다.
계산 그래프 기반 정책 표현과 MORSL 스킬 라이브러리 도입
로봇 정책을 원자적 스킬 노드와 데이터·제어 엣지로 구성되는 계산 그래프로 표현하여 모듈성·검증성을 확보했다. Modular Open Robot Skill Library(MORSL)는 51개 초기 스킬을 포함하여 인식·그리핑·모션·검증 primitives를 표준 인터페이스로 제공한다. 이 구조는 에이전트가 부분 그래프를 합성하고 정적 타입·엣지 검사를 통해 런타임 오류를 줄이도록 설계되었다.
다중 에이전트 하니스와 그래프 분해·합성 워크플로
오케스트레이션 에이전트가 자연어 명세를 기능적 세그먼트로 분할하고 각각의 Skill Agent가 지역 서브그래프를 생성하였다. 에이전트별로 책임을 분리하여 컨텍스트 윈도우를 제한하고 에이전트의 허위 성공 유인을 줄였다. 합성된 그래프는 정적 검증과 시뮬레이션 인터페이스로 연결되어 에이전트 생성과 실행을 분리하였다.
내부 시뮬레이션 리허설 기반의 자기학습 루프
GaP는 Isaac-Lab 기반의 내부 시뮬레이션에서 병렬롤아웃을 실행하고 노드별 실행 전후 상태를 계측하여 실패의 기하학적 원인을 추출하였다. 실패 원인 집합을 LLM 에이전트에게 제공하여 그래프 토폴로지 교체, 노드 교환, 파라미터 튜닝을 자동 적용하였다. 이 반복 과정은 성능 지표(성공률·처리량)의 정체 시까지 지속되었다.
시뮬레이션·실물 실험을 통한 성능 검증과 전이
논문은 LIBERO 기반의 식료품 픽앤플레이스, 팝콘 조리, USB-C 삽입, 크레이트 세척 등 8개 과제에서 GaP 성능을 보고하였다. GaP는 여러 변동 조건에서 기존 VLA·TAMP·CaP 계열 기법보다 높은 성공률을 보였고 실제 환경으로 전이되어 높은 실물 성공률을 기록하였다. 실험은 세부적 숫자(예: USB-C 삽입 121/130 성공, 팝콘 시뮬레이션 94% → 실물 18/20 성공)를 포함하였다.
핵심 아이디어 이해하기
Variational Automation 문제는 작업 환경과 로봇·센서 세팅이 고정되지만 객체 기하와 초기 포즈 분포가 넓어 반복 수행에서 높은 신뢰성이 요구된다. 기존의 모델프리 VLA(vision-language-action) 접근은 환경 분포 이동과 상세한 기하적 제약에 취약하여 산업 수준의 반복 신뢰성을 확보하기 어렵다. 따라서 VA는 작업의 구조를 활용해 모델프리의 적응성과 모델기반의 검증성을 결합할 필요가 있다. GaP는 이 문제에 대해 정책을 단일 거대한 네트워크로 학습하는 대신, 원자적 스킬을 노드로 하는 계산 그래프 형태로 정책을 표현함으로써 모듈화와 타입 검증을 보장한다. 그래프 구조는 무엇을 수행할지(노드)와 어떻게 연결할지(엣지)를 분리하여 에이전트의 문맥 크기를 줄이고 각 에이전트가 지역적 책임만 다루게 한다. 이로 인해 에이전트가 인터페이스나 데이터 흐름을 잘못 기술하여 발생하는 런타임 오류와 허위 성공 모드가 감소한다. GaP의 자기학습은 시뮬레이터에서 다양한 인스턴스를 병렬로 리허설하고 각 롤아웃의 실패 데이터를 자동으로 해석하여 그래프 구조와 노드 파라미터를 갱신하는 루프를 형성한다. 이 루프는 로컬 실패 원인을 기하학적·감지적 문제로 환원하고, 스킬 교체·인식 프롬프트 조정·배치 오프셋 수정 등 구체적 조치를 적용하여 성공률을 단계적으로 향상시킨다. 최종적으로 최적화된 그래프는 엣지 장치에서 인터프리터로 반복 실행될 수 있도록 경량화된 계산 그래프로 남겨져 상업적·산업적 반복 작업에서 지속 실행 가능성을 확보한다.
방법론
전체 접근은 자연어 명세를 입력으로 받아 오케스트레이션 에이전트가 작업을 기능적 세그먼트로 분해하고, 각 세그먼트에 대해 Skill Agent가 MORSL 스킬을 사용하여 원자 노드의 서브그래프를 합성하는 구조로 구성되었다. 합성된 서브그래프들은 정적 검증을 통해 타입·엣지 무결성이 확인된 후 실행 가능한 전체 계산 그래프로 연결되며, 이 그래프는 엣지 인터프리터와 시뮬레이션 환경에서 모두 실행 가능하도록 설계되었다. 핵심 메커니즘은 내부 시뮬레이션 리허설과 실패 분석 루프이다. 시스템은 belief space에서 N개의 인스턴스를 샘플링하여 병렬로 롤아웃을 수행하고, 각 노드 실행 전후의 로봇·객체 상태를 기록하여 접촉 여부·변위·성공 기준 미충족의 기하학적 원인을 추출하였다. 수식 𝒥 = w_s · 𝕀(success) + w_t · Φ가 성능 척도로 사용되었으며, 이 수식에 대해 입력-처리-출력-해석 구조로 정리하면 다음과 같다. 수식 원문은 𝒥 = w_s · 𝕀(success) + w_t · Φ이다. 변수 의미는 𝕀(success)가 성공 여부 지시자(성공이면 1, 실패면 0), Φ가 처리량(성공률/사이클타임), w_s와 w_t는 성공·처리량 가중치이다. 계산 흐름은 개별 롤아웃에서 성공 여부를 𝕀로 얻고 사이클 타임을 측정하여 Φ를 계산한 뒤 두 항을 가중 합하여 단일 성능 점수 𝒥를 산출한다. 작은 숫자 예시는 성공률 0.9, 평균 사이클타임 60초, 가중치 w_s=1, w_t=0.01이면 Φ≈0.9/60=0.015, 𝒥≈1·1 + 0.01·0.015≈1.00015로 성공이 주지표로 크게 기여함을 의미한다. 해석은 이 가중합이 우선적으로 성공을 극대화하되 처리량도 반영하여 그래프 업데이트 결정에 균형을 제공한다는 점이다. 그래프 갱신 단계에서는 수집된 실패 피드백을 LLM 에이전트에게 전달하여 토폴로지 변경(노드 교체·엣지 재배선), 파라미터 튜닝(오프셋·목표 위치·힘 임계값 조정), 인식 프롬프트 수정 등을 수행하게 하였다. 이 과정은 병렬 롤아웃 수 N과 반복횟수 M을 인자로 받아 성능이 플래토에 도달할 때까지 반복된다.
관련 Figure

사진은 로봇 팔과 포트가 배치된 실제 실험 환경을 보여주며 좌측에 위치 변동(±5cm)과 회전 변동(±15°) 범위가 그래픽으로 표시되어 있다. 이 이미지는 실험이 단순한 실험실 고정 셋업이 아니라 다양한 포즈 변동을 포함한 현실적 조건에서 수행되었음을 증명하며, 논문이 보고한 케이블 삽입 성공률(121/130)과 조건별 결과의 신뢰성을 뒷받침한다.
USB-C 케이블 삽입 실험의 실물 장치 구성과 위치·오리엔테이션 변동 범위를 표기한 실험 셋업 사진이다.
주요 결과
시뮬레이션 및 실물 실험에서 GaP는 여러 VA 벤치마크에서 우수한 성공률을 기록하였다. Fulfill Grocery Orders와 Pack Grocery Items 벤치마크의 시뮬레이션 결과에서 GaP는 다양한 포지션·오리엔테이션 변동 조건에서 0.93–0.99의 성공률을 유지한 반면, 기존 VLA 모델들은 포즈 변동에서 성능 저하를 보였다. GaP와 VLA의 결합 실험에서는 GaP가 손목 카메라 정렬과 상호작용적 인지 스킬로 VLA 입력을 분포에 맞춰 줌으로써 VLA 단독 대비 두 배 수준의 성공률 개선이 관찰되었다. 실물 실험에서는 Fulfill Grocery Orders 실험에서 GaP가 25/25(100%) 성공을 달성했고 TipTop 은 8/25 성공에 그쳤으며, Make Popcorn 과제는 시뮬레이션에서 94%로 수렴하고 실제 시험에서 18/20 성공을 기록하여 시뮬레이션에서 실물로의 전이 가능성을 보였다. USB-C 케이블 삽입 벤치마크에서는 GaP가 130회 시도 중 121회 성공(0.93)을 달성하였고, 삽입 조건별 세부 성능과 실행 시간(대략 30초/삽입)은 논문 표에 기재된 대로 보고되었다. Wash Crates 시뮬레이션 비교에서 GaP는 전문가가 수작업으로 설계한 그래프와 유사한 성공률(0.95 vs 0.99)과 유사한 주기 시간을 보이며 장시간 실행에서 처리량도 근접한 성능을 보였다. 추가로 수행된 소거 실험에서 그래프 없는 단일 LLM 접근이나 단일 에이전트로의 응집은 정적 타입·엣지 검사에서 실패율이 급증하여 성공률이 거의 0으로 떨어지는 결과를 보였다.
관련 Figure

그림 왼쪽은 다양한 물체 포즈에서의 리허설 장면을 보여주고 오른쪽은 반복 이터레이션에 따른 성공률 변화를 플롯으로 나타낸다. 플롯은 초기 그래프에서 잡기 실패가 발생하고 이후 운반·배치 관련 수정 단계에서 성공률이 급격히 상승하는 단계별 개선 패턴을 보여준다. 이 이미지는 논문의 핵심 메커니즘인 병렬 리허설 및 반복 그래프 갱신이 어떻게 구체적 실패 모드(그립·운반·배치)에 대응하는지를 시각적 근거로 보강한다.
자세 및 위치 변동을 가진 작업 인스턴스에 대한 내부 시뮬레이션 리허설과 반복적 그래프 업데이트로 성공률이 향상되는 과정을 시각화한 그림이다.

이미지는 양팔 협동, 그립 위치 제약, 뒤집기 동작 같은 복합 기하학적 행위를 포함하는 작업을 시뮬레이터에서 재현한 것을 보여준다. 논문 결과와 대응하여 GaP가 전문가 수작업 그래프와 유사한 성공률과 처리량을 달성했음을 시각적으로 보완한다.
크레이트 세척 작업에서 양팔 로봇이 상단 크레이트를 집어 뒤집어 세척 테이블에 놓는 시나리오를 보여주는 시뮬레이션 장면과 프로세스 스냅샷이다.
기술 상세
전체 아키텍처는 자연어 명세 → 오케스트레이션 에이전트(작업 분해) → Skill Agents(서브그래프 합성) → 정적 그래프 검증 → 내부 시뮬레이션 리허설 → 그래프 업데이트의 파이프라인으로 구성된다. 노드 추상화는 각 스킬이 입력·출력 타입과 전제조건을 선언하도록 규격화되어 있어 정적 타입 검사와 엣지 연결 검증이 가능하다. MORSL 초기 카탈로그는 51개 스킬로 구성되어 있으며 인식(SAM2/Grounding DINO 등), 그립(GraspGen, Contact GraspNet 등), 모션(cuRobo/cuRobo v2 등), 포인트클라우드 유틸리티, 검증·제어 primitives를 포함한다. 내부 시뮬레이션은 Isaac-Lab을 사용하여 시각적 렌더링과 물리 접촉을 계산하고, 각 노드 실행 전후의 상태를 기록하여 실패의 기하학적 원인을 역추적하였다. 그래프 업데이트는 에이전트에게 실패 사례 집합을 제공하고 노드 교체, 엣지 재배치, 파라미터(예: 배치 오프셋, 힘·깊이 임계값) 조정, 인식 프롬프트 변경을 수행하게 함으로써 자동 최적화를 달성하였다. 구현 세부로는 병렬 롤아웃 N과 반복 횟수 M을 조절 가능한 하이퍼파라미터로 두었고, 실제 실험에서는 Gemini-3.1-Flash-Lite 계열 VLM/LLM을 온도 0.1로 사용해 에이전트의 출력을 제어하였다. 또한 엣지에서 반복 실행할 수 있도록 그래프 인터프리터를 경량화하고 ROS 노드와 호환되는 모듈을 제공하여 실물 전이 시 레거시 시스템과의 통합을 보장하였다.
관련 Figure

왼쪽 패널은 수동으로 설계된 ROS 노드 간 토픽 흐름을 보여주고 가운데는 GaP가 생성한 단일 포트 삽입용 계산 그래프를, 오른쪽은 다중 포트 장기 과제를 처리하는 서브그래프 조합을 보여준다. 이 이미지는 GaP가 기존 ROS 노드를 활용하면서도 모듈식 노드로 구성해 높은 수준의 작업 논리를 자동으로 합성할 수 있음을 구조적으로 증명한다.
전통적 ROS 계산 그래프와 GaP가 생성한 계산 그래프 및 GaP 기술을 활용한 포트 일괄 삽입 서브그래프 예시를 병렬로 비교한 다이어그램이다.
한계점
논문은 GaP가 여러 VA 과제에서 성능을 크게 개선했지만 산업 수준의 완전한 신뢰성에는 아직 도달하지 못했다고 명시하였다. 실행 시간 측면에서 GaP의 처리 속도는 산업 기준(예: 500 units/hr)에 크게 못 미치며 VLM 호출과 역운동학·모션플래너의 지연이 병목으로 남아 있다. 제시한 8개 벤치마크는 주로 준정적 픽앤플레이스 유형에 국한되어 있어 변형성이 큰 변형 물체, 동적 힘 제어, 이동 타깃을 포함하는 작업군에 대한 적용성은 추가 연구가 필요하다고 한정하였다.
실무 활용
GaP는 실무용 자동화 환경에서 인간의 그래프 설계·튜닝 부담을 줄일 실질적 가능성을 보였다. MORSL과 계산 그래프 표준 인터페이스를 통해 기존 ROS 노드와 통합이 가능하여 레거시 시스템과의 연계성이 확보되었다. 공개된 코드 저장소가 있어 연구자가 실험을 재현하고 엔지니어링 파이프라인에 적용할 수 있는 기반이 제공되었다.
- 상거래·물류 창고에서 다양한 SKU와 포즈 변동을 처리하는 지속적 픽앤플레이스 자동화 시스템
- 산업용 케이블 삽입·조립 작업처럼 기하학적 정밀도와 힘 피드백이 필요한 반복 작업에 대한 자동화 그래프 생성 및 튜닝
- 다관절 로봇의 협업 작업에서 스킬 라이브러리를 활용한 양팔 협동 정책의 자동 합성 및 검증
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Variational Automation
- — 작업 인스턴스마다 물체 기하와 자세가 크게 변하는 반복 작업 범주로, 고정 자동화와 달리 작업 환경과 객체 분포가 한정된 범위 내에서 다양성을 보유하여 지속적 신뢰성이 필요하다.
- Computation Graph
- — 로봇 정책을 노드(원자적 스킬)와 방향성 엣지(데이터·제어 흐름)로 표현한 구조로, 각 노드는 입력·출력 타입을 갖고 독립 실행 혹은 병렬 실행이 가능하여 모듈성, 검증성, 재사용성을 확보한다.
- Agentic Coding
- — LLM/VLM 기반 에이전트들이 코드·그래프·스킬을 자동 생성하고 실행-관찰-피드백 루프를 통해 반복 개선을 수행하는 워크플로로, 사람 개입을 줄이면서 시스템 구성을 자동화한다.
- Internal Simulation Rehearsal
- — 물리 시뮬레이터에서 동일 작업의 다양한 인스턴스를 병렬으로 실행하여 실패 원인을 계측하고 그래프 토폴로지와 노드 파라미터를 자동으로 갱신하는 자기학습 루틴이다.
코드 예제
1 Input: 𝒯 = ⟨ ℒ , ℰ , ℛ , 𝒪 , 𝒳 , ℬ , 𝒥 ⟩ , Iterations M , Parallel Rollouts N
2 1ex Initialization:
3 𝒢0 ← Graph_Init(ℒ) // Initial graph from language
4 𝒮 ← Build_Scene(𝒢, {𝒢i}) // Instantiate sim environment
5 for j ← 1 to M do // Step 1: Scene Variational Sampling
6 {ŝi}i=1..N ∼ ℬ // Sample N instances
7 for i ← 1 to N do in parallel
8 τi ← Rehearsal(ŝi, 𝒢j−1) // Rollout policy
9 Fi ← Analyze_Failure(τi, 𝒢, {𝒢i})
10 // Step 3: Graph Refinement
11 𝒢j ← Graph_Update({F1,…,FN}) // Optimize via LLM
12 return 𝒢* ← 𝒢M이 코드는 GaP의 리허설 기반 그래프 최적화 알고리즘 핵심 루프를 보여주며, 입력으로 VA 작업 명세와 반복/병렬 롤아웃 수를 받아 시뮬레이션 리허설로 실패를 분석하고 그래프를 갱신한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


