TL;DR
가벼운 vision-language-action 정책에 RL 루프를 결합해 변형체 조작 문제에서 실전 경쟁력을 확보한 사례가 제시되었다. 이 접근은 정책 자체를 값(value)과 Q-유사 예측기능으로 확장해 우수한 프레임을 더 빈번히 학습하고 추론 시 조건 증폭을 적용하는 방식으로 작동한다. 실제 대회에서 시뮬레이션 1위와 실물 2위라는 결과를 달성해 복합적 엔지니어링과 RL 기법이 실무적 로봇 제어에 적용 가능한 수준임이 확인되었다.
왜 중요한가
가벼운 vision-language-action 정책에 RL 루프를 결합해 변형체 조작 문제에서 실전 경쟁력을 확보한 사례가 제시되었다. 이 접근은 정책 자체를 값(value)과 Q-유사 예측기능으로 확장해 우수한 프레임을 더 빈번히 학습하고 추론 시 조건 증폭을 적용하는 방식으로 작동한다. 실제 대회에서 시뮬레이션 1위와 실물 2위라는 결과를 달성해 복합적 엔지니어링과 RL 기법이 실무적 로봇 제어에 적용 가능한 수준임이 확인되었다.
관련 Figure

이 그림은 대회의 관측 각도와 평가 대상 의류 다양성을 직관적으로 보여준다. 모델 입력이 3개 카메라 영상임을 고려하면, 각 타입별 시각적 차이를 학습해야 일반화가 가능함이 확인된다. 논문 전반에서 의류 타입을 추정하고 타입별 하이퍼파라미터를 분리 튜닝한 설계가 이 차이에 대응하기 위한 실용적 선택임이 드러난다.
오버헤드 카메라 관측 예시로 네 가지 의류 타입(long-sleeve top, short-sleeve top, long pants, shorts)이 제시되어 있다.
핵심 기여
AWR과 RECAP의 결합으로 flow-matching VLA를 안정적으로 개선
본 연구는 AWR 기반의 우수-프레임 우선 샘플링과 RECAP식 advantage 조건화를 동시에 적용해 flow-matching 기반 VLA를 개선했다. 샘플링은 P(frame) ∝ exp(clip(A,−2,2))로 구현했고 보조헤드는 중요도 역확률로 보정했다. 이 구성은 정책을 행동 모달리티 바깥으로 밀어내지 않으면서 좋은 행동 쪽으로 질량을 재분배했다.
HuggingFace Hub를 통한 비동기 분산 훈련·롤아웃 파이프라인 구축
학습자는 하나의 H200에서 연속 학습을 수행하고 수많은 롤아웃 워커는 최신 체크포인트를 Hub에서 가져와 동작 데이터를 업로드했다. 데이터는 합쳐지지 않고 런타임 샘플러가 소스별 샘플링 비율을 관리해 실시간으로 믹스가 바뀌도록 설계되었다. 이 구조는 확장성과 비동기성을 동시에 제공했다.
추론 시 Thompson sampling으로 인퍼런스 하이퍼파라미터를 온라인 최적화
실행 길이, 재생 속도, 가이던스 스케일, 후보 수 등 추론 파라미터를 각 의류 타입별로 독립 밴딧으로 튜닝했다. 각 팔은 Beta(α,β) 후방분포를 유지하고 성공-베이스라인 차이를 보상으로 업데이트했다. 이 방식은 롤아웃 수집 중 저비용으로 동적 하이퍼파라미터 최적화를 가능하게 했다.
정책 내 보조 예측 헤드로 값·진행·미래 상태를 공유 표현에서 예측
하나의 learned query 토큰으로 성공 확률, completion, 키포인트 거리 등을 예측해 값 함수와 진행 신호를 정책 내부에 포함시켰다. 또한 액션-조건화된 FM query로 30프레임 앞의 keypoint, Δsuccess를 예측해 best-of-N 재랭킹에 활용했다. 이 설계는 모델 단일화와 표현 공유를 통해 서빙 복잡성을 줄였다.
시뮬레이션에서 실물로의 전이 레시피와 강한 데이터 증강, DAgger 활용
카메라 정렬, 강한 이미지·물리적 증강, 실물 teleop DAgger 데이터와 시뮬레이션 리플레이의 혼합으로 sim-to-real을 수행했다. 시뮬 체크포인트 중 과도히 특화된 최신판 대신 한 단계 앞선 체크포인트를 출발점으로 선택해 과적합 위험을 낮추었다. 이 파이프라인은 실물 결선에서 2위를 기록하는 데 기여했다.
핵심 아이디어 이해하기
문제 출발점은 행동의 연속성 때문에 좋은 행동이 행동 공간에서 좁은 매니폴드를 차지한다는 점이다. 행동을 벌점으로 밀어내는 알고리즘은 그 매니폴드를 벗어나 잘못된 예측을 만들 위험이 커서, 이미 정책이 생성하는 좋은 행동 분포 안에서 확률 질량을 재분배하는 방식이 안정적이다. 따라서 AWR의 샘플링 편향과 RECAP의 조건화는 동일 모델 내부에서 서로 보완적으로 작동하도록 설계되었다. 본 논문은 advantage를 두 경로로 소비한다: 하나는 샘플링 측면에서 exp(clip(A,−2,2))로 고득점 프레임을 더 자주 학습하게 만들고, 다른 하나는 advantage 토큰과 AdaRMS를 통해 action expert에 조건으로 주어 inference에서 classifier-free guidance를 가능하게 한다. 이 두 경로는 탐색 범위는 제한하나 높은 신뢰도의 즉시 성공률 향상에 유리한 트레이드오프를 제공한다. 또한 정책 자체를 값 추정기로 확장해 P(success)와 completion, 미래의 keypoint를 같은 네트워크가 예측하게 했다. 이는 값-와-정책 분리로 인한 서빙·학습 복잡성을 제거하고 representation 공유로 효율을 얻는 설계 결정을 반영한다.
방법론
전체 접근은 비동기적인 세 컴포넌트 루프다. 하나의 트레이너는 H200에서 체크포인트를 주기적으로 업로드하고, 다수의 롤아웃 워커는 Hub에서 최신 체크포인트를 가져와 다중 Isaac Sim 인스턴스로 에피소드를 생성해 값·어드밴티지 예측을 함께 기록했다. 수집된 에피소드는 통합하지 않고 런타임에 소스별 샘플 비율로 혼합해 학습 데이터의 구성비를 동적으로 조절했다. 핵심 메커니즘은 AWR 샘플링과 RECAP식 조건화의 결합이다. AWR은 샘플링을 P(frame) ∝ exp(clip(A,−2,2))로 구현해 배치 내 계산 효율을 높였고 보조 헤드에는 역샘플링 확률을 곱해 편향을 보정했다. RECAP은 advantage 토큰을 prefix 그룹에 넣어 토큰 마스킹 확률에 따라 양의 advantage를 조건화하고 inference에서는 conditional/unconditional denoise를 결합해 classifier-free guidance를 수행했다. 데이터 수집은 여러 전략을 병행했다. 무작위·전수 샘플링, 난이도 타깃 커리큘럼, 성공 리플레이(성공 상태를 저장해 강한 증강으로 재생), 절반성공 재생, 실패 하드마이닝(실패 시점 스냅샷 복원)이 동시에 운영되었다. 또한 사람이 교정하는 DAgger 루프를 비동기 방식으로 구축해 실패 상태를 빠르게 전문가 교정 시나리오로 전환했다. 모델 구조는 frozen SigLIP 비전 인코더 → Gemma-2B prefix transformer → Gemma-300M flow-matching action expert의 파이프라인이다. prefix에 이미지, 상태, garment-type, advantage, FAST 토큰을 계층적 attention mask로 배치하고 action expert는 30-스텝 덩어리를 flow-matching으로 생성했다. AdaRMS, Exclusive Self-Attention(XSA), per-timestep action normalization 등 여러 공학적 개선을 더해 안정성과 표현력을 높였다. 보상 설계는 대회의 키포인트 기반 성공 체크를 그대로 사용해 중간 체크포인트를 만들고 실패시 누적 보상을 전부 회수해 에피소드 리턴은 항상 이진이 되게 처리했다. 성공 예측과 completion 예측을 결합해 value baseline을 컵에드(CUPED)-스타일로 감쇠하고 GAE(γ=0.999, λ=0.99)로 어드밴티지를 계산해 샘플링·조건화에 사용했다.
관련 Figure

다이어그램은 Hub를 통해 트레이너, 롤아웃 워커, 수동 교정 스테이션이 비동기적으로 상태를 교환하는 설계를 명확히 보여준다. 이 구조는 데이터와 체크포인트의 중앙 저장을 통해 스케일 아웃과 비동기성을 확보하고자 한 설계 결정을 시각적으로 요약한다. 또한 훈련-수집 루프에서 체크포인트 롤백과 샘플 공유가 어떻게 가능했는지를 이해하는 데 도움이 된다.
시스템 오버뷰 다이어그램으로 Training machine, Model repo, Data repo, Rollout machine, Manual teleop 사이의 비동기 플로우를 나타낸다.

이 그림은 행동 분포를 '나쁜 행동'과 '좋은 행동' 모드의 혼합으로 모델링하고 AWR이 좋은 모드로 질량을 이동시키며 RECAP은 우수-advantage 슬라이스를 선택한다고 시각화한다. 그림은 이 두 메커니즘이 동시에 적용될 때 정책 목표가 좋은 모드에 거의 전부 집중된다는 직관을 제공하며 논문의 알고리즘 선택 근거를 보강한다.
AWR 재가중치와 RECAP 조건화가 행동 분포에 미치는 영향을 연속적인 밀도 곡선으로 보여주는 개념적 그림이다.

이 플롯은 어드밴티지 값이 증가할수록 샘플링 확률이 지수적으로 상승하며 음수 쪽은 잘려서 과도한 하향 샘플링을 방지함을 시각화한다. 이 수식적 선택은 배치 내에서 계산 효율을 유지하면서 고득점 프레임에 집중하는 방법의 핵심 구현이다. 논문 구현에서는 이 샘플링이 데이터 로더 수준에서 적용되어 이미지 디코딩 비용을 절감했다는 점을 함께 보고했다.
advantage A에 대한 AWR 샘플링 가중치 P ∝ exp(clip(A,−2,2))의 함수형 그래프를 보여준다.
주요 결과
온라인(시뮬레이션) 라운드에서 해당 시스템은 전체 62개 팀 중 1위를 기록했고 최종 평균 성공률은 79.63%였다. 2위와의 격차는 6.1 퍼센트포인트였으며 유형별 성능은 long top 74.5%, short top 70.0%, long pants 80.5%, shorts 93.5%로 보고되었다. 롤아웃 데이터셋은 최종적으로 약 12,500개의 정책 롤아웃(약 4.3M 프레임)을 보유했고 전체 수집 세션은 약 140회에 달했다. 시뮬레이션에서 출발해 실물 결승으로 전이하는 단기간(약 일주일) 스프린트에서 동일한 체크포인트를 기반으로 강한 증강 및 실물 DAgger 데이터로 미세조정해 오프라인(현장) 평가에서 2위를 달성했다. 성능 분석에서 주요 실패 모드는 정밀도 한계(키포인트가 임계값 근처에 걸림), 시뮬레이터 물리 근사, 그리고 복구 행동의 부재로 요약되었다. 저자는 이 솔루션을 공학적 사례 연구로 규정하며 체계적 관찰보다 실전 최적화에 중점을 두었다고 명시했다.
기술 상세
전체 아키텍처는 frozen SigLIP 이미지 인코더를 통해 3개 카메라(오버헤드·좌·우) 이미지를 추출하고 Gemma-2B prefix transformer에 이미지를 포함한 토큰들을 공급한다. prefix는 이미지 토큰·current query·state·garment-type·advantage·FAST 토큰으로 계층적 attention mask를 구성하며 current query는 이미지만 보게 해 값 예측이 proprioceptive 정보에 치우치지 않게 했다. action expert는 Gemma-300M이며 flow-matching으로 30프레임 덩어리를 생성하고 FM query가 suffix 끝에 위치해 행동-조건화된 미래 예측을 수행한다. Advantage 처리 파이프라인은 다중 구성요소로 이루어졌다. 수집 시점에 성공 확률과 completion을 함께 예측해 EMA로 평활한 S̄_t를 만들고 value baseline은 α_s=0.5로 감쇠했다. 보상은 키포인트 기반 중간 체크포인트(예: tops에 점진적 첫 체크포인트 0.5)로 densify하고 실패 시 누적 보상을 회수해 전체 리턴은 이진성을 유지했다. GAE(γ=0.999, λ=0.99)로 success GAE와 completion potential을 계산하고 오래된 롤아웃은 세그먼트 기반 outcome-only 기준으로 점진 블렌딩했다. AWR는 샘플링 편향으로 구현되었고 실제 배치 손실은 unweighted flow-matching MSE로 유지했다. 샘플 중요도는 p(frame) ∝ exp(clip(A,−2,2))로 계산해 데이터 효율을 높였고 보조헤드는 중요도 역확률로 보정해 편향을 제거했다. BC/DAgger 소스는 실패율에 비례한 다른 우선순위 스케일을 사용했다. 추론 시 최적화는 여러 인자에 의해 좌우된다. 덩어리 길이 H=30, denoising S=10 Euler 단계, 실행 길이 n_e, 재생 스트레치 k, 앵커 길이 n_a를 조합해 실행을 제어했다. Classifier-free guidance는 conditional/unconditional 속도 필드를 v_c, v_u로 얻어 v̂ = v_u + s (v_c − v_u)로 합성했고 가이던스 스케일은 의류 타입별로 Thompson sampling으로 튜닝해 최종 제출에서는 7–9 범위로 수렴했다. 구현·학습 세팅은 H200 단일 트레이너, 배치 192, 약 300k 스텝 규모의 훈련과 5 flow 샘플/배치 항목, cosine LR(1e-4→1e-5 over 100k steps), AdamW, bfloat16, frozen SigLIP, 경량 이미지 증강이 포함되었다. 롤아웃은 주로 RTX PRO 6000에서 수집했고 데이터는 약 12.5k 에피소드(4.3M 프레임) 정도의 보유 창으로 운영되었다. 공학적 요소로는 Exclusive Self-Attention(XSA) 적용, per-timestep action normalization(σ_d(t)=a_d + s_d sqrt(t+e_d) 형태 fitting), AdaRMS에 garment-type과 advantage 신호 추가 등이 있다. 이들 요소는 체크포인트 불연속을 줄이고 의류 타입·어드밴티지 정보가 action expert의 모든 층에 도달하도록 설계되었다.
관련 Figure

이 도식은 입력 이미지로부터 garment-type 추론, FAST 입력의 훈련 전용 역할, 그리고 action expert에 이르기까지의 토큰 흐름을 구조적으로 정리한다. 특히 FAST 토큰이 훈련 중 표현을 풍부하게 하는 보조 입력으로 쓰이고 inference에서는 제거된다는 점이 명확히 드러난다. 이 그림은 모델 내부에서 보조 예측들이 어떻게 분산되고 FM query가 행동-조건화 예측을 담당하는지를 연결시켜 준다.
PaliGemma 아키텍처 다이어그램으로 SigLIP, Gemma prefix, FAST 토큰, Flow Matching 액션 전문가의 데이터 흐름을 보여준다.

이 매트릭스는 current query가 이미지 그룹만 보도록 설계되어 값 예측이 상태 정보에 의존하지 않게 만든 정책화된 제약을 보여준다. 또한 advantage, FAST, action 토큰의 가시성 규칙이 어떻게 구성되어 action expert가 필요한 정보에만 접근하게 되는지를 직관적으로 드러낸다. 이 구조는 보조 헤드와 action expert 간의 정보 흐름 제어를 설명하는 핵심 기술적 디테일이다.
쿼리와 키 그룹 간의 계층적 attention 마스크를 행렬 형태로 시각화한 그림이다.
한계점
저자는 본 작업을 통제된 실험이 아닌 경쟁적 엔지니어링 사례 연구로 규정했고, 따라서 각 구성요소의 독립적 기여를 확인하는 체계적 ablation이 부족하다. DAgger 구성은 시뮬레이션에서는 제한적 효용을 보였고 실물 데이터 수집이 실전 전이 성공에 중요한 역할을 했으므로 완전한 제너럴리제이션 보장은 제공되지 않는다. 또한 일부 설계 결정(예: XSA, AdaRMS 채널)은 엄밀한 비교 없이 채택되었으며 이들 효과의 정량적 분리는 추가 연구가 필요하다.
실무 활용
이 파이프라인은 시뮬레이션 기반 데모에서 실물 로봇 제어로 전이할 때의 실무적 난관을 해결하는 실용적 레시피를 제공한다. 비동기 분산 데이터 수집, 보조 헤드를 포함한 단일 모델 아키텍처, 추론 시 하이퍼파라미터 온라인 튜닝 등은 실제 배치에서 유용한 구성 요소다. 공개된 코드 저장소와 실전 경쟁 결과는 산업 적용 가능성을 뒷받침한다.
- 가정용 또는 산업용 의류 취급 로봇에서 시뮬레이션 학습을 활용해 초기 정책을 빠르게 확보하고 실물에서 미세조정하는 워크플로우
- 데이터 수집 인프라가 제한된 환경에서 비동기 Hub 기반 롤아웃·학습 파이프라인으로 확장 가능한 수집 시스템 구축
- 복잡한 연속 제어 태스크에서 flow-matching 액션 전문가와 우수-프레임 기반 샘플링을 결합해 높은 신뢰도의 오픈루프 동작을 생성
코드 공개 여부: 공개
코드 저장소 보기키워드
추가 이미지 분석

오버레이는 수집 시점에 예측된 값들이 어떻게 변하는지와 어느 순간에 실패 스냅샷을 저장할지 판단하는 근거를 제공한다. 이 시각화는 하드마이닝과 DAgger 큐잉을 위한 자동 기준(예: success prediction 급락)을 정의하는 데 실무적으로 유용했다는 점을 보여준다. 또한 온라인 정책 행동과 보조 헤드의 상관을 점검하는 도구로 사용되었음을 알 수 있다.
롤아웃 디버그 비디오의 프레임 오버레이 예시로 per-frame 성공확률, 어드밴티지, 보상, completion, time-to-completion 추적선이 보인다.

그래프는 primary proximity distance의 감소에 따라 첫 0.5 보상이 점진적으로 할당되는 'gradual first checkpoint' 메커니즘을 수치적으로 보여준다. 실패 시 누적 보상을 회수해 에피소드 리턴을 이진으로 유지하는 설계가 보상 곡선에 직접적으로 반영되어 있다. 이 구조는 sparse binary objective와의 정렬을 유지하면서 학습 신호를 제공하려는 설계 의도를 명확히 한다.
성공 체크포인트 도달에 따른 누적 dense reward 예시와 타임라인 프레임을 함께 보여주는 그래프다.
용어 해설
- AWR
- — AWR은 행동을 회귀로 학습하되 샘플별로 exp(A/β)로 비중을 달리해 고유리득(advantage)이 큰 프레임을 더 자주 학습하는 방법이다. 이 논문에서는 샘플링 확률을 A에 비례해 편향시키고 보조 헤드에는 중요도 가중치를 적용해 편향을 보정했다. AWR은 기존의 확률 기울기 기반 방법과 달리 행동의 확률 질량을 보전하면서 좋은 행동에 집중하는 특성이 있다.
- RECAP
- — RECAP은 이득(advantage)을 입력으로 받아 모델 출력을 조건화함으로써 고득점 행동을 선택하도록 유도하는 기법이다. 본문에서는 advantage 토큰을 통해 action expert에 조건을 주고 inference에서 classifier-free guidance를 가능하게 했다. 이 방식은 행동 분포의 가능한 모달리티를 보존하면서 우수한 부분만 선택하는 특성이 있다.
- Flow Matching
- — Flow Matching은 노이즈에서 시작해 역확률 흐름을 따르는 복원 과정을 통해 연속 행동 덩어리(action chunk)를 생성하는 방법이다. 논문에서는 Gemma-300M 기반의 action expert가 30프레임 덩어리를 flow-matching으로 생성하고, 여러 샘플을 병렬로 디노이징해 후보를 비교했다. 이 방식은 연속 제어에서 자연스러운 궤적을 형성하는 데 유리하다.
- Classifier-Free Guidance
- — Classifier-Free Guidance는 조건부와 무조건부 모델 출력을 결합해 조건 신호를 증폭시키는 기법이다. 본문에서는 advantage 토큰을 조건으로 두 번의 denoising를 수행하고 두 결과의 차이에 스케일을 곱해 최종 속도 필드를 조정했다. 이 기법은 조건에 따른 최선의 행동을 선택하고자 할 때 활용되었다.
- GAE
- — GAE는 과거 보상에서 시간적 차분을 계산해 편향-분산 트레이드오프를 조절하는 우수(advantage) 추정 방식이다. 논문에서는 성공 확률 기반 값과 completion 기반 잠재(potential)를 합쳐 GAE로 어드밴티지를 계산하고, 오래된 롤아웃에서는 세그먼트 기반 기준으로 블렌딩했다. 이렇게 계산한 어드밴티지가 AWR 샘플링과 RECAP 조건화에 사용되었다.
- DAgger
- — DAgger는 인간 교정(teleop)을 통해 실패 상태에서 전문가 행동을 수집하고 그 데이터를 학습 파이프라인에 추가하는 인간-루프 데이터 수집 방식이다. 본문에서는 시뮬레이션과 실물 모두에서 실패 스냅샷을 보관해 비동기적으로 인간이 교정한 에피소드를 허브로 업로드했다. 실물 DAgger 데이터는 sim-to-real 전이에서 중요한 역할을 했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.