본문으로 건너뛰기

Learning to Fold: LeHome Challenge 2026 우승 솔루션의 엔지니어링 보고서

가벼운 vision-language-action 정책에 RL 루프를 결합해 변형체 조작 문제에서 실전 경쟁력을 확보한 사례가 제시되었다. 이 접근은 정책 자체를 값(value)과 Q-유사 예측기능으로 확장해 우수한 프레임을 더 빈번히 학습하고 추론 시 조건 증폭을 적용하는 방식으로 작동한다. 실제 대회에서 시뮬레이션 1위와 실물 2위라는 결과를 달성해 복합적 엔지니어링과 RL 기법이 실무적 로봇 제어에 적용 가능한 수준임이 확인되었다.

추가 이미지 분석

롤아웃 디버그 비디오의 프레임 오버레이 예시로 per-frame 성공확률, 어드밴티지, 보상, completion, time-to-completion 추적선이 보인다.
Screenshot

오버레이는 수집 시점에 예측된 값들이 어떻게 변하는지와 어느 순간에 실패 스냅샷을 저장할지 판단하는 근거를 제공한다. 이 시각화는 하드마이닝과 DAgger 큐잉을 위한 자동 기준(예: success prediction 급락)을 정의하는 데 실무적으로 유용했다는 점을 보여준다. 또한 온라인 정책 행동과 보조 헤드의 상관을 점검하는 도구로 사용되었음을 알 수 있다.

롤아웃 디버그 비디오의 프레임 오버레이 예시로 per-frame 성공확률, 어드밴티지, 보상, completion, time-to-completion 추적선이 보인다.

성공 체크포인트 도달에 따른 누적 dense reward 예시와 타임라인 프레임을 함께 보여주는 그래프다.
Chart

그래프는 primary proximity distance의 감소에 따라 첫 0.5 보상이 점진적으로 할당되는 'gradual first checkpoint' 메커니즘을 수치적으로 보여준다. 실패 시 누적 보상을 회수해 에피소드 리턴을 이진으로 유지하는 설계가 보상 곡선에 직접적으로 반영되어 있다. 이 구조는 sparse binary objective와의 정렬을 유지하면서 학습 신호를 제공하려는 설계 의도를 명확히 한다.

성공 체크포인트 도달에 따른 누적 dense reward 예시와 타임라인 프레임을 함께 보여주는 그래프다.

용어 해설

Advantage-Weighted Regression(AWR)
AWR은 행동을 회귀로 학습하되 샘플별로 exp(A/β)로 비중을 달리해 고유리득(advantage)이 큰 프레임을 더 자주 학습하는 방법이다. 이 논문에서는 샘플링 확률을 A에 비례해 편향시키고 보조 헤드에는 중요도 가중치를 적용해 편향을 보정했다. AWR은 기존의 확률 기울기 기반 방법과 달리 행동의 확률 질량을 보전하면서 좋은 행동에 집중하는 특성이 있다.
RECAP(advantage conditioning)(RECAP)
RECAP은 이득(advantage)을 입력으로 받아 모델 출력을 조건화함으로써 고득점 행동을 선택하도록 유도하는 기법이다. 본문에서는 advantage 토큰을 통해 action expert에 조건을 주고 inference에서 classifier-free guidance를 가능하게 했다. 이 방식은 행동 분포의 가능한 모달리티를 보존하면서 우수한 부분만 선택하는 특성이 있다.
Flow Matching(동작 생성)(Flow Matching)
Flow Matching은 노이즈에서 시작해 역확률 흐름을 따르는 복원 과정을 통해 연속 행동 덩어리(action chunk)를 생성하는 방법이다. 논문에서는 Gemma-300M 기반의 action expert가 30프레임 덩어리를 flow-matching으로 생성하고, 여러 샘플을 병렬로 디노이징해 후보를 비교했다. 이 방식은 연속 제어에서 자연스러운 궤적을 형성하는 데 유리하다.
Classifier-Free Guidance
Classifier-Free Guidance는 조건부와 무조건부 모델 출력을 결합해 조건 신호를 증폭시키는 기법이다. 본문에서는 advantage 토큰을 조건으로 두 번의 denoising를 수행하고 두 결과의 차이에 스케일을 곱해 최종 속도 필드를 조정했다. 이 기법은 조건에 따른 최선의 행동을 선택하고자 할 때 활용되었다.
Generalized Advantage Estimation(GAE)
GAE는 과거 보상에서 시간적 차분을 계산해 편향-분산 트레이드오프를 조절하는 우수(advantage) 추정 방식이다. 논문에서는 성공 확률 기반 값과 completion 기반 잠재(potential)를 합쳐 GAE로 어드밴티지를 계산하고, 오래된 롤아웃에서는 세그먼트 기반 기준으로 블렌딩했다. 이렇게 계산한 어드밴티지가 AWR 샘플링과 RECAP 조건화에 사용되었다.
DAgger(데이거)(DAgger)
DAgger는 인간 교정(teleop)을 통해 실패 상태에서 전문가 행동을 수집하고 그 데이터를 학습 파이프라인에 추가하는 인간-루프 데이터 수집 방식이다. 본문에서는 시뮬레이션과 실물 모두에서 실패 스냅샷을 보관해 비동기적으로 인간이 교정한 에피소드를 허브로 업로드했다. 실물 DAgger 데이터는 sim-to-real 전이에서 중요한 역할을 했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 25.수집 2026. 06. 30.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.