왜 중요한가
로봇 학습은 다단계의 긴 실행에서 최종 성공 신호만으로는 중간 행동의 진전 여부를 알기 어려워 샘플 효율과 신용 할당 문제가 심각하다. 진행 보상은 실행 중에 밀도 높은 피드백을 제공하여 정책 학습, 궤적 재평가, 데이터 필터링, 실패 조기 감지 등에 직접적으로 기여한다. 본 서베이는 이러한 진행 보상 연구를 입력·구성·평가의 세 관점으로 통합하여 서로 다른 방법들이 실제로 어떤 속성을 검증하는지 분명하게 만들었다.
관련 Figure

이 도식은 초기에는 목표 근접성과 시연 기반 방법이 주를 이루었고 이후에는 VLM 기반 점수, 선호학습, 지침 조정, 프로그래밍적 보상 생성이 점차 출현했음을 시각화한다. 시간 축에 따른 논문 분포는 연구 주제가 단일 접근에서 다양한 입력·지도·출력 방식으로 확장되었음을 보여준다.
연구 연표 형태의 도식으로 2017년부터 2026년까지 진행 보상 관련 주요 논문과 시스템의 시간적 확장을 보여준다.
핵심 기여
인터페이스 기반의 진행 모델 정형화
진행 모델을 외부 인터페이스 관점에서 입력 형식, 목표 명세, 출력 형태로 정형화하였다. 이 정형화는 단일 관찰·시간적 문맥·비교 기반·상태 접근이라는 네 가지 입력 범주를 도입하여 각 범주의 증거 강도와 온라인 사용성 사이의 트레이드오프를 연결한다. 따라서 아키텍처가 달라도 동일한 입출력 틀에서 방법들을 비교할 수 있게 되었다.
진행 보상 구성의 네 가지 패러다임 분류
연구들을 사전학습 모델 점수 추출, 시간·상대 감독 학습, 지침 조정 기반 진행 예측, 프로그래밍적 보상 구성의 네 범주로 체계화하였다. 각 범주는 진행 신호의 생성 원천과 그것을 보상으로 변환하는 메커니즘을 달리하여 적용 조건과 한계를 명확히 구분한다. 이 분류는 zero-shot VLM 점수, 쌍별 선호 학습, instruction-tuned VLM, 코드 생성 기반 보상 합성이라는 실제 기법들을 대응시키며 비교 기준을 제공한다.
데이터 파이프라인과 평가 프로토콜의 연결성 규명
진행 감독을 인간 주도의 라벨링, 인간-인-루프 보정, 완전 자동화된 규칙·모델로 구분하여 스케일과 의미적 근거 사이의 상충 관계를 밝혀냈다. 또한 벤치마크를 진행 충실도·강건성·하위 정책 유용성의 세 범주로 분류하여 각각이 검증하는 특성이 다르다는 사실을 명확히 하였다. 이 분석은 특정 평가 결과가 어떤 속성의 증거인지를 해석하는 데 필요한 기준을 제공한다.
핵심 아이디어 이해하기
로봇 과제는 연속적이고 히스토리에 의존하는 상태 전개를 포함하므로 단일 종단 성공 신호는 중간 행동의 가치나 진행을 알려주지 못한다. 동일한 현재 관찰이 이전에 무엇이 일어났는지에 따라 서로 다른 진행 위치를 가리킬 수 있어 진행은 관찰 자체의 직접적 속성이 아니라 잠재적 역사-조건화 상태로 이해되어야 한다. 따라서 진행 모델은 현재 관찰, 과거 문맥, 그리고 목표 조건의 조합을 통해 현재 상태가 전체 실행에서 어디에 위치하는지를 추정해야 한다.
방법론
논문은 진행 보상 구성 방식들을 진전 신호의 출처와 보상 계산 메커니즘 관점에서 네 패러다임으로 정리하였다. 첫 번째 패러다임은 사전학습된 VLM/CLIP 등의 점수에서 직접 유사성이나 토큰 확률을 추출하여 보상으로 사용하는 방식으로, 라벨 없이 바로 사용할 수 있으나 출력은 보정·정규화·차등화가 필요하다. 두 번째 패러다임은 시간적 순서나 쌍별 비교 같은 상대적 감독을 이용해 보상을 학습하는 방식으로, 시연 내후(state sequence) 정보를 목표 근접성 또는 선호 순위로 전환해 스칼라 보상을 얻는 과정이 포함된다. 세 번째 패러다임은 지침-튜닝된 VLM이나 비디오-언어 모델을 명시적 진행 예측기로 미세조정하는 방식으로, 모델이 명령형 타깃(절대 진행도·상대 개선·성공 여부 등)을 따르도록 학습시켜 보다 일관된 진행 점수를 얻는다. 네 번째 패러다임은 자연어 설명이나 시각적 기술을 코드·술어·특징 함수로 변환하여 실행 가능한 보상 함수로 합성하는 방식으로, 해석 가능성과 정밀도를 제공하되 환경의 상태 변수 접근성에 크게 의존한다.
관련 Figure

이 그림은 각 패러다임이 어떤 입력 증거를 사용하고 출력 신호를 생성하는지를 배치로 구분하여 보여주며, 특히 출력이 스칼라 점수·델타·순위·보상 함수로 어떻게 매핑되는지를 직관적으로 연결한다. 해당 다이어그램은 이후 방법론 분류와 데이터·평가 연결 논의를 읽을 때 참조되는 핵심 정리 역할을 한다.
네 가지 보상 구성 패러다임(사전학습 모델 점수, 시간·상대 감독, 지침-튜닝, 프로그래밍적 구성)을 요약한 다이어그램이다.
주요 결과
문헌 조사 결과 진행 보상 연구는 문제 정의·입력·출력·평가의 차이로 인해 현저히 조각화되어 있어 직접 비교가 어렵다. 평가 프로토콜이 시간적 순서 일관성, 절대적 점수 보정, 선호 정확도, 또는 정책 학습 성과와 같이 서로 다른 특성을 검증하므로 동일한 성능 지표를 서로 다른 의미로 해석할 위험이 확인되었다. 또한 데이터 구성 방식에서 인간 개입 정도는 의미적 근거와 확장성 사이의 명확한 트레이드오프를 만들며, 자동화된 라벨은 규모를 제공하지만 편향과 오류를 공유할 수 있다.
기술 상세
전체 아키텍처 관점에서 진행 모델은 입력 인터페이스(단일 프레임, 최근 윈도우, 전체 궤적, 비교 쌍, 또는 환경 상태 API), 목표 명세(언어·비전·데모·구조화 목표), 그리고 출력 형태(상태 스칼라·델타·순위·실행 가능한 보상 함수)를 조합하여 정의된다. 입력-출력 쌍마다 요구되는 데이터와 계산량이 달라 온라인 적용성, 시간적 증거의 강도, 그리고 보상 보정 필요성이 다르게 나타난다. 핵심 메커니즘은 사전학습된 표현의 유사성 점수 활용, 시간적 순서로부터 거리 또는 순서 학습, 쌍별 선호로부터 스칼라 재구성, 그리고 자연어→코드 변환을 통한 보상 함수 합성으로 요약된다. 학습·구현 세부에서는 사람 주도 라벨링, 사람-검증 기반 보정, 완전 자동화된 규칙·모델 기반 레이블링과 데이터 증강(시연 절단·뒤집기·노이즈 추가 등)이 병용되어 각 방법의 확장성과 의미적 일관성 사이의 균형을 맞춘다.
한계점
논문은 현재 방법들이 미세한 진행 변화를 민감하게 포착하지 못하는 경향이 있음을 지적한다. 시간 정규화나 순서를 감독으로 사용할 경우 진전이 일정 속도로 증가한다는 가정이 생기며 실제로는 급격한 도약이나 긴 정체 구간이 발생한다는 문제가 있다. 실시간 적용 관점에서는 대형 VLM 기반 접근의 추론 지연이 빈번한 제어 단계에서의 활용을 어렵게 한다고 지적한다. 또한 장기 실행을 정확히 위치시키기 위한 압축된 과거 기억을 보유하지 못하면 반복적·역행적 행동을 구분하지 못하는 한계가 존재한다.
실무 활용
저자들이 공개한 리소스와 분류는 연구자와 엔지니어가 진행 보상 방법을 목적에 맞춰 선택하고 평가 설계를 설계하는 데 실용적 기준을 제공한다. 특히 프로그래밍적 보상 합성이나 지침-튜닝된 VLM은 시뮬레이션 기반 개발 파이프라인에서 빠르게 프로토타이핑할 수 있는 실무 가치를 지닌다. 공개된 GitHub 리포지토리는 논문에서 다룬 방법과 데이터 파이프라인 예시를 확인할 수 있게 한다.
- 희소 보상 문제를 가진 장기 과제에서 진행 점수를 정책 보상으로 사용하여 샘플 효율을 개선하는 용도.
- 수집된 시연 데이터에서 실패·부분성·재시도 사례를 자동으로 필터링하거나 재순위하는 데이터 정제 용도.
- 시뮬레이터에서 목표가 명시적으로 주어질 때 Text2Reward 계열로 보상 함수를 자동 생성하여 빠른 실험 반복을 지원하는 용도.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 진행 보상(Progress Reward)
- — 로봇 과제 실행 중에 현재 상태가 목표 달성에 얼마나 가까운지를 나타내는 연속적 또는 순위 기반 신호로서, 최종 성공 신호보다 밀도 높은 피드백을 제공하여 신용 할당과 행동 선택을 개선한다.
- 비전-언어 모델(Vision-Language Model)
- — 이미지나 비디오와 자연어를 함께 입력으로 처리하여 시각적 장면과 언어 목표 간의 유사성이나 관련성을 계산하는 모델로서, 진행 점수 산출이나 목표 조건화에 직접 활용된다.
- 프로그래밍적 보상 구성(Programmatic Reward Construction)
- — 자연어 또는 시각적 설명을 코드·술어·기능으로 변환하여 실행 가능한 보상 함수로 생성하는 방식으로, 상태 변수 접근성이 좋을 때 명확하고 해석 가능한 보상을 얻을 수 있다.
- 시간적 감독(Temporal Supervision)
- — 성공 시연에서 시간 순서를 진전의 대리 신호로 사용하는 감독 방식으로, 후기 프레임을 더 목표에 가깝다고 간주하여 자동으로 진행 레이블을 생성할 수 있지만 시간과 진전이 항상 일치하지 않는 한계가 있다.
- 선호 학습(Preference Learning)
- — 두 상태·클립·궤적을 비교하여 어느 쪽이 더 진행했는지를 라벨로 수집한 후 비교 정보로부터 스칼라 보상을 학습하는 방법으로, 절대값 레이블보다 수집 비용이 낮지만 점수로 변환하는 추가 단계가 필요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

