TL;DR
완료된 온폴리시 궤적을 그대로 활용해 계층적 자연어 스킬을 추출하면 외부 스킬 저장소나 오프폴리시 검색 없이도 정책에 분포 일치형의 밀집 감독 신호를 제공할 수 있다. 이 방식은 장기 상호작용에서 보상이 희소해 발생하는 중간 결정에 대한 신용 배분 문제를 완화하여 성공률과 샘플 효율을 동시에 개선한다. 논문 실험은 ALFWorld WebShop Search-based QA에서 OPID가 결과 기반 RL과 기존 스킬 증류 기법보다 전반적으로 우수하거나 경쟁력 있음을 확인했다.
왜 중요한가
완료된 온폴리시 궤적을 그대로 활용해 계층적 자연어 스킬을 추출하면 외부 스킬 저장소나 오프폴리시 검색 없이도 정책에 분포 일치형의 밀집 감독 신호를 제공할 수 있다. 이 방식은 장기 상호작용에서 보상이 희소해 발생하는 중간 결정에 대한 신용 배분 문제를 완화하여 성공률과 샘플 효율을 동시에 개선한다. 논문 실험은 ALFWorld WebShop Search-based QA에서 OPID가 결과 기반 RL과 기존 스킬 증류 기법보다 전반적으로 우수하거나 경쟁력 있음을 확인했다.
핵심 기여
온폴리시 히든사이트 스킬 추출
완료된 온폴리시 롤아웃에서 에피소드 수준과 스텝 수준의 계층적 자연어 스킬을 직접 추출하는 절차를 개발했다. 이 절차는 각 궤적을 재구성한 뒤 LLM 기반 분석기로부터 전역 워크플로와 결정적 시점의 국소 지침을 도출한다. 외부 스킬 라이브러리나 오프폴리시 검색이 필요하지 않아 학습과 검증 간 맥락 불일치 문제를 줄인다.
크리티컬 우선 라우팅으로 스킬 적용
각 타임스텝이 분석기에 의해 결정적 시점인지 판별한 뒤 결정적 시점에는 스텝 수준 스킬을 우선 적용하고 그렇지 않으면 에피소드 수준 스킬을 사용하도록 라우팅 규칙을 설계했다. 이 규칙은 정밀한 지침과 넓은 워크플로 사이의 그레인 문제를 해소하며 단순 중첩보다 더 나은 성능을 보였다. 논문에서는 라우팅이 없을 때보다 ALFWorld 평균 성공률이 유의하게 하락하는 것을 보고했다.
토큰 수준 스킬 어드밴티지를 통한 정책 최적화 통합
스킬 주입 전후의 동일 응답 토큰에 대한 로그확률 차이를 토큰별 self-distillation advantage로 정의하고 이를 그룹 상대적 에피소드 어드밴티지와 합산해 PPO 스타일의 클립된 정책 손실로 최적화했다. 이 구성은 결과 기반 RL을 주된 목적함수로 유지하면서 토큰 수준의 밀집 신호를 추가하는 방식으로 작동한다. 토큰 마스크 m을 통해 유효 응답 토큰만 대상으로 삼아 안정성을 확보했다.
핵심 아이디어 이해하기
기존의 결과 기반 outcome-only RL은 에피소드 성공 여부 같은 희소한 보상만 제공하므로 긴 상호작용에서 중간 결정이 최종 성과에 미치는 영향이 식별되지 않아 신용 배분이 어렵다. 이 문제를 해결하기 위해 완료된 온폴리시 궤적 자체를 재활용해 궤적 전체를 요약한 에피소드 스킬과 특정 결정 시점의 국소 지침인 스텝 스킬을 추출한다. 이렇게 얻은 계층적 스킬을 각 타임스텝의 맥락에 주입하여 정책이 원래 맥락과 스킬 주입 맥락에서 동일 응답을 재평가하게 하고 로그확률 변화에서 토큰 단위의 밀집 신호를 얻는다.
방법론
첫 번째 구성 요소는 온폴리시 스킬 추출로서 완료된 궤적을 정렬된 기록으로 재구성한 뒤 LLM 기반 분석기가 해당 기록을 입력으로 받아 에피소드 수준 스킬과 결정적 시점들의 스텝 수준 스킬을 출력한다. 두 번째 구성 요소는 크리티컬 우선 라우팅으로서 분석기가 지정한 결정적 시점 집합 C에 대해 각 타임스텝에 사용할 스킬을 선택한다. 세 번째 구성 요소는 스킬 주입과 토큰별 self-distillation advantage 산출로서 스킬을 주입한 히스토리와 원래 히스토리에서 동일 응답 토큰의 로그확률 차이를 계산해 A^{skill}을 얻고 이를 그룹 상대적 에피소드 어드밴티지 A^{ep}와 결합해 클립된 정책 손실로 최적화한다.
관련 Figure

다이어그램은 세 단계 처리 흐름을 시각적으로 정리해 스킬 추출 라우팅 및 토큰 수준 self-distillation의 연결 관계를 보여준다. 오른쪽 상단에는 Episode Advantage 계산 방법과 브로드캐스트 규칙이 표시되어 정책 손실 구성과 어떻게 결합되는지 확인할 수 있다. 이 다이어그램은 방법론의 전체 구조를 한눈에 이해하게 하며 메서드의 구성 요소별 역할을 명확히 한다.
OPID 파이프라인을 단계별로 나타낸 다이어그램으로 에이전트 롤아웃 분석 스킬 라우팅 토큰 레벨 우위 계산이 도식화되어 있다.
주요 결과
주요 벤치마크 ALFWorld WebShop Search-based QA에서 OPID는 다수의 모델 규모와 설정에서 GRPO보다 높은 성공률 또는 정확도를 기록했다. 예를 들어 Qwen2.5-3B 기준 ALFWorld에서 +9.3포인트 WebShop에서 +10.9포인트 Search-based QA에서 +8.6포인트의 절대 개선을 보고했다. 또한 Qwen3-1.7B와 같은 작은 백본에서 ALFWorld에서 +12.8포인트 WebShop에서 +26.5포인트의 큰 이득을 기록해 소규모 모델에서의 효용을 보였다.
관련 Figure

이 그림은 OPID가 ALFWorld와 WebShop에서 주된 비교군보다 평균 성능이 높음을 수치로 보여준다. 표에는 Vanilla GRPO Skill-GRPO SDAR 등 다양한 방법과 함께 OPID의 절대 성공률 수치가 표기되어 있어 표준 벤치마크 비교 근거로 사용된다. 그림은 논문의 주된 성능 주장을 뒷받침하는 근거로서 Table 1의 수치와 일치한다.
ALFWorld Search-based QA WebShop에서 여러 기법의 성공률과 점수를 비교한 막대그래프이다.

그래프는 학습 초기에 양 기법이 개선되나 중간 단계 이후 OPID가 GRPO보다 안정적으로 더 높은 성공률을 유지함을 보여준다. 반투명 곡선은 원시 측정값을 실선은 스무딩된 추세를 나타내어 변동성을 함께 확인할 수 있게 한다. 이 결과는 논문의 주장처럼 스킬 기반의 밀집 신호가 정책 정제 속도를 가속함을 실험적으로 뒷받침한다.
학습 스텝에 따른 성공률 변화를 비교한 선그래프로 OPID와 GRPO의 학습 동태를 보여준다.

이 그래프는 OPID가 성공률 상승과 동시에 에피소드 길이를 15-16 스텝 수준으로 줄였음을 보여준다. 에피소드 길이의 감소는 탐색 경로의 간결화와 불필요한 반복 행동 감소를 의미하며 에피소드 및 스텝 스킬의 역할과 일치한다. 해당 데이터는 방법이 행동 효율성 측면에서도 개선을 유도함을 지지한다.
학습 스텝에 따른 평균 에피소드 길이 변화를 비교한 선그래프로 OPID가 GRPO보다 더 짧은 에피소드 길이를 달성함을 보인다.

그래프는 20 40 60 80 100퍼센트의 훈련 데이터 분량에서 OPID가 일관되게 GRPO를 앞서는 절대 이득을 기록함을 수치로 보여준다. 특히 약 60퍼센트 데이터로 OPID가 전체 데이터로 GRPO의 성능에 근접하거나 초과함이 시각적으로 강조되어 샘플 효율 개선 주장을 뒷받침한다. 이 그림은 논문의 샘플 효율 분석과 직접적으로 연결된다.
학습 데이터 분량 대비 성공률을 나타낸 그래프로 OPID가 데이터 부족 상황에서 GRPO보다 높은 샘플 효율을 보임을 표현하고 있다.

이 막대그래프는 작업별 성능 차이를 상세히 보여주며 Look Heat 같은 특정 작업에서 OPID의 상대적 이득이 크다는 점을 드러낸다. 평균 성능 열이 포함되어 있어 개별 작업과 전체 성능 간의 관계를 동시에 평가할 수 있다. 이 결과는 교차 도메인 일반화와 작업별 강점의 근거로 활용된다.
ALFWorld의 여러 세부 작업별로 GRPO와 OPID의 성공률을 비교한 막대그래프이다.

사례는 GRPO가 존재하지 않는 대상을 참조하거나 잘못된 객체를 대체하며 최종 배치에 실패한 반면 OPID는 locate clean place 워크플로를 따르며 더 적은 스텝으로 작업을 완료했음을 보여준다. 이 질적 비교는 계층적 스킬이 현장성 있는 행동 규범과 국소적 결정을 향상시킨다는 정성적 근거로 작용한다. 그림은 정량적 결과를 보완하는 사례 근거로서 논문 본문에서 제시된 분석과 일치한다.
ALFWorld의 동일 과제를 GRPO와 OPID로 수행한 에피소드 궤적을 비교한 질적 사례이다.
기술 상세
전체 파이프라인은 세 단계로 동작한다 스킬 추출 라우팅 스킬 기반 자기증류이며 각 단계는 궤적 단위의 전처리와 LLM 기반 분석기 호출을 포함한다. 스킬 주입 함수 H는 라우팅에 의해 선택된 자연어 스킬을 히스토리에 선행 또는 후행 텍스트로 추가해 원래 상태 정보를 보존하면서 정책이 동일 응답을 재점수하도록 만든다. 로그확률 기호는 기존 표기법을 사용하며 토큰 ℓ에 대한 old 로그확률 ℓ^{old}와 skill 로그확률 ℓ^{skill}의 차이를 m mask로 가중해 A^{skill}을 계산한다.
실무 활용
OPID는 온폴리시로 수집한 롤아웃을 추가적인 비용 없이 더 많은 감독 신호로 바꾸므로 제한된 샘플 예산 상황에서 RL 에이전트의 데이터 효율을 높인다. 학습 과정에서만 분석기 호출과 스킬 추출이 필요하며 추론 시에는 스킬이 전혀 불필요해 실제 배포 환경에 바로 적용 가능하다. 구현 코드는 공개 저장소에 있어 실무 적용을 위한 재현이 가능하다.
- 장기 상호작용을 요구하는 가정용 시뮬레이터나 텍스트 기반 에뮬레이터에서 샘플 효율을 높여 빠르게 정책을 개선하는 용도로 활용할 수 있다
- 웹 탐색 기반 상품 검색과 구매 같은 멀티스텝 작업에서 단계별 오류를 줄이고 최종 성공률을 개선하는 데 사용될 수 있다
- 검색을 통해 답을 구성하는 Search-based QA처럼 중간 의사결정이 최종 성능에 크게 영향을 미치는 작업에서 토큰 수준의 밀집 신호로 신용 배분을 개선하는 데 유용하다
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- On-policy Distillation
- — 완료된 온폴리시 롤아웃에서 모델 자체의 생성물을 다시 이용해 토큰 단위의 감독 신호를 얻는 기법으로서 동일한 정책이 원래 맥락과 스킬이 주입된 맥락에서 동일한 응답을 재평가하여 로그확률 변화로 밀도화된 지표를 만든다. 이 접근은 외부 교사 없이 정책 내부의 분포와 일치하는 심층적 자기지도 신호를 제공하므로 장기 상호작용에서 희소한 결과 보상을 보완한다. 논문에서는 이 신호를 그룹 상대적 outcome advantage와 결합하여 정책 최적화에 활용한다.
- Skill Distillation
- — 자연어로 표현된 절차적 지식이나 실패 회피 규칙 같은 스킬을 교사적 맥락으로 사용해 정책이 특정 행동 선호를 학습하도록 만드는 방법이다. 외부 스킬 라이브러리를 사용하는 기존 방식과 달리 본 논문은 완료된 온폴리시 궤적에서 직접 에피소드 및 스텝 수준 스킬을 추출해 학습에 투입한다. 스킬 증류는 토큰 수준의 우선순위 변화를 만들어 정책의 세부 행동을 형성하는 역할을 한다.
- Critical-First Routing
- — 각 타임스텝에서 먼저 결정적 시점인지 판별한 뒤 결정적 시점이면 스텝 수준 스킬을, 그렇지 않으면 에피소드 수준 스킬을 적용하는 라우팅 규칙이다. 이 방식은 정밀하지만 드문 스텝 수준 지식을 우선 사용하고, 대부분의 일반적 상태에서는 더 넓은 워크플로 기반 에피소드 스킬을 기본으로 사용하게 한다. 논문 결과는 이 선택적 라우팅이 단순 중첩보다 유의미한 성능 향상을 가져온다고 보고한다.
- Token-level Advantage
- — 스킬이 주입된 맥락과 원래 맥락에서 동일한 응답 토큰에 대한 로그확률 차이를 토큰별 이득으로 취급한 값이다. 이 값은 m mask로 유효 토큰에만 적용되고 양수이면 스킬과 일치하는 토큰임을 나타내며 정책 최적화에서 그룹 상대적 에피소드 어드밴티지와 합산되어 사용된다. 토큰 수준의 밀집 신호가 희소한 에피소드 보상을 보완한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.