본문으로 건너뛰기

에이전트형 강화학습을 위한 단일 롤아웃 비동기 최적화

SAO는 그룹 기반 샘플링을 단일 롤아웃으로 대체하고 토큰 수준의 이중측 클리핑과 DIS를 도입해 비동기 LLM 강화학습의 불안정성과 오프폴리시 영향을 줄여 GRPO 계열보다 안정적이고 높은 성능을 달성했다.

용어 해설

단일 롤아웃 샘플링(Single-Rollout)
각 프롬프트마다 하나의 롤아웃을 즉시 학습에 반영하는 샘플링 방식으로, 그룹 단위로 여러 샘플을 모아 평균화하는 대신 생성 완료 즉시 업데이트를 수행하여 비동기 환경에서 GPU 활용도를 높이고 지연으로 인한 동기화 병목을 회피한다.
그룹 단위 샘플링(Group-wise Sampling)
하나의 프롬프트에 대해 여러 응답을 생성하여 그룹 수준에서 이득을 추정하거나 정규화하는 방식으로, 동기적 업데이트에서는 분산 감소 효과가 있으나 비동기 환경에서는 느린 롤아웃 때문에 오프폴리시 편향과 정책 지연을 유발할 수 있다.
토큰 수준 중요도 샘플링(Token-level Importance Sampling)
롤아웃 시 기록된 토큰별 로그확률을 행동 분포의 대리로 사용해 현재 정책과의 확률비(r_t)를 계산하고, 이 값을 기준으로 토큰별로 그래디언트 신뢰 구간을 제한하거나 마스킹해 오프폴리시 업데이트 영향을 국소적으로 제어하는 기법이다.
관찰 건너뛰기 GAE(Skip-Observation GAE)
에이전트와 환경 피드백이 교차하는 토큰열에서 환경이 생성한 관찰 토큰을 가치 추정에서 건너뛰고 액션 토큰 간의 시차를 연결하여 잡음 전파를 줄이는 GAE 변형으로, 에이전트 행동의 가치 추정이 외생적 관찰 토큰에 의해 오염되는 것을 방지한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 08.수집 2026. 07. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.