본문으로 건너뛰기
HF Daily Papers조회 1

LLM-에이전트 시대에서 DAgger 재조명

롱-호라이즌 의사결정에서 초기 오착이 전체 상태 분포를 왜곡해 성능 저하를 유발한다. SFT는 전문가 상태에서의 학습으로 충분한 피드백을 주지만 배포 시 상태 분포가 달라지는 covariate shift를 초래하고, RLVR은 희소한 보상으로 학습한다. 본 연구는 DAgger의 원칙을 멀티턴 LM 에이전트에 적용해 교사 라벨을 유지하면서 학생의 방문 상태를 점차 반영하도록 학습 데이터를 확장, 배포 시 배치와의 불일치를 줄이고 밀집한 피드백을 제공한다.

용어 해설

공변량-시프트(Covariate Shift)
모델이 배치의 분포와 배치간의 차이로 인해 테스트 시 성능이 저하되는 현상. 이 논문은 멀티턴 상호작용에서 초기 오실레이션으로 인해 상태 분포가 deployment 시점의 분포와 달라지는 문제를 다룬다.
DAgger
데이터를 수집하는 정책과 예측 정책 사이의 차이를 줄이기 위해, 학생이 방문한 상태에서 교사의 라벨을 점진적으로 수집하는 imitation-learning 알고리즘.
AggreVaTe
초기 프리픽스 후 교사-완성을 통해traj를 구성하는 imitation-learning 기법으로, 교사가 잔여 시퀀스를 완성하도록 하는 롤아웃 전략.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 13.수집 2026. 05. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.