본문으로 건너뛰기

InfoPO: 사용자 중심 에이전트를 위한 정보 기반 정책 최적화

사용자의 모호한 요청을 해결하기 위해 에이전트가 스스로 유용한 질문을 던지는 법을 배우게 하는 강화학습 방법론이다. 기존의 결과 중심 보상이 가진 한계를 극복하여 학습 효율을 높이고 더 똑똑한 대화형 AI를 만드는 데 기여한다.

용어 해설

기여도 할당(Credit Assignment)
강화학습에서 최종 결과(보상)가 발생했을 때, 그 결과에 기여한 과거의 특정 행동들을 찾아내어 적절한 보상을 나누어 주는 메커니즘이다. 다회차 대화에서는 어떤 질문이 유용했는지 판별하는 데 필수적이다.
반사실적 추론(Counterfactual Reasoning)
'만약 특정 사건이 일어나지 않았다면 결과가 어떻게 달라졌을까?'를 가정하여 인과 관계를 분석하는 기법이다. 본 논문에서는 정보가 주어지지 않았을 때의 행동 변화를 측정하여 정보의 가치를 계산한다.
상호 정보량(Mutual Information)
두 확률 변수 사이의 의존성을 측정하는 척도로, 한 변수를 알 때 다른 변수에 대해 얻을 수 있는 정보의 양을 의미한다. 에이전트가 얻은 피드백이 다음 행동을 얼마나 명확하게 만드는지 수치화하는 기반이 된다.
티처 포싱(Teacher Forcing)
RNN이나 Transformer 학습 시 모델의 이전 출력이 아닌 실제 정답(Ground Truth)을 다음 단계의 입력으로 사용하는 기법이다. 본 논문에서는 반사실적 비교 시 동일한 행동 시퀀스에 대해 확률값만 비교하기 위해 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 28.수집 2026. 03. 05.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.