본문으로 건너뛰기

RAGEN-2: 에이전트 강화학습에서의 추론 붕괴 현상 분석

멀티턴 AI 에이전트를 강화학습으로 훈련할 때, 모델이 입력에 상관없이 고정된 답변 패턴만 반복하는 '템플릿 붕괴' 현상을 발견하고 이를 해결할 수 있는 새로운 진단 지표와 학습 기법을 제시한다. 보상 분산을 활용해 유의미한 학습 신호가 있는 데이터만 선별함으로써 추론의 질과 작업 성공률을 동시에 높일 수 있다.

용어 해설

템플릿 붕괴(Template Collapse)
강화학습 과정에서 모델의 추론이 겉보기에는 다양해 보이지만 실제로는 입력값과 상관없이 고정된 패턴(템플릿)으로 수렴하는 현상이다. 이는 기존의 엔트로피 지표로는 감지되지 않아 모델의 신뢰성을 저해하는 주요 원인이 된다.
상호 정보량(Mutual Information)
두 확률 변수 사이의 의존성을 측정하는 척도로, 여기서는 입력 프롬프트와 생성된 추론 체인 사이의 상관관계를 의미한다. 상호 정보량이 높을수록 모델이 입력에 기반하여 논리적으로 사고하고 있음을 나타낸다.
신호 대 잡음비(Signal-to-Noise Ratio)
유효한 학습 신호(보상 변동성)와 무관한 노이즈(정규화 항 및 샘플링 오차)의 비율을 의미한다. SNR이 낮으면 모델은 과업 수행에 필요한 논리 대신 입력과 무관한 정규화 제약 조건에만 집중하게 된다.
보상 분산(Reward Variance)
동일한 입력에 대해 서로 다른 추론 경로를 거쳤을 때 발생하는 보상값들의 차이를 나타낸다. 보상 분산이 높을수록 어떤 추론이 더 나은지에 대한 명확한 학습 신호를 제공하므로 효과적인 가중치 업데이트가 가능해진다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 07.수집 2026. 04. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.