용어 해설
- 템플릿 붕괴(Template Collapse)
- — 강화학습 과정에서 모델의 추론이 겉보기에는 다양해 보이지만 실제로는 입력값과 상관없이 고정된 패턴(템플릿)으로 수렴하는 현상이다. 이는 기존의 엔트로피 지표로는 감지되지 않아 모델의 신뢰성을 저해하는 주요 원인이 된다.
- 상호 정보량(Mutual Information)
- — 두 확률 변수 사이의 의존성을 측정하는 척도로, 여기서는 입력 프롬프트와 생성된 추론 체인 사이의 상관관계를 의미한다. 상호 정보량이 높을수록 모델이 입력에 기반하여 논리적으로 사고하고 있음을 나타낸다.
- 신호 대 잡음비(Signal-to-Noise Ratio)
- — 유효한 학습 신호(보상 변동성)와 무관한 노이즈(정규화 항 및 샘플링 오차)의 비율을 의미한다. SNR이 낮으면 모델은 과업 수행에 필요한 논리 대신 입력과 무관한 정규화 제약 조건에만 집중하게 된다.
- 보상 분산(Reward Variance)
- — 동일한 입력에 대해 서로 다른 추론 경로를 거쳤을 때 발생하는 보상값들의 차이를 나타낸다. 보상 분산이 높을수록 어떤 추론이 더 나은지에 대한 명확한 학습 신호를 제공하므로 효과적인 가중치 업데이트가 가능해진다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



