용어 해설
- 기여도 할당(Credit Assignment)
- — 강화학습에서 최종 결과(보상)가 발생했을 때, 그 결과에 기여한 과거의 특정 행동들을 찾아내어 적절한 보상을 나누어 주는 메커니즘이다. 다회차 대화에서는 어떤 질문이 유용했는지 판별하는 데 필수적이다.
- 반사실적 추론(Counterfactual Reasoning)
- — '만약 특정 사건이 일어나지 않았다면 결과가 어떻게 달라졌을까?'를 가정하여 인과 관계를 분석하는 기법이다. 본 논문에서는 정보가 주어지지 않았을 때의 행동 변화를 측정하여 정보의 가치를 계산한다.
- 상호 정보량(Mutual Information)
- — 두 확률 변수 사이의 의존성을 측정하는 척도로, 한 변수를 알 때 다른 변수에 대해 얻을 수 있는 정보의 양을 의미한다. 에이전트가 얻은 피드백이 다음 행동을 얼마나 명확하게 만드는지 수치화하는 기반이 된다.
- 티처 포싱(Teacher Forcing)
- — RNN이나 Transformer 학습 시 모델의 이전 출력이 아닌 실제 정답(Ground Truth)을 다음 단계의 입력으로 사용하는 기법이다. 본 논문에서는 반사실적 비교 시 동일한 행동 시퀀스에 대해 확률값만 비교하기 위해 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.