용어 해설
- 모방 학습(Imitation Learning)
- — 전문가가 수행한 행동 데이터를 모델이 그대로 따라 하도록 학습시키는 방식이다. 정답 궤적을 다음 토큰 예측으로 학습하여 초기 성능 확보에 유리하지만, 왜 그 행동이 좋은지나 실패 상황에서의 대처법을 배우기 어렵다는 단점이 있다.
- 그룹 상대 정책 최적화(GRPO)
- — 별도의 가치 모델 없이 그룹 내 응답들의 상대적 보상 차이를 이용해 정책을 업데이트하는 강화학습 알고리즘이다. 계산 효율성이 높고 검증 가능한 보상을 통해 모델의 추론 능력을 강화하는 데 효과적이다.
- 사고의 사슬(Chain-of-Thought)
- — 모델이 최종 답안을 내기 전에 중간 추론 단계를 거치도록 유도하는 기법이다. 복잡한 문제를 단계별로 나누어 해결하게 함으로써 논리적 정확도를 높이며, ACT에서는 모델이 행동의 품질을 판단하는 근거로 활용된다.
- 분포 외 일반화(Out-of-Distribution)
- — 학습 데이터에 포함되지 않은 새로운 환경이나 조건에서도 모델이 성능을 유지하는 능력을 의미한다. 에이전트가 훈련 시 보지 못한 낯선 방 구조나 도구 조합을 만났을 때 얼마나 잘 적응하는지를 평가하는 척도다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.