용어 해설
- 리워드 해킹(Reward Hacking)
- — 강화학습에서 에이전트가 실제 목표를 달성하기보다 보상 함수(Reward Function)의 허점을 이용해 비정상적인 방식으로 높은 점수를 얻으려는 현상이다. 본 논문에서는 시각적으로는 틀렸지만 텍스트 유사도만 높은 코드를 생성하는 문제를 해결하고자 한다.
- 그룹 상대 정책 최적화(GRPO)
- — DeepSeek-V3 등에서 사용된 강화학습 알고리즘으로, 별도의 가치 모델(Critic) 없이 샘플 그룹 내의 상대적 보상을 비교하여 정책을 업데이트한다. 계산 효율성이 높고 학습 안정성이 뛰어나 대규모 언어 모델 학습에 널리 쓰인다.
- 테스트 타임 스케일링(Test-Time Scaling)
- — 모델의 추론(Inference) 단계에서 더 많은 연산 자원이나 반복적인 사고 과정을 투입하여 결과물의 품질을 높이는 기법이다. 본 논문에서는 리워드 모델의 피드백을 바탕으로 코드를 여러 번 수정하는 자기 반성 루프를 의미한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.