용어 해설
- 그룹 상대 정책 최적화(GRPO)
- — 강화학습에서 별도의 가치 모델(Value Model) 없이 생성된 답변 그룹 내의 상대적 점수를 비교하여 정책을 업데이트하는 기법이다. 연산 비용을 크게 줄이면서도 모델이 정답에 가까운 행동을 하도록 유도하는 데 효과적이다.
- 패스 앳 원(Pass@1)
- — 모델이 생성한 첫 번째 코드가 테스트 케이스를 모두 통과할 확률을 의미한다. 코드 생성 모델의 성능을 평가하는 가장 핵심적인 지표 중 하나다.
- 엔트로피(Entropy)
- — 정보 이론에서 다음 토큰이 얼마나 예측 불가능한지를 나타내는 척도다. 엔트로피가 높다는 것은 모델이 다음에 올 내용을 확신하지 못한다는 뜻이며, 이 논문에서는 이 지점이 추론이 필요한 시점으로 간주된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.