용어 해설
- 검증 가능한 보상 기반 강화학습(RLVR)
- — 정답 여부를 자동으로 확인할 수 있는 검증기(verifier)의 결과를 보상으로 사용하는 강화학습 방식입니다. 수백~수천 개 토큰으로 구성된 추론 응답에 최종 보상 하나를 부여하므로 결과 신뢰성은 높지만 토큰별 학습 신호는 희소합니다.
- 그룹 상대 어드밴티지(Group-relative Advantage)
- — 같은 프롬프트에서 생성한 여러 응답의 보상을 그룹 평균과 표준편차에 따라 정규화한 값입니다. 각 응답이 그룹 안에서 상대적으로 얼마나 좋은지 나타내며, FlowBalance에서는 검증 신호의 방향을 결정합니다.
- 궤적 균형(Trajectory Balance)
- — 완전한 생성 궤적의 정책 확률과 목표 에너지 사이를 맞추는 학습 원리입니다. 토큰별 모방 손실 대신 전체 응답의 정규화된 확률분포를 학습해 장기 추론 과정의 상대적 선호를 보존합니다.
- 특권적 사후 정보(Privileged Hindsight)
- — 추론 시에는 사용할 수 없지만 학습 중에는 정답 풀이 또는 과제 피드백을 추가로 참조하는 관점입니다. 이미 생성된 토큰을 다시 채점해 조밀한 자기지도 신호를 만들지만, 실패 응답에도 높은 점수를 줄 수 있습니다.
- 역방향 KL 발산(Reverse-KL)
- — 새 분포가 기준 분포에서 얼마나 이동했는지 측정하는 거리입니다. FlowBalance의 목표분포는 원하는 복합 에너지 수준을 달성하는 분포 중 기준 정책과의 역방향 KL 이동이 가장 작은 분포로 해석됩니다.
- Simpson 다양성(Simpson Diversity)
- — 정답 응답을 핵심 풀이 전략별로 묶은 뒤, 서로 다른 전략을 사용하는 두 응답을 뽑을 확률을 계산하는 지표입니다. 전략 군집 비율을 p_k라 하면 로 계산하며 값이 클수록 성공 풀이가 여러 방식에 분산됩니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
