본문으로 건너뛰기

FlowBalance: 검증기로 조율한 추론 자기개선

검증기 보상과 사후 자기지도를 결합해 정답 추론 분포를 학습하는 FlowBalance

용어 해설

검증 가능한 보상 기반 강화학습(RLVR)
정답 여부를 자동으로 확인할 수 있는 검증기(verifier)의 결과를 보상으로 사용하는 강화학습 방식입니다. 수백~수천 개 토큰으로 구성된 추론 응답에 최종 보상 하나를 부여하므로 결과 신뢰성은 높지만 토큰별 학습 신호는 희소합니다.
그룹 상대 어드밴티지(Group-relative Advantage)
같은 프롬프트에서 생성한 여러 응답의 보상을 그룹 평균과 표준편차에 따라 정규화한 값입니다. 각 응답이 그룹 안에서 상대적으로 얼마나 좋은지 나타내며, FlowBalance에서는 검증 신호의 방향을 결정합니다.
궤적 균형(Trajectory Balance)
완전한 생성 궤적의 정책 확률과 목표 에너지 사이를 맞추는 학습 원리입니다. 토큰별 모방 손실 대신 전체 응답의 정규화된 확률분포를 학습해 장기 추론 과정의 상대적 선호를 보존합니다.
특권적 사후 정보(Privileged Hindsight)
추론 시에는 사용할 수 없지만 학습 중에는 정답 풀이 또는 과제 피드백을 추가로 참조하는 관점입니다. 이미 생성된 토큰을 다시 채점해 조밀한 자기지도 신호를 만들지만, 실패 응답에도 높은 점수를 줄 수 있습니다.
역방향 KL 발산(Reverse-KL)
새 분포가 기준 분포에서 얼마나 이동했는지 측정하는 거리입니다. FlowBalance의 목표분포는 원하는 복합 에너지 수준을 달성하는 분포 중 기준 정책과의 역방향 KL 이동이 가장 작은 분포로 해석됩니다.
Simpson 다양성(Simpson Diversity)
정답 응답을 핵심 풀이 전략별로 묶은 뒤, 서로 다른 전략을 사용하는 두 응답을 뽑을 확률을 계산하는 지표입니다. 전략 군집 비율을 p_k라 하면 1kpk21-\sum_k p_k^2로 계산하며 값이 클수록 성공 풀이가 여러 방식에 분산됩니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.