DG-WGPO
Dual-Granularity WER-Gated Policy Optimization의 약자로, 토큰-수준의 미세 보정과 문장-수준의 재구성을 동적으로 융합하는 보상 체계의 RL 기반 정책 최적화 방법이다.