Reason–Act–Draw GRPO (RAD-GRPO)
Reason–Act–Draw GRPO (RAD‑GRPO)
RAD‑GRPO는 SFT로 초기화된 UMM 정책을 온라인 상호작용으로 추가 최적화하는 RL 알고리즘이다. 최종 생성 캡션의 의도(intent) 적합성과 디코딩된 이미지의 품질(quality)을 각각 보상으로 사용하고, 이 둘을 결합한 그룹 상대 이득(group-relative advantage)으로 이유·툴 사용·네이티브 생성 전체를 공동 최적화한다. 기본 결합 계수는 α=0.5이며 품질 보상은 faithfulness·visual correctness·text accuracy·aesthetics에 가중치 0.1/0.4/0.4/0.1을 부여한다.