본문으로 건너뛰기

Multi-Task Reinforcement Learning

멀티태스크 Reinforcement Learning

여러 과제에서 얻은 과제별 보상을 하나의 정책 최적화 신호로 사용해 모델을 학습하는 방식입니다. VBVR-Pro는 50개 In-Domain 과제의 50K 샘플에서 생성 결과를 검증 가능한 스코어러로 채점하고, 그 점수를 이용해 시각적 의사결정을 갱신했습니다. 과제별 규칙이 명확하기 때문에 VLM judge보다 방향성이 분명한 보상을 제공합니다.