용어 해설
- 통합 마르코프 결정 과정(Unified MDP)
- — 텍스트와 이미지 생성을 하나의 상태·행동 공간으로 통합하여 전체 추론 궤적을 단일 보상 신호 아래 최적화하는 수학적 프레임워크이다. 본문 맥락에서는 각 텍스트 청크와 이미지 생성 단계를 매크로-액션으로 취급하고, 이들을 미시적 토큰/디노이징 단계로 펼쳐서 궤적 수준 advantage를 공동 계산한다. 이렇게 하면 서로 다른 생성 메커니즘에 대해 일관된 보상 전파가 가능해진다.
- 흐름 매칭(Flow Matching)(Flow Matching)
- — 연속 시간 축에서 노이즈 샘플을 깨끗한 이미지로 옮기는 속도장(velocity field)을 예측하도록 학습하는 방법이다. 논문에서는 이미지 분기에서 이 방식의 미세한 denoising 경로를 마이크로 액션으로 보고 정책으로 최적화한다. 확산 기반 생성기를 RL과 결합할 때 likelihood 추정을 회피하면서 보상을 주입하는 기반 수단으로 사용된다.
- 그룹 기반 정책 최적화(Grupo)(GRPO)
- — 프롬프트별로 다수의 롤아웃을 샘플링하고 그룹 정규화된 advantage를 계산한 뒤 클리핑된 서러게이트 목적과 KL 페널티로 정책을 갱신하는 방법이다. 텍스트 분기에 적용되어 토큰 단위로 importance ratio를 활용한 안정적 업데이트를 가능하게 한다. 본문에서는 텍스트 브랜치 최적화에 GRPO 스타일을 채택해 통합 목표와 결합했다.
- 비전 사고 프로세스 보상(Vision-Thinking Reward)
- — 중간에 생성된 각 이미지를 시각적 정확성, 충실도, 추론 유용성, 신뢰성 기준으로 평가하여 이미지 턴에 촘촘한 보상을 부여하는 설계이다. 이 보상은 VLM 판정기로 산출된 다중 구성 요소 값을 그룹 내 정규화한 뒤 궤적 advantage에 합쳐 이미지 생성의 신호 대 잡음을 개선한다. 지연된 최종 보상만으로는 식별하기 어려운 시각적 분기 기여도를 세분화한다는 점이 핵심이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






