본문으로 건너뛰기

Qwen-Image-2.0-RL 기술 보고서

기존 감독학습 기반의 확산 모델은 denoising 목적만 최적화되어 인간의 미적 선호와 프롬프트 충실도를 직접 반영하지 못했다. 본 논문은 RLHF와 VLM 기반의 복합 보상 체계를 도입해 텍스트-이미지 정렬, 미적 품질, 인물 정합성 같은 인간 중심의 품질 지표를 직접 최적화했다. 또한 작업별 RL 정책을 통합하는 on-policy distillation을 통해 다중 작업 성능 유지와 배포용 단일 모델 확보 문제를 해결했다.

용어 해설

플로우 매칭(Flow Matching)
데이터 분포를 역ODE로 생성하는 방법으로, 시점별 연속 경로를 학습하여 노이즈에서 깨끗한 샘플로 역추적하는 생성 모델 프레임워크이며 본문에서는 확률적 ODE 근사와 정책 최적화에 연결되어 사용됐다.
분류기-프리 가이던스(Classifier-Free Guidance)
조건부·무조건부 모델 예측을 결합해 텍스트 조건을 강화하는 샘플링 기법으로, 본문에서는 rollout 단계에서만 적용해 샘플 품질은 확보하고 최적화 안정성은 유지하는 하이브리드 전략으로 활용됐다.
포인트와이즈 점수화(Pointwise Scoring)
각 이미지에 절대 점수(예: 1~5)를 레이블로 부여해 VLM을 회귀적으로 학습시키는 방법으로, 쌍비교(pairwise)보다 절대적 품질 척도를 제공하여 RL 보상 신호로 유리하게 사용됐다.
그룹 상대 이득(Group-Relative Advantage)
한 프롬프트에서 생성된 샘플 군의 보상 평균·표준편차로 정규화한 이득 신호로, 서로 다른 보상 스케일을 균일화하고 그룹 내부 비교를 통해 안정적인 정책 그레이디언트를 얻는 데 사용됐다.
비전-언어 모델(Vision-Language Model)
이미지와 텍스트를 함께 입력으로 처리해 시맨틱 점수 또는 서술을 출력하는 모델 계열로, 본문에서는 VLM을 미세조정해 정밀한 정렬·미적 평가 보상기를 구성했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 25.수집 2026. 06. 30.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.