TL;DR
기존 감독학습 기반의 확산 모델은 denoising 목적만 최적화되어 인간의 미적 선호와 프롬프트 충실도를 직접 반영하지 못했다. 본 논문은 RLHF와 VLM 기반의 복합 보상 체계를 도입해 텍스트-이미지 정렬, 미적 품질, 인물 정합성 같은 인간 중심의 품질 지표를 직접 최적화했다. 또한 작업별 RL 정책을 통합하는 on-policy distillation을 통해 다중 작업 성능 유지와 배포용 단일 모델 확보 문제를 해결했다.
왜 중요한가
기존 감독학습 기반의 확산 모델은 denoising 목적만 최적화되어 인간의 미적 선호와 프롬프트 충실도를 직접 반영하지 못했다. 본 논문은 RLHF와 VLM 기반의 복합 보상 체계를 도입해 텍스트-이미지 정렬, 미적 품질, 인물 정합성 같은 인간 중심의 품질 지표를 직접 최적화했다. 또한 작업별 RL 정책을 통합하는 on-policy distillation을 통해 다중 작업 성능 유지와 배포용 단일 모델 확보 문제를 해결했다.
핵심 기여
VLM 기반의 작업별 복합 보상기 구축
Qwen 계열 VLM을 pointwise scoring과 chain-of-thought 입력으로 미세조정해 T2I용 정렬·미학·초상 보상과 편집용 명령 수행·얼굴 정체성 보상으로 구성된 복합 보상 체계를 구성했다. 각 보상기는 서로 다른 평가 우선순위를 반영해 층화된 보상 설계(예: 먼저 프롬프트 정합성, 그다음 미학)를 적용했다. 포인트와이즈 레이블링이 쌍비교 방식보다 절대적 품질 신호를 제공해 RL 최종 결과에 더 우수한 시각 품질을 유도했다.
확장 가능한 GRPO 기반 RL 학습 파이프라인과 하이브리드 CFG
Flow-GRPO 계열의 GRPO 기반 정책 최적화를 채택하고 그룹 상대 이득(group-relative advantage)을 다중 보상 가중합으로 계산해 보상 스케일을 정규화했다. 샘플 생성 시에는 CFG를 적용하고 정책 업데이트 목적함수에는 무조건부 분기를 제외하는 하이브리드 전략을 사용해 사전학습 지식 보존과 학습 안정성 사이의 균형을 확보했다. 추가로 비동기 보상 파이프라인, 프롬프트 필터링(내부 그룹 보상 범위 기준), 카테고리별 보상 가중치 보정으로 대규모 학습을 효율화했다.
작업별 교사 모델을 단일 학생으로 통합하는 On-Policy Distillation
작업 특화 RL 정책(T2I 교사, 편집 교사)으로 학습한 후 학생 모델이 자신의 추론 궤적에서 교사의 velocity를 매칭하도록 trajectory-level velocity matching 손실을 최소화해 단일 모델로 통합했다. 학생은 자신의 ODE 경로에서 샘플을 생성한 뒤 해당 시점의 속도 필드 차이를 제곱합으로 학습해 분포 거리(W2)의 상한을 줄이는 방향으로 최적화됐다. 다수 교사를 동적 로드해 메모리를 절약하고 교사 간 상충하는 보상을 직접 최적화하지 않아도 되는 장점이 확보됐다.
관련 Figure
같은 모델 풀에서 생성된 이미지를 두 보상 학습 방식으로 평가한 예시가 제시되어 pointwise 레이블의 절대적 품질 신호가 시각적 품질 향상으로 연결됨이 관측됐다. 이 근거는 논문이 pointwise scoring을 기본으로 채택한 실험적 이유와 연결된다. 보상 학습 패러다임 선택이 최종 생성 품질에 미치는 영향을 실증적으로 보강한다.
포인트와이즈 보상 학습과 페어와이즈 보상 학습의 결과 비교 이미지로, pointwise 학습에서 텍스처와 품질이 더 우수하게 나타났다.
핵심 아이디어 이해하기
감독학습으로 학습된 flow-matching 확산 모델은 denoising/flow matching 목표를 따르며 고품질 샘플을 생성하지만 인간의 미적 선호나 프롬프트 충실성 같은 주관적 척도는 손실 함수에 직접 포함되어 있지 않다. 이 때문에 텍스트-이미지 정렬, 질감·구성의 미학, 인물의 얼굴 정체성 같은 다차원 평가 기준을 직접 최적화할 필요가 발생했다. 이러한 배경에서 RLHF 패러다임을 확산 모델에 적용해 보상 신호로 인간 선호를 직접 반영하는 접근이 핵심 출발점이다.
비교적 결정론적 성격의 flow-matching 생성 과정은 전통적 다단계 MDP로의 확장에서 중요한 난제를 야기했다. 본 논문은 샘플 군(group) 수준의 보상 정규화와 흐름 기반의 확률적 샘플링 근사를 결합한 GRPO 계열의 알고리즘을 사용해 이 난제를 완화했다. 구체적으로 각 프롬프트에서 생성된 샘플들의 보상을 그룹 평균·표준편차로 정규화한 group-relative advantage를 계산해, 보상 스케일 불일치로 인한 편향을 제거하고 안정적인 정책 그레이디언트를 확보했다.
보상 신호의 설계 관점에서는 절대 점수(pointwise scoring)가 쌍비교(pairwise)보다 더 풍부한 감독 신호를 제공한다는 관찰이 핵심 직관이다. 절대 점수는 '얼마나 좋은가'를 캘리브레이션된 축으로 제공하므로 다중 보상(정렬, 미학, 초상 등)을 합산할 때 각 보상 차원이 갖는 값의 의미가 명확해진다. 마지막으로 작업별 RL로 얻은 교사 정책들을 학생이 자신의 궤적에서 교사의 속도 필드를 따라가도록 학습시키면 서로 상충하는 보상을 동시에 최적화하려다 발생하는 트레이드오프를 피하면서 단일 모델로 통합할 수 있다.
방법론
전체 파이프라인은 세 단계로 구성됐다: 보상 모델 구축, 작업별 RL 최적화, on-policy distillation을 통한 통합이다. 먼저 VLM을 pointwise 레이블(1~5)로 회귀 미세조정하고 chain-of-thought 맥락을 포함해 정렬·미학·초상 등 T2I 보상과 편집용 명령 수행·얼굴 정체성 보상을 학습했다. 보상 모델은 원격 API로 배포되어 비동기 방식으로 학습 루프와 분리되어 점수 수집 지연을 숨기도록 구현됐다.
정책 최적화는 Flow-GRPO 스타일의 클리핑된 서러게이트 목적함수와 중요도비를 시간축별로 계산하는 방식에 기반했다. 다만 결정론적 ODE 생성의 문제를 해결하기 위해 확률적 샘플링 근사를 도입했고, rollout 과정에서는 CFG를 적용하되 최적화시에는 무조건부 분기를 제외하는 하이브리드 CFG 전략을 사용했다. 또한 전체 동작에서는 40스텝 ODE 솔버를 사용하되 고노이즈 시점에 더 큰 비중을 두고 일부 시점만을 학습 대상으로 삼아 보상 해킹을 완화했다.
프롬프트 큐레이션은 각 프롬프트 그룹의 보상 범위(최대-최소)를 계산해 임계값 이하인 경우 학습에서 제외하는 방식으로 이루어졌다. 학습 데이터는 의미별 카테고리로 분류되어 카테고리별 보상 가중치가 달리 적용되며, 이는 포트레이트·타이포그래피 등 도메인별 품질 요구를 반영하기 위한 조치이다. 마지막으로 OPD 단계에서는 학생 모델이 자신의 경로에서 교사 속도를 모방하도록 LOPD = Σ‖vθ(xtn, tn, c) − vθ⋆(xtn, tn, c)‖^2 형태의 궤적 수준 손실로 학습했다.
관련 Figure
이 그림은 학습 과정의 구조적 분해를 시각적으로 요약해 주며 각 단계의 목적과 상호작용을 확인할 수 있다. 특히 T2I와 편집에 대해 서로 다른 보상 구성을 사용한 뒤 trajectory-level distillation으로 병합하는 설계 의도를 직접적으로 보여준다. 작업별 교사를 유지하면서 학생으로 통합하는 워크플로우의 필요성을 이해하는 데 핵심적이다.
파이프라인 다이어그램으로, 베이스 모델에서 T2I와 편집 학습을 별도로 수행한 뒤 OPD로 통합하는 전체 흐름을 시각화했다.
주요 결과
자동화된 평가에서 Qwen-Image-2.0-RL은 Qwen-Image-Bench에서 전체 점수 57.84를 기록해 베이스 모델(55.23) 대비 +2.61 향상을 보였다. 구성 요소별로는 Creative Generation에서 6.72 포인트, Real-world Fidelity에서 4.29 포인트의 큰 개선이 관측됐다. 평가에 사용된 Q-Judger는 130K 이상의 사람 라벨 이미지-프롬프트 쌍으로 학습된 통합 판정 모델이다.
인간 선호 기반의 아레나 평가에서는 텍스트-투-이미지 Elo가 1115에서 1193으로 +78 상승했고, 이미지 편집 아레나는 1256에서 1349로 +93 상승했다. 하위 카테고리에서는 3D Modeling과 Photorealism에서 각각 +93, +91의 향상이 보고되어 구조적 일관성과 세부 묘사에서의 개선이 뚜렷했다. 질적 비교에서 Mix-RL과 OPD 통합 모델을 비교하면 Mix-RL이 베이스 대비 개선을 보였으나 OPD 기반 모델이 더 선명한 세부, 높은 프롬프트 충실성, 우수한 얼굴 정체성 보존을 달성했다.
추가 분석에서는 pointwise 보상 학습이 pairwise보다 시각적 품질과 텍스처 세부에서 우수한 결과를 유도했고, CFG를 rollout에서만 사용하는 하이브리드 전략이 학습 안정성과 사전지식 보존 사이의 적절한 균형을 제공함이 확인됐다.
관련 Figure
동일 프롬프트 하에서 Mix-RL이 베이스 대비 전반적 개선을 보이지만 OPD 모델이 세부 선명도와 구성 일관성에서 더 우수한 결과를 산출하는 경향이 명확하게 나타났다. 이 정성적 비교는 혼합 RL의 트레이드오프와 OPD의 통합 이점에 대한 직관적 근거를 제공한다.
Qwen-Image-2.0-Base, Mix-RL, Qwen-Image-2.0-RL(OPD) 세 모델의 질적 T2I 비교 패널로, OPD 모델이 디테일과 프롬프트 충실성에서 우세함을 보여준다.
입력 레퍼런스 인물의 얼굴 특징을 유지하면서 복잡한 편집 지시를 수행한 예시들이 제시되어 OPD 통합 모델의 편집 정확도가 객관적으로 향상되었음을 시사한다. 이 이미지는 편집용 얼굴 정체성 보상기와 OPD 조합의 효용을 뒷받침한다.
초상 편집 시 동일 입력에 대한 세 모델 결과 비교로, OPD 모델이 얼굴 정체성 보존과 지시사항 이행에서 우수함을 보여준다.
기술 상세
모델 아키텍처는 Qwen-Image-2.0 기반의 flow-matching 계열 생성기와 Qwen 시리즈 VLM을 보상기용으로 미세조정한 구성으로 이루어졌다. 생성기는 40스텝 ODE 솔버를 사용해 역ODE를 풀며, 학생과 교사 모두 동일한 역ODE 해석을 통해 샘플 궤적을 생성했다. 보상기는 VLM으로 토큰 확률로 점수 집합 S={1,2,3,4,5}의 기대값을 계산(Rϕ(x,c)=Σ s·pϕ(s|x,c))하는 방식으로 구현됐다.
정책 최적화 측면에서는 Flow-GRPO 계열의 clipped surrogate objective가 사용됐다. 이 때 그룹화된 샘플 집합에서 중요도비 r(i)_t를 시간별로 계산하고 클리핑하여 안정화했으며, 다중 보상은 per-prompt-group 정규화를 통해 가중합으로 합성했다(A=Σ wk·(Rk−μk)/σk). CFG는 rollout 샘플링에만 적용해 보상 평가의 신뢰성을 확보하고, 정책 목적함수 계산에서는 CFG의 무조건부 분기를 제외해 최적화 안정성을 높였다.
On-Policy Distillation의 이론적 기반은 출력 분포의 W2 거리 상한을 속도 필드 오차의 시간적 적분으로 바인딩하는 결과에 기초한다. 따라서 학생은 자신의 경로 샘플 {xtn}에서 교사의 속도 vθ⋆(xtn, tn, c)에 대한 MSE를 최소화하도록 학습했고, 이산화된 N 시점 합으로 실무적 손실 LOPD를 구성했다. 다중 교사 환경에서는 배치별로 작업 유형에 맞는 교사를 동적으로 활성화해 GPU 메모리 사용을 제어했다.
훈련 실무에서는 비동기 보상 API와 백그라운드 스레드로 점수 수집 지연을 마스킹했고, 프롬프트 필터링은 그룹 내 보상 범위를 기준으로 유효한 프롬프트만 선택해 학습 효율을 개선했다. 또한 타임스텝 샘플링 전략은 고노이즈 시점을 중심으로 일부 시점만 최적화 대상으로 삼아 보상 해킹 위험을 줄였다.
관련 Figure
왼쪽은 양단계에서 CFG 사용 시 훈련 불안정으로 품질 붕괴가 발생하고, 가운데는 CFG 미사용 시 스타일 표현력 상실이 관찰되며 오른쪽 하이브리드가 균형을 제공하는 패턴을 제시한다. 이 그림은 본문에서 기술된 하이브리드 CFG의 실효성을 직관적으로 보강하는 증거로 기능한다.
세 가지 CFG 적용 전략 비교 이미지로, rollout 전용 CFG가 안정성과 사전학습 지식 보존을 동시에 확보하는 결과를 보여준다.
실무 활용
실무적으로 Qwen-Image-2.0-RL은 텍스트 기반 고품질 이미지 생성과 정밀한 이미지 편집 워크플로에 적용 가능하다. 분리된 보상기와 OPD 통합 절차는 작업별 최적화 효과를 유지한 채 배포용 단일 모델을 확보하는 데 유리하다.
- 크리에이티브 제작 파이프라인에서 프롬프트 충실성 및 미학을 동시에 강화한 고해상도 이미지 생성
- 레퍼런스 인물의 얼굴 특징을 보존하면서 복잡한 편집 지시를 수행하는 초상 편집 서비스
- 도메인별(타이포그래피, 제품, 3D 스타일링) 보상 가중치 설정을 통한 스타일 특화 이미지 생산
코드 공개 여부: 미확인
키워드
용어 해설
- Flow Matching
- — 데이터 분포를 역ODE로 생성하는 방법으로, 시점별 연속 경로를 학습하여 노이즈에서 깨끗한 샘플로 역추적하는 생성 모델 프레임워크이며 본문에서는 확률적 ODE 근사와 정책 최적화에 연결되어 사용됐다.
- Classifier-Free Guidance
- — 조건부·무조건부 모델 예측을 결합해 텍스트 조건을 강화하는 샘플링 기법으로, 본문에서는 rollout 단계에서만 적용해 샘플 품질은 확보하고 최적화 안정성은 유지하는 하이브리드 전략으로 활용됐다.
- Pointwise Scoring
- — 각 이미지에 절대 점수(예: 1~5)를 레이블로 부여해 VLM을 회귀적으로 학습시키는 방법으로, 쌍비교(pairwise)보다 절대적 품질 척도를 제공하여 RL 보상 신호로 유리하게 사용됐다.
- Group-Relative Advantage
- — 한 프롬프트에서 생성된 샘플 군의 보상 평균·표준편차로 정규화한 이득 신호로, 서로 다른 보상 스케일을 균일화하고 그룹 내부 비교를 통해 안정적인 정책 그레이디언트를 얻는 데 사용됐다.
- Vision-Language Model
- — 이미지와 텍스트를 함께 입력으로 처리해 시맨틱 점수 또는 서술을 출력하는 모델 계열로, 본문에서는 VLM을 미세조정해 정밀한 정렬·미적 평가 보상기를 구성했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.