TL;DR
현대 이미지 생성은 하나의 배포 모델이 text-to-image, 로컬 편집, 글로벌 편집 같은 이질적 능력을 함께 지원할 것을 요구한다. 이들 능력은 동시 최적화 시 상호 간섭이 발생하여 한 능력을 강화하면 다른 능력이 약화되는 경향이 있다. DanceOPD는 각 능력을 속도 필드로 보고 학생이 자신의 롤아웃 상태에서 하드 라우팅된 필드를 단일 low-noise 쿼리로 학습하도록 하여 능력 합성을 달성했다.
왜 중요한가
현대 이미지 생성은 하나의 배포 모델이 text-to-image, 로컬 편집, 글로벌 편집 같은 이질적 능력을 함께 지원할 것을 요구한다. 이들 능력은 동시 최적화 시 상호 간섭이 발생하여 한 능력을 강화하면 다른 능력이 약화되는 경향이 있다. DanceOPD는 각 능력을 속도 필드로 보고 학생이 자신의 롤아웃 상태에서 하드 라우팅된 필드를 단일 low-noise 쿼리로 학습하도록 하여 능력 합성을 달성했다.
핵심 기여
온-정책 생성 필드 증류 프레임워크 도입
논문은 여러 고정된 능력 소스를 상태 공간 위의 속도 필드로 취급하고 이를 하나의 학생 모델로 증류하는 온-정책 프레임워크를 도입했다. 각 학습 샘플은 정확히 하나의 능력 필드로 라우팅되고 학생 롤아웃에서 의미측 단일 상태를 쿼리하여 해당 필드의 속도를 목표로 MSE 손실로 회귀한다. 이 설계는 샘플 수준의 의미 정체성을 보존하면서 학생이 자체 방문 분포에서 직접 학습하도록 만든다.
세 가지 쿼리 유발 정렬 문제 규명 및 설계 해법
능력 합성 문제를 필드 쿼리 관점으로 재정의하면서 세 가지 핵심 정렬 문제를 규명했다. 첫째, 여러 필드를 하나의 샘플 목표로 평균하는 경우 목표 필드의 의미 정체성이 손상된다. 둘째, 오프-폴리시 상태에서 쿼리하면 학생이 실제 방문하는 상태 분포와 불일치가 발생한다. 셋째, 동일 롤아웃에서 다중 상태를 밀집 쿼리하면 상관된 감독 신호로 인해 편향이 생긴다.
하드 라우팅과 의미측 단일 쿼리의 실험적 유효성 검증
하드 라우팅과 학생-유도 의미측 단일 쿼리, 그리고 단순한 velocity MSE 목표 조합이 여러 벤치마크에서 유의미한 성능 향상을 보였다. T2I와 편집 합성 설정에서 GEditBench와 GenEval 지표에서 기존 OPD 대비 우수한 수치가 관찰되었고 realism-field 및 CFG 흡수 실험에서도 목표 능력을 강화하면서 앵커 능력을 보존했다. 상세한 ablation은 쿼리 시점, 롤아웃 길이, 밀집 쿼리 개수, 손실 가중치 등 설계 축의 민감도를 정량적으로 제시했다.
핵심 아이디어 이해하기
기본 출발점은 flow-matching 모델이 각 시간 스텝에서 상태를 다음 상태로 움직이는 속도 필드 v(z,t,c)를 학습한다는 관점이다. 서로 다른 능력 소스는 동일한 상태 공간에 서로 다른 속도 필드를 고정된 형태로 제공하며, 학생은 이들 필드를 동일한 공간에서 흉내 내도록 학습될 수 있다. 따라서 능력 합성 문제는 '어떤 필드를 샘플별로 선택할 것인가', '어떤 학생 상태에서 필드를 쿼리할 것인가', '한 롤아웃에서 몇 개의 상태를 사용할 것인가'라는 세 가지 쿼리 문제로 환원된다.
방법론
DanceOPD는 샘플-단위 하드 라우팅을 기본 정책으로 채택하여 각 학습 예제가 정확히 하나의 능력 필드로 연결되도록 설계되었다. 라우팅 확률 π(m)은 기본적으로 균등 분포를 사용하며 라우팅된 필드 u_m(z,t,c) = v_m(z,t,c)를 정답 속도로 취득한다. 학생은 현재 파라미터로 생성한 롤아웃 z_{0:T}^θ에서 의미측 좌표 s를 샘플링하여 대응하는 물리적 시간 t=t(s)에서 stop-gradient 처리한 상태 z̄_t를 얻고 이 상태에서 라우팅된 교사 속도를 쿼리한다.
관련 Figure

이 그림은 세 가지 핵심 설계 선택이 어떻게 결합되는지 시각적으로 연결한다. 각 샘플이 하나의 능력 필드로 라우팅되고 학생 롤아웃에서 stop-gradient 상태를 선택하여 교사 속도를 쿼리한 뒤 학생 속도를 MSE로 회귀하는 순서가 흐름도로 제시되어 있다. 이 다이어그램은 이론적 유도부의 쿼리 문제 세 가지와 방법의 구현적 절차를 직접적으로 연결한다.
DanceOPD의 개념적 다이어그램으로 하드 라우팅, 학생 롤아웃 쿼리, 의미측 단일 쿼리와 velocity MSE 목표가 한 그림으로 정리되어 있다.
주요 결과
주요 실험은 T2I와 편집 합성, 로컬·글로벌 편집 합성, realism-field 흡수, CFG 흡수의 네 가지 설정으로 구성되었다. T2I와 편집 합성에서 DanceOPD는 GEditBench 평균에서 재현된 최강 OPD 대비 8.1% 향상을 기록했고 편집 소스 대비 8.5% 향상을 보였다. 로컬·글로벌 편집 합성에서는 최강 경쟁 구성 대비 16.1% 개선을 보였고 realism-field 흡수에서는 오프-폴리시 증류보다 realism 보상이 9.9% 높아졌으며 학생과 교사의 보상 격차를 85.3%까지 메웠다.
관련 Figure

정성적 결과는 의미측 단일 쿼리와 하드 라우팅이 편집 목표를 강화하면서 원본의 레이아웃과 기하학 정보를 보존함을 보여준다. 사과 예시에서는 색상과 재질 변경이 이루어지되 잎과 테이블 배치가 유지되며 피아노 예시에서는 수중 환경 변화가 구조를 해치지 않고 반영된다. 이러한 사례는 수치 지표와 함께 능력 합성의 실무적 유효성을 보강한다.
사과, 피아노, 가죽 안락의자 예시로 DanceOPD가 편집과 T2I 능력을 균형 있게 유지하며 목표 속성 변화를 적용한 정성 결과가 제시되어 있다.

이 행렬은 동일 프롬프트에서 각 방법이 어떤 시각적 결과를 만드는지 직접 비교할 수 있게 한다. 행별로 동일한 능력 조건을 유지하면서 DanceOPD가 색상, 조명, 디테일 유지 측면에서 타 방법보다 균형이 좋음을 관찰할 수 있다. 이 시각 자료는 정량 지표의 해석을 용이하게 하며 ablation 결과와 연계되어 설계 선택의 효과를 뒷받침한다.
다양한 데이터셋과 바리에이션 대조표로서 DanceOPD, Teacher, Off-Policy, FlowOPD, DiffusionOPD 등의 비교 결과 샘플들이 행렬 형태로 제시되어 있다.

이 패널은 방법의 일반화 성능을 도메인 별로 보여주며 하드-라우팅 기반의 DanceOPD가 T2I와 편집 과제를 동시에 충족하는 사례를 포함한다. Off-Policy나 Joint Training과 비교해 특정 편집 카테고리에서 색상·스타일·배경 변경이 더 정확하게 반영되는 경향이 관찰된다. 도메인별 반복 실험을 통해 라우팅과 의미측 쿼리의 일관된 이득이 확인된다.
다수의 능력 조합 설정에 대한 격자형 결과로서 말, 해바라기, 노트북, UI 컨셉 등 서로 다른 도메인에서 각 방법의 출력을 비교한 패널이다.

이 그림들은 realism-field를 온-정책으로 흡수했을 때 표면 질감, 조명 대비, 재질 반사 등에서 향상이 발생했음을 시각적으로 확인시킨다. 오프-폴리시 증류와 비교하면 DanceOPD 결과는 과도한 채도나 디테일 손실 없이 실사성 보상 지표 상승과 일치하는 변화를 보인다. 이 자료는 논문의 realism-field 흡수 실험 결과와 정합성을 가진다.
다양한 아티팩트와 품질 요소가 포함된 티켓부스, 인물, 찻잔, 가죽구두 예시에서 DanceOPD의 realism-field 흡수 효과를 보여주는 정성 이미지 모음이다.
기술 상세
목표 손실은 의미측 학생 상태에서의 단순한 속도 MSE로 정의되며 이는 로컬 가우시안 전이 가정을 통해 KL-스타일 지역 전이 매칭이 시간 가중 MSE로 환원된다는 수학적 근거를 가진다. 구체적으로 작은 역시간 스텝에서 학생과 교사는 동일 공분산 σ_t^2 I를 가지는 정규분포 전이를 유도한다고 가정하면 forward KL은 Δt^2 /(2 σ_t^2) 계수와 함께 속도 차의 제곱으로 표현된다. 따라서 목표는 v_θ( z̄_t,t,c)와 v_m( z̄_t,t,c)의 L2 차를 최소화하는 회귀 문제로 정리된다.
한계점
제시된 방법은 교사와 학생이 동일한 생성 상태 공간과 호환 가능한 속도 파라미터화를 공유한다는 가정을 전제로 한다. 논문 실험은 동일한 백본 계열과 잠재 표현, 스케줄러 관습을 사용한 소스들에 대해 수행되었으므로 이 가정이 충족되었다. 또한 구현에서 라우팅은 미리 정의된 능력 버킷에 의존하므로 작업 경계가 모호하거나 단일 프롬프트가 여러 능력을 동시에 요구하는 경우에는 라우팅 정책을 검증기나 보상 모델로 확장할 필요가 있다.
키워드
용어 해설
- Velocity Field
- — Flow-matching 계열 모델에서 생성 과정은 연속 상태 공간 상의 벡터장으로 표현되는 속도 필드로 기술된다. 이 속도 필드는 특정 상태 z_t와 시간 t에서 다음 상태로 이동시키는 방향과 크기를 제공하며 로컬 가우시안 전이해석을 통해 MSE 형태로 회귀 대상이 된다. 여러 능력 소스는 동일한 상태 공간에서 서로 다른 속도 필드로 고정되어 학생이 이를 학습하여 합성 능력을 획득하도록 만든다.
- On-Policy Distillation
- — 학생 모델이 실제 생성 시 방문하는 롤아웃 상태에서 교사 신호를 취득하여 학습하는 증류 방식이다. 이 방식은 오프-폴리시로 수집한 고정된 상태와 학생이 실제 방문하는 상태 분포 간의 불일치를 줄여 배포 시 성능 저하를 완화한다. DanceOPD는 학생 롤아웃에서 한 지점을 선택해 해당 상태에서 라우팅된 교사 속도 필드를 쿼리하는 형태로 온-정책 증류를 수행한다.
- Semantic-Side Query
- — 롤아웃의 노이즈 레벨이 낮아지고 의미적 정보가 집중되는 시점에 학생 상태를 선택하여 교사 필드를 쿼리하는 전략이다. 고노이즈 초기 상태는 일반적 노이즈 제거 신호가 우세하므로 의미적 편집 정보가 희석되며, 의미측 쿼리는 편집·스타일 신호의 SNR을 높인다. DanceOPD는 Beta 분포를 사용해 의미측 지점에서 단일 쿼리를 샘플링한다.
- Hard Routing
- — 각 학습 샘플을 정확히 하나의 고정된 능력 버킷(예: T2I, 로컬 편집, 글로벌 편집)으로 배정하여 해당 능력의 속도 필드만을 감독 신호로 사용하는 방식이다. 필드를 샘플 단위로 혼합하지 않으므로 샘플별로 의미적 정체성이 보존되고 목표 필드의 모호성이 제거된다. DanceOPD는 균등한 경로 확률을 기본으로 하드 라우팅을 수행한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.