TL;DR
몇 단계만으로 고품질 샘플을 만드는 MeanFlow 구조는 실질적 샘플 비용을 크게 낮추어 실제 배포 가능성을 높였다. 그러나 순방향 프로세스 기반의 보상 최적화는 순간 속도를 대상으로 설계되어 평균 속도 파라미터화와 직접적으로 맞지 않았다. 본 연구는 평균 속도 기반 생성기에서도 likelihood-free 순방향 RL을 적용하여 few-step 생성의 품질을 보존하면서 보상에 따른 정책 개선을 달성했다.
왜 중요한가
몇 단계만으로 고품질 샘플을 만드는 MeanFlow 구조는 실질적 샘플 비용을 크게 낮추어 실제 배포 가능성을 높였다. 그러나 순방향 프로세스 기반의 보상 최적화는 순간 속도를 대상으로 설계되어 평균 속도 파라미터화와 직접적으로 맞지 않았다. 본 연구는 평균 속도 기반 생성기에서도 likelihood-free 순방향 RL을 적용하여 few-step 생성의 품질을 보존하면서 보상에 따른 정책 개선을 달성했다.
핵심 기여
MeanFlow 기반 순방향 RL 프레임워크 도입
본 논문은 MeanFlow의 평균 속도 예측기를 유지하면서 MeanFlow 항등식을 이용해 유도된 순간 속도 예측기 V_theta를 구성하고, 이 예측기에 DiffusionNFT 스타일의 보상 가중 목표를 적용하여 평균 속도 네트워크를 보상에 따라 개선하는 MeanFlowNFT를 도입했다.
이론적 정책 개선 보장
이상화된 설정에서 유도된 예측기의 최적 해가 DiffusionNFT의 개선된 정책 목표와 일치하며, 이 개선이 평균 속도 네트워크로 이전되어 최종 정책의 보상 J(pi) 증가로 이어짐을 수학적으로 보였다.
실용적 구현을 위한 설계와 안정화 기법
총미분 항을 중앙 유한차분으로 근사하고 기준 모델의 유한차분 도함수를 train/reference가 공유하도록 설계하여 계산 비용을 절감하고 훈련 안정성을 확보했다.
이미지·비디오 few-step 실험에서의 우수한 성능
SD3.5-M 이미지 실험에서 4스텝으로 8개 지표 중 6개에서 최고 성능을 기록했고 Wan2.1 비디오에서는 4스텝으로 VBench 84.33을 얻어 50스텝 LongCat-Video RL(82.57)을 능가했다.
핵심 아이디어 이해하기
Flow Matching은 각 시점의 순간 속도 v_t를 모델링하여 노이즈에서 데이터로 이어지는 연속적 변화를 재현한다. 이 방식은 정확하지만 시간 축을 작은 단계로 세분화하여 순간 속도를 반복 평가해야 하므로 많은 네트워크 호출과 연산 비용이 발생한다. MeanFlow는 구간 [s,t]에 대한 평균 속도 u(x_t,s,t)를 직접 예측하여 한두 번의 큰 보간으로 샘플을 얻을 수 있게 하여 평가 비용을 획기적으로 줄인다.
방법론
MeanFlowNFT는 평균 속도 u_theta를 유지하되 MeanFlow 항등식 v(x_t,t)=u(x_t,s,t)+(t-s) d/dt u(x_t,s,t)를 활용해 u_theta로부터 유도된 순간 속도 예측기 V_theta(x_t,s,t)를 구성한다. 이 유도된 예측기는 u_theta와 총미분 항의 조합으로 정의되며, 이 예측기에 DiffusionNFT와 유사한 보상 가중 회귀 손실을 적용하여 positive/negative 샘플을 구분하는 방식으로 최적화한다. 실무적 구현에서는 총미분 항을 중앙 유한차분으로 근사하고 기준 모델의 도함수는 EMA 기반의 u_old에서 한 번만 계산하여 train/reference간 도함수 차이로 인한 불안정을 제거했다.
관련 Figure

이 다이어그램은 u_theta로부터 V_theta를 구성하는 과정과 학습 시에는 V_theta에 보상 가중 회귀를 적용하고 추론 시에는 u_theta의 few-step 샘플러를 사용하는 핵심 설계를 시각화한다. 파이프라인은 이론적 보장과 실무적 근사(유한차분, 도함수 공유)를 어떻게 결합했는지를 보여 주어 방법론 이해를 돕는다.
MeanFlowNFT의 전체 파이프라인을 도식화한 다이어그램으로서 평균 속도 네트워크와 유도된 순간 속도, 학습 및 추론의 분리를 나타낸 Figure이다.
주요 결과
이미지 생성 실험에서 SD3.5-M 기준으로 MeanFlowNFT는 ImageReward 1.4504, CLIPScore 0.2967 등을 기록하여 동일한 few-step 범주에서 기존 distillation·few-step 방법들을 능가했다. 특히 4스텝으로 DiffusionNFT(40스텝)와 유사하거나 더 우수한 보상 지표(예: ImageReward 1.45 vs 1.41)를 획득하여 함수 평가 수를 10배 줄이면서 품질을 유지했다. 비디오 실험에서는 Wan2.1 1.3B에서 4스텝으로 VBench 84.33을 얻어 50스텝 LongCat-Video RL의 82.57보다 높은 총점과 여러 하위 지표에서 우수한 성능을 보였다.
관련 Figure

이 이미지는 동일한 프롬프트에 대해 50스텝 기반 방법과 4스텝 기반 방법들의 시각적 차이를 보여 주며, MeanFlowNFT가 적은 샘플링 단계에서도 구조적 일관성과 색상·구성면에서 경쟁력을 유지함을 시사한다. 그림은 모델별로 시간에 따른 프레임 품질과 보상 해킹(과포화 색상, 비현실적 물체 스케일) 경향을 비교하는 근거로 활용되었다.
Wan2.1 1.3B 및 SD3.5-M 데이터셋에서의 정성적 비교로서 각 방법이 생성한 프레임을 시간 축에서 균등 샘플링해 배열한 Figure이다.

해당 Figure는 few-step 추론에서 MeanFlowNFT가 생성한 샘플들이 다른 few-step 기법보다 텍스트 정합성과 시각적 불일치 현상이 적음을 시각적으로 보이는 증거로 사용되었다. 논문 본문은 이 정성적 관찰을 정량 지표(예: OCR, CLIPScore)와 함께 연결해 성능 해석을 강화했다.
SD3.5-M 이미지 실험의 정성적 샘플들을 모은 Figure로서 few-step 샘플 품질 비교를 보여준다.
기술 상세
전체 구조는 평균 속도 예측기 u_theta(x_t,s,t)를 중심으로 하며 이로부터 총미분 항을 더한 유도된 순간 속도 V_theta(x_t,s,t)=u_theta+(t-s)[∂_t u_theta + (∂_x u_theta) v̂_theta]를 정의한다. 여기서 v̂_theta는 s→t 한계에서의 u_theta 값으로 네트워크의 즉시 속도 추정치 역할을 하고, 실제 최적화는 유도된 순간 속도 V_theta에 대해 이루어진다. 이 구성은 최적화와 추론을 분리하여 학습은 순간 속도 공간에서 보상 신호를 반영하지만 추론은 평균 속도 u_theta를 사용해 few-step 샘플링을 유지한다.
한계점
논문은 DiffusionNFT 스타일의 순방향 보상 목적만을 MeanFlow에 적용한 범위에 국한되어 있다. 다른 순방향 목적 함수들(RAM, AWM 등)이나 MeanFlow 외의 flow-map 모델들에 대한 실험은 수행되지 않았다. 따라서 해당 확장 방향들의 실성능 및 안정성 보장은 본문 밖의 향후 연구 과제로 남아 있다.
실무 활용
MeanFlowNFT는 few-step 샘플링을 유지하면서 보상 기반 정렬을 수행해야 하는 실제 이미지·비디오 생성 파이프라인에 바로 적용 가능하다. 실제 구현에서는 LoRA(rank=32, scale=64)로 효율적으로 파인튜닝하고 EMA 레퍼런스와 유한차분 도함수 공유로 안정적 온라인 학습이 가능하다. 코드는 공개 저장소로 제공되어 재현과 배포가 용이하다.
- 생성 모델을 실시간 또는 저지연 환경에 배포하여 평가 횟수를 줄여 응답 지연을 낮춘 상태에서 사용자 피드백 기반 품질 정렬을 수행하는 경우
- 고해상도 텍스트→이미지 또는 텍스트→비디오 파이프라인에서 few-step 샘플링을 적용해 비용을 절감하면서 보상 지표(예: CLIPScore, HPSv3)를 직접 최적화해야 하는 연구·제품 개발
- 사전학습된 MeanFlow 계열 모델에 대해 사용자 정의 보상 신호로 안전·정렬·스타일 제어를 적용하려는 실험 및 프로덕션 파이프라인
코드 공개 여부: 공개
코드 저장소 보기키워드
추가 이미지 분석

이 차트는 도함수 공유 여부와 총미분 방향 선택 같은 구현 결정이 학습 안정성과 보상 증대에 미치는 영향을 정량적으로 보여 준다. 논문은 이러한 실험 결과를 바탕으로 유한차분 기반 도함수 공유와 조건부 속도(v_t) 사용이 안정성에 필수적임을 주장하고 근거로 제시했다.
훈련 보상 및 안정성 비교를 나타내는 그래프 Figure로서 다양한 설계 선택에 따른 학습 곡선을 제시한다.
용어 해설
- MeanFlow
- — 평균 속도 예측은 시간 구간 전체에 대한 평균 속도 벡터를 직접 예측하여 몇 단계의 큰 점프로 샘플을 생성하는 방법이다. 이 접근은 순간 속도를 한 시점씩 통합하는 기존 Flow Matching 대비 평가 횟수를 크게 줄여 몇 단계(few-step) 생성이 가능하게 만든다. 본 논문에서는 MeanFlow의 평균 속도 파라미터화와 순방향 RL을 연결하는 것이 핵심이다.
- Flow Matching
- — Flow Matching은 확률 흐름 ODE의 조건부 순간 속도(v_t)를 학습하여 노이즈에서 데이터로의 연속적 변환을 재현하는 방법이다. 보통 시계열적 통합이 필요하여 네트워크 평가 횟수가 많아지는 단점이 있다. MeanFlow는 이와 달리 구간 평균 속도(u) 예측으로 통합 비용을 줄인다.
- Instantaneous Velocity
- — 순간 속도는 특정 시점 t에서 ODE의 순간적인 변화율로, Flow Matching의 학습 목표로 사용되는 조건부 평균이다. 순방향 RL 기법인 DiffusionNFT는 이 순간 속도에 보상 기반 정렬을 적용하여 정책 개선 방향을 얻는다. MeanFlow는 구간 평균 속도에 기반하므로 순간 속도로 직접 보상 최적화를 적용할 수 없다는 점이 도전 과제다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.