4스텝 DMD2 증류 기반 Qwen-Image 초저지연 이미지 생성
이 모델은 few-step text-to-image 생성 작업을 수행한다. 입력 텍스트를 Qwen2.5-VL 텍스트 인코더로 임베딩한 뒤 증류된 변환기가 네 단계의 FlowMatch Euler denoising을 수행하고 VAE가 최종 RGB 이미지를 복원한다. 지연 민감 워크플로에 맞춰 설계되었으며 이미지 편집이나 안전·생명 관련 의사결정 용도는 의도되지 않는다.20.43B (denoising transformer); 28.85B (전체 파이프라인, 텍스트 인코더·VAE 포함)프롬프트 토큰 최대 1,024개, 기본값 512 토큰 컨텍스트nvidia-open-model-license (NVIDIA Open Model License)
Qwen-Image-Flash는 Qwen-Image를 DMD2로 증류해 네 단계 추론으로 고품질 이미지를 빠르게 생성하도록 최적화한 text-to-image 파이프라인이다.
TL;DR
NVIDIA의 Qwen-Image-Flash는 Qwen/Qwen-Image를 기반으로 DMD2 증류를 적용해 네 단계 FlowMatch Euler 스케줄로 추론을 압축한 text-to-image 모델이다. 학생 모델은 원본 변환기 아키텍처와 파라미터 수를 유지하면서 교사의 출력 분포를 네 번의 denoising으로 근사하도록 학습되어 transformer 평가 횟수를 줄여 레이턴시를 낮춘다. 벤치마크에서는 원본과 유사한 범위의 성능을 보였고 영어 캡션 기준에서 1024×1024 생성이 검증되었으나 스케줄이나 단계 수 변경 시 품질이 달라질 수 있고 비영어 성능은 평가되지 않았다.
핵심 역량
- 자연어 프롬프트로부터 1024×1024 RGB 이미지를 생성하고 일반적으로 PIL 이미지 객체로 반환한다.
- DMD2로 증류된 네 단계 추론으로 transformer 평가 횟수를 줄여 지연을 낮추며 latency-sensitive 애플리케이션에 적합하다.
- Hugging Face Diffusers, SGLang Diffusion, vLLM-Omni, TensorRT-LLM 등의 런타임에서 실행이 검증되었다.
- 프롬프트 토큰은 최대 1,024개를 허용하며 기본값은 512 토큰으로 설정되어 있다.
강점
- 네 단계 DMD2 증류를 통해 transformer 평가 횟수를 줄여 추론 지연을 낮출 수 있어 latency-sensitive 워크플로에서 유리하다.
- 학생 모델이 원본 아키텍처와 파라미터 수를 유지하므로 증류 후에도 기본 품질 특성이 보존될 가능성이 있다.
- Diffusers, vLLM-Omni, TensorRT-LLM 등 다양한 추론 엔진과 NVIDIA H100·B200 같은 가속 하드웨어에서 실행 검증이 이루어졌다.
훈련 방식
Qwen/Qwen-Image를 기반으로 NVIDIA Model Optimizer와 FastGen의 DMD2 분포 정합 증류를 적용해 학생 모델이 네 단계 FlowMatch Euler 스케줄에서 교사 출력 분포를 근사하도록 학습했으며 증류에는 합성된 영어 캡션 1,000,000쌍이 사용되었다.
알아두면 좋은 것
- 모델은 Qwen/Qwen-Image를 기반으로 DMD2(Distribution Matching Distillation)를 적용해 네 단계로 생성하도록 증류되었으며 학생은 원본 아키텍처와 파라미터 수를 유지한다.
- 증류에 사용된 소스 프롬프트 데이터셋은 ProGamerGov/synthetic-dataset-1m-dalle3-high-quality-captions로 영어 캡션을 사용해 1,000,000개의 프롬프트-이미지 쌍을 합성해 생성하였다.
- 패키지된 스케줄러는 shift-3 FlowMatch Euler 정적 궤적을 제공하고 네 단계에서 유효한 시그마 시퀀스가 포함되어 있어 권장 설정을 벗어나면 품질이 저하될 위험이 있다.
- 사용 권한은 NVIDIA Open Model License에 의해 관리되며 README에서는 상업적·비상업적 사용이 가능하다고 명시되었다.
기술적 특징
- 분포 정합 증류 방식인 DMD2를 적용하여 교사 Qwen-Image의 출력 분포를 학생이 네 단계의 denoising으로 근사하도록 학습했다. 이 과정에서 학생은 원본 변환기 아키텍처와 파라미터 수를 유지하므로 체크포인트 크기와 메모리 요구량은 줄지 않지만 transformer 호출 횟수를 네 번으로 고정해 추론 레이턴시를 감소시킨다.
- 증류 과정에서는 classifier-free guidance 4.0을 교사가 활용했고 학생은 가이던스 효과를 내부화하여 추론 시 true_cfg_scale=1.0을 사용하도록 설계되었다. 이로 인해 별도의 guidance 반복을 적용하지 않아도 교사의 조건화 효과를 유지한다.
- 패키지된 스케줄러는 shift-3 FlowMatch Euler의 정적 궤적과 고정된 sigma 시퀀스([1.0, 0.9, 0.75, 0.5, 0.0])를 제공하며 README에서는 스케줄이나 단계 수 변경이 품질에 영향을 줄 수 있다고 명시되어 있다. 따라서 권장 스케줄로 네 단계 추론을 유지해야 일관된 결과를 얻을 수 있다.
- 풀 파이프라인 구성은 Qwen2.5-VL 텍스트 인코더, Qwen tokenizer, 60층 Qwen-Image transformer, VAE를 포함하며 denoising transformer 단독으로 20.43B 파라미터를 가진다. 증류는 NVIDIA Model Optimizer 0.45.0과 FastGen 관련 도구를 활용해 수행되었고 여러 런타임 엔진에서의 통합을 검증했다.
차별점
- 네 단계로 압축된 DMD2 증류를 사용해 추론 단계 수를 최소화한 점이 핵심 차별화 요소이다.
- 학생 모델이 원본 변환기 아키텍처와 파라미터 수를 유지하여 모델 용량은 보존하면서도 추론 지연을 개선하도록 설계되었다.
- 패키지된 shift-3 FlowMatch Euler 스케줄과 고정 sigma 시퀀스를 함께 제공해 권장 설정으로 즉시 저지연 생성이 가능하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Qwen-Image | Qwen-Image-Bench | 49.070 | — |
| Qwen-Image-Lightning | Qwen-Image-Bench | 46.980 | — |
| Qwen-Image-Flash (Ours) | Qwen-Image-Bench | 47.080 | — |
| Qwen-Image | OneIG-Bench-EN | 0.886 | — |
| Qwen-Image-Lightning | OneIG-Bench-EN | 0.887 | — |
| Qwen-Image-Flash (Ours) | OneIG-Bench-EN | 0.885 | — |
69
Likes
509
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.