nvidia/Qwen-Image-Flash
NVIDIA가 DMD2로 증류한 Qwen-Image 4스텝판으로, 원본에 근접한 품질을 유지하며 생성 단계를 4번으로 줄였다.
학습 방식 · Qwen/Qwen-Image를 teacher로 두고 NVIDIA FastGen의 DMD2(Distribution Matching Distillation)로 4스텝 학생 모델을 증류했으며, ProGamerGov 데이터셋의 영어 프롬프트로 Qwen-Image가 직접 생성한 100만 장의 합성 이미지-프롬프트 쌍을 학습에 사용했다.
TL;DR
Qwen-Image-Flash는 NVIDIA가 FastGen·Model Optimizer·AutoModel로 Qwen/Qwen-Image를 DMD2(Distribution Matching Distillation) 방식으로 증류해 4스텝, shift-3 스케줄로 이미지를 생성하도록 만든 모델이다. 트랜스포머 아키텍처와 파라미터 수(20.43B 디노이징 트랜스포머, 파이프라인 전체 28.85B)는 원본과 동일하게 유지한 채 학습된 학생(student) 가중치로 교체됐고, teacher가 사용한 CFG 4.0을 학생이 내재화해 추론 시 true_cfg_scale=1.0으로 guidance를 다시 적용하지 않아도 된다. Qwen-Image-Bench 47.080·OneIG-Bench-EN 0.885로 원본 Qwen-Image(49.070/0.886)에 근접한 품질로 4번의 트랜스포머 평가만으로 이미지를 완성한다. Diffusers·SGLang Diffusion·vLLM-Omni·TensorRT-LLM VisualGen 등 여러 서빙 엔진을 지원해 지연에 민감한 이미지 생성 프로토타이핑에 적합하다.
핵심 포인트
- DMD2 증류로 원본 Qwen-Image와 같은 아키텍처·파라미터 수를 유지한 채 4스텝만으로 생성을 끝낸다.
- Qwen-Image-Bench 47.080·OneIG-Bench-EN 0.885로 원본(49.070/0.886)에 근접한 점수를 냈다.
- teacher의 CFG 4.0을 학생 모델이 내재화해 추론 시 true_cfg_scale=1.0으로 별도 guidance 재적용이 필요 없다.
제한사항
- 영어 캡션으로만 증류돼 원본이 갖고 있던 중국어 처리 능력은 이 릴리스에서 평가되지 않았다.
- 패키지된 4스텝·shift-3 스케줄을 벗어나 스텝 수나 스케줄러를 바꾸면 품질이 떨어지거나 예상치 못한 결과가 나올 수 있다.
- 1024×1024 외 해상도는 16으로 나누어지는 값이면 동작하지만 테스트되지 않아 품질이 달라질 수 있고, 별도의 안전 필터가 포함돼 있지 않다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Qwen-Image-Bench | score | 47.080 | Qwen-Image 49.070, Qwen-Image-Lightning 46.980 |
| OneIG-Bench-EN | score | 0.885 | Qwen-Image 0.886 |
69
LIKES
509
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.