본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/Qwen-Image-Flash

텍스트-투-이미지 생성(few-step 고속 디스틸 모델)20.43B (디노이징 트랜스포머), 28.85B (전체 파이프라인)NVIDIA Open Model License

NVIDIA가 DMD2로 증류한 Qwen-Image 4스텝판으로, 원본에 근접한 품질을 유지하며 생성 단계를 4번으로 줄였다.

학습 방식 · Qwen/Qwen-Image를 teacher로 두고 NVIDIA FastGen의 DMD2(Distribution Matching Distillation)로 4스텝 학생 모델을 증류했으며, ProGamerGov 데이터셋의 영어 프롬프트로 Qwen-Image가 직접 생성한 100만 장의 합성 이미지-프롬프트 쌍을 학습에 사용했다.

TL;DR

Qwen-Image-Flash는 NVIDIA가 FastGen·Model Optimizer·AutoModel로 Qwen/Qwen-Image를 DMD2(Distribution Matching Distillation) 방식으로 증류해 4스텝, shift-3 스케줄로 이미지를 생성하도록 만든 모델이다. 트랜스포머 아키텍처와 파라미터 수(20.43B 디노이징 트랜스포머, 파이프라인 전체 28.85B)는 원본과 동일하게 유지한 채 학습된 학생(student) 가중치로 교체됐고, teacher가 사용한 CFG 4.0을 학생이 내재화해 추론 시 true_cfg_scale=1.0으로 guidance를 다시 적용하지 않아도 된다. Qwen-Image-Bench 47.080·OneIG-Bench-EN 0.885로 원본 Qwen-Image(49.070/0.886)에 근접한 품질로 4번의 트랜스포머 평가만으로 이미지를 완성한다. Diffusers·SGLang Diffusion·vLLM-Omni·TensorRT-LLM VisualGen 등 여러 서빙 엔진을 지원해 지연에 민감한 이미지 생성 프로토타이핑에 적합하다.

핵심 포인트

  • DMD2 증류로 원본 Qwen-Image와 같은 아키텍처·파라미터 수를 유지한 채 4스텝만으로 생성을 끝낸다.
  • Qwen-Image-Bench 47.080·OneIG-Bench-EN 0.885로 원본(49.070/0.886)에 근접한 점수를 냈다.
  • teacher의 CFG 4.0을 학생 모델이 내재화해 추론 시 true_cfg_scale=1.0으로 별도 guidance 재적용이 필요 없다.

제한사항

  • 영어 캡션으로만 증류돼 원본이 갖고 있던 중국어 처리 능력은 이 릴리스에서 평가되지 않았다.
  • 패키지된 4스텝·shift-3 스케줄을 벗어나 스텝 수나 스케줄러를 바꾸면 품질이 떨어지거나 예상치 못한 결과가 나올 수 있다.
  • 1024×1024 외 해상도는 16으로 나누어지는 값이면 동작하지만 테스트되지 않아 품질이 달라질 수 있고, 별도의 안전 필터가 포함돼 있지 않다.

벤치마크

벤치마크지표비교
Qwen-Image-Benchscore47.080Qwen-Image 49.070, Qwen-Image-Lightning 46.980
OneIG-Bench-ENscore0.885Qwen-Image 0.886

69

LIKES

509

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.