본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

microsoft/Mage-Flow-Turbo

텍스트-투-이미지 생성 및 지시 기반 이미지 편집(4스텝 고속 추론 변형)4B네이티브 해상도 출력 512–2048 컨텍스트mit

Mage-Flow 스택의 4스텝 Turbo 생성 변형으로 A100 1024² 기준 약 0.59초에 GenEval 0.90급 이미지를 뽑아낸다.

학습 방식 · Mage-VAE 잠재공간에서 NR-MMDiT(4B)를 rectified flow matching으로 학습한 뒤 Diffusion-NFT로 RL 정렬하고 decoupled-DMD+적대적 지각 안내로 4스텝 증류했다.

TL;DR

Mage-Flow-Turbo는 Mage-VAE와 NR-MMDiT(4B)를 공동 설계한 Mage-Flow 스택을 decoupled-DMD로 증류해 추론을 4스텝으로 줄인 고속 변형으로, A100에서 1024² 기준 약 0.59초/이미지의 생성 지연을 기록하면서도 GenEval 0.90을 유지한다. 학습은 Mage-VAE 잠재공간에서 rectified flow matching으로 Base를 학습하고 Diffusion-NFT로 RL 정렬한 뒤 적대적 지각 안내를 결합해 증류하는 순서를 따른다. 512~2048 해상도를 네이티브 종횡비로 생성할 수 있고, 참조 이미지를 받아 배경 교체·객체 추가/삭제·복원 같은 지시 기반 편집도 같은 체크포인트로 수행한다. Mage-VAE가 인코드/디코드 연산을 픽셀당 약 12×·22× 줄인 덕분에 VAE가 고해상도 처리의 병목이 되지 않는다.

핵심 포인트

  • 4스텝 증류로 A100 1024² 기준 약 0.59초/이미지의 생성 지연을 내면서도 GenEval 0.90을 유지한다.
  • 같은 체크포인트로 텍스트-이미지 생성과 지시 기반 편집(배경 교체·객체 추가/삭제·복원)을 모두 수행한다.
  • Mage-VAE가 인코드/디코드 연산을 픽셀당 약 12×·22× 줄여 512~2048 네이티브 해상도에서도 VAE가 병목이 되지 않는다.

제한사항

  • 실행에 flash-attn 빌드와 torch/CUDA 버전 호환이 필요하다.

벤치마크

벤치마크지표비교
GenEvalscore0.90
생성 지연초/이미지 (A100, 1024²)0.59

72

LIKES

1.6k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.