본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

microsoft/Mage-Flow

텍스트-투-이미지 생성 및 지시 기반 이미지 편집(단일 체크포인트, 512~2048 네이티브 해상도)4B512K 컨텍스트mit

Microsoft의 4B NR-MMDiT와 Mage-VAE 토크나이저를 공동 설계해 512~2048 해상도 텍스트-이미지 생성과 지시 기반 편집을 한 체크포인트로 수행한다.

학습 방식 · Mage-VAE 잠재공간에서 NR-MMDiT(4B)를 rectified flow matching으로 학습한 뒤 Diffusion-NFT로 선호도·prompt following을 정렬하고, decoupled-DMD와 적대적 지각 손실을 결합한 증류로 4스텝 Turbo 변형을 만들었다.

TL;DR

Mage-Flow는 Microsoft가 공개한 4B 규모의 네이티브 해상도 멀티모달 확산 스택으로, one-step 확산 토크나이저 Mage-VAE와 NR-MMDiT 백본을 함께 설계해 텍스트-이미지 생성과 지시 기반 편집을 같은 아키텍처로 처리한다. 네이티브 해상도 패킹과 FlashAttention var-len, per-sample 2D RoPE, CUDA fused kernel을 결합해 학습 속도를 약 2.5배 높였고, GenEval 0.90을 기록해 더 큰 오픈소스 모델들과 경쟁하는 성능을 보였다. Base 모델에 Diffusion-NFT로 선호도 정렬을 적용하고 decoupled-DMD 기반 증류로 4단계 Turbo 변형까지 만들어 지연-품질 트레이드오프를 선택할 수 있게 했다. Mage-VAE는 FLUX.2-VAE급 재구성 품질을 유지하면서 인코드/디코드 연산을 약 12배·22배 줄여 고해상도 처리의 VAE 병목을 없앤 것이 핵심 설계다.

핵심 포인트

  • Mage-VAE(one-step 확산 토크나이저)와 NR-MMDiT 백본을 공동 설계해 인코드/디코드 연산을 약 12×·22× 줄였다.
  • 4B 규모로 GenEval 0.90을 기록해 더 큰 오픈소스 모델들과 경쟁하는 파라미터 효율을 보였다.
  • 같은 체크포인트 계열에서 생성용 Base·정렬된 버전·4스텝 Turbo까지 제공해 목적에 맞는 지연-품질 균형을 고를 수 있다.
  • 네이티브 해상도 패킹과 fused CUDA 커널로 학습 스텝 시간을 약 2.5배 줄였다.

제한사항

  • 설치 시 flash-attn 빌드와 torch/CUDA 버전 호환성을 맞춰야 정상 동작한다.

벤치마크

벤치마크지표비교
GenEvalscore0.90

415

LIKES

2k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.