4B Native-Resolution 이미지 생성·편집 스택
Mage-Flow는 4B NR-MMDiT와 Mage-VAE로 고해상도 텍스트→이미지 생성과 지시 기반 편집을 빠르고 메모리 효율적으로 수행한다.
TL;DR
Mage-Flow는 Microsoft가 제시한 4B 규모의 Native-Resolution Multimodal Diffusion 스택으로 Mage-VAE의 one-step diffusion 토크나이저와 NR-MMDiT 백본을 공동 설계해 텍스트→이미지 생성과 지시 기반 편집을 동일 아키텍처로 처리한다. 네이티브 해상도 패킹과 FlashAttention var-len, per-sample 2D RoPE, CUDA fused kernel 조합으로 학습 속도를 약 2.5배 개선했고 출력은 512에서 2048까지 다루며 Turbo 변형은 1024²에서 0.59초/이미지의 추론 지연을 기록했다. 후처리 파이프라인은 Diffusion-NFT로 선호도 정렬을 수행하고 decoupled-DMD 기반 증류로 4단계 Turbo를 만들어 지연과 품질의 균형을 제공하며 설치 시 flash-attn과 torch/CUDA 버전 호환성에 주의해야 한다.
핵심 역량
- Mage-Flow는 단일 체크포인트로 512에서 2048 해상도까지 다양한 종횡비의 텍스트→이미지 생성을 지원하며 각 샘플을 per-sample heights/widths로 패킹해 배치 내에서 혼합 해상도를 동시에 처리할 수 있다. 이 기능은 이미지 출력마다 별도 전처리 없이도 고해상도 결과를 얻을 수 있게 한다. 배치 구성은 하나의 packed forward로 denoising 단계가 실행되어 효율성을 높인다.
- Mage-Flow-Edit는 단일 또는 다중 레퍼런스 이미지를 입력으로 받아 배경 교체, 객체 추가·제거, 외관 스타일 변경, 로컬 콘텐츠 편집, 저수준 복원 작업까지 지시 기반 편집을 수행한다. 편집 파이프라인은 텍스트와 이미지 조건을 결합해 구조-보존 및 재구성 품질을 유지하도록 설계되었다. Turbo 옵션을 통해 4단계로 빠른 인터랙티브 레이턴시를 달성할 수 있다.
- Mage-VAE의 one-step diffusion 기반 토크나이저는 인코더/디코더를 대칭 구조로 설계해 고충실도 잠재 표현을 생성하며 FLUX.2-VAE와 정렬된 anchor-latent KL로 재구성 품질을 확보한다. 이로 인해 VAE 관련 연산량이 크게 줄어들어 encode/decode MACs가 현저히 낮아진다. 결과적으로 전체 스택의 메모리 및 연산 병목이 완화되어 실무 환경에서 미세 조정과 추론이 용이해진다.
- 시스템 수준에서는 FlashAttention var-len, per-sample 2D RoPE, native-resolution packing 및 CUDA fused kernels를 결합해 학습 시간과 메모리를 최적화했다. 이 조합은 학습 단계당 평균 시간을 약 1.93초에서 0.78초로 단축시켜 약 2.5배 빠른 학습 성능을 가능하게 했다. 또한 CFG의 조건/무조건 분기를 하나의 포워드로 통합해 연산 중복을 줄였다.
강점
- Mage-Flow는 4B 규모의 단일 패밀리로 생성과 편집을 모두 다루면서 공개 벤치마크에서 높은 점수를 보여 동급 대비 파라미터 효율성이 우수하다. README의 벤치마크 표에는 Mage-Flow가 GenEval에서 0.90을 기록해 다수의 더 큰 모델과 성능 면에서 경쟁함이 드러나 있다. 이 결과는 토크나이저·백본·시스템의 공동 설계가 모델 크기 당 성능을 개선했음을 시사한다.
- Mage-VAE는 FLUX.2-VAE와 유사한 재구성 충실도를 갖되 encode/decode MACs를 샘플당 약 12×/22× 줄였다고 명시되어 VAE 관련 연산 병목을 완화했다. 이 연산 절감은 고해상도 이미지를 처리할 때 전체 스택의 메모리 및 시간 비용을 낮추는 실질적인 이점으로 이어진다. 결과적으로 같은 계산 예산 하에서 더 높은 출력 해상도 또는 더 빠른 반복이 가능하다.
- 시스템 측면에서는 native-resolution packing과 FlashAttention var-len, per-sample 2D RoPE, CUDA fused kernels의 결합으로 학습 단계당 시간을 약 1.93초에서 0.78초로 단축해 약 2.5배 빠른 학습을 달성했다고 보고되었다. 추론 측면에서도 1024²에서 Mage-Flow-Turbo는 0.59초/이미지, Edit-Turbo는 1.02초/edit를 기록해 낮은 레이턴시를 보였다. 이 수치들은 대화형 워크플로와 프로토타이핑 환경에서 유의미한 개선이다.
훈련 방식
Mage-Flow의 기반은 Mage-VAE로 잠재를 생성하고 NR-MMDiT(4B)를 rectified flow matching으로 Mage-VAE 잠재공간에서 학습한 것이다. Base에서 출발한 모델은 Diffusion-NFT로 prompt following 및 선호도를 맞추어 RL-aligned 변형을 만들고, decoupled-DMD와 적대적 지각 손실을 결합한 증류 과정을 통해 4-step Turbo 변형을 획득했다. 편집 모델은 생성 데이터와 편집 데이터의 혼합으로 후속 학습하여 생성 prior를 보존하면서도 지시 기반 편집 능력을 확보했다.
알아두면 좋은 것
- 라이선스는 MIT로 공개되어 있으며 diffusers 파이프라인 형태로 제공되어 기존 diffusers 기반 워크플로에 바로 통합할 수 있다. 리포지토리는 Base·RL-aligned·Turbo 변형을 모두 포함하는 모델 군을 제공해 목적에 맞는 단계 수와 성능/지연 타협을 선택할 수 있다. README는 설치 시 flash-attn 빌드와 torch/CUDA 버전 매칭을 반드시 지키라고 명확히 안내한다.
- 모델 아키텍처는 Mage-VAE와 NR-MMDiT의 공동 설계를 기반으로 하며 토크나이저-백본-시스템의 co-design을 통해 4B 규모에서 경쟁력 있는 품질을 달성했다. Mage-VAE는 one-step diffusion encode/decode 구조와 anchor-latent KL을 사용하여 VAE 연산 병목을 줄였고 NR-MMDiT는 가변 길이 패킹과 2D RoPE로 네이티브 해상도를 지원한다. 이 설계는 하나의 체크포인트로 생성과 편집을 모두 수행할 수 있게 한다.
- 성능 지표는 공개 벤치마크 표로 제시되어 있으며 Mage-Flow(4B)는 GenEval 0.90, CVTG-2K 0.887, LongText-EN 0.944 등 일부 지표에서 상위권 성적을 기록했다. 편집 모델도 ImgEdit·GEdit 등에서 경쟁력 있는 점수를 보였고 Turbo 변형은 대화형 지연을 목표로 4단계 증류를 적용했다. README에는 모델별 권장 단계 수와 cfg 기본값이 명시되어 있어 재현성이 높다.
- API는 pipe.generate와 pipe.edit로 간결하게 제공되어 단일 배치에서 여러 해상도와 시드를 병합한 패킹 포워드를 허용한다. CLI와 Gradio 앱도 제공되어 연구용 스크립트 및 인터랙티브 실험에 모두 활용할 수 있다. 설치 가이드는 torch/CUDA 호환성, flash-attn의 no-build-isolation 설치 순서와 같은 실무적 빌드 주의사항을 포함한다.
기술적 특징
- Mage-VAE는 대칭형 one-step diffusion 인코더·디코더 구조를 채택하고 앵커-잠재 KL로 FLUX.2-VAE 잠재와 정렬시켜 한 단계 인코딩/디코딩으로도 높은 재구성 품질을 유지한다. 이 설계는 VAE의 전통적 multi-step 디노이징 병목을 제거해 per-pixel MACs를 크게 절감한다. 결과적으로 고해상도 입력을 처리할 때 전체 파이프라인의 연산량과 메모리 소비가 크게 줄어든다.
- NR-MMDiT는 텍스트와 이미지의 가변 길이 토큰을 네이티브 해상도로 패킹해 joint self-attention으로 처리하며 per-sample 2D RoPE를 적용해 위치 인코딩을 최적화한다. 네이티브 패킹은 버킷화와 패딩을 제거해 메모리 효율을 개선하고 하나의 체크포인트로 512–2048 범위의 출력을 지원한다. 이 구조는 다양한 종횡비의 배치를 단일 포워드로 처리할 수 있게 하여 대규모 배치 운용 시 연산 낭비를 줄인다.
- 학습 인프라에서는 FlashAttention var-len과 fused CUDA kernel을 사용해 조건/무조건 분기의 병합과 연산 융합을 수행해 학습 속도를 개선했다. 이러한 시스템 수준 최적화는 denoising step 당 계산을 줄여 전체 학습 시간을 단축시키며 Turbo 증류와 함께 실용적 추론 레이턴시 측면의 이득을 만든다. 또한 batch_cfg 옵션으로 CFG의 두 경로를 하나의 포워드로 퓨전하여 추론 효율을 더한다.
- 후처리 및 파이프라인 관점에서 Base→RL-aligned→Turbo로 이어지는 파이프라인을 설계해 성능·선호도·속도의 트레이드오프를 관리했다. Diffusion-NFT로 prompt following 및 선호도 정렬을 수행하고 decoupled-DMD와 adversarial perceptual guidance로 4-step 증류를 진행해 Turbo 변형의 품질을 유지하면서 단계 수를 크게 줄였다. 이 연속적인 파이프라인은 동일한 아키텍처로 다양한 운영 요구를 충족시키는 실용적 경로를 제공한다.
차별점
- Mage-Flow는 4B 단일 백본으로 생성과 편집을 모두 지원하는 공유 스택을 제공하여 대형 모델 없이도 광범위한 작업을 처리할 수 있는 설계를 채택했다. 이 접근은 모델 관리와 파라미터 비용 면에서 실무적 이점이 있으며 README의 벤치마크에서 더 큰 모델들과 경쟁력을 보였다. 단일 스택으로 Base·RL-aligned·Turbo 세 변형을 제공해 용도별 최적화를 용이하게 한다.
- Mage-VAE의 one-step diffusion 코덱과 anchor-latent KL 조합은 VAE와 관련된 고해상도 연산 병목을 제거하면서도 재구성과 생성 품질을 유지하도록 설계되었다. 이 설계는 per-pixel MACs를 크게 줄여 동일한 하드웨어 제약에서 더 높은 해상도나 더 빠른 반복을 가능하게 한다. 특히 VAE 연산이 시스템 병목이 되기 쉬운 고해상도 워크로드에서 실질적 이득을 제공한다.
- 시스템 레이어에서 native-resolution packing과 FlashAttention var-len, per-sample 2D RoPE의 결합은 다양한 종횡비와 해상도를 하나의 패킹된 포워드로 처리하게 하여 패딩과 버킷 양자화의 필요성을 없앴다. 이로 인해 메모리 사용과 연산 낭비가 감소하고 학습 속도가 개선되며 CFG 분기를 통합해 추론 효율도 증가했다. 이러한 종합 최적화는 실무 환경에서 학습·추론 비용을 함께 낮춘다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GenEval | score | 0.90 | vs FLUX.2: 0.87 (open-source 비교) |
| CVTG-2K | score | 0.887 | — |
| LongText-EN | score | 0.944 | — |
| Mage-Flow-Turbo latency | time_per_image | 0.59 s/image @ 1024^2 on single A100 | — |
| Mage-Flow-Edit-Turbo latency | time_per_edit | 1.02 s/edit @ 1024^2 on single A100 | — |
| Mage-Flow-Base ImgEdit | score | 4.28 | — |
| Mage-Flow-Edit GEdit-EN | score | 8.127 | — |
이미지 분석



415
Likes
2k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.