4B로 네이티브 해상도 편집을 가능하게 한 Mage-Flow Edit Turbo
Mage-Flow-Edit-Turbo는 4B 규모의 네이티브 해상도 멀티모달 확산 Transformer로 텍스트 조건의 고해상도 이미지 편집을 4스텝으로 빠르게 수행한다.
TL;DR
Mage-Flow-Edit-Turbo는 Microsoft가 발표한 4B 규모의 네이티브 해상도 멀티모달 확산 스택의 편집 특화 Turbo 변종으로, Mage-VAE의 효율적 one-step latent 토크나이저와 NR-MMDiT의 네이티브 해상도 패킹을 결합해 512–2048 해상도에서 텍스트 조건의 의미적 편집을 지원한다. 학습면에서는 Mage-VAE latent 공간에서 rectified flow matching을 적용하고 Diffusion-NFT로 RL 정렬을 수행한 뒤 decoupled-DMD 기반 증류로 Turbo를 얻어 추론 스텝을 4로 줄였으며, README에 따르면 A100에서 1024² 기준 약 1.02초의 편집 지연과 peak 메모리 약 18–20GB를 기록했다. 이 설계는 VAE 연산 병목을 제거하고 하나의 체크포인트로 다양한 종횡비와 다국어 텍스트 렌더링을 다루는 실용적 장점을 제공하지만, flash-attn 빌드와 CUDA 버전 호환성 같은 환경 의존성과 벤치마크에서의 상대적 우열은 실제 도입 전 검증이 필요한 한계로 남아 있다.
핵심 역량
- Mage-Flow-Edit-Turbo는 텍스트 프롬프트와 하나 이상의 참조 이미지를 함께 입력받아 의미론적 콘텐츠 편집을 수행할 수 있다. 이 모델은 배경 교체, 물체 추가·제거, 재질과 톤 변경 같은 외형 편집을 지원하며 결과물은 입력 해상도에 맞춰 네이티브로 생성된다. 패킹된 배치 처리를 통해 서로 다른 해상도와 시드를 가진 샘플을 하나의 전방 전달로 처리할 수 있다.
- 해당 체크포인트는 4스텝 Turbo 추론 모드에서 빠른 대화형 지연시간을 제공하도록 설계되었다. README의 측정 값 기준으로 A100에서 1024² 해상도 편집 시 약 1.02초의 평균 편집 지연을 기록하며 peak 메모리는 약 18–20GB 수준으로 보고되었다. 이 특성은 실험적 프로토타입이나 라이트급 서비스에서 빠른 반복을 가능하게 한다.
- 텍스트 렌더링과 다국어(영어·중국어) 프롬프트 준수 능력이 편집 및 생성 모두에서 향상되도록 학습 파이프라인이 구성되어 있다. 이 모델은 텍스트-이미지 혼합 토큰을 joint self-attention으로 처리하고 per-sample 2D RoPE를 적용하여 문맥 길이와 해상도 변화에 견고하게 대응한다. 그러므로 긴 텍스트 프롬프트나 다국어 지시를 포함하는 편집에서도 텍스트 일치성과 레이아웃 보존 성능이 유지된다.
- 패킹 기반의 CFG(batch_cfg) 실행을 통해 conditional/unconditional 분기를 한 번의 포워드로 융합하므로 추론 효율성이 높다. 사용자 API는 generate와 edit 두 함수로 제공되며 배치당 서로 다른 heights/widths/seeds를 지정할 수 있어 유연한 워크플로를 지원한다. 또한 vl_cond_long_edge와 같은 편집 전처리 파라미터로 시각-언어 인코더 입력 크기를 제어할 수 있다.
강점
- Mage-Flow는 4B 규모의 단일 스택으로 텍스트→이미지 생성과 지침 기반 이미지 편집을 모두 지원하며 공개된 더 큰 모델들과 비교해 경쟁력 있는 성능을 보인다. README의 벤치마크 표에서는 4B 계열임에도 일부 지표에서 상위권 결과를 보여 동급 대비 효율성과 품질의 균형을 입증하였다. 또한 네이티브 해상도 지원으로 단일 체크포인트로 512에서 2048까지 다양한 출력 크기와 극단적 종횡비를 처리할 수 있다는 점이 실용적 강점으로 제시된다.
- 시스템 수준의 최적화는 학습과 추론 양쪽에서 실질적 이득을 주며, fused CUDA 커널과 패킹 처리로 훈련 스텝 시간을 약 2.5배 단축한 수치를 README에서 제시하고 있다. Turbo 변종은 few-step 증류로 추론 스텝을 4로 줄여 대화형 지연을 달성했고, Edit-Turbo는 A100에서 1024² 기준 약 1.02초 편집 지연을 기록해 실무적 응답성을 확보했다. 메모리 측면에서도 peak 약 18–20GB를 보고하여 대형 모델 대비 낮은 리소스 요구를 내세운다.
훈련 방식
Mage-Flow 스택은 Mage-VAE로 입력 이미지를 효율적 latent로 토크나이즈하고 NR-MMDiT(Native-Resolution Multimodal Diffusion Transformer) 4B 모델을 Mage-VAE latent 공간에서 rectified flow matching으로 학습하여 생성·편집 사전을 공동으로 학습하였다. 이후 Base에서 Diffusion-NFT 정렬을 적용해 prompt 준수·미학·텍스트 렌더링 성능을 개선하고, Turbo는 decoupled-DMD와 adversarial perceptual guidance를 이용해 4스텝으로 증류하여 추론 단계를 크게 줄였다. 편집 모델은 생성과 편집 데이터를 혼합해 훈련하여 생성적 사전(prior)을 유지하면서 편집 지시를 따르도록 구성되었다.
알아두면 좋은 것
- 모델 패밀리는 Base, RL-aligned, 4-step Turbo의 세 변종으로 제공되며 generation과 editing 모두 같은 4B 기반 스택을 공유한다. Turbo는 few-step distilled된 버전으로 추론 단계 수를 4로 줄여서 대화형 지연시간을 현실적으로 낮췄다. 각 체크포인트는 Diffusers 스타일의 리포지토리 구조(transformer/ + vae/ + text_encoder/ + scheduler/)로 제공된다.
- Mage-VAE는 FLUX.2-VAE와 유사한 재구성 품질을 유지하면서 인코딩/디코딩 당 MACs를 각각 약 12배·22배 줄여 고해상도 VAE 처리 비용을 제거했다는 수치적 근거를 제시한다. 이로 인해 VAE가 고해상도 병목이 되지 않고 Native-Resolution 흐름이 가능해졌다. anchor-latent KL은 FLUX.2-VAE latent로의 정규화를 통해 생성 가능한 latent를 확보한다.
- 시스템 레벨 최적화로 FlashAttention var-len, per-sample 2D RoPE, 그리고 fused CUDA 커널을 적용하여 훈련 단계당 시간을 약 1.93초에서 0.78초로 단축하여 약 2.5배 빠른 학습 속도를 달성했다고 보고한다. 또한 CFG의 conditional/ unconditional 브랜치를 하나의 패킹된 포워드로 실행하도록 하여 실질적 연산 절감을 달성했다. 설치 시 flash-attn은 기존 torch 빌드와 nvcc 버전을 맞춰 빌드해야 한다는 주의가 있다.
- 성능 비교 테이블에서 4B 스케일의 Mage-Flow 계열이 더 큰 공개 모델들과 경쟁하거나 우위를 보이는 지표를 제시하며, 이미지 편집 벤치마크에서 Mage-Flow-Edit와 Turbo 변종이 상위권 성능을 기록했다. 다만 벤치마크는 열린 모델 비교 표로서 closed-source 모델도 참고용으로 병기되어 있다. 학습·추론 수치와 벤치마크 표는 README 내부 테이블에 직접 기재되어 있다.
기술적 특징
- 네이티브 해상도 페킹은 각 샘플의 실제 이미지 해상도에 맞춰 텍스트·이미지 토큰을 가변 길이로 묶어 처리하므로 버킷 양자화와 패딩을 제거한다. 이 방식은 하나의 체크포인트가 512에서 2048까지 다양한 출력 크기와 극단적 종횡비(예: 4:1)를 일반화하도록 허용하며, per-sample 2D RoPE를 함께 사용해 위치 인코딩을 각 해상도에 적응시킨다. 결과적으로 모델은 다양한 출력 사이즈를 별도로 재학습하지 않고도 지원할 수 있다.
- Mage-VAE는 한 단계 확산(one-step) 기반의 대칭적 인코더·디코더 설계를 채택하고 anchor-latent KL로 posterior를 FLUX.2-VAE latent에 규제하여 재구성 품질을 유지하면서 인코드/디코드 연산량을 크게 줄인다. README에 따르면 인코드/디코드 MACs가 각각 약 12배·22배 절감되어 고해상도 VAE가 병목이 되는 문제를 해소하였다. 이로 인해 전체 스택의 메모리·연산 효율이 개선되어 4B 모델로도 고품질 결과를 달성할 수 있었다.
- NR-MMDiT는 Qwen3-VL로 텍스트를 인코딩하고 Mage-VAE로 이미지를 인코딩한 뒤 joint self-attention으로 패킹된 가변 길이 시퀀스를 처리하는 4B Multimodal DiT 구조이다. 모델은 CFG의 conditional/unconditional 분기를 하나의 packed forward에서 융합 처리하며 FlashAttention var-len과 fused CUDA 커널을 활용해 학습·추론 효율을 높였다. 이러한 설계는 긴 텍스트와 고해상도 이미지 토큰을 병렬로 처리하면서도 연산과 메모리 비용을 제어하는 데 기여한다.
- 추가로 포스트 트레이닝에서 Diffusion-NFT 기반의 RL 정렬을 통해 프롬프트 준수성과 미학적 선호를 향상시켰고 Turbo 변종에서는 decoupled-DMD와 adversarial perceptual guidance로 소수 스텝으로 증류하여 속도·품질 절충을 최적화했다. 이 파이프라인은 생성과 편집 데이터의 혼합 학습을 통해 편집 작업에서의 구조 보존과 외형 변환 능력을 함께 유지하도록 구성되었다. 학습 인프라 측면에서는 fused-kernel 트레이닝과 per-sample 패킹이 핵심적인 시스템 기여 요소다.
차별점
- Mage-Flow는 4B 모델 규모로 Mage-VAE의 효율적 토크나이저와 NR-MMDiT의 네이티브 해상도 패킹을 결합해 더 큰 모델 없이도 고품질 텍스트→이미지 생성과 지침 기반 편집을 실현한다. 이 설계는 VAE 연산 비용을 크게 줄여 고해상도 처리를 가능하게 했고, 하나의 체크포인트로 다양한 종횡비를 처리하는 점에서 실무적 유연성을 제공한다. 결과적으로 동일한 연산 예산으로도 더 넓은 출력 범위와 상호작용성을 제공하는 것이 차별점이다.
- 시스템 수준 최적화는 학습과 추론의 실제 속도를 개선하여 동일한 하드웨어에서 더 빠른 반복을 가능하게 한다. FlashAttention var-len, per-sample 2D RoPE, 그리고 fused CUDA 커널은 학습 스텝 시간을 약 1.93초에서 0.78초로 낮추는 데 기여했고, Turbo 증류는 추론 스텝을 4로 줄여 응답성을 높였다. 따라서 대화형 편집이나 프로토타입 환경에서 운영 비용과 지연을 동시에 줄이는 점이 경쟁 우위로 작용한다.
- 편집 모델은 생성 사전(prior)을 유지하면서도 다양한 유형의 편집(내용, 외형, 복원, 구조 인지)을 하나의 통일된 모델로 처리하도록 훈련 데이터와 레시피가 구성되어 있다. 이 통합적 접근은 별도 편집 네트워크를 만들지 않고도 다목적 편집 파이프라인을 제공하므로 개발·배포 복잡도를 낮춘다. 또한 텍스트 렌더링과 다국어 프롬프트에 대한 실험적 성능을 강조하여 응용 범위를 넓혔다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Mage-Flow-Edit-Turbo | ImgEdit | 4.38 | — |
| Mage-Flow-Edit-Turbo | GEdit-EN | 8.271 | — |
| Mage-Flow-Edit-Turbo | GEdit-CN | 8.264 | — |
| Mage-Flow-Edit-Turbo | TextEdit-Syn | 12.77 | — |
| Mage-Flow-Edit-Turbo | TextEdit-Real | 15.41 | — |
이미지 분석



109
Likes
1.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.