microsoft/Mage-Flow-Edit-Turbo
Mage-Flow 스택의 편집 특화 4스텝 Turbo 변형으로 A100에서 1024² 기준 약 1.02초에 지시 기반 이미지 편집을 수행한다.
학습 방식 · Mage-VAE 잠재공간에서 NR-MMDiT(4B)를 rectified flow matching으로 학습한 뒤 Diffusion-NFT 정렬, decoupled-DMD+적대적 지각 손실 증류를 거쳐 4스텝 Turbo 편집 모델을 만들었고, 생성·편집 데이터를 혼합해 후속 학습했다.
TL;DR
Mage-Flow-Edit-Turbo는 Mage-Flow 스택(Mage-VAE 토크나이저 + NR-MMDiT 4B)의 편집 특화 4스텝 증류판으로, decoupled-DMD와 적대적 지각 안내로 추론 단계를 4로 줄여 A100에서 1024² 기준 약 1.02초의 편집 지연과 18~20GB의 피크 메모리를 기록했다. 학습은 Mage-VAE 잠재공간에서 rectified flow matching으로 생성·편집 사전을 함께 학습하고 Diffusion-NFT로 정렬한 뒤 증류하는 순서를 따라, 텍스트와 참조 이미지를 함께 조건으로 받아 배경 교체·객체 추가/제거·재질 변경 등 구조 보존형 편집을 수행한다. 512~2048 해상도를 네이티브로 처리하고 다국어 텍스트 렌더링도 다루지만, 실행에는 flash-attn 빌드와 CUDA 버전 호환이 요구된다. 빠른 반복이 필요한 대화형 이미지 편집 프로토타입이나 라이트급 서비스에 적합하다.
핵심 포인트
- 4스텝 증류로 A100 1024² 기준 약 1.02초/편집, 피크 메모리 18~20GB의 대화형 지연을 달성했다.
- 텍스트와 하나 이상의 참조 이미지를 함께 받아 배경 교체·객체 추가/제거·재질 변경 같은 구조 보존형 편집을 수행한다.
- 생성 전용 Base 모델과 같은 Mage-VAE+NR-MMDiT 스택을 공유해 생성 사전(prior)을 유지한 채 편집 능력을 얻었다.
제한사항
- 실행에 flash-attn 빌드와 torch/CUDA 버전 호환이 필요하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| 편집 지연 | 초/이미지 (A100, 1024²) | 1.02 | — |
109
LIKES
1.3k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.