왜 중요한가
대규모 10B급 일반ist와 소형 전문 네트워크 간의 성능 격차를 줄이려는 시도다. Moebius는 Local-λλ Mix Interaction(LλMI) 블록과 어댑티브 멀티-그레이네르(distillation)을 결합해 극단적 축소에도 고해상도 텍스처와 시맨틱 지식을 유지한다. 0.22B 파라미터로 10B급 품질에 근접하거나 이를 능가하며, 단일 스텝 추론에서 FLUX.1-Fill-Dev 대비 >15× 총 추론 시간 가속을 달성한다.
핵심 기여
LλMI 블록 및 Moebius 아키텍처
Local-λλ과 Interactive-λλ 모듈로 구성된 LλMI 블록은 Local-λλ이 Self-Attention에 상응하는 로컬 맥락 요약을, Interactive-λλ가 LCG Latent Priors와의 Cross-Interaction을 선형-복잡도에서 구현한다. DWConv와 Mix-FFN의 결합으로 극단적 축소가 가능하고, 이들 모듈은 고정 크기 선형 행렬로 정보를 집계하여 다수의 Latent Representations를 효과적으로 결합한다.
Adaptive Multi-Granularity Distillation
Latent 공간에서 교차-그래뉼러(distillation)를 수행하는 KD 손실들을 Coarse(KD_C), Fine(KD_FD), Perceptual(LPIPS 기반)로 구성하고, 최적의 가중치를 각 그래뉼러의 gradient norm에 기반해 동적으로 조정한다. 이를 통해 극단적 구조 축소에서도 Teacher-PixelHacker의 시맨틱 지원과 텍스처 일치를 유지한다.
극단적 축소 vs. 성능의 균형
Moebius는 파라미터 수 0.22B, FLOPs 0.154T로 축소하면서 Places2 및 CelebA-HQ/FFHQ에서 10B급 일반ist에 근접한 품질을 달성한다. 단일 스텝 latency는 26.01 ms/step로 기록되며, 총 샘플링 스텝을 고려한 속도는 >15× 증가한다.
다양한 벤치마크에서의 실험적 검증
Places2(테스트/대형/소형/256), CelebA-HQ(512), FFHQ(256) 등 natural/portrait 도메인에서 FID와 LPIPS를 보고했다. Moebius는 자연 장면에서 PixelHacker를 제외하면 10B급 산업 SOTA인 FLUX에 근접하거나 이를 능가하며, 포트레이트에서는 10B급 일반 모델들을 압도하는 경향을 보였다.
핵심 아이디어 이해하기
단락 1: 축소된 Backbone에서의 표현력 한계가 생긴다. Lightweight 연산자(DWConv·저_rank FFN 등)로 교체하면 Local-Semantic/Spatial Reasoning에 필요한 상호작용이 손실되어 고해상도 인페인팅 품질이 크게 저하한다. 단락 2: Lλλ 모듈은 Self-Attention의 지역성(local context)과 외부 시맨틱 priors를 고정 크기 행렬로 요약해 연산량을 선형화한다. Local-λλ은 intra-image 컨텍스트를, Interactive-λλ은 LCG 임베딩과 Latent Representations 사이의 상호작용을 담당한다. Cross-attention의 대체를 가능하게 하고, 두 모듈의 합으로 복합 latent 상호작용을 유지한다. 단락 3: Mix-FFN과 DWConv를 통해 극단적 축소를 달성하고, 어댑티브 멀티-그레이너리 디스틸레이션으로 teacher의 시맨틱/텍스처 정보를 latent 공간에서 전달받아 표현력을 회복한다. 결과적으로 0.22B 파라미터의 네트워크가 10B급 모델의 품질에 근접할 수 있다.
관련 Figure

Latent 공간에서의 상호작용이 어떻게 선형 복잡도로 구현되는지 보여준다. 모델의 효율성 핵심 근거 중 하나이다.
Local-λλ과 Interactive-λλ 모듈의 동작 원리 그림. 고정 크기의 λ 매트릭스로 지역 컨텍스트와 글로벌 프라이어를 요약한다.
방법론
단계1: Latent Diffusion Model(LDM) 프레임워크를 사용하고, VAE 인코더를 통해 원본 이미지(x)와 마스크가 인코딩된 잠재 z를 얻는다. LCG(Latent Categories Guidance) 임베딩을 도입해 전이적 시맨틱 프라이어를 cross-attention으로 Denosing 네트워크에 주입한다. 단계2: Local-λλ 모듈은 입력 특징 Xl에서 Ql, Kl, Vl을 1×1 컨볼루션으로 얻고, λc와 λp를 통해 fixed-size 행렬로 구성한 뒤 Ql과 곱해 출력을 얻는다. 단계3: Interactive-λλ 모듈은 Xi를 Qi로, ELCG를 Ki, Vi로 변환하고, Epos를 이용해 위치 정보를 보강한 λi_p를 통해 최종 Y i를 얻는다. 단계4: Mix-FFN과 DWConv를 통해 파라미터를 더 줄인다. 단계5: Moebius denoising U-Net를 0.22B 파라미터로 구성하고, 16GPU에서 138K iterations의 latent distillation을 수행한다. 단계6: Adaptive gradient-based balance로 coarse/fin e granularity 손실 및 perceptual 손실의 가중치를 각 스텝에서 동적으로 조정한다. 입력 → Local-λλ/I νλ → latent 공간 디스틸레이션 손실 → 최종 출력 xout.
관련 Figure

아키텍처 구성 요소 간의 관계를 시각적으로 보여주며, LλMI가 어떤 방식으로 계산을 대체하는지 설명한다.
Moebius 아키텍처 개요 도식. Local-λλ, Interactive-λλ, Mix-FFN으로 구성된 LλMI 블록이 Latent Diffusion U-Net에 통합되는 그림.

극단적 압축에서 표현력을 유지하는 기제의 구체적 구현 방식을 시각적으로 확인할 수 있다.
LλMI 블록의 구성 예시 및 Latent 영역에서의 교차-참조 흐름. Local-λλ 및 Mix-FFN의 상호작용을 시각화.
주요 결과
주요 벤치마크에서 Moebius는 Places2(테스트)에서 0.92 FID, 0.091 LPIPS를 기록하며 Latency 26.01 ms/step, Param 0.226B, FLOPs 0.154T를 달성한다. 이는 10B급 산업 SOTA인 FLUX.1-Fill-Dev(11.9B) 대비 총 추론 시간에서 >15× 빠름을 의미한다. Places2(대형/소형/256)에서의 성능은 각각 0.92/0.91/0.90 수준의 FID, 0.090/0.089/0.085 수준의 LPIPS를 보이며, FFHQ(256)에서 8.15 FID, 0.231 LPIPS, CelebA-HQ(512)에서 5.39 FID, 0.122 LPIPS를 달성한다. Portrait 도메인에서의 성능은 CelebA-HQ 5.39/0.122, FFHQ 8.15/0.231로, 10B급 일반 모델을 대체하거나 능가한다. Ablation 연구에서 Lλλ, Iλλ, DWConv, Mix-FFN의 결합이 단순 모듈 치환보다 효과적임이 확인되었다. LλMI 블록의 3.2.3 단계에서의 구성은 0.22B/0.154T에서 최적의 구조적 시너지를 이룬다. Real-World 물체 제거 실험에서 Moebius는 구조적 혼란, 색 차이, 블러링 등의 일반 진입에서 더 일관된 결과를 보인다. 평가 체계: 주관적 사용자 연구에서도 Moebius가 관찰자 선호도에서 Teacher PixelHacker와 유사한 성능을 보였고, 10B급 대형 일반 모델 대비 우수한 점수를 얻었다.
관련 Figure

Moebius의 시각적 품질과 텍스처 재현력이 대체로 우수함을 보강한다.
실제 비교 결과 이미지. Places2/Natural과 CelebA-HQ/FFHQ에서 Moebius의 예시 이미지와 다른 방법들 간의 차이를 보여준다.
기술 상세
전반적 아키텍처: Latent Diffusion Model 기반으로, VAE 인코더를 통해 x, xm이 잠재 z로 매핑된다. LCG 임베딩은 대용량 Teacher PixelHacker에서 얻은 시맨틱 priors를 latent 공간 Cross-Attention으로 주입한다. Local-λλ 모듈은 self-attention의 대체로서 fixed-size 행렬 λc, λp를 통해 Q와 결합한다. Interactive-λλ 모듈은 ELCG를 Key/Value로 삼아 Cross-Interaction을 도모한다. DW-Res와 Mix-FFN의 조합으로 파라미터를 축소하고, LλMI 블록으로 표현력을 유지한다. 학습 전략은 어댑티브 멀티-그래뉼러 디스틸레이션으로 Coarse/Fine/Perceptual 손실을 latent space에서 최적화한다. 수학적 표현: Local-λλ의 출력 Yl = Ql λl_c + Ql λl_p; Interactive-λλ의 출력 Yi = Qi λi_c + Qi λi_p; 전체 출력 Xout = Mix-FFN(LN(X2)) + X2. 어댑티브 가중치는 W_F_KD, W_perceptual, W_C_task로 정의되며, 각 손실의 gradient를 기반으로 동적으로 조정한다. 손실 구성: L_out = L_task + W_F_KD·L_F_KD + W_perceptual·L_perceptual; L_total = L_C_KD + W_C_task·L_out. 실험 설정 및 구현 세부사항은 16GPU/ bf16에서 138K iterations, Places2/CelebA-HQ/FFHQ 데이터셋에서 미세조정 실시. 한계: 극단적 축소는 표현력 저하 가능성이 있으며, 학술/산업 대형모델과의 격차를 완전히 제거하지는 않는다.
한계점
극단적 구조 압축으로 인한 표현력 상실 가능성; latent 공간 디스틸레이션의 일반화 한계; 특정 도메인/태스크에서의 최적화가 달라질 수 있음.
실무 활용
Moebius는 edge 디바이스 및 실시간 인페인팅이 필요한 응용에서 고해상도 텍스처 재현과 시맨틱 일치를 유지하면서도 파라미터 수와 추론 비용을 크게 낮춘다. Latent 공간에서의 학습/추론으로 메모리 요구를 절감한다.
- Real-time object removal in consumer photo/video apps
- Background completion for mobile photo editing
- Attribute-preserving portrait restoration on edge devices
- Content-aware image editing in constrained hardware environments
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Local-λλ
- — Local-λλ은 공간적인 맥락과 글로벌 시맨틱 프라이어를 고정 크기 선형 행렬로 요약해 Self-Attention과 Cross-Attention의 기능을 근사하는 모듈로, 연산복잡도를 선형화한다.
- Interactive-λλ
- — Interactive-λλ은 외부 시맨틱 프라이어(LCG embeddings)와의 상호작용을 Cross-Attention 없이도 효과적으로 수행하도록 설계된 모듈이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.