본문으로 건너뛰기

Moebius: 0.2B 파라미터의 경량 이미지 인페인팅 프레임워크로 10B급 성능 달성

대규모 10B급 일반ist와 소형 전문 네트워크 간의 성능 격차를 줄이려는 시도다. Moebius는 Local-λλ Mix Interaction(LλMI) 블록과 어댑티브 멀티-그레이네르(distillation)을 결합해 극단적 축소에도 고해상도 텍스처와 시맨틱 지식을 유지한다. 0.22B 파라미터로 10B급 품질에 근접하거나 이를 능가하며, 단일 스텝 추론에서 FLUX.1-Fill-Dev 대비 >15× 총 추론 시간 가속을 달성한다.

왜 중요한가

대규모 10B급 일반ist와 소형 전문 네트워크 간의 성능 격차를 줄이려는 시도다. Moebius는 Local-λλ Mix Interaction(LλMI) 블록과 어댑티브 멀티-그레이네르(distillation)을 결합해 극단적 축소에도 고해상도 텍스처와 시맨틱 지식을 유지한다. 0.22B 파라미터로 10B급 품질에 근접하거나 이를 능가하며, 단일 스텝 추론에서 FLUX.1-Fill-Dev 대비 >15× 총 추론 시간 가속을 달성한다.

핵심 기여

LλMI 블록 및 Moebius 아키텍처

Local-λλ과 Interactive-λλ 모듈로 구성된 LλMI 블록은 Local-λλ이 Self-Attention에 상응하는 로컬 맥락 요약을, Interactive-λλ가 LCG Latent Priors와의 Cross-Interaction을 선형-복잡도에서 구현한다. DWConv와 Mix-FFN의 결합으로 극단적 축소가 가능하고, 이들 모듈은 고정 크기 선형 행렬로 정보를 집계하여 다수의 Latent Representations를 효과적으로 결합한다.

Adaptive Multi-Granularity Distillation

Latent 공간에서 교차-그래뉼러(distillation)를 수행하는 KD 손실들을 Coarse(KD_C), Fine(KD_FD), Perceptual(LPIPS 기반)로 구성하고, 최적의 가중치를 각 그래뉼러의 gradient norm에 기반해 동적으로 조정한다. 이를 통해 극단적 구조 축소에서도 Teacher-PixelHacker의 시맨틱 지원과 텍스처 일치를 유지한다.

극단적 축소 vs. 성능의 균형

Moebius는 파라미터 수 0.22B, FLOPs 0.154T로 축소하면서 Places2 및 CelebA-HQ/FFHQ에서 10B급 일반ist에 근접한 품질을 달성한다. 단일 스텝 latency는 26.01 ms/step로 기록되며, 총 샘플링 스텝을 고려한 속도는 >15× 증가한다.

다양한 벤치마크에서의 실험적 검증

Places2(테스트/대형/소형/256), CelebA-HQ(512), FFHQ(256) 등 natural/portrait 도메인에서 FID와 LPIPS를 보고했다. Moebius는 자연 장면에서 PixelHacker를 제외하면 10B급 산업 SOTA인 FLUX에 근접하거나 이를 능가하며, 포트레이트에서는 10B급 일반 모델들을 압도하는 경향을 보였다.

핵심 아이디어 이해하기

단락 1: 축소된 Backbone에서의 표현력 한계가 생긴다. Lightweight 연산자(DWConv·저_rank FFN 등)로 교체하면 Local-Semantic/Spatial Reasoning에 필요한 상호작용이 손실되어 고해상도 인페인팅 품질이 크게 저하한다. 단락 2: Lλλ 모듈은 Self-Attention의 지역성(local context)과 외부 시맨틱 priors를 고정 크기 행렬로 요약해 연산량을 선형화한다. Local-λλ은 intra-image 컨텍스트를, Interactive-λλ은 LCG 임베딩과 Latent Representations 사이의 상호작용을 담당한다. Cross-attention의 대체를 가능하게 하고, 두 모듈의 합으로 복합 latent 상호작용을 유지한다. 단락 3: Mix-FFN과 DWConv를 통해 극단적 축소를 달성하고, 어댑티브 멀티-그레이너리 디스틸레이션으로 teacher의 시맨틱/텍스처 정보를 latent 공간에서 전달받아 표현력을 회복한다. 결과적으로 0.22B 파라미터의 네트워크가 10B급 모델의 품질에 근접할 수 있다.

관련 Figure

Local-λλ과 Interactive-λλ 모듈의 동작 원리 그림. 고정 크기의 λ 매트릭스로 지역 컨텍스트와 글로벌 프라이어를 요약한다.
Diagram

Latent 공간에서의 상호작용이 어떻게 선형 복잡도로 구현되는지 보여준다. 모델의 효율성 핵심 근거 중 하나이다.

Local-λλ과 Interactive-λλ 모듈의 동작 원리 그림. 고정 크기의 λ 매트릭스로 지역 컨텍스트와 글로벌 프라이어를 요약한다.

방법론

단계1: Latent Diffusion Model(LDM) 프레임워크를 사용하고, VAE 인코더를 통해 원본 이미지(x)와 마스크가 인코딩된 잠재 z를 얻는다. LCG(Latent Categories Guidance) 임베딩을 도입해 전이적 시맨틱 프라이어를 cross-attention으로 Denosing 네트워크에 주입한다. 단계2: Local-λλ 모듈은 입력 특징 Xl에서 Ql, Kl, Vl을 1×1 컨볼루션으로 얻고, λc와 λp를 통해 fixed-size 행렬로 구성한 뒤 Ql과 곱해 출력을 얻는다. 단계3: Interactive-λλ 모듈은 Xi를 Qi로, ELCG를 Ki, Vi로 변환하고, Epos를 이용해 위치 정보를 보강한 λi_p를 통해 최종 Y i를 얻는다. 단계4: Mix-FFN과 DWConv를 통해 파라미터를 더 줄인다. 단계5: Moebius denoising U-Net를 0.22B 파라미터로 구성하고, 16GPU에서 138K iterations의 latent distillation을 수행한다. 단계6: Adaptive gradient-based balance로 coarse/fin e granularity 손실 및 perceptual 손실의 가중치를 각 스텝에서 동적으로 조정한다. 입력 → Local-λλ/I νλ → latent 공간 디스틸레이션 손실 → 최종 출력 xout.

관련 Figure

Moebius 아키텍처 개요 도식. Local-λλ, Interactive-λλ, Mix-FFN으로 구성된 LλMI 블록이 Latent Diffusion U-Net에 통합되는 그림.
Diagram

아키텍처 구성 요소 간의 관계를 시각적으로 보여주며, LλMI가 어떤 방식으로 계산을 대체하는지 설명한다.

Moebius 아키텍처 개요 도식. Local-λλ, Interactive-λλ, Mix-FFN으로 구성된 LλMI 블록이 Latent Diffusion U-Net에 통합되는 그림.

LλMI 블록의 구성 예시 및 Latent 영역에서의 교차-참조 흐름. Local-λλ 및 Mix-FFN의 상호작용을 시각화.
Diagram

극단적 압축에서 표현력을 유지하는 기제의 구체적 구현 방식을 시각적으로 확인할 수 있다.

LλMI 블록의 구성 예시 및 Latent 영역에서의 교차-참조 흐름. Local-λλ 및 Mix-FFN의 상호작용을 시각화.

주요 결과

주요 벤치마크에서 Moebius는 Places2(테스트)에서 0.92 FID, 0.091 LPIPS를 기록하며 Latency 26.01 ms/step, Param 0.226B, FLOPs 0.154T를 달성한다. 이는 10B급 산업 SOTA인 FLUX.1-Fill-Dev(11.9B) 대비 총 추론 시간에서 >15× 빠름을 의미한다. Places2(대형/소형/256)에서의 성능은 각각 0.92/0.91/0.90 수준의 FID, 0.090/0.089/0.085 수준의 LPIPS를 보이며, FFHQ(256)에서 8.15 FID, 0.231 LPIPS, CelebA-HQ(512)에서 5.39 FID, 0.122 LPIPS를 달성한다. Portrait 도메인에서의 성능은 CelebA-HQ 5.39/0.122, FFHQ 8.15/0.231로, 10B급 일반 모델을 대체하거나 능가한다. Ablation 연구에서 Lλλ, Iλλ, DWConv, Mix-FFN의 결합이 단순 모듈 치환보다 효과적임이 확인되었다. LλMI 블록의 3.2.3 단계에서의 구성은 0.22B/0.154T에서 최적의 구조적 시너지를 이룬다. Real-World 물체 제거 실험에서 Moebius는 구조적 혼란, 색 차이, 블러링 등의 일반 진입에서 더 일관된 결과를 보인다. 평가 체계: 주관적 사용자 연구에서도 Moebius가 관찰자 선호도에서 Teacher PixelHacker와 유사한 성능을 보였고, 10B급 대형 일반 모델 대비 우수한 점수를 얻었다.

관련 Figure

실제 비교 결과 이미지. Places2/Natural과 CelebA-HQ/FFHQ에서 Moebius의 예시 이미지와 다른 방법들 간의 차이를 보여준다.
Photo

Moebius의 시각적 품질과 텍스처 재현력이 대체로 우수함을 보강한다.

실제 비교 결과 이미지. Places2/Natural과 CelebA-HQ/FFHQ에서 Moebius의 예시 이미지와 다른 방법들 간의 차이를 보여준다.

기술 상세

전반적 아키텍처: Latent Diffusion Model 기반으로, VAE 인코더를 통해 x, xm이 잠재 z로 매핑된다. LCG 임베딩은 대용량 Teacher PixelHacker에서 얻은 시맨틱 priors를 latent 공간 Cross-Attention으로 주입한다. Local-λλ 모듈은 self-attention의 대체로서 fixed-size 행렬 λc, λp를 통해 Q와 결합한다. Interactive-λλ 모듈은 ELCG를 Key/Value로 삼아 Cross-Interaction을 도모한다. DW-Res와 Mix-FFN의 조합으로 파라미터를 축소하고, LλMI 블록으로 표현력을 유지한다. 학습 전략은 어댑티브 멀티-그래뉼러 디스틸레이션으로 Coarse/Fine/Perceptual 손실을 latent space에서 최적화한다. 수학적 표현: Local-λλ의 출력 Yl = Ql λl_c + Ql λl_p; Interactive-λλ의 출력 Yi = Qi λi_c + Qi λi_p; 전체 출력 Xout = Mix-FFN(LN(X2)) + X2. 어댑티브 가중치는 W_F_KD, W_perceptual, W_C_task로 정의되며, 각 손실의 gradient를 기반으로 동적으로 조정한다. 손실 구성: L_out = L_task + W_F_KD·L_F_KD + W_perceptual·L_perceptual; L_total = L_C_KD + W_C_task·L_out. 실험 설정 및 구현 세부사항은 16GPU/ bf16에서 138K iterations, Places2/CelebA-HQ/FFHQ 데이터셋에서 미세조정 실시. 한계: 극단적 축소는 표현력 저하 가능성이 있으며, 학술/산업 대형모델과의 격차를 완전히 제거하지는 않는다.

한계점

극단적 구조 압축으로 인한 표현력 상실 가능성; latent 공간 디스틸레이션의 일반화 한계; 특정 도메인/태스크에서의 최적화가 달라질 수 있음.

실무 활용

Moebius는 edge 디바이스 및 실시간 인페인팅이 필요한 응용에서 고해상도 텍스처 재현과 시맨틱 일치를 유지하면서도 파라미터 수와 추론 비용을 크게 낮춘다. Latent 공간에서의 학습/추론으로 메모리 요구를 절감한다.

  • Real-time object removal in consumer photo/video apps
  • Background completion for mobile photo editing
  • Attribute-preserving portrait restoration on edge devices
  • Content-aware image editing in constrained hardware environments

코드 공개 여부: 공개

코드 저장소 보기

키워드

diffusion(backbone)Local-λλInteractive-λλLCGLatent-diffusiondistillationMix-FFNDWConvlatent-spaceinpainting

용어 해설

Local-λλ
Local-λλ은 공간적인 맥락과 글로벌 시맨틱 프라이어를 고정 크기 선형 행렬로 요약해 Self-Attention과 Cross-Attention의 기능을 근사하는 모듈로, 연산복잡도를 선형화한다.
Interactive-λλ
Interactive-λλ은 외부 시맨틱 프라이어(LCG embeddings)와의 상호작용을 Cross-Attention 없이도 효과적으로 수행하도록 설계된 모듈이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 17.수집 2026. 06. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.