본문으로 건너뛰기

MMFace-DiT: 고충실도 멀티모달 얼굴 생성을 위한 이중 스트림 확산 트랜스포머

텍스트 프롬프트만으로는 얼굴의 미세한 구조나 배치를 정밀하게 제어하기 어렵다는 기존 생성 모델의 한계를 극복했다. 별도의 보조 모듈 없이 하나의 통합된 모델로 마스크와 스케치 등 다양한 공간 정보를 텍스트와 결합하여 실제 사진 같은 얼굴 합성을 가능하게 한다.

용어 해설

확산 트랜스포머(Diffusion Transformer)
기존의 U-Net 구조 대신 Transformer 아키텍처를 확산 모델의 백본으로 사용하는 방식이다. 데이터의 패치 단위 처리를 통해 확장성이 뛰어나며 고해상도 이미지 생성에서 더 높은 품질을 제공한다.
회전 위치 임베딩(RoPE)
토큰의 위치 정보를 벡터의 회전 각도로 인코딩하는 기법이다. 상대적인 위치 관계를 보존하는 데 유리하며, 이미지의 2D 구조와 텍스트의 1D 구조를 하나의 어텐션 메커니즘 안에서 효과적으로 결합할 수 있게 한다.
잠재 확산 모델(Latent Diffusion)
고해상도 픽셀 공간이 아닌 VAE를 통해 압축된 저차원 잠재 공간에서 확산 과정을 수행하는 방식이다. 연산 효율성을 극대화하면서도 고품질의 시각적 세부 사항을 유지할 수 있다.
플로우 매칭(Flow Matching)
노이즈에서 데이터로 가는 경로를 직선적인 속도 벡터(Velocity)로 학습하는 생성 모델링 기법이다. 기존 확산 모델보다 학습이 안정적이고 더 적은 단계의 추론으로도 고품질 이미지를 생성할 수 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 31.수집 2026. 04. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.