본문으로 건너뛰기

MirrorPPR: 예제 기반 인물 사진 구조적 리터칭

구조적 인물 리터칭은 얼굴과 신체 비율의 미세한 공간적 변경을 요구하여 자연어 지시만으로는 정확한 제어가 어렵다. MirrorPPR은 예제의 전·후 쌍에서 편집 연산을 직접 추출해 쿼리 이미지에 동일한 연산을 적용하므로 언어 기반 접근의 한계를 보완한다. 이 방법은 미세한 구조 수정에서 높은 재현성 및 신원 보존을 동시에 만족시켜 실제 리터칭 워크플로에 응용 가능성을 제공한다.

용어 해설

Diffusion Transformer(Diffusion Transformer (DiT))
Diffusion Transformer(DiT)는 확산모델의 노이즈 제거 과정을 Transformer 블록으로 구현한 모델 군으로, 시간 조건과 이미지 잠재벡터를 입력으로 받아 중간 잠재를 복원하는 데 적합하다. 본 논문에서는 DiT를 고정된 백본으로 사용하고 외부에서 추출한 편집 조건을 연결해 구조적 리터칭을 수행한다. DiT는 시각적 컨텍스트를 보존한 채 세밀한 구조 변경을 적용할 수 있어 본 과제에 핵심적이다.
MAE(Masked Autoencoder)(MAE)
MAE는 입력 이미지의 일부 패치를 마스킹하고 비어 있는 픽셀을 디코더로 재구성하는 자기지도 학습 방식으로, 패치 수준의 지역 구조와 기하학 정보를 보존하는 특징을 학습한다. 본 논문에서는 MAE를 고정시켜 R-Former의 입력 특성으로 사용하며 미세한 리터칭 차이를 포착하는 기초 표현을 제공한다. MAE의 지역성 특성은 매우 섬세한 구조 편집을 구별하는 데 유리하다.
Self-Augmentation(자기 증강)(Self-Augmentation)
Self-Augmentation은 동일한 랜덤 공간 변환을 원-후(전/후) 예제 쌍에 동시에 적용해 편집 연산의 정렬성은 유지하되 절대 픽셀 좌표 결합을 깨는 데이터 구성 기법이다. 이 방법은 동일 신원의 쿼리 생성으로 인한 좌표 복사 숏컷을 방지하고 교차 신원 쌍의 정렬 불일치 문제를 우회한다. 결과적으로 학습 난이도를 낮추고 교차 신원 전이 일반화를 촉진한다.
R-Former
R-Former는 MAE로부터 추출된 패치 특성에 학습 가능한 쿼리 토큰을 결합해 예제의 전후 차이를 편집 연산 임베딩으로 변환하는 Transformer 기반 모듈이다. 쿼리 토큰은 self-attention을 통해 이미지 특성과 상호작용하며 미세한 구조적 변화 방향을 압축된 벡터로 캡처한다. 이 모듈의 출력(𝐇_edit)은 이후 connector를 통해 DiT의 조건 공간으로 맵핑된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 28.수집 2026. 07. 01.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.