용어 해설
- Diffusion Transformer(Diffusion Transformer (DiT))
- — Diffusion Transformer(DiT)는 확산모델의 노이즈 제거 과정을 Transformer 블록으로 구현한 모델 군으로, 시간 조건과 이미지 잠재벡터를 입력으로 받아 중간 잠재를 복원하는 데 적합하다. 본 논문에서는 DiT를 고정된 백본으로 사용하고 외부에서 추출한 편집 조건을 연결해 구조적 리터칭을 수행한다. DiT는 시각적 컨텍스트를 보존한 채 세밀한 구조 변경을 적용할 수 있어 본 과제에 핵심적이다.
- MAE(Masked Autoencoder)(MAE)
- — MAE는 입력 이미지의 일부 패치를 마스킹하고 비어 있는 픽셀을 디코더로 재구성하는 자기지도 학습 방식으로, 패치 수준의 지역 구조와 기하학 정보를 보존하는 특징을 학습한다. 본 논문에서는 MAE를 고정시켜 R-Former의 입력 특성으로 사용하며 미세한 리터칭 차이를 포착하는 기초 표현을 제공한다. MAE의 지역성 특성은 매우 섬세한 구조 편집을 구별하는 데 유리하다.
- Self-Augmentation(자기 증강)(Self-Augmentation)
- — Self-Augmentation은 동일한 랜덤 공간 변환을 원-후(전/후) 예제 쌍에 동시에 적용해 편집 연산의 정렬성은 유지하되 절대 픽셀 좌표 결합을 깨는 데이터 구성 기법이다. 이 방법은 동일 신원의 쿼리 생성으로 인한 좌표 복사 숏컷을 방지하고 교차 신원 쌍의 정렬 불일치 문제를 우회한다. 결과적으로 학습 난이도를 낮추고 교차 신원 전이 일반화를 촉진한다.
- R-Former
- — R-Former는 MAE로부터 추출된 패치 특성에 학습 가능한 쿼리 토큰을 결합해 예제의 전후 차이를 편집 연산 임베딩으로 변환하는 Transformer 기반 모듈이다. 쿼리 토큰은 self-attention을 통해 이미지 특성과 상호작용하며 미세한 구조적 변화 방향을 압축된 벡터로 캡처한다. 이 모듈의 출력(𝐇_edit)은 이후 connector를 통해 DiT의 조건 공간으로 맵핑된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






