용어 해설
- 시각 인스턴스 프롬프트 분할(VIP-Seg)
- — 특정 평면 촬영(예: flatlay) 의상 이미지를 시각적 프롬프트로 주었을 때, 동일한 개체를 인물 사진에서 정확히 분할하는 과업이다. 이 과업은 범주 수준 분할과 달리 동일 범주 내에서 특정 인스턴스를 구별해야 하며, 층층 착용·부분 가려짐·비강체 변형 상황을 다루는 점이 핵심이다.
- 마스크 조건화(Mask-Conditioning)
- — 생성 모델의 입력으로 원본 이미지와 함께 해당 영역의 마스크를 잠재 표현 차원에서 결합하는 기법이다. 본문에서는 VAE 잠재의 채널 차원에 마스크 잠재를 채널 합쳐넣어(H×W 격자는 유지) 공간적 제어를 구현했다. 이렇게 하면 어텐션 비용 증가 없이 픽셀 단위 배치·핏 제어가 가능하다.
- 플로우 매칭(Flow-Matching)
- — 확률적 생성과정에서 시간별 잠재의 속도장(velocity field)을 학습하는 손실 프레임워크이다. 논문에서는 DiT 기반 편집 모델의 속도장을 고정 가중치 모델 위에 LoRA로 조정하여 목표 잠재와의 차이를 최소화하는 방식으로 학습을 진행했다. 이 방식은 표준 확산(denoising)과 유사한 목적을 갖되 속도장 예측을 직접 최적화한다.
- LoRA(저순위 적응)(LoRA)
- — 기존 대형 모델의 일부 선형 투영에 저순위 보정 행렬만 학습해 파라미터 효율적으로 적응시키는 기법이다. 본문에서는 편집용 DiT의 블록에 LoRA 어댑터를 붙여 마스크 조건화를 학습하고 기본 가중치는 고정했다. 이로써 전체 모델을 재학습하지 않고도 공간 제어 능력을 추가할 수 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.








