TL;DR
온라인 패션에서 고객이 원하는 의상 착용 방식은 크기, 스타일, 배치와 같은 세부 제어가 필요하나 기존 VTO는 이러한 세부 조작을 제공하지 못했다. 본 연구는 평면 촬영 의상을 참조로 동일한 인스턴스를 인물 사진에서 정확히 분할하는 VIP-Seg 과업을 규정하고 이를 해결하는 VIP-SAM을 제시했다. 그 결과 인스턴스 마스크를 학습 데이터와 추론 파이프라인에 적용해 마스크 기반 픽셀 제어가 가능한 CtrlVTON을 구현함으로써 사용자가 의상의 착용 방식과 위치를 정밀하게 조절할 수 있게 했다.
왜 중요한가
온라인 패션에서 고객이 원하는 의상 착용 방식은 크기, 스타일, 배치와 같은 세부 제어가 필요하나 기존 VTO는 이러한 세부 조작을 제공하지 못했다. 본 연구는 평면 촬영 의상을 참조로 동일한 인스턴스를 인물 사진에서 정확히 분할하는 VIP-Seg 과업을 규정하고 이를 해결하는 VIP-SAM을 제시했다. 그 결과 인스턴스 마스크를 학습 데이터와 추론 파이프라인에 적용해 마스크 기반 픽셀 제어가 가능한 CtrlVTON을 구현함으로써 사용자가 의상의 착용 방식과 위치를 정밀하게 조절할 수 있게 했다.
핵심 기여
VIP-Seg 과업 정의 및 VIP-SAM 모델 제안
특정 평면 촬영 의상을 시각적 프롬프트로 주어 인물 사진에서 동일 인스턴스를 분할하는 VIP-Seg을 정의했고, 쿼리 인코더 내부에 서포트 특징을 주입하는 VIP-SAM을 설계하여 인스턴스 수준 분별력을 확보했다. 모델은 ViT/Hiera 백본과 중간 단계의 cross-attention 어댑터로 구성되어 층층 착용·유사 텍스처 상황에서 성능이 향상되었다.
편집 기반 마스크 제어형 VTO 프레임워크 CtrlVTON
VTO를 이미지 인페인팅 대신 편집 문제로 재구성하고 전체 이미지 조건화와 마스크 조건화를 결합해 픽셀 단위 제어를 달성했다. 베이스 편집 모델은 사전학습된 DiT를 고정하고 LoRA 어댑터로 마스크 입력을 학습해 실시간 마스크 편집으로 스타일·핏·배치 조정이 가능하다.
합성 데이터 파이프라인과 VITON-HD-edit 벤치마크 공개
원본-참조-타깃(p, p_ref, g_ref) 삼중쌍을 합성하는 데이터 생성 절차를 도입했고, VIP-SAM으로 추출한 인스턴스 마스크를 학습에 활용했다. 이 파이프라인으로 VITON-HD-edit를 만들었으며 마스크 제어성과 인스턴스 분할을 동시에 평가할 수 있는 공개 테스트셋을 제공했다.
핵심 아이디어 이해하기
기존 참조 기반 분할 방법은 지원 이미지와 쿼리 이미지를 별도로 인코딩한 뒤 최종 마스크 디코더 수준에서 매칭하는 구조가 많아, 초기 인코딩 단계에서 동일 인스턴스 정보를 반영하지 못하면 층층 착용이나 유사 색상의 교란에 취약했다. 본 논문은 서포트 이미지 특징을 쿼리 인코더의 중간 블록에 주입하여 쿼리의 표현 자체가 참조 인스턴스와 조건화되도록 설계함으로써 이 문제를 해결했다. 이로 인해 마스크 디코더가 아니라 쿼리 표현 단계에서 인스턴스 분별에 필요한 문맥 정보를 이미 반영하게 되어 어려운 케이스에서의 분할 정확도가 개선되었다.
방법론
전체 VTO 파이프라인은 세 단계로 구성된다. 첫째, VIP-SAM은 지원 이미지(평면 의상)와 쿼리 이미지(착용자)를 각각 인코딩하되 쿼리 인코더의 반복 블록들 사이에 cross-attention 어댑터를 삽입해 지원 특징을 주입하고, 최종적으로 학습된 마스크 디코더로 인스턴스 마스크를 생성한다. 둘째, CtrlVTON-base는 사전학습된 DiT 편집기를 고정 가중치로 사용하고 입력으로 참조 인물, 참조 의상, 태스크·의상 클래스 토큰을 받아 편집 결과를 생성하며, 이때 전체 이미지 조건화를 통해 신원·포즈·배경 정보를 유지한다. 셋째, 픽셀 단위 제어를 위해 마스크들을 VAE 잠재 공간에서 채널 단위로 결합하여 각 이미지의 잠재 z_X에 대응하는 z_{M_X}를 채널 결합([z_X ∥ z_{M_X}])으로 입력하고, 이 조건화를 학습 가능한 LoRA 어댑터로만 미세조정하여 마스크에 따른 위치·핏·스타일 제어를 구현했다.
관련 Figure

그림은 VRP-SAM 방식이 지원 특징을 마스크 디코더 수준에서만 결합하는 반면 VIP-SAM은 쿼리 인코더의 블록 사이사이에 어댑터를 넣어 초기 표현 자체를 조건화함을 보여준다. 이 구조적 차이가 층층 착용이나 동일 범주 내 혼동 상황에서의 인스턴스 분별력을 높이는 핵심 메커니즘으로 연결된다.
VIP-SAM과 VRP-SAM 계열의 아키텍처를 비교하는 다이어그램으로서 쿼리 인코더의 중간 단계에 지원 특징을 주입하는 구조를 시각화한다.

그림은 원본 인물 이미지, 합성된 참조 인물, 평면 의상 이미지와 이들에 대응하는 마스크들이 어떻게 조합되어 학습 샘플을 구성하는지를 단계별로 제시한다. 또한 VITON-HD-edit 데이터셋 생성 절차와 자동 선별 과정(후보 생성 → VLM 스크리닝 → 인간 검수)의 흐름을 시각적으로 확인할 수 있다.
학습용 삼중쌍(p, p_ref, g_ref)과 마스크 생성 파이프라인을 예시 이미지로 보여주는 도식이다.

그림은 동일 입력에서 태스크 토큰만 바꿔도 모델이 전부 교체, 부분 교체, 추가 레이어링으로 서로 다른 동작을 수행함을 직관적으로 보여준다. 이는 두 개의 이산 토큰(의상 클래스·작업 토큰)으로 다양한 편집 연산을 통일하는 설계의 실효성을 보완한다.
task token(full_swap, partial_swap, add)에 따른 출력 차이를 예시 이미지로 보여 주는 시각 자료이다.
주요 결과
VIP-SAM은 패션 도메인 및 재평가된 COCO/PASCAL 분할 기준에서 우수한 수치적 성능을 기록했다. 예컨대 VIP-SAM(Hiera-L, DINOv3-H)은 벤치마크에서 mIoU 96.6(97.8계열 표기) 수준을 달성해 기존 VRP-SAM 계열을 능가했다. CtrlVTON-base는 단일 의상 VTO에서 VITON-HD 상의 M-DINO 0.8054, OmniTry Bench에서 M-DINO 0.7282를 기록하며 인페인팅 기반 및 일부 편집 기반 대조군을 상회하거나 경쟁 수준을 유지했다. 마스크 제어성 평가에서는 VITON-HD-edit 기준으로 CtrlVTON이 IoU 0.961, d_Hu 0.0022, d_H 26.05를 달성하여 가장 근접한 공개/상용 편집 모델들(예: FLUX.2 IoU 0.873) 대비 공간 일치성이 크게 개선되었다.
관련 Figure

이미지 비교는 VRP-SAM 계열과 PerSAM, Matcher 등 기존 방법들이 주변 의상이나 신체 일부를 포함하는 실패 사례를 가지는 반면 VIP-SAM은 쿼리 인스턴스만 안정적으로 분리하는 경향을 보인다는 점을 시각화한다. 이 시각 증거는 논문에서 주장하는 중간 단계 특징 주입의 효용과 직접 연결된다.
여러 분할 방법의 질적 비교를 보여주는 그림으로서 VIP-SAM이 동일 인스턴스만 정확히 분할하는 예를 포함한다.

그림은 생성된 마스크와 제어 마스크를 세 가지 상보적 척도로 비교하는 절차를 보여주며 각 지표가 어떤 형태의 불일치를 측정하는지(영역 겹침, 전역 형태, 최악 경계 편차)를 분류한다. 이 도식은 마스크 제어성 평가가 단순 IoU를 넘어 형태·경계 측면까지 고려했음을 근거로 제시한다.
마스크 일치도를 평가하기 위해 IoU, Hu 모멘트 거리, 대칭 하우스도르프 거리 세 가지를 사용하는 평가 지표 도식이다.

그림은 CtrlVTON-base가 참조 의상의 디테일을 유지하면서 인물의 신원·소지품·헤어스타일을 잘 보전하는 특성을 보여준다. 대조군에서는 텍스처 왜곡, 정체성 손실, 마스크 비일치와 같은 실패 유형이 관찰된다.
단일 의상 VTO의 질적 비교 결과로서 여러 방법의 출력 이미지를 나란히 제시한다.

그림은 상용 편집 모델들이 전체적인 의상 충실도는 유지하면서도 입력 제어 마스크와 공간적으로 일치하지 않는 경우가 많음을 보여주며, 반면 CtrlVTON은 높은 IoU와 낮은 모멘트·하우스도르프 값으로 마스크 준수성을 크게 개선했음을 시각적으로 뒷받침한다. 이 비교는 수치적 평가 결과와 일관된 증거를 제공한다.
마스크 기반 제어성 비교 그림으로서 CtrlVTON과 상용 편집 모델들의 출력을 나열하고 각 이미지에 마스크 일치 지표를 표기한다.
기술 상세
아키텍처 전체는 두 축으로 구성된다: 인스턴스 분할을 담당하는 VIP-SAM과 이미지 편집·생성을 담당하는 CtrlVTON이다. VIP-SAM은 SAM/SAM2의 ViT 또는 Hiera 기반 쿼리 인코더를 재사용하되 각 블록 뒤에 교차-어텐션 어댑터를 삽입해 지원 이미지의 특징을 쿼리 표현에 주입하는 구조를 채택했고, 지원 인코더로는 ResNet-50, DINOv2/3 계열을 실험적으로 사용했다. CtrlVTON은 사전학습된 DiT를 고정하고 LoRA 어댑터로만 파라미터를 학습하여 마스크 조건화를 구현했으며, 입력 잠재의 채널 결합([z_X ∥ z_{M_X}]) 방식으로 마스크를 주입해 토큰 격자(H×W)는 유지하면서 채널 차원만 확장했다. 학습은 flow-matching 손실을 사용하여 속도장 예측을 최적화했고, 다중 의상 조건화를 위해 각 의상을 서로 다른 RGB 색상으로 인코딩해 채널 결합 방식으로 동시에 입력하도록 설계했다.
관련 Figure

그림에서는 DiT 기반 편집기 위에 LoRA를 붙여 마스크 채널을 잠재에 채널 결합으로 삽입하는 설계가 시퀀스 흐름으로 표기되어 있다. 이 도식은 마스크 주입이 토큰 그리드 크기에 영향을 주지 않도록 채널 차원에서 확장함으로써 어텐션 비용 증가를 피한 설계 의도를 명확히 전달한다.
CtrlVTON의 전체 모델 구성도를 보여주며 마스크 채널 결합과 LoRA 어댑터 적용 지점을 강조한다.
한계점
다중 의상에 대한 마스크 제어의 공개 벤치가 부재하여 다중 의상 제어 성능은 정성적 결과로만 보고되었다. 합성 참조 인물(p_ref)을 생성하기 위해 상용·비공개 편집 모델들을 사용한 점이 있어 동일한 공개 구성으로 완전 재현하려면 추가 작업이 필요하다. 또한 학습과 평가에서 삼중쌍(p, p_ref, g_ref) 생성 프로세스에 의존하므로 이 데이터 파이프라인 품질이 최종 편집 품질에 직접적인 영향을 미친다.
실무 활용
CtrlVTON은 전자상거래 및 스타일링 툴에서 사용자가 특정 착용 방식과 위치를 정확히 지정할 필요가 있는 사례에 적용 가능하다. 픽셀 단위 마스크 입력으로 단일 의상 교체, 부분 교체, 레이어링과 같은 편집 작업을 통합적으로 수행할 수 있다. VIP-SAM은 참조 기반 자동 마스크 추출을 가능하게 하여 대규모 데이터 파이프라인 자동화에 기여한다.
- 상품 상세 페이지 이미지에 올라온 평면 의상 이미지를 자동으로 인물 이미지에서 분할해 대규모 합성 데이터셋을 생성하는 작업
- 사용자가 마우스로 그리거나 편집한 마스크를 기반으로 의상 착용 방식(예: 셔츠를 속에 집어넣기, 소매 길이 조정)을 세밀하게 제어하는 인터랙티브 편집기
- 여러 의상을 색상별 마스크로 입력해 다중 의상 레이어링을 단일 모델로 처리하는 스타일 조합 툴
코드 공개 여부: 미확인
키워드
용어 해설
- VIP-Seg
- — 특정 평면 촬영(예: flatlay) 의상 이미지를 시각적 프롬프트로 주었을 때, 동일한 개체를 인물 사진에서 정확히 분할하는 과업이다. 이 과업은 범주 수준 분할과 달리 동일 범주 내에서 특정 인스턴스를 구별해야 하며, 층층 착용·부분 가려짐·비강체 변형 상황을 다루는 점이 핵심이다.
- Mask-Conditioning
- — 생성 모델의 입력으로 원본 이미지와 함께 해당 영역의 마스크를 잠재 표현 차원에서 결합하는 기법이다. 본문에서는 VAE 잠재의 채널 차원에 마스크 잠재를 채널 합쳐넣어(H×W 격자는 유지) 공간적 제어를 구현했다. 이렇게 하면 어텐션 비용 증가 없이 픽셀 단위 배치·핏 제어가 가능하다.
- Flow-Matching
- — 확률적 생성과정에서 시간별 잠재의 속도장(velocity field)을 학습하는 손실 프레임워크이다. 논문에서는 DiT 기반 편집 모델의 속도장을 고정 가중치 모델 위에 LoRA로 조정하여 목표 잠재와의 차이를 최소화하는 방식으로 학습을 진행했다. 이 방식은 표준 확산(denoising)과 유사한 목적을 갖되 속도장 예측을 직접 최적화한다.
- LoRA
- — 기존 대형 모델의 일부 선형 투영에 저순위 보정 행렬만 학습해 파라미터 효율적으로 적응시키는 기법이다. 본문에서는 편집용 DiT의 블록에 LoRA 어댑터를 붙여 마스크 조건화를 학습하고 기본 가중치는 고정했다. 이로써 전체 모델을 재학습하지 않고도 공간 제어 능력을 추가할 수 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.