왜 중요한가
패션 이미지 검색은 이미지/텍스트/비디오 등 다양한 입력 형식과 서로 다른 검색 의도를 포괄하는 다중 태스크 문제이다. 기존 방법은 태스크 간 간섭으로 임베딩 공간의 해석이 손상되며, 데이터 규모의 불균형으로 일부 태스크가 과소 최적화된다. FashionLens는 MLLM 백본, PGSQC, GGAS를 통해 태스크 간 상호작용으로 인한 성능 저하를 줄이고, unseen 태스크까지 일반화된 성능을 달성한다.
핵심 기여
U-FIRE 벤치마크 구축
15개 데이터셋을 9개 패션 검색 태스크로 통합하고, OOD 평가를 위한 2개 unseen 태스크를 추가한 표준화된 벤치마크를 제시한다.
FashionLens 제안
MLLM 백본 기반의 다중 입력 형식을 지원하는 프레임워크로, PGSQC를 통해 의도-정렬을 위한 임베딩 간 노이즈를 줄이고 태스크 특이성을 강조한다.
GGAS 제안
Gradient 정보를 활용한 Adaptive 샘플링으로 학습 난이도 차이를 보정하고 데이터 규모를 반영한 재가중치를 통해 다중 태스크 학습의 안정성과 성능을 향상시킨다.
핵심 아이디어 이해하기
출발점은 다중 태스크 학습에서 태스크 간 의도 차이가 임베딩 공간에 음의 전달(negative transfer)을 유발하는 현상이다. FashionLens는 q0를 기반으로 의도-지향적 프로포절 qp를 도출하고, adaptive Slerp으로 q0를 qp로 회전시켜 태스크-aligned metric space로 조정한다. GGAS는 각 태스크의 학습 난이도를 실시간으로 측정해 gradient norms를 기준으로 샘플링 확률을 재조정하고, 데이터 규모를 보정해 데이터 불균형의 영향을 완화한다. 이 두 구성요소의 결합으로, 일반화 가능한 태스크-적응형 검색 성능이 달성된다.
관련 Figure

λ의 데이터 규모에 따른 차이와 adaptiveness를 시각화하여 필요성 및 역할을 보강한다.
λ 분포의 추적: adaptive Slerp의 가중치 분포
방법론
아키텍처: MLLM 백본에 두 개의 학습 토큰 [RETq], [RETt]를 추가하고, 쿼리 q0과 타깃 t를 각각 얻어 q0, t를 unit hypersphere에 정규화한다. Loss 구성: Lret(InfoNCE) + β1Lortho + β2Lreg으로 최적화한다. 1) PGSQC: A∈R^{D×d}, B∈R^{d×D를 이용해 qp = Norm(q0 + q0AB)로 계산하고, q = Slerp(q0, qp, λ(q0))로 최종 쿼리 표현을 얻는다. 2) GGAS: L_k(t)에서 RETq/RETt의 gradient를 이용해 d^{(t)}_k를 계산하고 EMA로 G^{(t)}_k를 업데이트한다. S^{(t)}_k = exp(G^{(t)}_k/η + γ log N_k)로 샘플링 확률을 결정하고, 배치 단위로 상위 k^{*}를 샘플링한다. 3) 학습 세부: Qwen3-VL-4B를 백본으로 사용하고, LoRA rank=8, learning rate=1e-4, 5 에폭, 배치 64, GradCache 사용.
관련 Figure

데이터 분포와 태스크 구성이 다중 태스크 학습에 적합하게 설계되었음을 시사한다.
U-FIRE training data의 분포 및 태스크 구성을 도식화한 그림

OOD 평가를 구성하는 방식과 새로운 태스크의 도메인 차이를 보여준다.
Unseen Task 10/11의 구성 예시: Street+Modification Text→Shop, Image(s)+Text→Compatible Item
![FashionLens 아키텍처: Q0, qp, [RETq], [RETt], PGSQC, GGAS를 포함하는 흐름도](/api/image-proxy?url=https%3A%2F%2Farxiv.org%2Fhtml%2F2605.22552v1%2Fx3.png&articleId=59930)
PGSQC와 GGAS의 작동 원리를 시각적으로 요약하며 핵심 구성요소를 보강한다.
FashionLens 아키텍처: Q0, qp, [RETq], [RETt], PGSQC, GGAS를 포함하는 흐름도
주요 결과
주요 벤치마크 결과에서 FashionLens는 대부분의 태스크에서 최상위를 차지했다. Task 10 Street+Modification Text→Shop에서 mR=66.27, Task 11 Image(s)+Text→Compatible Item에서 mR=77.70를 달성했고, Commonly Supported 평균은 51.24, All 데이터셋 평균은 52.21이다. Ablation 연구에서 GGAS 도입으로 기존 대비 큰 개선이 나타났고, Ours q(Slerp) GGAS에서 평균 mR=50.01을 기록했다. GGAS의 영향은 Table III의 #2에서 확인 가능하다.
관련 Figure

GGAS, PGSQC의 효과와 각 구성의 성능 차이를 정량적으로 제시한다.
Table III Ablation 결과: 구성 간 평균 성능 비교
기술 상세
아키텍처: MLLM 기반의 쿼리/타깃 인코딩, [RETq], [RETt] 토큰을 도입하고 q0, t를 구한다. qp는 q0 + q0AB를 Norm한 뒤, adaptive Slerp으로 q를 얻는다. A, B, λ은 q0에 condition된 MLP로 예측된다. 제약으로 A에 직교성 제약 Lortho와 Lreg(Frobenius) 제약을 적용한다. GGAS는 RET 토큰의 gradient를 이용해 각 태스크의 difficulty d^{(t)}_k를 계산하고 EMA로 G^{(t)}_k를 갱신한다. 샘플링 확률은 S^{(t)}_k = exp(G^{(t)}_k/η + γ log N_k)로 정의하고, P^{(t)}_k를 정규화한다. 배치 샘플링은 k^{*} = argmax P^{(t)}_k로 결정된다. 손실은 L = Lret + β1Lortho + β2Lreg.
실무 활용
패션 이커머스에서 다양한 입력과 의도를 하나의 프레임워크로 처리해 검색 품질을 높이며, unseen 태스크에 대한 일반화도 강건하게 수행한다.
- 다양한 입력 포맷(image/text/video)을 동시에 처리하는 패션 검색 엔진
- 의도-지향적 검색(유사성/호환성/속성 매칭)을 하나의 시스템에서 지원
- OOD 일반화 평가 및 개선 방안으로 사용
- 대규모 멀티태스크 학습 파이프라인의 관리 및 최적화
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- U-FIRE 벤치마크(U-FIRE)
- — U-FIRE 벤치마크는 15개 데이터셋을 9개 패션 검색 태스크로 통합하고, OOD 평가를 위한 2개 unseen 태스크를 추가한 패션 도메인 데이터집합이다. 다양한 입력 포맷과 검색 의도를 포함하는 표준화된 학습/평가 프레임워크를 제공한다.
- Proposal-Guided 구면 쿼리 보정기(Proposal-Guided Spherical Query Calibrator)
- — 쿼리 표현의 의도-지향적 보정을 위한 프로포절(proposal) 방향을 도출하고, q0와 qp 사이에서 adaptive Slerp를 적용해 태스크-정렬된 임베딩으로 회전시킨다.
- Gradient-Guided Adaptive Sampling
- — 각 태스크의 학습 난이도를 gradient_norm으로 추정하고, 데이터 규모를 보정해 샘플링 확률을 동적으로 재조정하는 샘플링 전략이다.
- LoRA
- — 저랭크 어댑터를 통해 전체 가중치가 아닌 두 개의 저랭크 행렬만 학습시키는 파인튜닝 기법으로, 파라미터 수를 크게 줄여 학습을 효율화한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.