TL;DR
텍스트-투-이미지 확산 모델은 텍스트 프롬프트에 대한 품질은 높지만 시각적 가이던스를 추론 시점에 유연하게 반영하는 방법이 부족하다. 기존 접근은 파인튜닝이 필요하거나 스타일 전이로 인한 의미 불일치를 초래할 수 있다. Visual Concept Fusion(VCF)은 concept-specific 학습 없이 이미지와 텍스트의 이중 조건 제공을 가능하게 하여 레퍼런스 이미지의 스타일, 구성, 색채를 프롬프트의 내용과 함께 반영한다.
왜 중요한가
텍스트-투-이미지 확산 모델은 텍스트 프롬프트에 대한 품질은 높지만 시각적 가이던스를 추론 시점에 유연하게 반영하는 방법이 부족하다. 기존 접근은 파인튜닝이 필요하거나 스타일 전이로 인한 의미 불일치를 초래할 수 있다. Visual Concept Fusion(VCF)은 concept-specific 학습 없이 이미지와 텍스트의 이중 조건 제공을 가능하게 하여 레퍼런스 이미지의 스타일, 구성, 색채를 프롬프트의 내용과 함께 반영한다.
핵심 기여
Dual conditioning at inference without concept-specific training
이미지와 텍스트 프롬프트를 동시에 인퍼런스 시점에 조합하는 최초의 방법으로, diffusion 모델의 back-bone을 재학습하지 않고 이미지 가이던스를 주입한다.
Lightweight image-aligner
Image tokens를 텍스트 임베딩 공간으로 매핑하는 두-layer MLP aligner를 도입하고 InfoNCE 및 cross-attention reconstruction 손실로 학습한다. 이 ALIGNER는 전체 파라미터 수가 소량으로, diffusion 모델은 동결된 상태로 남는다.
Text–image fusion strategies
Naive fusion, Concatenation fusion, Cross-attention fusion의 세 가지 융합 방법을 비교하고, Concatenation fusion이 텍스트 프롬프트 충실도와 참조 이미지 준수도 사이의 최적 균형을 제공한다.
Test-time Prompt–Noise Optimization (PNO)
참고 이미지를 이용해 생성 과정의 conditioning 토큰과 초기 노이즈를 함께 최적화하여 CLIP 공간에서 참조 이미지와의 유사도를 최대화하는 선택적 테스트 시점 보정 기법을 도입한다.
핵심 아이디어 이해하기
출발점: 텍스트-조건 확산 모델은 텍스트 임베딩 공간에 의존하므로 이미지의 가이드 정보를 직접 주입하면 모달리티 간 분포 차이로 정합이 깨진다. 솔루션의 핵심은 이미지 토큰을 텍스트 임베딩 공간에 매핑하는 경량 aligner를 학습하고, 이를 이미지 토큰으로 확장해 텍스트 토큰과 결합하는 fusion 모듈을 통해 두 모달리티의 의미를 동시에 유지하는 것에 있다. 세부적으로는 (1) 이미지 토큰을 텍스트 공간으로 맵핑하는 aligner(LIne4, LInfoNCE + Lattn)로 전반적 분포 정합을 달성하고, (2) 텍스트-이미지 토큰을 결합하는 세 가지 fusion 전략 중 CONCATENATION이 프롬프트 충실도와 참조 이미지에 대한 반영 간의 최적 균형을 주며, (3) 필요 시 PNO를 통해 초기 노이즈 및 conditioning 토큰을 테스트 타임에 추가로 최적화해 레퍼런스와의 CLIP 유사도를 높인다.
방법론
- 알라이너(이미지-to-텍스트 alignment): SDv2의 CLIP 텍스트 인코더로부터 얻은 T와 CLIP 이미지 인코더로부터 얻은 I를 각각 p_text, p_image로 취한다. 이미지 토큰 ˆI=fϕ(I)로 매핑하는 두-layer MLP를 학습한다. 글로벌 정합도 LInfoNCE = -log(exp(cos(μI, μT)/τ) / sum_j exp(cos(μI, μTj)/τ))를 최소화하고, 로컬 정합도 Lattn= ||T′ − T||^2_2를 최소화한다. Lalign = λ LInfoNCE + Lattn에서 λ=0.2로 설정. 2) Text–Image Fusion: Naive fusion은 ˆI를 전 텍스트 토큰에 평균적으로 주입; Concatenation fusion은 [T; ˆI]를 단순히 SD 입력으로 사용; Cross-attention fusion은 Tfused = Attn(Q=T, K=ˆI, V=ˆI) 후 Tfinal = (1−α)T + α γ Tfused로 결합한다. α은 0.3으로 고정되며 γ는 매 스텝에서 Tfused의 규모를 조정한다. 3) Prompt–Noise Optimization (PNO): LPNO = λreg Lreg(xT) − cos(CLIP(f(xT, Tfinal)), CLIP(xguide))를 사용해 Tfinal과 초기 노이즈 xT를 함께 최적화한다. λreg은 0.1로 설정되며 10–50 gradient_steps를 통해 DDIM 샘플링 전에 수행한다. 4) 학습 설정: aligner는 COCO Captions의 10% 데이터셋으로 학습, 약 60k 이미지-캡션 쌍, 80/10/10 분할, A100에서 약 2시간 소요. DDIM 샘플링은 50 step, 해상도 768×768에서 수행한다.
관련 Figure

이미지-aligner, 텍스트-이미지 fusion 모듈, 및 PNO의 상호작용을 시각적으로 설명한다. methodology(anchor: why_it_matters, methodology)
VCF 파이프라인의 구성요소와 데이터 흐름을 보여주는 다이어그램

Aligner의 손실 구성요소가 결과에 미치는 영향을 시각적으로 보여준다. methodology(anchor: core_intuition)
aligner loss function의 ablation(InfoNCE, Cross-Attention, Both) 비교

Cross-attention fusion의 품질과 노이즈 특성 비교를 통해 Concatenation이 주요 방식으로 채택됨을 보강한다. methodology(anchor: methodology)
Cross-attention fusion의 질적 결과 비교
주요 결과
4.1 실험 설정: Stable Diffusion v2.1(768-ema-pruned), 50 DDIM steps, 768×768 해상도, COCO Captions(10%)로 aligner 학습. 4.2 평가 지표: CLIP Score(텍스트와 이미지의 CLIP 공간 코사인 유사도)와 LPIPS(참조 이미지와의 perceptual 유사도). 4.3 정성적 결과: Naive fusion은 참조 이미지 정보를 일관되게 반영하지 못하고 노이즈가 증가하는 경향이 나타났으나, VCF는 참조 이미지의 스타일·구성 및 색채를 프롬프트의 내용과 함께 반영한다. 4.4 정량적 결과: Table 3에서 SDv2(텍스트-전용) CLIP 0.29, LPIPS 0.78; Naive fusion CLIP 0.28, LPIPS 0.77; VCF(CLIP) 0.27, LPIPS 0.76. 즉, VCF는 참조 이미지에 대한 perceptual 일치를 높이되 프롬프트 충실도는 약간 감소하는 trade-off를 보였다.
관련 Figure

참조 이미지의 스타일/구성 반영이 VCF에서 더 강하게 나타나며 프롬프트 충실도와의 trade-off를 보여준다. results(anchor: results)
참조 이미지 기반의 SDv2, Naive fusion, VCF의 정성적 비교 예시

PNO가 단독으로도 구조적 정합성과 참조 이미지 유사도를 개선함을 보여준다. results(anchor: results)
PNO의 단독 효과 및 VCF와의 결합 시 변화
기술 상세
3단계 구성: (1) Image-to-Text Alignment: 이미지 토큰 ˆI를 텍스트 임베딩 공간으로 맵핑하는 aligner를 두-layer MLP로 학습하고 LInfoNCE + Lattn으로 전체 정합을 달성한다. (2) Text–Image Fusion: Naive, Concatenation, Cross-attention의 세 가지 융합 전략 중 Concatenation이 최적의 프롬프트 충실도–참조 반영 균형을 달성한다. (3) Prompt–Noise Optimization: Tfinal와 xT를 동시 최적화해 CLIP(x0, xguide) 유사도를 최대화한다. (4) 데이터 및 파라미터: aligner 파라미터 약 2.4M, COCO Captions 데이터 60k 샘플, 768×768 해상도, 50 steps 샘플링.
한계점
참조 이미지의 어떤 시각 특징이 전이되는지에 대한 세부 제어 메커니즘은 제시되지 않았다. ablation은 COCO 데이터셋과 단일 캡션 설정에서만 수행되었고, SDEdit 등 기존 기준선과의 직접 비교는 제한적이다.
실무 활용
레이퍼런스 이미지를 이용한 시각적 가이드가 필요한 창작 흐름에서 텍스트 프롬프트의 충실도를 유지하면서 참조 이미지의 스타일·구성·색채를 반영하는 생성 결과를 얻을 수 있다.
- 스타일 트랜스퍼와 구성 제어를 동시에 필요로 하는 디자인 프로토타이핑
- 참조 이미지 기반 색채 팔레트와 조명 조건으로 프롬프트의 해석 확산
- 추상적이거나 애매한 프롬프트의 해석을 보정해 시각적 일관성 향상
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- InfoNCE
- — InfoNCE 손실은 다중 샘플 간의 대조를 통해 전체 임베딩 공간의 분포를 정렬하는 목표를 지닌 대조학습 손실이다. 이 논문에서 이미지 토큰의 글로벌 분포를 텍스트 임베딩 공간과 맞추는 목적의 정합에 사용된다.
- CLIP
- — CLIP은 텍스트와 이미지의 임베딩을 대조적으로 학습해 서로 다른 모달리티 간의 매칭 가능성을 높이는 프리트레이닝 모델이다. 본 논문의 정합 평가 및 임베딩 매핑에 활용된다.
- Cross-attention
- — Transformer 구조에서 Q(쿼리)와 K(키), V(값) 간의 어텐션 연산으로 서로 다른 모달리티의 정보를 융합하는 메커니즘이다. VCF의 이미지-토큰 융합에 활용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.