TL;DR
다중 인스턴스 장면에서 기존의 조건부 이미지 생성 기법들은 인스턴스 간 속성 혼동으로 인해 정밀한 제어를 달성하지 못했다. 본 논문은 Vision-Language Model을 활용해 텍스트 내 인스턴스 설명과 시각 조건상의 영역을 자동으로 대응시키는 방법론을 제공해 사람의 수작업 라벨링 없이 세밀한 제어를 가능하게 했다. 라벨이 없는 설정에서도 여러 벤치마크에서 우수한 정밀도와 이미지 품질을 확인했다.
왜 중요한가
다중 인스턴스 장면에서 기존의 조건부 이미지 생성 기법들은 인스턴스 간 속성 혼동으로 인해 정밀한 제어를 달성하지 못했다. 본 논문은 Vision-Language Model을 활용해 텍스트 내 인스턴스 설명과 시각 조건상의 영역을 자동으로 대응시키는 방법론을 제공해 사람의 수작업 라벨링 없이 세밀한 제어를 가능하게 했다. 라벨이 없는 설정에서도 여러 벤치마크에서 우수한 정밀도와 이미지 품질을 확인했다.
핵심 기여
VLM 기반 인스턴스 수준 텍스트-시각 대응 자동화
논문은 Vision-Language Model을 사용해 텍스트 프롬프트에서 인스턴스 설명을 파싱하고 동일한 VLM 파이프라인에서 시각 조건으로부터 인스턴스 마스크를 예측해 (t_i, m_i) 쌍의 인스턴스 레벨 대응을 자동으로 생성했다. 이 대응은 사용자가 별도 인스턴스 라벨을 제공하지 않아도 각 인스턴스의 속성을 특정 공간 영역과 연결하는 근거가 된다. 대응 생성은 이후 생성 과정의 attention 제약으로 바로 활용되어 속성 혼동을 줄이는 핵심 입력이 되었다.
Shared SEG Token으로 다중 구절 참조 일관성 확보
텍스트 내 하나의 인스턴스가 여러 구절로 기술될 때 발생하는 불일치를 완화하기 위해 같은 인스턴스 ID에 속한 여러 <SEG> 토큰 표현을 결합하는 Shared SEG Token 전략을 도입했다. 각 <SEG> 토큰의 최종층 히든을 Concat해 단일 통합 쿼리 표현을 만들고 이를 SAM 디코더로 전달함으로써 동일 인스턴스에 대해 일관된 마스크를 생성했다. 이 전략은 다중 언급 상황에서 마스크 품질과 최종 생성의 텍스트-이미지 정렬을 향상시켰다.
Mask Refinement Module로 예측 마스크의 신뢰도 기반 정제
VLM이 예측한 마스크는 누락, 불완전 영역, 위치 오프셋 등의 노이즈를 포함할 수 있어 단순 강제 적용 시 성능이 떨어졌다. 이를 해결하기 위해 예측 마스크, diffusion 모델의 attention 기반 마스크, 신뢰도 점수, 이미지 잠재 특징을 입력으로 받는 경량 U-Net 기반 Mask Refinement Module을 설계해 정제된 마스크를 생성했다. 정제된 마스크는 신뢰도가 높을 때 원래 예측을 유지하고 신뢰도가 낮을 때 attention 신호를 더 반영하도록 동적으로 조절되어 생성 정확도를 개선했다.
대응 마스크를 어텐션에 통합하는 Correspondence Mask 설계
각 인스턴스의 정제 마스크와 해당 인스턴스 텍스트 토큰 집합을 이용해 이미지-텍스트 토큰 간의 대응 마스크 M을 구성했다. 계산식에서는 어텐션 점수에 log(M)을 더해 M[q,k]가 0에 가까운 경우 해당 토큰 쌍의 어텐션을 사실상 차단하고 M[q,k]가 1이면 기존 어텐션을 유지하도록 처리했다. 이 방식으로 이미지 토큰이 오직 대응되는 텍스트 토큰만 참조하도록 강제해 인스턴스 간 정보 누출을 줄이고 세밀한 속성 제어가 가능하게 했다.
핵심 아이디어 이해하기
기존의 조건부 생성 방법들은 시각 조건(엣지, 깊이 등)과 텍스트 프롬프트를 함께 사용할 때 인스턴스 간 속성 혼동이 자주 발생했다. 이 문제의 근본 원인은 텍스트의 인스턴스 서술을 시각 조건의 특정 공간 영역과 정확히 연결하지 못하는 데 있다. 인간은 텍스트와 이미지를 동시에 볼 때 자연스럽게 인스턴스 수준 대응을 형성하지만 기존 모델은 이를 자동으로 얻지 못했다. 본 논문은 VLM의 교차모달 추론 능력을 활용해 텍스트에서 인스턴스 설명을 파싱하고 SAM 기반 디코더를 통해 시각 조건으로부터 대응 마스크를 예측함으로써 인스턴스 수준 대응을 자동으로 구성했다. 구체적으로 VLM은 텍스트-시각 입력을 받아 고정 형식의 응답을 생성하고 각 구문 끝에 토큰과 인스턴스 ID를 붙이는 방식으로 인스턴스 설명을 구조화했다. 이렇게 얻은 토큰의 히든 표현을 집약해 SAM 디코더의 쿼리로 사용하면 각 인스턴스에 대한 픽셀 수준 마스크가 생성된다. 예측 마스크는 완전하지 않을 수 있으므로 하나의 신뢰 기반 보정 전략이 필요했다. 논문은 예측 마스크의 신뢰도, diffusion 모델의 attention 기반 마스크, 이미지 잠재 표현을 통합하는 Mask Refinement Module을 도입해 정제 마스크를 얻었다. 이 정제 마스크와 해당 인스턴스 텍스트 토큰을 사용해 correspondence mask M을 구성하고 어텐션에 log(M)을 더하면 이미지 토큰이 올바른 텍스트 토큰만 참조하도록 어텐션을 조정할 수 있다. 결과적으로 인스턴스 간 속성 누출이 감소하고, 텍스트-마스크 간 바인딩이 강화되어 세밀한 제어가 가능해진다.
방법론
전체 접근은 두 단계로 구성되어 첫 번째 단계에서 VLM을 이용해 인스턴스 수준 텍스트-시각 대응 𝒞={ (t_i, m_i) }을 구축하고 두 번째 단계에서 이 대응을 생성 모델의 어텐션에 직접 주입해 인스턴스 단위 제어를 달성하는 방식이다. 첫 단계의 핵심은 VLM이 텍스트에서 모든 서술적 명사구를 추출하고 각 구절에 토큰과 인스턴스 ID를 부여해 인스턴스 설명 t_i를 구성하는 것이다. 다수의 구절로 기술된 동일 인스턴스는 Shared SEG Token 전략으로 여러 토큰의 최종층 표현을 Concat해 하나의 통합 쿼리 h_i를 만들고 이를 SAM 디코더에 입력해 픽셀 단위 마스크 m_i^pred를 얻는다. 두 번째 단계에서는 예측된 마스크의 노이즈를 완화하기 위해 Mask Refinement Module(MRM)을 도입했다. MRM은 예측 마스크 m_i^pred, attention 기반 마스크 m_i^att, 신뢰도 s_i^pred, 이미지 잠재 특징 H_img를 입력으로 받고 경량 U-Net 구조 내의 intra/inter-instance attention과 ResNet 블록을 통해 정제 마스크 m_i^rfn을 출력한다. MRM은 s_i^pred가 높을 때 m_i^pred를 우선 유지하고 낮을 때 m_i^att 쪽으로 정합을 이동시키는 동적 동작을 보인다. 정제 마스크를 생성 과정에 통합하기 위해 각 인스턴스 텍스트 토큰 집합 𝒯_i와 이미지 토큰 집합 𝓘_i를 이용해 correspondence mask M을 구성했다. M[q,k]가 m_i^rfn인 경우 해당 이미지 토큰 q가 텍스트 토큰 k에 대해 제한된 어텐션을 갖게 되고 배경 토큰에 대해서는 1을 부여해 기존의 상호작용을 유지한다. 최종적으로 어텐션 계산은 Softmax((QK^T)/√d + log(M))V로 수행되어 관련 없는 어텐션 항을 실질적으로 차단한다.
관련 Figure

다이어그램은 VLM을 통한 텍스트-마스크 생성 파이프라인, Shared SEG Token 흐름, SAM 디코더 연결 및 correspondence mask가 Transformer 어텐션에 통합되는 전체 처리 흐름을 명확하게 보여준다. 이 그림은 방법론의 구조적 요소(Shared SEG Token, MRM, log(M) 적용 등)와 데이터 흐름을 시각적으로 연결해 논문 방법의 작동 원리를 이해하는 데 직접적인 정보를 제공한다.
전체 프레임워크의 두 단계(인스턴스 수준 대응과 인스턴스 인식 생성)를 블록 다이어그램으로 정리한 Fig.2이다.
주요 결과
논문은 MIG-Eval 및 COCO-POS 등 여러 벤치마크에서 비교를 수행했고 대부분의 조건( Canny, Depth, HED )에서 기존 방법보다 우수한 성능을 보였다. 예를 들어 MIG-Eval의 HED 조건에서 InstanceControl은 MIoU 0.8504를 기록해 FLUX ControlNet의 0.6817보다 유의미하게 높은 공간 정렬을 달성했다. 논문은 또한 canny 조건에서 Accuracy와 Local CLIP에서 약 12.3%의 이득을 보고해 라벨 없는 설정에서도 텍스트-영역 정합이 크게 개선됨을 확인했다. 정량적 지표 외에 정성적 실험에서 InstanceControl은 복잡한 인스턴스 중첩 상황에서 속성 혼동을 크게 줄였고, 예측 마스크의 오류가 심할 경우에는 사용자 제공 포인트나 바운딩 박스로 상호작용 보정을 수행해 추가 개선이 가능함을 보였다. Ablation 결과에서는 Shared SEG Token 적용이 MIoU 및 Region-wise 지표를 꾸준히 향상시켰고 Mask Refinement Module이 정제 마스크를 통해 최종 성능을 끌어올리는 핵심 요소로 확인되었다. 실험 설정 세부사항도 공개되어 있어 재현 가능성이 높다. 주요 학습 설정으로는 stage1에서 Sa2VA 기반 파인튜닝에 LoRA rank=256을 적용해 30k step, batch size 64, learning rate 4×10^{-5}로 학습했고 stage2의 생성 파인튜닝은 LoRA로 80k step, batch size 4, 초기 lr 1×10^{-4}를 사용했다. 모든 실험은 4장의 NVIDIA A6000 GPU에서 수행되었다.
관련 Figure

이 그림은 동일한 텍스트-시각 조건에서 FLUX ControlNet이 인스턴스 간 속성 혼동을 일으키는 사례와 InstanceControl이 인스턴스별 속성을 정확히 바인딩한 사례를 나란히 배치해 성능 차이를 직관적으로 드러낸다. 그림 내 빨간 박스는 잘못된 인스턴스를 강조하고 있으며 해당 오류가 correspondence mask로 제어되는 과정과 대비되어 논문의 주장을 보강한다.
다중 인스턴스 장면에서 FLUX ControlNet과 InstanceControl의 정성적 비교를 보여주는 Fig.1이다.

이 그림은 다양한 입력 조건에서 InstanceControl이 인스턴스 속성(색상, 의상 등)을 텍스트에 맞춰 유지하는 결과를 보여주며, 특히 겹침과 복잡한 배치에서도 속성 혼동이 줄어든 점을 강조한다. 여러 샘플을 통해 방법의 범용성을 확인할 수 있으며 정성적 관찰이 정량 지표의 우수성을 보완하는 증거로 작용한다.
다양한 시각 조건(Canny, Depth, HED)과 여러 경쟁 기법과의 정성적 비교를 모아둔 Fig.3이다.
기술 상세
전체 시스템은 두 단계로 구성되며 첫 단계는 VLM 기반의 인스턴스 설명 파싱 및 마스크 예측이고 두 번째 단계는 correspondence mask를 생성 모델의 어텐션에 주입해 제어를 수행하는 구조이다. 첫 단계에서는 Sa2VA 아키텍처를 백본으로 사용하고 VLM의 출력에서 생성된 토큰의 최종층 히든을 MLP로 투영해 SAM 디코더의 쿼리 표현으로 활용했다. 동일 인스턴스에 대한 다중 구절은 Shared SEG Token(SST) 전략으로 Concat해 unified representation을 만들고 이를 통해 SAM 디코더가 일관된 마스크를 예측하도록 했다. Mask Refinement Module은 경량 U-Net 기반 구조이며 각 블록 내에 ResNet 모듈과 intra/inter-instance attention을 포함한다. MRM은 입력으로 m_i^{pred}, m_i^{att}, s_i^{pred}, H_img를 받아 정제된 m_i^{rfn}을 출력한다. 동작 원리는 s_i^{pred}가 클수록 m_i^{pred}의 정보를 더 보존하고 s_i^{pred}가 작으면 attention 기반의 공간 의도에 더 의존하도록 가중합 및 학습 가능한 보정 연산을 수행하는 것이다. 생성 단계에서는 정제 마스크와 인스턴스 텍스트 토큰 집합을 이용해 correspondence mask M을 구성하고 어텐션 식에 log(M)을 더해 Softmax 입력을 조정했다. 수식적으로 Attention(Q,K,V)=Softmax(QK^T/√d + log(M))V로 처리되어 M[q,k]→0이면 해당 어텐션 항이 실질적으로 0에 가까워진다. 학습 손실은 flux loss(정류화된 flow-matching 손실)와 mask 예측 손실(BCE + DICE)의 조합으로 구성되어 MRM과 생성 모듈을 함께 최적화했다. 학습/구현 세부사항은 reproducibility를 고려해 공개되었고 stage1에서는 LoRA rank=256을 VLM·이미지 인코더·SAM에 적용해 30k steps, batch size 64, lr 4e-5(5% warmup), weight decay 0.05로 학습했다. stage2에서는 FLUX 기반 초기화 위에서 LoRA를 DiT 블록의 모든 linear layer에 적용해 80k steps, batch size 4, 초기 lr 1e-4의 cosine 스케줄로 미세조정했고 MRM은 예측 마스크로 10k steps 추가 학습했다. 실험은 4×NVIDIA A6000에서 수행되었다.
관련 Figure

이 그림은 VLM이 생성한 <SEG> 토큰과 그로부터 유도된 마스크들이 텍스트의 각 인스턴스 설명과 정합되는 방식을 보여준다. 시각화는 대응 품질을 직접적으로 확인할 수 있게 하고, Mask Refinement Module 적용 전후의 변화와 대응의 일관성이 최종 생성 품질 향상과 어떻게 연결되는지를 보강한다.
학습된 텍스트-시각 대응의 시각화와 인스턴스별 마스크 샘플을 모아둔 Fig.4이다.
한계점
논문 자체에서 언급된 주요 실패 유형은 Stage1의 마스크 예측 오류로, 불완전한 영역, 위치 오프셋, 객체 누락이 주요 문제로 지적되었다. 이러한 심각한 예측 오류는 Stage2에서 잘못된 대응으로 이어져 생성 결과의 속성 바인딩 오류를 야기할 수 있다. Mask Refinement Module과 상호작용적 보정(포인트/박스 입력)을 통해 많은 오류를 완화했으나 논문은 여전히 위치 오프셋 및 누락된 객체에 대한 완전한 해결은 남아있음을 명시했다.
실무 활용
InstanceControl은 사용자 입력 프롬프트와 시각 조건만으로 복잡한 다중 인스턴스 장면에서 인스턴스 수준의 속성 제어를 가능하게 하며, 별도의 인스턴스 라벨링 없이도 높은 품질의 이미지를 생성한다. 공개된 코드 저장소가 있어 연구자와 엔지니어가 본 프레임워크를 실험 환경이나 프로토타입 단계에 빠르게 통합할 수 있다. 특히 시각적 레이아웃이나 스케치 기반 생성, 객체별 스타일 제어와 같은 응용에서 실무적 가치가 크다.
- 스케치 또는 엣지 기반 레이아웃을 입력으로 받아 장면 내 각 인물이나 객체의 의상·색상 같은 속성을 인스턴스 단위로 제어하는 크리에이티브 도구.
- 복수 객체가 포함된 광고·콘텐츠 제작에서 텍스트로 특정 객체의 속성을 지정해 자동으로 이미지 에셋을 생성하는 워크플로.
- 데이터 증강 파이프라인에서 객체별 속성을 보존하거나 변형해 정밀한 레이블 없이 합성 이미지 데이터를 생성하는 용도.
- 인터랙티브 편집 도구에서 사용자가 포인트나 박스로 오작동한 마스크를 보정해 즉시 원하는 속성으로 재생성하는 편집 플로우.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Instance-level Correspondence
- — 텍스트 프롬프트 내 개별 인스턴스 설명과 시각 조건(예: 엣지, 깊이 지도) 상의 공간 영역을 1:1로 연결한 정보이다. 본 논문에서는 VLM이 텍스트에서 인스턴스 설명을 추출하고 SAM 기반 디코더로 해당 영역의 마스크를 예측해 이 대응을 구성했다. 이 대응은 생성 모델의 어텐션을 제약하는 correspondence mask를 만드는 핵심 입력으로 사용되어 인스턴스 간 속성 혼동을 줄이는 역할을 한다.
- Correspondence Mask
- — 이미지 토큰과 텍스트 토큰 간의 어텐션을 제어하기 위해 구성된 행렬로, 특정 이미지 토큰이 오직 대응되는 텍스트 토큰만 참조하게 만드는 역할을 한다. 논문에서는 refined instance mask와 텍스트 토큰 집합을 이용해 M을 구성하고 log(M)을 어텐션 점수에 더해 관련 없는 상호작용을 억제했다. 이 기법은 인스턴스 수준의 강한 바인딩과 속성 혼동 감소에 직접 기여한다.
- Mask Refinement Module
- — 예측된 인스턴스 마스크의 노이즈와 위치 오프셋을 보정하기 위해 설계된 경량 U-Net 기반 모듈이다. 입력으로 VLM이 예측한 마스크, diffusion 모델의 attention 기반 마스크, 신뢰도 점수, 이미지 잠재 특징을 받아 intra/inter-instance attention과 ResNet 블록을 통해 정제된 마스크를 출력한다. 정제 마스크는 신뢰도가 낮을 때 attention 신호에 더 의존하고 신뢰도가 높을 때 예측 마스크를 유지해 생성 신뢰도를 높인다.
- Shared SEG Token
- — 하나의 인스턴스가 텍스트 내 여러 구절로 기술될 때 각 구절에 대응하는 <SEG> 토큰들의 표현을 결합해 하나의 통합 쿼리 표현을 만드는 전략이다. 논문에서는 여러 <SEG> 토큰의 최종층 히든 임베딩을 Concat으로 합쳐 SAM 디코더 입력용 단일 쿼리로 사용함으로써 동일 인스턴스에 대한 일관된 마스크 예측을 유도했다. 이는 중복 서술로 인한 마스크 불일치를 줄이고 다중 구절 참조 상황에서 성능을 향상시켰다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.