본문으로 건너뛰기

IV-CoT: 구조 인식을 위한 암시적 시각 Chain-of-Thought 기반 텍스트→이미지 생성

텍스트에서 복잡한 장면 구성을 정확히 따르는 구조-민감 텍스트→이미지 생성은 객체 개수·위치·속성 바인딩에서 실패하기 쉬우며, 기존 방법은 언어 또는 중간 디코딩에 의존해 한계가 존재한다. IV-CoT는 구조적 계획을 잠재 쿼리에 담아 단일 포워드로 추론하면서 구조 정확도를 높이고, 명시적 중간 디코딩 없이도 효율성을 유지한다.

용어 해설

암시적 시각 체인오브쏘트(Implicit Visual Chain-of-Thought)
중간 추론 상태를 텍스트나 중간 이미지로 외부화하지 않고, MLLM의 내부 쿼리(learnable queries)에 구조적 계획과 의미적 렌더링을 순차적으로 담아 디퓨전 생성기(DiT)에 조건으로 제공하는 기법이다. 구조적 쿼리(Q_s)가 먼저 형태·배치 정보를 인코딩하고, 의미적 쿼리(Q_m)가 이를 참조해 색·재질 등 외형을 완성한다. 추론은 단일 포워드 패스로 이루어지며 학습 시에만 스케치 감독을 사용한다.
쿼리 기반 생성(Query-Conditioned Generation)
텍스트와 함께 학습 가능한 연속형 시각 쿼리(learnable queries)를 MLLM에 입력해 그 출력 쿼리를 디퓨전 생성기 조건으로 사용해 이미지를 복원하는 방식이다. 쿼리는 구조·외형 정보를 압축하고, DiT는 이 쿼리들을 cross-attention으로 참조해 노이즈 제거를 수행한다.
스케치 감독(Sketch-Supervision)
학습 단계에서만 대상 이미지로부터 추출한 에지/윤곽 스케치를 디퓨전 VAE 잠재공간에 매핑해 구조적 쿼리(Q_s)가 윤곽·개수·배치를 인코딩하도록 유도하는 보조 손실이다. 추론 시 스케치 입력은 필요 없다.
구조→의미 쿼리 캐스케이드(Structural-to-Semantic Query Cascade)
MLLM 입력 시 구조적 쿼리(𝐐_s^0)를 의미적 쿼리(𝐐_m^0)보다 앞에 배치하여 causal self-attention으로 단방향 의존성을 만들고, 출력 쿼리(𝐐_s → 𝐐_m)가 구조를 먼저 형성한 뒤 의미적 세부를 조건으로 받아 생성에 사용되도록 하는 구조화 기법이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 23.수집 2026. 06. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.