용어 해설
- 암시적 시각 체인오브쏘트(Implicit Visual Chain-of-Thought)
- — 중간 추론 상태를 텍스트나 중간 이미지로 외부화하지 않고, MLLM의 내부 쿼리(learnable queries)에 구조적 계획과 의미적 렌더링을 순차적으로 담아 디퓨전 생성기(DiT)에 조건으로 제공하는 기법이다. 구조적 쿼리(Q_s)가 먼저 형태·배치 정보를 인코딩하고, 의미적 쿼리(Q_m)가 이를 참조해 색·재질 등 외형을 완성한다. 추론은 단일 포워드 패스로 이루어지며 학습 시에만 스케치 감독을 사용한다.
- 쿼리 기반 생성(Query-Conditioned Generation)
- — 텍스트와 함께 학습 가능한 연속형 시각 쿼리(learnable queries)를 MLLM에 입력해 그 출력 쿼리를 디퓨전 생성기 조건으로 사용해 이미지를 복원하는 방식이다. 쿼리는 구조·외형 정보를 압축하고, DiT는 이 쿼리들을 cross-attention으로 참조해 노이즈 제거를 수행한다.
- 스케치 감독(Sketch-Supervision)
- — 학습 단계에서만 대상 이미지로부터 추출한 에지/윤곽 스케치를 디퓨전 VAE 잠재공간에 매핑해 구조적 쿼리(Q_s)가 윤곽·개수·배치를 인코딩하도록 유도하는 보조 손실이다. 추론 시 스케치 입력은 필요 없다.
- 구조→의미 쿼리 캐스케이드(Structural-to-Semantic Query Cascade)
- — MLLM 입력 시 구조적 쿼리(𝐐_s^0)를 의미적 쿼리(𝐐_m^0)보다 앞에 배치하여 causal self-attention으로 단방향 의존성을 만들고, 출력 쿼리(𝐐_s → 𝐐_m)가 구조를 먼저 형성한 뒤 의미적 세부를 조건으로 받아 생성에 사용되도록 하는 구조화 기법이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





