본문으로 건너뛰기

Generated Contents Enrichment(GCE): 장면 그래프 기반 명시적 장면 확장과 그래프 조건부 이미지 합성

GCE는 희소한 장면 설명을 장면 그래프로 변환해 추가 객체와 관계를 예측·검증한 뒤 이를 기반으로 이미지 합성을 수행해 생성물의 의미적 풍부함과 구조적 일관성을 개선했다.

용어 해설

장면 그래프(Scene Graph)
장면 내 객체와 객체 간 관계를 객체 노드와 관계 엣지로 구조화한 표현이다. 이 표현은 이미지의 고수준 의미 관계를 명시적으로 캡처해 객체 배치와 관계 정보를 모델이 직접 활용하도록 만든다. 본 논문에서는 희소한 텍스트 설명을 먼저 장면 그래프로 변환하고 이 그래프를 확장해 시각적 합성 조건으로 사용한다.
그래프 합성곱 네트워크(Graph Convolutional Network)
그래프 구조에서 노드와 엣지의 특성을 이웃 메시지 전달로 통합해 노드·엣지 표현을 갱신하는 신경망 계열이다. 각 레이어는 트리플릿(subject-predicate-object)을 입력으로 받아 MLP 기반의 지역 변환과 평균 집계를 통해 다음 레이어 피처를 계산한다. 본 논문에서는 추가 객체와 그 관계를 예측하기 위해 반복적 GCN 업데이트가 핵심 역할을 한다.
장면 그래프 판별자(Scene Graph Critic)
확장된 장면 그래프의 구조적·의미적 타당성을 판별하는 적대적 학습 구성요소로 로컬 판별자와 글로벌 판별자를 병렬로 사용한다. 로컬 판별자는 추가된 노드와 인접 부분을, 글로벌 판별자는 전체 그래프 통계와 구조를 평가한다. 판별자의 출력은 그래프 생성기 학습에서 현실성 제약을 제공해 비현실적 확장을 억제한다.
이미지-텍스트 정렬기(Image-Text Aligner)
CLIP과 유사한 사전학습된 멀티모달 인코더를 사용해 그래프로부터 생성한 텍스트 조건과 렌더된 이미지 특징을 같은 임베딩 공간에 투사하고 코사인 유사도로 정렬 손실을 계산하는 모듈이다. 이 모듈은 확장된 그래프가 생성 이미지의 시맨틱 핵심을 유지하도록 시각적 정렬 신호를 제공한다. 학습 시 정렬 손실은 그래프 확장 모듈의 그래디언트로 되돌아간다.
그래프-텍스트 선형화(Graph-to-Text Linearization)
장면 그래프의 이산 객체·관계 정보를 순서화해 텍스트 프롬프트로 변환하는 규칙 기반 매핑 방식이다. 객체와 관계의 소프트 확률 분포는 해당 토큰 임베딩으로 연속적으로 맵핑되어 고정 이미지 생성기 조건으로 투입된다. 본 연구는 이 경로를 통해 이미지-텍스트 정렬 손실이 그래프 확장 모듈에 전파되도록 허용한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 07.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.