TL;DR
희소한 텍스트 설명만으로 이미지를 생성하면 시각적 결과가 구조적으로나 의미적으로 부족할 수 있으며, 기존 생성기는 추가된 내용을 내부 표현에 암묵적으로 보관해 외부에서 검토하기 어렵다. GCE는 장면 그래프 수준에서 명시적으로 추가 객체와 관계를 예측하고 이 검증된 중간 표현을 기반으로 이미지를 렌더링하므로 생성 과정의 투명성과 제어 가능성이 높아진다. 이 접근은 생성된 장면의 현실성, 구조적 일관성, 그리고 입력과의 시맨틱 정합성을 동시에 개선하려는 실무적 요구를 충족시킨다.
왜 중요한가
희소한 텍스트 설명만으로 이미지를 생성하면 시각적 결과가 구조적으로나 의미적으로 부족할 수 있으며, 기존 생성기는 추가된 내용을 내부 표현에 암묵적으로 보관해 외부에서 검토하기 어렵다. GCE는 장면 그래프 수준에서 명시적으로 추가 객체와 관계를 예측하고 이 검증된 중간 표현을 기반으로 이미지를 렌더링하므로 생성 과정의 투명성과 제어 가능성이 높아진다. 이 접근은 생성된 장면의 현실성, 구조적 일관성, 그리고 입력과의 시맨틱 정합성을 동시에 개선하려는 실무적 요구를 충족시킨다.
핵심 기여
Generated Contents Enrichment(GCE)이라는 과제 규정과 파이프라인 확립
본 연구는 희소한 장면 설명을 입력으로 받아 이를 장면 그래프로 변환한 뒤 그래프 수준에서 추가 객체와 관계를 예측하고 최종적으로 그 그래프를 렌더링하는 전체 경로를 GCE로 규정했다. 이 정의는 그래프 완성, 무조건적 그래프 생성, 그래프-투-이미지 렌더링, 텍스트 확장과 구별되는 문제적 요구를 명확히 구분했다. 결과적으로 GCE는 그래프 수준의 검사 가능성과 이미지 측 평가를 결합하는 평가 프로토콜을 요구한다.
반복적 GCN 기반 장면 그래프 확장 모듈과 에지 검출기 설계
입력 그래프에 대해 한 번에 하나의 임시 객체 슬롯을 추가하고 GCN으로 객체 레이블과 해당 슬롯에 연결되는 지향성 엣지 점수를 예측하는 반복적 확장 전략을 구현했다. 에지 검출기는 주체/객체 측 표현을 별도의 MLP로 변환해 점수 행렬을 구성하고 최댓값 규칙으로 확장 엣지를 선택한다. 이러한 설계는 지역적 메시지 전달과 평균 집계를 통해 추가 내용이 입력 문맥과 의미적으로 정렬되도록 한다.
그래프-레벨 판별자와 시각적 정렬 손실을 결합한 공동 학습 프레임워크
확장된 그래프의 구조적 현실성을 보장하기 위해 로컬/글로벌 이중 판별자로 구성된 Scene Graph Critic을 도입해 적대적 학습 신호를 제공했다. 생성된 그래프는 graph-to-text 선형화로 변환되어 고정된 Stable Diffusion 렌더러에 의해 이미지로 합성되며, CLIP 기반 이미지-텍스트 정렬기와 사전학습된 장면 분류기의 피처 거리를 통해 시각적 정합성 손실을 역전파했다. 이 학습 설계는 이미지 생성기 파라미터를 고정한 채 그래프 확장 모듈만 업데이트하도록 하여 그래프 수준의 수정이 시각적 결과에 미치는 영향을 직접 학습했다.
Visual Genome에서의 체계적 평가와 인간 평가를 통한 실증
Visual Genome 서브셋(약 62.5k 학습 샘플)을 사용해 단일 객체 제거 복원 프로토콜을 도입하고 객체 정확도, 이용 가능한 엣지/술어 복원, 트리플릿 정밀도·재현율·F1, MEP+ 등 프록시 지표로 성능을 보고했다. 동일한 고정 렌더러(Stable Diffusion) 아래에서 ChatGPT 기반 텍스트 확장과 비교해 Inception Score와 FID 개선을 확인했고, 110명의 사용자 평가에서 확장된 이미지가 실제 레퍼런스 대비 선호되는 경향을 보였다. 코드 및 실험 구성은 공개 저장소로 제공된다.
핵심 아이디어 이해하기
입력 텍스트에서 바로 이미지를 생성하면 생성기는 내부 표현에 암묵적 추가 콘텐츠를 삽입하나 이 추가물은 외부에서 점검하거나 수정하기 어렵다. 장면 그래프는 객체와 객체 간 관계를 명시적으로 표현하므로 그래프 수준에서 추가 객체와 관계를 예측하면 사람이 검토하고 제어할 수 있는 중간 표현을 얻을 수 있다. 따라서 그래프 기반 확장은 생성물의 투명성과 정합성을 동시에 확보하는 출발점이 된다. 그래프 확장은 주변 문맥 정보에 기반한 지역적 메시지 전달을 통해 수행된다. 구체적으로 각 반복 단계에서 임시 객체 슬롯을 추가하고 GCN의 트리플릿 기반 메시지 전달로 주변 노드의 표현을 통합해 후보 객체 레이블과 후보 엣지 점수를 계산한다. 이후 에지 점수 행렬에서 최적 후보를 선택하고 독립 파라미터를 가진 predicate 예측기를 통해 엣지의 술어를 결정함으로써 확장이 완성된다. 확장 그래프의 시각적 타당성은 이미지 수준 손실로 검증된다. 그래프를 선형화해 고정된 텍스트-투-이미지 생성기 조건으로 사용하면 생성된 이미지와 원본 장면 특성 간의 피처 거리, 그리고 그래프-기반 텍스트와 이미지의 CLIP 유사도를 계산할 수 있다. 이 유사성 신호와 그래프 판별자의 적대적 신호를 결합해 확장 모듈을 학습하면 그래프 수준에서의 추가가 실제로 이미지 품질과 시맨틱 일관성에 긍정적 영향을 미치도록 유도할 수 있다.
방법론
전체 파이프라인은 세 단계로 구성된다. 첫 단계는 입력 텍스트를 reduced scene graph로 변환하고, 두 번째 단계는 반복적 GCN 기반 Scene Graph Enricher가 한 번에 하나의 임시 객체 슬롯을 추가해 객체 레이블과 그 슬롯과 기존 노드 사이의 지향성 엣지 점수를 예측하는 과정이다. 세 번째 단계는 enriched graph를 graph-to-text 선형화로 변환해 고정된 Stable Diffusion 렌더러에 입력하고, 학습 시에는 생성 이미지의 장면 분류기 특징과 CLIP 기반 이미지-텍스트 정렬 손실을 통해 그래디언트를 되돌려 확장 모듈을 업데이트한다. Scene Graph Enricher 내부는 SG2IM 스타일의 GConv 계층을 확장해 사용한다. 각 GConv는 트리플릿(subject, predicate, object)을 입력으로 받아 MLP f_g를 통해 중간 벡터를 계산하고, 주체·객체 관점의 후보 벡터를 수집한 뒤 평균 집계를 통해 다음 레이어 노드 표현을 산출한다. 추가 객체 후보는 G_{sg,obj}에서 soft 분포로 예측되며 에지 후보 점수 행렬은 두 개의 MLP(주체용과 객체용)의 내적으로 구성된다. 학습 중에는 이 확률적 표현을 임베딩으로 매핑해 이미지 조건으로 활용한다. 학습 목적 함수는 다중 항으로 구성되어 그래프 복원(객체·엣지·술어)용 교차 엔트로피 손실, 판별자 기반의 적대적 손실, 장면 분류기 특징의 L1 거리, CLIP 기반의 이미지-그래프 정렬 손실을 포함한다. 각 손실 항은 스케일과 목적에 맞게 가중치가 부여되어 공동 훈련이 안정적으로 진행되도록 설계되어 있으며 판별자 쌍(로컬·글로벌)은 그래프의 지역적 일관성과 전역적 구조를 동시에 유지하도록 작동한다.
주요 결과
장면 그래프 복원 프록시 실험에서 제안한 방법은 단일 객체 제거 복원 프로토콜 기준으로 객체 정확도와 이용 가능한 엣지·술어 정확도, 트리플릿 정밀도·재현율·F1에서 모든 비교군 대비 우수한 성능을 보였다. 예컨대 SceneGraphGen+ 대비 이용 가능한 엣지 정확도는 36.64에서 75.18로, 이용 가능한 술어 정확도는 14.17에서 42.20으로 향상되었다. 이러한 결과는 반복적 GCN 기반 확장과 판별자-정렬 혼합 학습이 그래프 복원 능력을 크게 향상시켰음을 시사한다. 이미지 수준 비교에서 동일한 Stable Diffusion 렌더러를 사용해 텍스트 기반 단순 렌더링, ChatGPT 기반 텍스트 확장, 그리고 제안한 그래프 기반 확장을 비교했다. 제안된 그래프 기반 확장은 Inception Score와 FID에서 단순 문장 렌더링 대비 개선을 보였고 보고된 표에서 Enriched Ours가 Simple보다 IS가 약 13.74% 향상되고 FID가 개선된 것으로 나타났다. 다만 ChatGPT가 속성 단어를 더 많이 추가할 수 있어 IS·FID에 유리할 수 있으나 장면 구성의 일관성 측면에서는 그래프 기반 접근이 균형 잡힌 개선을 보였다. 인간 평가에서는 110명의 참가자가 참여한 4개 실험에서 확장된 이미지가 실제 이미지 대비 더 현실적으로 보이는 비율은 낮았지만(약 20%), 단순 생성 이미지와 비교해 확장된 이미지의 현실성은 거의 동등하게 평가되었고, 실제 이미지가 주어졌을 때 참가자들은 단순 이미지보다 확장된 이미지를 더 선호하는 경향을 보였다. 이 관찰은 그래프 기반 확장이 입력 의미를 보존하면서 시각적으로 더 풍부한 결과를 만들어냈다는 점을 지지한다.
관련 Figure

해당 이미지는 희소 설명에서 그래프 확장을 통해 어떻게 추가 객체가 삽입되고 그 결과 이미지 구성에 변화가 발생하는지를 시각적으로 전달한다. 확장 전후 비교를 통해 제안한 GCN 기반 확장이 입력 장면의 핵심 요소를 보존하면서 주변 객체를 추가해 장면의 의미적 풍부함을 높였음이 확인된다. 이 예시는 그래프-수준 변경이 이미지 수준으로 어떻게 반영되는지를 보여줘 결과 기반 정렬 손실의 효과를 보강한다.
원문 Figure에 수록된 싱크 주변 장면의 합성 예시로 입력 설명 대비 그래프 확장 후 생성 이미지가 추가 객체와 관계를 포함한 모습을 보여준다.

이 이미지는 동일한 입력 그래프에서 다양한 확장 전략과 렌더링이 시각적으로 어떤 차이를 초래하는지 비교할 수 있게 한다. 장면 분류기 및 CLIP 정렬 손실이 그래프 확장 결과의 시각적 일관성을 유지하는 데 어떻게 기여하는지 시사한다. 반복적 확장 단계에서 선택된 엣지와 술어가 이미지 구성에 실질적인 변화를 만들어내는 관찰 근거를 제공한다.
논문에 제시된 또 다른 싱크 장면 합성 예시로서 그래프 확장으로 추가된 관계와 객체가 렌더링된 결과를 보여준다.

원본 이미지는 그래프 확장의 타당성을 평가하는 데 기준이 되는 실제 장면의 객체 구성과 관계를 제공한다. 제안 방법의 확장 결과가 원본과 얼마나 유사하게 의미적 풍부함을 복원하는지 인간 평가와 자동 지표를 통해 비교할 때 이 이미지가 근거로 사용되었다. 특히 실제 이미지의 객체 밀도와 관계 패턴이 복원된 정도가 MEP+와 트리플릿 성능과 대응한다.
해당 테스트 케이스의 실제 Visual Genome 원본 이미지로서 확장된 생성물과 비교를 위한 레퍼런스 역할을 한다.

거리 장면 예시는 차량, 보도, 표지판 같은 다수 객체와 관계가 밀집한 환경에서 그래프 확장과 판별자 제약이 작동하는 방식을 드러낸다. 로컬 판별자가 추가된 객체 주변 구조를 엄격히 제한함으로써 비현실적 또는 문맥에 맞지 않는 확장을 억제하는 효과가 관찰된다. 이 예시는 복잡한 장면에서의 반복적 확장 전략의 실용성을 보강하는 근거로 활용되었다.
거리 장면의 합성 예시로 입력 그래프에 기반한 확장 결과가 도시 환경 구조 내 객체 배치를 어떻게 변화시키는지 보여준다.
기술 상세
전체 아키텍처는 입력 텍스트에서 reduced scene graph를 구성한 뒤 반복적 확장을 수행하는 Scene Graph Enricher, 생성된 그래프의 현실성을 판별하는 Scene Graph Critic(로컬·글로벌), 고정된 Stable Diffusion 기반 Image Synthesizer, 그리고 학습 시 시각적 정렬 신호를 제공하는 Visual Scene Characterizer 및 Image-Text Aligner로 구성된다. 각 구성요소 중 판별자와 정렬 모듈은 학습 시 신호를 제공하지만 렌더러와 정렬기 파라미터는 고정되어 그래디언트가 그래프 확장 모듈로만 흐르도록 설계되었다. 이러한 구조는 그래프 수준의 수정이 실제 이미지 통계와 정렬 지표에 미치는 영향을 직접 학습하게 한다. GCN 기반의 Scene Graph Enricher는 SG2IM 스타일의 GConv 레이어를 확장해 사용하며 각 레이어는 트리플릿(subject, predicate, object)을 입력으로 받아 MLP f_g로 중간 벡터를 계산한다. 노드 집계는 주체측 후보 집합 C_i^s와 객체측 후보 집합 C_i^o의 평균을 사용해 노드 표현을 업데이트하고 술어 벡터는 별도의 MLP f_r에 잔차 연결을 포함해 갱신한다. 임시 객체 슬롯은 학습 중 soft 분포로 표현되며 이 확률 분포는 임베딩 수준에서 graph-to-text 선형화 경로로 매핑된다. 에지 검출기는 phi_s와 phi_o라는 두 개의 MLP를 사용해 각 노드의 주체·객체 관점 표현을 계산한 뒤 내적으로 점수 행렬을 구성한다. 학습 목표는 제거된 GT 객체와 연관된 엣지 존재 여부를 BCE로 학습하고 선택된 엣지의 술어를 교차 엔트로피로 학습하는 것이다. 판별자는 전역 신호와 국소 신호를 결합해 enriched graph의 분포가 실제 그래프 분포와 유사하도록 적대적 학습을 수행한다. 목적함수는 객체 분류 손실, 엣지 BCE, 술어 교차 엔트로피(available/none case), 판별자 기반 GAN 손실, 장면 분류기 특징의 L1 거리, CLIP 기반 이미지-그래프 정렬 손실을 가중합으로 결합한 형태이다. 학습은 미니배치 단위로 진행되며 하이퍼파라미터와 손실항 가중치는 부록에 정리되어 있다. 추론 시에는 임시 슬롯을 삽입하고 에지 점수 행렬에서 최댓값으로 엣지를 선택하는 결정 규칙으로 반복적 확장을 수행한다.
한계점
이 연구는 Visual Genome에 의존해 장면 그래프 레이블이 풍부한 도메인에서만 실험을 수행했으므로 다른 데이터셋이나 라벨 분포로의 일반화는 추가 검증이 필요하다. 현재 그래프 확장 대상은 객체와 관계 수준으로 한정되어 객체 속성(예: 색상, 재질) 확장은 수행하지 않아 텍스트 기반 확장 대비 속성 다양성에서 불리할 수 있다. 고정된 Stable Diffusion 렌더러를 사용했기 때문에 렌더러 한계로 인한 시각적 재현 오류가 확장 모듈 평가에 영향을 줄 수 있으며 더 강력한 렌더러로의 전이가 향후 과제로 남아 있다.
실무 활용
GCE 프레임워크는 희소한 장면 설명으로부터 사람이 검토 가능한 중간 장면 그래프를 생성하고 이를 기반으로 이미지 합성을 수행하므로 데이터 생성 파이프라인이나 합성 데이터 증강, 이미지 기반 시각화 실험 설계에 적용 가능성이 있다. 고정된 고품질 렌더러를 사용해 그래프 확장 모듈만 교체하거나 확장하면 실무적 적응이 용이하다. 공개된 코드 저장소를 통해 재현과 응용이 지원된다.
- 합성 데이터 생성에서 라벨링 갭을 메우기 위해 희소한 레이블을 그래프 수준으로 확장해 다양한 장면 변형을 생성하는 용도
- 시각적 장면 이해 연구에서 그래프 수준의 가설을 사람이 검토하고 합성 이미지로 결과를 평가하는 인터랙티브한 실험 파이프라인
- 데이터 부족 도메인에서 초기 설명만으로 plausible한 추가 객체·관계를 예측해 데이터 증강에 활용하는 시나리오
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Scene Graph
- — 장면 내 객체와 객체 간 관계를 객체 노드와 관계 엣지로 구조화한 표현이다. 이 표현은 이미지의 고수준 의미 관계를 명시적으로 캡처해 객체 배치와 관계 정보를 모델이 직접 활용하도록 만든다. 본 논문에서는 희소한 텍스트 설명을 먼저 장면 그래프로 변환하고 이 그래프를 확장해 시각적 합성 조건으로 사용한다.
- Graph Convolutional Network
- — 그래프 구조에서 노드와 엣지의 특성을 이웃 메시지 전달로 통합해 노드·엣지 표현을 갱신하는 신경망 계열이다. 각 레이어는 트리플릿(subject-predicate-object)을 입력으로 받아 MLP 기반의 지역 변환과 평균 집계를 통해 다음 레이어 피처를 계산한다. 본 논문에서는 추가 객체와 그 관계를 예측하기 위해 반복적 GCN 업데이트가 핵심 역할을 한다.
- Scene Graph Critic
- — 확장된 장면 그래프의 구조적·의미적 타당성을 판별하는 적대적 학습 구성요소로 로컬 판별자와 글로벌 판별자를 병렬로 사용한다. 로컬 판별자는 추가된 노드와 인접 부분을, 글로벌 판별자는 전체 그래프 통계와 구조를 평가한다. 판별자의 출력은 그래프 생성기 학습에서 현실성 제약을 제공해 비현실적 확장을 억제한다.
- Image-Text Aligner
- — CLIP과 유사한 사전학습된 멀티모달 인코더를 사용해 그래프로부터 생성한 텍스트 조건과 렌더된 이미지 특징을 같은 임베딩 공간에 투사하고 코사인 유사도로 정렬 손실을 계산하는 모듈이다. 이 모듈은 확장된 그래프가 생성 이미지의 시맨틱 핵심을 유지하도록 시각적 정렬 신호를 제공한다. 학습 시 정렬 손실은 그래프 확장 모듈의 그래디언트로 되돌아간다.
- Graph-to-Text Linearization
- — 장면 그래프의 이산 객체·관계 정보를 순서화해 텍스트 프롬프트로 변환하는 규칙 기반 매핑 방식이다. 객체와 관계의 소프트 확률 분포는 해당 토큰 임베딩으로 연속적으로 맵핑되어 고정 이미지 생성기 조건으로 투입된다. 본 연구는 이 경로를 통해 이미지-텍스트 정렬 손실이 그래프 확장 모듈에 전파되도록 허용한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.