본문으로 건너뛰기

Physics Question Scene Graph(PQSG): 텍스트-투-비디오 생성에서 물리적 타당성의 세분화된 평가

최신 텍스트-투-비디오 모델은 고해상도·현실적 장면을 생성하지만 기본적인 물리 법칙(예: 중력, 흡수, 변형)을 위반하는 결과가 빈번하다. PQSG는 물리적 위반을 객체/행동/물리 계층의 원자적 질문으로 분해해 어떤 요소가 실패하는지 정확히 지적하므로, 평가·디버깅·프롬프트 기반 수정(학습 불필요)을 실무적으로 가능하게 한다.

용어 해설

시각-언어 모델(Vision-Language Model (VLM))
이미지/영상과 텍스트를 동시에 입력으로 받아 멀티모달 이해·생성 작업을 수행하는 모델. 본문에서는 PQSG의 Question Generation(QG)과 Question Answering(QA) 단계에서 질문 생성과 비디오 기반 답변을 생성하는 데 사용되어 물리적 검증 파이프라인의 핵심 컴포넌트로 작동한다.
장면 그래프(Scene Graph)
장면 내 객체(node)와 객체 간 관계(edge)를 구조화한 표현. 본문에서는 물리 검증 질문들을 Object/Action/Physics 노드로 구성한 DAG 형태의 PQSG로 표현해 질문 간 논리적 의존성을 명시하고, 상위 전제 실패 시 하위 질문을 비활성화하는 데 사용된다.
질문 생성(Question Generation (QG))
텍스트 프롬프트로부터 검증용의 원자적 질문 집합을 생성하는 과정. 본문에서는 VLM에 in-context example을 제공해 Object/Action/Physics 계층 구조를 가진 PQSG를 자동 생성하며, 생성된 질문의 precision/recall을 인간 기준으로 평가한다.
의존성 그래프(Dependency Graph)
질문들 사이의 전제-결론 관계를 나타내는 유향 비순환 그래프(DAG). PQSG에서는 객체 존재(Object) → 행동(Action) → 물리(Physics) 순의 부모-자식 관계를 강제해 전제 조건을 확인한 뒤에만 하위 물리 질문을 평가함으로써 비현실적/비판리한 판단을 줄인다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 24.수집 2026. 06. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.