용어 해설
- 시각-언어 모델(Vision-Language Model (VLM))
- — 이미지/영상과 텍스트를 동시에 입력으로 받아 멀티모달 이해·생성 작업을 수행하는 모델. 본문에서는 PQSG의 Question Generation(QG)과 Question Answering(QA) 단계에서 질문 생성과 비디오 기반 답변을 생성하는 데 사용되어 물리적 검증 파이프라인의 핵심 컴포넌트로 작동한다.
- 장면 그래프(Scene Graph)
- — 장면 내 객체(node)와 객체 간 관계(edge)를 구조화한 표현. 본문에서는 물리 검증 질문들을 Object/Action/Physics 노드로 구성한 DAG 형태의 PQSG로 표현해 질문 간 논리적 의존성을 명시하고, 상위 전제 실패 시 하위 질문을 비활성화하는 데 사용된다.
- 질문 생성(Question Generation (QG))
- — 텍스트 프롬프트로부터 검증용의 원자적 질문 집합을 생성하는 과정. 본문에서는 VLM에 in-context example을 제공해 Object/Action/Physics 계층 구조를 가진 PQSG를 자동 생성하며, 생성된 질문의 precision/recall을 인간 기준으로 평가한다.
- 의존성 그래프(Dependency Graph)
- — 질문들 사이의 전제-결론 관계를 나타내는 유향 비순환 그래프(DAG). PQSG에서는 객체 존재(Object) → 행동(Action) → 물리(Physics) 순의 부모-자식 관계를 강제해 전제 조건을 확인한 뒤에만 하위 물리 질문을 평가함으로써 비현실적/비판리한 판단을 줄인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


