본문으로 건너뛰기

참조 의미를 보존하는 결과 중심 영상 생성 평가

참조 이미지의 의미를 유지하면서 지시된 최종 상태에 도달하는 영상 생성 능력을 OA와 GR로 평가한다.

용어 해설

의미적 그라운딩(Semantic Grounding)
참조 이미지의 모든 외형을 그대로 복사하는 대신, 과제 수행에 필요한 객체·정체성·재질·구조 같은 의미적 관계와 속성을 생성 결과에 유지하는 기준이다. 이 논문에서는 지시된 결과를 만들면서도 결과가 참조 이미지와 연결되어 있는지 판정하는 데 사용된다.
결과 달성(Outcome Achievement)
생성된 영상이 지시문에 적힌 완성 상태에 도달했는지 측정하는 평가 차원이다. 결과 실현, 의미적 그라운딩, 그라운딩된 객체의 일관성, 전역 시각 연속성 네 기준을 모두 통과해야 샘플의 OA 성공으로 계산된다.
생성 신뢰성(Generation Reliability)
영상이 과제를 달성했는지와 별개로, 생성 과정과 결과에 물리적 위반·흐림·합성 흔적·장면 내부 불안정·손상된 텍스트가 없는지 측정하는 차원이다. 다섯 가지 이진 기준의 평균으로 GR Score를 계산한다.
비전-언어 모델(Vision-Language Model)
이미지나 영상의 시각 정보와 자연어 지시를 함께 처리하는 모델이다. SemComp-Bench에서는 정해진 이진 질문에 답하고 시각적 근거를 연결해 참조-결과 관계, 결과 달성 여부, 영상 품질을 판정하는 평가자로 사용된다.
결과 중심 영상 클립(Outcome-Centric Video Clip)
전체 작업 과정을 모두 담기보다 완성된 결과가 나타나는 시점을 중심으로 잘라낸 영상이다. 검증된 결과 timestamp가 포함된 핵심 장면을 선택한 뒤 같은 장면의 인접 구간을 합쳐 최소 3초 길이로 만들며, SemComp-Data의 평균 길이는 약 4.03초이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.