용어 해설
- 의미적 그라운딩(Semantic Grounding)
- — 참조 이미지의 모든 외형을 그대로 복사하는 대신, 과제 수행에 필요한 객체·정체성·재질·구조 같은 의미적 관계와 속성을 생성 결과에 유지하는 기준이다. 이 논문에서는 지시된 결과를 만들면서도 결과가 참조 이미지와 연결되어 있는지 판정하는 데 사용된다.
- 결과 달성(Outcome Achievement)
- — 생성된 영상이 지시문에 적힌 완성 상태에 도달했는지 측정하는 평가 차원이다. 결과 실현, 의미적 그라운딩, 그라운딩된 객체의 일관성, 전역 시각 연속성 네 기준을 모두 통과해야 샘플의 OA 성공으로 계산된다.
- 생성 신뢰성(Generation Reliability)
- — 영상이 과제를 달성했는지와 별개로, 생성 과정과 결과에 물리적 위반·흐림·합성 흔적·장면 내부 불안정·손상된 텍스트가 없는지 측정하는 차원이다. 다섯 가지 이진 기준의 평균으로 GR Score를 계산한다.
- 비전-언어 모델(Vision-Language Model)
- — 이미지나 영상의 시각 정보와 자연어 지시를 함께 처리하는 모델이다. SemComp-Bench에서는 정해진 이진 질문에 답하고 시각적 근거를 연결해 참조-결과 관계, 결과 달성 여부, 영상 품질을 판정하는 평가자로 사용된다.
- 결과 중심 영상 클립(Outcome-Centric Video Clip)
- — 전체 작업 과정을 모두 담기보다 완성된 결과가 나타나는 시점을 중심으로 잘라낸 영상이다. 검증된 결과 timestamp가 포함된 핵심 장면을 선택한 뒤 같은 장면의 인접 구간을 합쳐 최소 3초 길이로 만들며, SemComp-Data의 평균 길이는 약 4.03초이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




