이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
영상 캡션 품질은 생성 문장과 정답 문장의 단어 일치만으로 측정하기 어렵습니다. 같은 영상에 여러 타당한 서술이 존재하는 일대다 특성과 캡션 품질의 세부 차이를 반영하기 위해, 이 연구는 영상에서 만든 사람이 검증한 객관식 질문에 캡션이 답하는 능력을 측정하는 참조 문장 없는 benchmark CapQuiz를 고안했습니다. CapQuiz는 24개 영상 영역에서 서술형과 추론형을 아우르는 10가지 질문 유형을 사용하며, 사실성을 나타내는 CapP와 정보 범위를 나타내는 CapR을 결합한 CapF1도 함께 사용합니다. 실험에서 CapQuiz는 기존 지표보다 인간 판단과 더 높은 상관을 보였고 모델 성능을 해석할 수 있는 세부 정보를 제공했습니다.
섹션별 상세
기존 영상 캡션 평가는 생성 문장을 정답 캡션과 비교하는 방식에 크게 의존하지만, 하나의 영상에 여러 타당한 서술이 존재해 어휘가 다르다는 이유만으로 좋은 캡션이 낮은 점수를 받을 수 있습니다. 이런 방식은 캡션이 영상의 중요한 정보를 얼마나 담았는지와 사실을 지켰는지를 세밀하게 나누어 판단하기 어렵습니다. 연구는 캡션 품질의 기준을 정보 충실도로 두고, 중요한 시각 정보의 포괄성과 엄격한 사실성을 동시에 요구합니다.
CapQuiz는 정답 캡션과의 문장 일치 대신 영상에서 도출한 사람이 검증한 세부 객관식 질문에 캡션이 답하는 능력을 측정하는 참조 문장 없는 benchmark입니다. 질문은 영상의 핵심 장면과 세부 내용을 확인하도록 구성되며, 캡션이 제공한 정보가 실제 영상에 근거하는지와 필요한 시각 정보를 포함하는지를 답변 결과로 판단합니다. 이를 통해 표현 방식이 달라도 의미가 맞는 캡션을 평가 대상에 포함하면서 품질 차이를 더 세밀하게 분리할 수 있습니다.
CapQuiz는 서술형과 추론형 범주를 아우르는 10가지 질문 유형을 24개 영상 영역에 걸쳐 구성합니다. 평가 과정은 영상에서 질문과 선택지를 만들고 사람의 검증을 거친 뒤, 캡션을 바탕으로 각 질문의 정답을 고르게 하는 흐름으로 이루어집니다. 따라서 단일 점수만 제공하는 기존 평가보다 캡션이 어떤 정보는 보존하고 어떤 정보에서 오류를 내는지 해석할 수 있는 구조를 갖춥니다.
연구진은 사실성을 측정하는 CapP와 정보 범위를 측정하는 CapR을 결합해 CapF1을 구성했습니다. CapP는 캡션에 담긴 내용이 영상의 사실과 맞는지에 초점을 두고, CapR은 중요한 시각 정보가 캡션에 얼마나 포함됐는지를 반영합니다. 두 기준을 함께 사용하면 장면을 많이 담았지만 부정확한 캡션이나 사실은 맞지만 정보가 부족한 캡션을 구분할 수 있습니다.
실험 결과 CapQuiz는 기존 캡션 평가 지표보다 인간 판단과 유의하게 더 높은 상관을 보였습니다. 객관식 질문에 대한 답변 결과를 이용하기 때문에 점수 차이가 단순한 단어 겹침이 아니라 사실성 및 정보 범위의 차이와 연결됩니다. 이 특성은 Visual Large Language Models의 영상 캡션 성능을 비교하고 오류 원인을 파악하는 평가 기반으로 활용될 수 있습니다.
용어 해설
- 비디오 캡셔닝(Video Captioning)
- — 영상의 시각적 정보를 자연어 문장으로 변환하는 작업입니다. 열린 서술 공간 때문에 같은 영상에도 서로 다른 정답 캡션이 나올 수 있으며, 생성 문장과 참조 문장의 단어 일치만으로 품질을 재면 의미가 맞는 표현까지 낮게 평가될 수 있습니다.
- 참조 문장 없는 평가(Reference-Free Evaluation)
- — 정답 캡션과 생성 캡션의 직접적인 문장 일치 대신, 영상에서 확인한 질문에 대한 캡션의 답변 능력으로 품질을 측정하는 방식입니다. 참조 문장에 의존하지 않아 표현 차이를 줄이고 사실성 및 정보 범위를 따로 판단할 수 있습니다.
- 정보 충실도(Information Fidelity)
- — 캡션이 영상의 중요한 시각 정보를 얼마나 빠짐없이 담으면서도 사실과 어긋나지 않는지를 나타내는 기준입니다. CapQuiz에서는 영상에서 도출한 세부 질문에 대한 답변 가능성을 통해 정보 범위와 사실성을 함께 측정합니다.
- 객관식 질의응답(Multiple-Choice Question Answering)
- — 주어진 선택지 가운데 정답을 고르는 방식의 질의응답입니다. 이 연구에서는 사람이 검증한 영상 기반 질문을 사용해 캡션이 장면의 핵심 정보를 보존하는지, 관찰되지 않은 내용을 덧붙이지 않는지를 확인합니다.
- 일대다 서술 특성(One-to-Many)
- — 하나의 영상에 대해 의미가 같거나 타당한 여러 캡션이 존재할 수 있는 특성입니다. 이 때문에 특정 참조 문장과 어휘가 다르다는 이유만으로 고품질 캡션을 낮게 평가하는 문제가 발생합니다.
기술
- Visual Large Language Models (VLLMs)
- CapQuiz
- CapF1
- CapP
- CapR
활용 사례
- Visual Large Language Models의 영상 캡션 성능 평가
- 영상 캡션의 사실성과 정보 범위 비교
- 캡션 오류 유형의 세부 분석
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 09. 11.수집 2026. 09. 11.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.