TL;DR
AI 영상 생성 기술은 비약적으로 발전했으나, 생성된 영상의 품질을 평가하는 체계는 여전히 초기 단계에 머물러 있다. 기존의 CLIP 스코어와 같은 방식은 프레임 단위의 정적인 품질만 평가할 뿐, 영상의 핵심인 시간적 일관성과 서사적 흐름을 파악하지 못한다. 이를 해결하기 위해 절대적인 점수 산정 대신 두 영상 중 더 나은 것을 선택하는 비교(pairwise) 방식을 도입하고, 실제 영상과 의도적으로 손상된 영상을 쌍으로 학습시킨 Qwen-VL 기반 판별기를 구축했다. 이 판별기는 CI 파이프라인의 회귀 게이트로 작동하여 인간의 선호도와 일치하는 품질 평가를 자동화함으로써, 생성 과정 초기 단계에서 오류를 감지하고 수정하는 루프를 완성했다.
챕터별 상세
AI 영상 생성 평가의 문제점
기존 평가 도구인 CLIP, LPIPS 등은 주로 이미지 단위의 유사도를 측정하는 데 최적화되어 있어 영상의 연속성을 평가하기 어렵다.
비교 평가(Pairwise) 방식의 도입
절대 평가의 모호함을 해결하기 위해 두 대상을 비교하는 상대 평가 방식을 채택하여 데이터의 신뢰도를 높였다.
판별기 학습을 위한 데이터셋 구축
모델이 단순히 예쁜 영상에 높은 점수를 주는 편향을 방지하기 위해 의도적인 오류 데이터를 포함한 학습 전략을 사용했다.
CI 파이프라인 내 판별기 통합
회귀 게이트(Regression Gate)는 소프트웨어 개발에서 코드 변경이 기존 기능을 해치지 않는지 확인하는 자동화된 검증 단계를 의미한다.
용어 해설
- Temporal Consistency
- — 영상 생성 AI에서 프레임 간 객체, 배경, 움직임이 자연스럽게 이어지는 정도를 의미한다. 이 일관성이 깨지면 캐릭터가 갑자기 변하거나 배경이 뒤틀리는 현상이 발생하며, 영상의 품질을 결정하는 핵심 요소다.
- Bradley-Terry Loss
- — 두 항목 중 어느 것이 더 선호되는지를 학습하기 위한 확률 모델 기반의 손실 함수이다. 절대적인 점수를 매기는 대신 두 영상 중 더 나은 것을 선택하는 비교 학습을 통해 모델이 인간의 선호도를 더 정확하게 모사하도록 돕는다.
- VLM
- — 텍스트와 이미지를 동시에 이해하고 처리할 수 있는 모델이다. 영상 생성 평가에서 프레임 내의 시각적 정보와 프롬프트의 의도를 대조하여 영상의 품질을 판단하는 판별기로 활용된다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
