본문으로 건너뛰기

옴니모달 밀집 비디오 캡셔닝을 위한 병렬화된 자기회귀 디코딩

PadCaptioner는 잠재 전역 플래닝과 이벤트 분해 병렬 디코딩으로 Dense Video Captioning에서 정확도 향상과 실제 디코딩 시간 기준 최대 3.8× 속도향상을 달성했다.

용어 해설

밀집 비디오 캡셔닝(Dense Video Captioning)
긴 비디오에서 시간적으로 밀집된 여러 이벤트를 탐지하고 각 이벤트에 대해 시간적으로 근거 있는 문장 설명을 생성하는 과제이며 이벤트 국지화와 문장 생성이 결합된 문제이기 때문에 토큰 수와 문맥 길이가 크게 증가하면 추론 비용이 급증한다.
잠재 전역 플래닝(Latent Global Planning)
오디오·비주얼 입력으로부터 이벤트 수준의 압축된 잠재 토큰을 순차적으로 생성하여 영상의 사건 구조와 사건 간 인과 관계를 캡처하고, 이후 이벤트 단위 병렬 디코딩을 위한 전역 구조적 기준으로 사용하는 기법이다.
이벤트 분해 병렬 디코딩(Event-Factorized Decoding)
전체 토큰 순차 생성 체인을 이벤트별 하위 체인들로 분해하고 서로 다른 이벤트 하위 체인들은 전역 토큰을 조건으로 동시 생성하되 각 하위 체인 내에서는 자기회귀를 유지하여 지역적 일관성을 보장하는 디코딩 구조이다.
인과 의존 그래프(Causal Dependency Graph)
토큰 수준에서 어떤 이전 출력들이 이후 토큰의 예측에 영향을 주는지를 나타내는 그래프로서, 이 논문에서는 이벤트 단위로 그래프 구조를 재구성하여 병렬성이 가능하도록 변환한다.
적응형 의미 집약(Adaptive Semantic Aggregation)
각 이벤트에 해당하는 멀티모달 프리픽스 토큰들로부터 중요도를 추정해 가중합을 수행함으로써 전역 이벤트 토큰이 사건별로 풍부한 오디오·비주얼 정보를 담도록 하는 집약 전략이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 03.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.