용어 해설
- 밀집 비디오 캡셔닝(Dense Video Captioning)
- — 긴 비디오에서 시간적으로 밀집된 여러 이벤트를 탐지하고 각 이벤트에 대해 시간적으로 근거 있는 문장 설명을 생성하는 과제이며 이벤트 국지화와 문장 생성이 결합된 문제이기 때문에 토큰 수와 문맥 길이가 크게 증가하면 추론 비용이 급증한다.
- 잠재 전역 플래닝(Latent Global Planning)
- — 오디오·비주얼 입력으로부터 이벤트 수준의 압축된 잠재 토큰을 순차적으로 생성하여 영상의 사건 구조와 사건 간 인과 관계를 캡처하고, 이후 이벤트 단위 병렬 디코딩을 위한 전역 구조적 기준으로 사용하는 기법이다.
- 이벤트 분해 병렬 디코딩(Event-Factorized Decoding)
- — 전체 토큰 순차 생성 체인을 이벤트별 하위 체인들로 분해하고 서로 다른 이벤트 하위 체인들은 전역 토큰을 조건으로 동시 생성하되 각 하위 체인 내에서는 자기회귀를 유지하여 지역적 일관성을 보장하는 디코딩 구조이다.
- 인과 의존 그래프(Causal Dependency Graph)
- — 토큰 수준에서 어떤 이전 출력들이 이후 토큰의 예측에 영향을 주는지를 나타내는 그래프로서, 이 논문에서는 이벤트 단위로 그래프 구조를 재구성하여 병렬성이 가능하도록 변환한다.
- 적응형 의미 집약(Adaptive Semantic Aggregation)
- — 각 이벤트에 해당하는 멀티모달 프리픽스 토큰들로부터 중요도를 추정해 가중합을 수행함으로써 전역 이벤트 토큰이 사건별로 풍부한 오디오·비주얼 정보를 담도록 하는 집약 전략이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


