TL;DR
밀집 비디오 캡셔닝은 긴 영상에서 다수의 시간적 이벤트를 정확히 찾고 각 사건을 서술해야 하므로 토큰 단위의 완전 연속적 자기회귀 생성은 추론 지연을 크게 유발한다. 이 논문은 이벤트 간 약한 의존성은 전역적 잠재 토큰으로 요약하고 각 이벤트 내에서는 순차 생성을 유지하는 방식으로 토큰 생성 의존 그래프를 재구성하여 병렬 생성을 허용했다. 그 결과 정확도를 저해하지 않으면서도 실제 디코딩 시간에서 다배속 향상(논문 보고 기준 최대 3.8배)을 이루어 장시간·다수 이벤트 영상 처리의 실용적 한계를 완화했다.
왜 중요한가
밀집 비디오 캡셔닝은 긴 영상에서 다수의 시간적 이벤트를 정확히 찾고 각 사건을 서술해야 하므로 토큰 단위의 완전 연속적 자기회귀 생성은 추론 지연을 크게 유발한다. 이 논문은 이벤트 간 약한 의존성은 전역적 잠재 토큰으로 요약하고 각 이벤트 내에서는 순차 생성을 유지하는 방식으로 토큰 생성 의존 그래프를 재구성하여 병렬 생성을 허용했다. 그 결과 정확도를 저해하지 않으면서도 실제 디코딩 시간에서 다배속 향상(논문 보고 기준 최대 3.8배)을 이루어 장시간·다수 이벤트 영상 처리의 실용적 한계를 완화했다.
핵심 기여
잠재 전역 플래닝 메커니즘
모델이 멀티모달 입력을 조건으로 이벤트 단위의 압축된 잠재 토큰 {G1,...,GK,S}를 자기회귀적으로 생성하도록 구성했고 각 전역 토큰은 시간적 구간과 유사도 기반 제약으로 해당 이벤트에 시맨틱하게 정렬되도록 학습됐다. 이 전역 토큰은 사건 간 인과구조를 보존해 이후의 병렬 디코딩을 위한 구조적 기준 역할을 수행하며 훈련 중 유사도 기반 grounding 손실을 통해 시간적 근거성을 확보했다. 전역 토큰은 이벤트별 오디오·비주얼 토큰의 적응형 집약을 통해 사건 특화 표현을 쌓아 각 병렬 분기에서의 지역 집중을 강화했다.
이벤트 분해 병렬 디코딩 구조
전체 캡션 생성 체인을 이벤트별 하위 체인으로 분해해 서로 다른 이벤트의 동일한 디코딩 스텝에 속한 로컬 토큰들을 동시 예측하도록 설계했다. 각 하위 체인 내에서는 순차적 자기회귀를 유지해 지역 의미 일관성을 보장하고, 하위 체인 간에는 다른 이벤트의 로컬 토큰에 대한 attention을 마스킹해 불필요한 교란을 차단했다. 모든 분기들은 공유된 전역 이벤트 토큰과 멀티모달 프리픽스에 접근할 수 있어 전역적 일관성이 보존되도록 균형을 맞췄다.
이벤트 분해에 적합한 인과적 어텐션과 포지셔널 설계
동기화된 병렬 디코딩을 위해 각 디코딩 스텝에서 서로 다른 하위 체인의 토큰들이 동일한 위치 인덱스를 공유하도록 위치 인코딩을 조정했으며 짧은 체인은 EOS 패딩을 통해 훈련 시 정렬하게 했다. 이 구성은 추론 시에는 불필요한 패딩 토큰을 생성하지 않고도 동기 병렬화를 가능하게 했으며, 실험적으로 표준 인과적 어텐션을 그대로 적용할 경우 성능 저하가 발생함이 확인됐다. 또한 전역 토큰에 대한 전권 접근이 있을 때 성능이 더 좋아져 전역 요약을 통한 교차 이벤트 상호작용 전달이 효과적임이 검증됐다.
광범위한 실험으로 입증된 성능·효율 개선
LongVALE 및 ChronusAV 등의 omni-modal DVC 벤치마크에서 PadCaptioner(3B)는 LongVALE에서 F1 56.4 및 Sim 58.5를 기록했고 ChronusAV에서 F1 63.2 및 Sim 40.0을 달성했다. 실제 벽시계 기반 디코딩 시간 측정에서 기존 최강 모델 대비 영상당 평균 디코딩 시간이 16162.1ms에서 4283.8ms로 약 3.8배 개선되는 등 실전 추론 비용 측면에서도 유의미한 이득을 보였다. 추가로 다양한 어블레이션이 잠재 플래닝과 이벤트 분해 설계가 성능과 효율에 핵심 기여를 한다는 점을 지지했다.
핵심 아이디어 이해하기
기존 자기회귀 기반 Video-LLM은 모든 출력 토큰이 이전 토큰 전체에 의존한다고 가정해 왔으며 이로 인해 토큰 수가 많은 장기 영상에서 디코딩 비용이 선형 이상의 방식으로 증폭됐다. 비디오 콘텐츠는 본질적으로 시간에 따라 구획된 이벤트들로 구성되며, 이벤트 간 정교한 토큰 단위 상호작용은 상대적으로 약한 경우가 많아 이벤트 수준의 압축 표현으로 교차 이벤트 정보를 요약할 수 있다. 본 논문은 이러한 관찰을 바탕으로 이벤트 단위의 잠재 전역 토큰을 순차적으로 생성해 사건 간 인과구조를 보존하고, 그 전역 토큰을 조건으로 각 이벤트의 로컬 토큰 체인을 병렬로 동시 생성하는 구조적 재구성을 제안했다.
방법론
전체 파이프라인은 두 단계로 구성된다. 첫 단계는 멀티모달 프리픽스 P를 조건으로 잠재 전역 토큰 {G1,...,GK,S}를 자기회귀적으로 생성하는 플래닝 단계이고 두 번째 단계는 각 G i를 앵커로 삼아 이벤트별 하위 체인들을 동시 디코딩하는 병렬 디코딩 단계이다. 플래닝 단계에서는 각 G i가 시간적 구간과 정렬되도록 유사도 기반의 grounding 손실 ℒ_gnd^{G^i}를 사용하며 해당 손실은 y_t^i(시간 세그먼트 t가 i번째 이벤트에 속하면 1, 아니면 0)와 G^i와 해당 구간의 멀티모달 토큰 간 정규화 점곱 유사도 sim_t^i를 입력으로 하는 평균 binary cross-entropy로 정의된다. 이 손실의 입력-처리-출력 구조는 다음과 같다: 입력은 각 시간 세그먼트의 라벨 y_t^i와 유사도 sim_t^i이고 처리 단계는 BCE(y_t^i, sim_t^i) 계산이며 출력은 시간축 전체에 대한 평균 값으로 전역 토큰의 시간적 근거성을 측정하는 스칼라 값이다. 병렬 디코딩 단계에서는 각 디코딩 스텝 j에서 모든 이벤트 분기 i에 대해 로컬 토큰 L_j^i들을 동시에 샘플링하도록 재구성하였고 그 조건부 분포는 {L_j^i}{i=1}^K ∼ P({L_j^i}{i=1}^K | P, G^{1:K}, {G^i, L_{<j}^i}_{i=1}^K)로 표현된다. 이 조건부 분포의 입력은 공유 멀티모달 프리픽스와 전역 토큰들 및 각 분기의 로컬 히스토리이며 처리 결과는 동일 타임스텝에서의 병렬 토큰 샘플링이다. 구현적으로 분기 간 로컬 토큰 간 attention을 마스킹하고 모든 분기는 모든 전역 토큰과 멀티모달 프리픽스에 접근하도록 설계해 전역 의존성은 전역 토큰을 통해 전파되도록 했다.
주요 결과
메인 벤치마크에서 PadCaptioner(3B)는 LongVALE에서 F1 56.4와 Sim 58.5를 기록하며 이전 SOTA 대비 F1에서 최소 6.7%p, Sim에서 6.1%p의 향상을 보였다. ChronusAV에서는 PadCaptioner가 F1 63.2와 Sim 40.0을 기록해 강건한 일반화 성능을 나타냈으며 YouCook2의 제로샷 평가에서도 CIDEr와 SODA_c 측면에서 우수한 수치를 보였다. 효율성 측정에서 실측 벽시계 시간 기준으로 ChronusOmni(7B)의 평균 디코딩 시간 16162.1ms 대비 PadCaptioner는 4283.8ms를 기록해 약 3.8× 속도 향상이 보고됐고 토큰당 디코딩 시간은 41.3ms에서 13.4ms로 약 3.1× 개선이 관찰됐다. 어블레이션 결과는 잠재 플래닝이 단독으로 성능을 크게 끌어올렸고 이벤트 분해 병렬 디코딩과 이벤트 인과화 어텐션 설계가 함께 적용될 때 성능과 효율 모두 최적화됨을 지지했다.
관련 Figure

도표 왼쪽은 기존의 완전 연속적 토큰 의존성 구조와 PadCaptioner의 잠재 전역 플래닝 및 이벤트 분해 병렬 디코딩 구조를 대비해 보이며 전역 토큰 G^i를 생성한 뒤 이벤트별로 병렬 디코딩하는 워크플로를 구조적으로 나타낸다. 도표 오른쪽의 막대그래프는 LongVALE 기준 Event grounding F1과 Event captioning Sim에서 각각 수치적 향상(예: F1 49.7→56.4, Sim 52.4→58.5)과 실제 디코딩 시간/토큰당 시간에서의 수배 속도 개선(예: 16162.1ms→4283.8ms)을 시각적으로 전달한다.
전체 시스템 파이프라인과 성능·효율성 비교 막대그래프를 함께 제시한 도판으로서 플래닝-병렬 디코딩 흐름과 기존 연속 디코딩 대비 실제 디코딩 시간 및 성능 향상을 시각화하고 있다.

화면은 시간 스탬프별로 분할된 장면 이미지와 대응하는 캡션 텍스트를 제시해 모델이 어떻게 영상 장면을 이벤트 단위로 구분하고 각 사건에서 시각·청각 신호를 결합해 상세한 문장을 생성했는지를 보여준다. 이 정성적 예시는 양적 지표뿐 아니라 실제 생성 품질과 이벤트 근거성 측면에서 모델의 동작 방식을 보완적으로 확인시킨다.
PadCaptioner가 생성한 예시 캡션과 해당 시간 구간의 프레임들을 나열한 정성적 결과로서 모델의 이벤트 분할·현지화 및 오디오·비주얼 기반 설명 능력을 보여준다.
기술 상세
전체 아키텍처는 멀티모달 인코더와 LLM 디코더로 구성된 Omni-LLM 기반이며 본 논문 실험은 Video-SALMONN 2+(3B)를 베이스로 Qwen2.5-VL을 시각 인코더 및 디코더, Whisper-Large-v3를 오디오 인코더로 사용하고 Q-Former를 오디오 정렬기 역할로 배치해 구현됐다. 입력 전처리는 프레임 샘플링 0.5 FPS, 최대 256 프레임 제약을 적용하며 긴 영상은 균등 샘플링으로 프레임 수를 맞추었다. 학습 세부사항으로는 ChronusAV 서브셋(18K 비디오)을 LoRA로 1 에폭 파인튜닝했고 표준 토큰 분류 손실을 재구성된 시퀀스에 적용했으며 이때 전역 플래닝을 위한 ℒ_gnd와 토큰 예측을 위한 cross-entropy를 병행하여 최적화했다. 어텐션 조작은 로컬 토큰 간의 교차 이벤트 attention을 마스킹하고 각 로컬 토큰이 멀티모달 프리픽스와 모든 전역 토큰에 접근하도록 허용하는 방식으로 구현됐으며, 위치 인코딩은 동일한 디코딩 스텝의 서로 다른 분기 토큰들이 같은 위치 인덱스를 공유하도록 조정해 병렬 동기화를 실현했다. 훈련 시에는 최대 분기 길이에 맞춘 EOS 패딩을 적용하고 패딩된 EOS에 대한 손실도 포함시켜 분기 종료를 촉진하도록 했으며 추론 시에는 불필요한 패딩 토큰이 추가로 생성되지 않도록 분기별 EOS 검출로 독립 종료가 가능하게 구성했다.
관련 Figure

이 그림은 입력과 출력 토큰 간 허용된 어텐션 연결을 행렬 형태로 구체화해 표준 인과적 어텐션이 모든 이전 토큰을 볼 수 있게 하는 반면, 본 논문의 이벤트-분해 어텐션은 동일 스텝 내 다른 이벤트의 로컬 토큰을 마스킹하고 전역 토큰에는 접근을 허용해 지역 집중과 전역 인지를 균형시킨다는 점을 직관적으로 전달한다. 이 매트릭스는 방법론의 핵심 설계가 어떻게 불필요한 교란을 차단하면서 병렬화 가능성을 확보하는지를 기술적 관점에서 보강한다.
다양한 어텐션/디코딩 전략에 대한 시각적 행렬 비교로서 표준 순차 디코딩, 병렬 디코딩(일반 인과 어텐션), 그리고 이벤트-분해 인과 어텐션의 입력·출력 가시성 차이를 보여준다.
한계점
의존성 그래프 재구성은 현재 이벤트 수준의 분해에 한정되어 있어 더 미세한 서브이벤트나 공간-시간 인스턴스 단위 병렬화 가능성은 남아 있다. 장시간 이벤트에 대해 적응형 의미 집약이 완전히 세부 정보를 포착하지 못해 생성 문장이 다소 거칠어질 수 있다는 관찰이 보고됐다. 제안한 어텐션 패턴은 일부 상용화된 최적화된 어텐션 커널과의 완전한 호환성이 부족해 추가적인 커널 레벨 최적화가 필요하다.
실무 활용
PadCaptioner의 설계는 긴 영상과 다수의 이벤트가 존재하는 실제 애플리케이션에서 디코딩 비용을 줄이면서도 시간적 근거성을 유지한 설명을 생성하는 데 적합하다. 공개된 코드 저장소가 있어 연구나 프로덕션으로의 이전 검증이 용이하며 LoRA 기반의 파인튜닝으로 비교적 경량한 재학습이 가능하다. 실제 활용에서는 프레임 샘플링, 이벤트 수 추정, 전역 토큰 품질에 따라 적용 성능이 달라질 것으로 보인다.
- 대용량 사용자 생성 영상의 자동 요약 및 인덱싱을 통해 검색 랭킹 및 탐색 속도를 개선하기 위한 메타데이터 생성
- 장시간의 시큐리티·대시보드 영상에서 이벤트별 요약을 생성해 이벤트 탐지 후 신속한 검토를 지원하는 워크플로우
- 교육·요리·튜토리얼 영상의 단계별 디텍션과 텍스트 설명 생성을 결합한 콘텐츠 자동 편집 및 자막 생성 파이프라인
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Dense Video Captioning
- — 긴 비디오에서 시간적으로 밀집된 여러 이벤트를 탐지하고 각 이벤트에 대해 시간적으로 근거 있는 문장 설명을 생성하는 과제이며 이벤트 국지화와 문장 생성이 결합된 문제이기 때문에 토큰 수와 문맥 길이가 크게 증가하면 추론 비용이 급증한다.
- Latent Global Planning
- — 오디오·비주얼 입력으로부터 이벤트 수준의 압축된 잠재 토큰을 순차적으로 생성하여 영상의 사건 구조와 사건 간 인과 관계를 캡처하고, 이후 이벤트 단위 병렬 디코딩을 위한 전역 구조적 기준으로 사용하는 기법이다.
- Event-Factorized Decoding
- — 전체 토큰 순차 생성 체인을 이벤트별 하위 체인들로 분해하고 서로 다른 이벤트 하위 체인들은 전역 토큰을 조건으로 동시 생성하되 각 하위 체인 내에서는 자기회귀를 유지하여 지역적 일관성을 보장하는 디코딩 구조이다.
- Causal Dependency Graph
- — 토큰 수준에서 어떤 이전 출력들이 이후 토큰의 예측에 영향을 주는지를 나타내는 그래프로서, 이 논문에서는 이벤트 단위로 그래프 구조를 재구성하여 병렬성이 가능하도록 변환한다.
- Adaptive Semantic Aggregation
- — 각 이벤트에 해당하는 멀티모달 프리픽스 토큰들로부터 중요도를 추정해 가중합을 수행함으로써 전역 이벤트 토큰이 사건별로 풍부한 오디오·비주얼 정보를 담도록 하는 집약 전략이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.