TL;DR
비디오 MLLM의 출력은 언제 근거가 나타나는지 알려주지 않으면 검증 가능성이 떨어진다. TimeLens2는 장기 영상과 다중 스팬 케이스에서 신뢰 가능한 간격 집합 라벨을 대규모로 구축하여 근거 검색을 학습 가능하게 만들었다. 또한 tIoU가 제공하지 못하는 시간적 기하 정보를 temporal Wasserstein 보상으로 보완해 근접한 오류에 대해 세분화된 학습 신호를 제공했다.
왜 중요한가
비디오 MLLM의 출력은 언제 근거가 나타나는지 알려주지 않으면 검증 가능성이 떨어진다. TimeLens2는 장기 영상과 다중 스팬 케이스에서 신뢰 가능한 간격 집합 라벨을 대규모로 구축하여 근거 검색을 학습 가능하게 만들었다. 또한 tIoU가 제공하지 못하는 시간적 기하 정보를 temporal Wasserstein 보상으로 보완해 근접한 오류에 대해 세분화된 학습 신호를 제공했다.
핵심 기여
TimeLens2-93K: 단계적 증거 검증 파이프라인
원문 캡션에서 파생된 선언형 쿼리와 세그먼트 제안을 생성하고 서로 다른 로컬화 에이전트가 독립적으로 재현한 결과에 대해 합의와 임베딩 기반 유효성 검사를 적용한 뒤 경계 정밀화를 수행하여 23,793개 비디오와 93,232개 라벨을 확보했다. 이 파이프라인은 한 번의 전역 결정보다 반복적이고 지역적인 증거 확인 절차를 통해 반복 출현과 잘못 정렬된 캡션을 배제했다. 최종적으로 합의된 예시에만 ±3초 내 지역 정제를 적용해 경계 잡음을 줄였다.
Temporal Wasserstein 보상: 매칭-프리 거리 기반 보상
예측과 목표의 병합된 지지를 균일 분포로 리프팅하고 1차원 W1 거리를 정확한 적분식으로 계산하여 거리 기반 유사도를 도출했다. 이 보상은 분할이나 불일치한 개수에 대해 불변성을 가지며 근접한 'near miss'에 대해 연속적인 학습 신호를 제공해 tIoU가 0을 주는 경우를 해소했다. 보상은 R = R_tIoU + exp(−W/|merge(Y)|+ϵ) − 1_{invalid} 형태로 사용되어 겹침과 거리 정보를 병행 반영한다.
컴팩트 범용 모델의 광범위한 성능 향상
Qwen3-VL 기반의 2B, 4B, 8B 변형을 SFT와 GRPO로 학습한 결과 모든 규모에서 크기 동급 공개 모델들을 일관되게 능가했고 4B와 8B는 여러 벤치에서 SOTA 수준을 달성했다. 특히 2B, 4B, 8B 모델은 각각 백본 대비 mIoU에서 +14.2, +13.0, +18.1포인트 향상을 기록했다. 장기 비디오, 다중 스팬, 질문형, 그리고 에고센트릭 장면에 걸쳐 검색 중심의 성능 향상이 관찰되었다.
핵심 아이디어 이해하기
문제 출발점은 비디오 시간 근거가 단일 타임스탬프나 한 쌍의 경계가 아니라 가변 개수의 지원 간격 집합이라는 점이다. 전통적 레이블링은 긴 비디오에서 전역적 한 번의 결정을 사용해 반복 출현을 놓치거나 경계가 부정확해지는 오류를 낳았다. 또한 tIoU와 같은 평가지표는 비중첩 예측에 제로를 부여하여 근접한 오답을 구별할 수 없었다.
관련 Figure

패널들은 zero-overlap plateau, 부분 정답 대 탐색, 분할에 의한 오매칭 사례 등을 제시해 tIoU나 일대일 매칭 기반 보상의 왜곡 사례를 시각화했다. 각 패널 옆의 수치 블록은 tIoU와 R_TW 값의 대비를 보여주어 왜 거리 기반 보상이 근접한 오답을 구분하고 다중 스팬에 대해 파티셔닝 불변성을 제공하는지를 수치적으로 보강했다.
tIoU의 한계와 temporal Wasserstein이 해결하는 사례를 비교한 일련의 타임라인 예시이다.
방법론
TimeLens2의 핵심 해결 원리는 감독과 최적화를 간격 집합 관점으로 통일하는 것이다. 먼저 계층적 시간표시 캡션으로 쿼리와 제안을 생성하고 서로 다른 로컬 에이전트가 제안을 비디오에서 재현하게 하여 시간적 합의와 임베딩 기반 정합성을 검증했다. 합의된 예시에 대해 경계 정제를 적용하여 경계 불확실성만을 좁히는 파이프라인이 데이터의 신뢰도를 크게 개선했다.
관련 Figure

이미지는 캡션 유도 제안, 이중 에이전트 로컬화, 교차 합의, 의미 검증, 경계 정제의 6단계 파이프라인을 시각적으로 연결해 보였다. 우측 열은 시간 길이 분포와 도메인 분포 등 코퍼스 구성 비율을 제시해 장기 및 도메인 다양성을 수치로 뒷받침했다. 이 그림은 본문에서 데이터 구성과 단계별 필터링이 어떻게 라벨 신뢰도를 높였는지를 직접 보강한다.
TimeLens2-93K 데이터 구축 파이프라인과 코퍼스 통계를 요약한 도식이다.
주요 결과
주요 실험에서 TimeLens2-2B, -4B, -8B는 각각 평균 mIoU 44.5, 47.7, 48.0을 기록했고 동일한 Qwen3-VL 백본 대비 각각 14.2, 13.0, 18.1 포인트의 개선을 보였다. 보상 설계 실험에서 uniform-support 기반 temporal Wasserstein을 tIoU에 추가하면 평균 mIoU가 47.0에서 47.7로 상승했으며 zero-overlap 그룹의 75.8%를 구조적으로 구분 가능한 신호로 바꾸었다. 데이터 측면에서 TimeLens2-93K의 초소형 고신뢰 서브셋(약 5%)이 검색 행동의 큰 개선을 만들었고 전체 코퍼스는 장기 문맥과 에고센트릭 견고성을 추가로 향상시켰다.
관련 Figure

각 패널은 타깃 프레임, 쿼리, 전체 타임라인에 대한 정답과 여러 모델의 예측 스팬을 나란히 표시해 TimeLens2가 드리프트 없이 희소한 증거를 회수하는 양상을 강조했다. 이 정성적 예시는 수치 성능뿐 아니라 긴 탐색 공간에서의 완전성, 반복 출현 복원능력, 그리고 질의 의도에 따른 증거 분리 능력이 개선되었음을 보강했다.
장기 비디오, 다중 스팬, 질문형, 에고센트릭 예제에 대한 정성적 비교를 보여주는 패널이다.
기술 상세
모델 아키텍처는 Qwen3-VL-2B/4B/8B Instruct 백본을 기반으로 하고 비주얼 인코더는 고정한 채 언어 데코더 파라미터만 업데이트했다. SFT 단계는 TimeLens2-93K, TimeLens-100K, 그리고 Ego4D-NLQ를 사용해 긴 컨텍스트(최대 100K 토큰)에서 증거 검색과 간격 집합 출력 포맷을 학습시켰다. RL 단계에서는 GRPO를 적용해 그룹 단위의 평균 중심 보상으로 정책을 미세조정했으며 기본 RL 하이퍼파라미터는 배치 64, KL 계수 0.04, 오프폴리시 롤아웃 8회 등이다.
관련 Figure

Uniform support, endpoint atoms, center Gaussians, boundary Gaussians 네 모형을 나란히 그려 각 표현이 간격의 점유와 전이 정보를 어떻게 보존하거나 손실하는지를 보여주었다. 본문 실험에서 uniform support가 가장 일관된 성능을 낸 근거로 이 그림이 사용되며 보상 표현이 mIoU 평가지표와 어떤 기하학적 정합성을 요구하는지 시사한다.
간격 집합을 어떻게 시간적 질량으로 표현할지에 따른 네 가지 분포 모형을 비교한 시각화이다.
실무 활용
TimeLens2의 코드와 데이터 파이프라인은 공개되어 있어 실무 적용이 가능하다. 검증된 라벨 생성 파이프라인과 RL 보상 구성을 재현하면 장기 비디오 검색과 증거 기반 응답 기능을 기존 MLLM에 추가할 수 있다.
- 비디오 아카이브에서 질의에 대한 증거 구간 검색과 링크 생성
- 비디오 기반 질문응답 서비스에서 근거 위치를 포함한 검증 가능한 응답 제공
- 에고센트릭 또는 장기 사건 탐지용 라벨 증강 파이프라인으로서의 데이터 구축
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Temporal Wasserstein
- — 예측된 간격 집합과 목표 간격 집합의 병합된 지지를 균일 분포로 취급하고 1차원 W1 거리를 계산하여 예측 위치와 목표 지지의 정렬에 필요한 '운반량'을 정량화하는 보상이다. 이 보상은 분할(fragmentation)과 예측 간 개수 불일치에 불변성을 가지며 근접한 'near miss' 에 대한 연속적 학습 신호를 제공한다.
- Set-valued Supervision
- — 타임라인 상에서 단일 구간 대신 가변 개수의 지원 간격 집합을 정답 표기로 사용하여 반복 출현, 분할 구간, 그리고 긴 비디오 문맥을 보존하면서 학습 신호를 구성하는 감독 방식이다. 이 표기는 다중 스팬 예시를 자연스럽게 표현하고 이를 일관된 최적화 대상으로 만든다.
- Temporal IoU
- — 예측된 병합 지지와 목표 병합 지지의 교집합 길이를 합집합 길이로 나눈 값으로, 이미 맞춘 지원량의 비율을 측정한다. 중첩된 부분에 대해서는 정밀한 평가를 제공하지만 비중첩 예측에는 0을 부여해 근접성 정보가 소실될 수 있다.
- GRPO
- — 집단화된 생성 기반 정책 최적화로, 다수의 샘플 롤아웃 그룹 내 상대적 보상 순위를 이용해 디코더 기반 생성 모델의 출력을 최적화하는 강화학습 절차이다. 그룹 내 평균 중심화(mean-centering)를 적용하여 집단 상대 선호를 정책 갱신에 반영한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.