본문으로 건너뛰기

TimeLens2: 멀티모달 LLM 기반 범용 비디오 시간 근거 모델

TimeLens2는 캡션 유도 제안과 교차 에이전트 합의로 93,232개의 고신뢰 다중스팬 라벨을 구성하고 temporal Wasserstein 보상을 도입하여 2B·4B·8B 모델이 장·다중스팬·질문형·1인칭 벤치에서 큰 성능 향상을 달성했다.

용어 해설

시간적 Wasserstein 보상(Temporal Wasserstein)
예측된 간격 집합과 목표 간격 집합의 병합된 지지를 균일 분포로 취급하고 1차원 W1 거리를 계산하여 예측 위치와 목표 지지의 정렬에 필요한 '운반량'을 정량화하는 보상이다. 이 보상은 분할(fragmentation)과 예측 간 개수 불일치에 불변성을 가지며 근접한 'near miss' 에 대한 연속적 학습 신호를 제공한다.
집합값 감독(Set-valued Supervision)
타임라인 상에서 단일 구간 대신 가변 개수의 지원 간격 집합을 정답 표기로 사용하여 반복 출현, 분할 구간, 그리고 긴 비디오 문맥을 보존하면서 학습 신호를 구성하는 감독 방식이다. 이 표기는 다중 스팬 예시를 자연스럽게 표현하고 이를 일관된 최적화 대상으로 만든다.
시간적 IoU(Temporal IoU)
예측된 병합 지지와 목표 병합 지지의 교집합 길이를 합집합 길이로 나눈 값으로, 이미 맞춘 지원량의 비율을 측정한다. 중첩된 부분에 대해서는 정밀한 평가를 제공하지만 비중첩 예측에는 0을 부여해 근접성 정보가 소실될 수 있다.
GRPO
집단화된 생성 기반 정책 최적화로, 다수의 샘플 롤아웃 그룹 내 상대적 보상 순위를 이용해 디코더 기반 생성 모델의 출력을 최적화하는 강화학습 절차이다. 그룹 내 평균 중심화(mean-centering)를 적용하여 집단 상대 선호를 정책 갱신에 반영한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 19.수집 2026. 07. 22.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.