왜 중요한가
비디오 스트림을 대상으로 한 멀티모달 연구 에이전트는 단일 이미지 기반 접근법으로는 처리하기 어려운 시공간적 근거 결합과 장기적 탐색 전략을 요구한다. 본 논문은 시각적 근거 수집을 먼저 강제한 뒤 웹 탐색을 허용하는 분리형 파이프라인을 통해 모달리티 편향을 완화하고, 내부 파라미터 의존도를 낮추는 방식으로 평가 신뢰도를 높인다. 결과적으로 외부 도구 활용을 필수로 만드는 데이터·훈련·평가 설계는 실세계 영상에서의 근거 기반 질문응답 성능을 향상시키는 실용적 방안을 제공한다.
핵심 기여
대규모 비디오-기반 VQA 데이터 엔진
원본 비디오를 규칙 기반과 에이전트 기반 필터링으로 선별한 뒤 CLIP 유사도와 모델 기반 키프레임 선택으로 엔티티를 크롭해 시각 검색 메타데이터를 생성했다. 이 파이프라인에서 30,000개의 VQA 쌍과 검증된 7,000개의 성공 궤적을 획득했고, 도구 없는 정답 시도 네 번 중 하나라도 정답이면 해당 인스턴스를 배제해 파라미터 누수 가능성을 제거했다. 이렇게 확보한 데이터는 시각적 근거가 실제로 필요하도록 구성되어 downstream 훈련과 벤치마크에 사용되었다.
분단된 지각·탐색과 GRPO 훈련 파이프라인
학습은 먼저 SFT로 분리된 지각·탐색 문법을 모델에 각인시키고, 이어서 Group Relative Policy Optimization으로 에이전트의 자율적 탐색을 장려했다. GRPO는 그룹 내 상대 보상으로 advantage를 계산하고 KL 페널티를 결합하되 음의 이득 그래디언트를 20% 비율로만 적용해 안정성을 확보했다. 이 절차로 작은 모델(30B)도 대형 독점 모델과 견줄 만한 성능을 달성할 수 있었다.
VideoDR-Bench: 도구 의존형 다중 홉 평가
인간-모델 협업 주석 파이프라인을 통해 각 비디오 인스턴스에서 크롭 검색으로 외부 증거를 검증한 다음 다중 에이전트로 복합적 다중 홉 질문을 생성하고 등급화했다. 최종 벤치마크는 총 200개의 사례로 구성되며 모든 문항이 시각적 근거와 외부 지식 결합을 요구하도록 설계되었다. 이 벤치마크는 모달리티 편향과 매개변수 지식 누수의 영향을 평가하는 데 초점을 둔다.
핵심 아이디어 이해하기
비디오는 시공간적으로 연결된 키프레임들의 연속이므로 복합적 질의는 단일 프레임의 단순 조회로는 해결되지 않는 경우가 많다. 따라서 에이전트가 먼저 여러 프레임에서 객체를 선택·크롭해 외부 검색 쿼리를 구성하고 충분한 시각 증거를 축적한 뒤에야 텍스트 기반 탐색을 수행하도록 워크플로우를 분리한다. 이렇게 단계별로 도구 접근을 해제하면 시각 도구 사용을 회피하는 모달리티 편향을 억제하고, 내부 파라미터에 의한 정답 도출(지식 누수)을 줄여 근거 기반 추론이 요구되는 문제에 대해 더 신뢰할 수 있는 행동을 유도할 수 있다.
방법론
파이프라인은 세 단계로 구성된다. 먼저 다양한 소스의 원시 비디오를 규칙 기반 길이 필터와 에이전트 판별로 선별하고, CLIP 유사도로 후보 프레임을 추출한 다음 Qwen3.5-397B-A17B로 키프레임과 바운딩박스를 예측해 엔티티를 크롭한다. 크롭된 엔티티로 시각 검색을 수행하고 검색 결과의 정합성은 Qwen3.5-35B-A3B가 재검증하며, 이후 단일·다중 엔티티 패턴으로 VQA 문항을 생성하되 도구 없는 정답 시도(4회)를 통해 파라미터 누수 위험한 문항을 배제한다. 학습은 7K의 성공 궤적으로 SFT를 수행해 기본 정책을 학습한 뒤 2K의 RL 데이터로 GRPO를 적용해 자율적 탐색 능력을 강화한다.
관련 Figure

이미지는 입력 비디오에서 Select_Keyframe과 Crop_Search로 시각적 근거를 먼저 축적한 뒤 Text_Search·Visit을 통해 외부 증거를 조회하는 분리형 워크플로우를 시각적으로 보여준다. 각 단계는 데이터 생성(키프레임·크롭·메타데이터), 궤적 생성(시각 우선 정책), 학습(SFT→GRPO) 및 평가(VideoDR-Bench)로 이어져 논문의 설계 의도를 한눈에 파악하게 한다. 이 그림은 논문의 핵심 메커니즘인 '시각 근거 우선·단계적 도구 잠금 해제'를 이해하는 데 핵심적이다.
Figure 1은 Video-DeepResearch 파이프라인의 개요로, 키프레임 선택부터 크롭 검색, 단계적 도구 잠금 해제와 최종 웹 탐색에 이르는 처리 흐름을 도식화하고 있다.

이 도식은 논문의 전체 파이프라인을 단계별로 세분화해 각 단계에서 사용된 모델(예: Qwen3.5-397B-A17B), 필터링 규칙, VQA 생성 패턴(단일·다중 엔티티), 그리고 파라미터 누수 제거 절차(4회 도구 없는 롤아웃) 같은 구체적 절차를 보여준다. 연구자가 실제로 데이터와 궤적을 생성할 때 따라야 할 입력·프로세스·출력의 흐름을 명확히 하므로 재현 가능성 관점에서 중요한 시각 자료다.
Figure 3(또는 후속 도식)는 데이터 생성(필터링·키프레임·VQA 합성), 궤적 생성(분리형 정책·거부 샘플링), 훈련(SFT·GRPO) 및 벤치마크 구성 단계를 차례로 정리한 플로우 차트이다.
주요 결과
Video-DeepResearch-35B-A3B는 64.0% 평균 정확도를 기록하여 Claude-4.5-Sonnet(59.0%)보다 5.0%포인트 높게 나타났다. 30B-A3B 변종은 59.3%로 독점 기준에 근접한 성능을 보였으며, GPT-5(52.5%)와 Gemini 2.5 Pro(57.5%)보다 높은 수치를 보고했다. 예비 분석에서는 기존 모델들이 시각 도구 호출을 거의 하지 않는 모달리티 편향(예: Qwen3.5-397B-A17B는 시각 도구 평균 0.10회, 텍스트 도구 1.27회)을 보였고 GPT-5는 도구 호출 거의 없이 57%를 달성해 파라미터 기반 해결 경향이 관찰되었다.
기술 상세
기본 모델로 30B는 Qwen3-VL-30B-A3B-Instruct를, 35B는 Qwen3.5-35B-A3B를 사용했다. SFT 단계에서는 7K 성공 궤적과 추가 7K의 텍스트 전용 QA를 섞어 자동회귀 음의 로그우도 손실로 학습하며, 손실식은 로 표현된다. RL 단계는 GRPO를 적용해 그룹 내 상대보상으로 advantage를 산출하고 PPO 유사의 surrogate loss에 KL 페널티를 더했으며, 음의 advantage에 대한 그래디언트는 20% 확률로만 반영해 업데이트의 안정성을 확보했다. RL용 데이터는 궤적당 4회 롤아웃을 수행해 Pass@4가 0~1 범위인 인스턴스만 유지한 2K 규모이며 보상은 정답일 때 r=1, 그 외 r=0의 희소 이진 보상이다. 실험은 4대의 NVIDIA H800(80GB) GPU 노드 클러스터에서 수행되었다.
실무 활용
분리된 지각·탐색 워크플로우와 도구 의존형 데이터 설계는 장기적 멀티홉 비디오 질의응답과 근거 추적이 필요한 실무 애플리케이션에서 유용하다. 특히 뉴스, 엔터테인먼트, 일상 기록처럼 시공간적 맥락이 중요한 도메인에서 시각 증거를 우선 확보한 뒤 외부 지식을 추가로 수집하는 작업 흐름을 구현할 수 있다. 공개 구현은 GitHub 리포지토리로 제공되어 연구·개발 재현이 가능하다.
- 시사 뉴스 클립에서 인물·사건의 시공간적 근거를 기반으로 사실관계를 검증하는 도구로 활용 가능하다.
- 엔터테인먼트 영상에서 등장인물의 신원·관련 사실을 다중 홉으로 추적하는 검색 보조 시스템에 적용할 수 있다.
- 로컬 감시나 기록 영상에서 시간에 따른 객체 궤적을 종합해 외부 데이터베이스와 교차검증하는 사례에 적합하다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 키프레임 선택(Select_Keyframe)
- — 연속된 비디오 스트림에서 시공간적으로 정보가 풍부한 프레임 인덱스 t를 선택하는 도구로, 에이전트는 이 프레임을 기준으로 이후의 객체 크롭과 시각 검색을 수행한다.
- 영역 크롭 검색(Crop_Search)
- — 선택된 프레임에서 바운딩박스 B를 이용해 관심 객체를 잘라내고 이를 시각 쿼리로 웹 검색에 입력해 외부 증거를 회수하는 공간적 검색 도구를 의미한다.
- 모달리티 편향(Modality Bias)
- — 에이전트가 시각 도구 호출을 회피하고 문자 기반 탐색만으로 답을 찾아내려는 행동 경향으로, 논문은 이 편향이 비디오 기반 심층 리서치에서 핵심 병목이라고 진단한다.
- 매개변수 지식 누수(Parametric Knowledge Leakage)
- — 모델이 외부 도구를 사용하지 않고 내부에 저장된 사전 지식을 활용해 문제를 해결하는 현상으로, 평가에서 도구 의존성을 약화시키는 원인으로 지목된다.
- 지각·탐색 분리 파이프라인(Decoupled Perception-Exploration)
- — 초기에는 시각 전용 도구만 허용해 크로스-프레임 객체 근거를 축적하고, 이후 텍스트 탐색 도구를 잠금 해제해 웹 기반 증거 수집을 수행하는 단계별 워크플로우이다.
코드 예제
SFT loss: L_SFT = -E_{(x,y)~D}[\sum_{i=1}^{|y|} log pi_theta(y_i | x, y_{<i})]SFT(지도식 미세조정) 단계에서 사용된 표준 자동회귀 음의 로그우도 손실을 수식 형태로 원문에서 가져온 코드 스니펫이다. x는 시스템 프롬프트와 시각 입력 및 상호작용 이력, y는 목표 토큰 시퀀스를 나타낸다.
GRPO objective: averaged PPO-style surrogate with KL penalty, negative gradients of negative advantages downsampled with 20% probability.GRPO(Group Relative Policy Optimization) 훈련에서 사용된 목표식의 핵심 동작을 요약한 스니펫으로, intra-group 상대보상으로 이득을 계산하고 KL 페널티를 결합해 정책 업데이트를 수행하며 음의 이득에 대한 그래디언트는 20% 확률로만 적용하여 안정성을 확보한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.