TL;DR
실세계 영상은 모션 블러, 글레어, 부분 차폐 등으로 자주 열화되어 Video-LLM의 예측을 왜곡한다. 본 논문은 각 프레임의 신뢰도를 추정해 신뢰도가 높은 프레임만을 중심으로 다양한 시각 도구를 선택하고 통합하는 파이프라인을 제시했다. 그 결과 깨끗한 입력에서 56.4% 정확도를 달성하고 오염된 입력에서도 54.3%를 유지하여 실환경 적용 시 예측의 무감지 실패를 줄였다.
왜 중요한가
실세계 영상은 모션 블러, 글레어, 부분 차폐 등으로 자주 열화되어 Video-LLM의 예측을 왜곡한다. 본 논문은 각 프레임의 신뢰도를 추정해 신뢰도가 높은 프레임만을 중심으로 다양한 시각 도구를 선택하고 통합하는 파이프라인을 제시했다. 그 결과 깨끗한 입력에서 56.4% 정확도를 달성하고 오염된 입력에서도 54.3%를 유지하여 실환경 적용 시 예측의 무감지 실패를 줄였다.
핵심 기여
프레임 단위 품질 프로파일링과 신뢰도-관련성 결합 프레임 선택
프레임별로 blur, brightness, occlusion 세 채널에 대해 신호 수준 통계로 disturbance score를 계산했다. 이 점수를 1−d(fi)로 변환한 뒤 쿼리-프레임 유사도와 곱해 신뢰도-관련성 점수 s(fi)를 만든 다음 상위 K 프레임을 선택했다. 선택 과정은 학습이 필요 없는 파라미터-프리 assess_quality 도구로 구현되어 다양한 손상 유형에 즉시 적용 가능하다.
통일된 (result, confidence) 도구 인터페이스와 신뢰도 보정 규약
각 시각 도구는 자체 불확실도 c_intrinsic을 반환하고 입력 프레임 집합의 보수적 평균 신뢰도 ρ(Fj)와 곱하여 최종 신뢰도 cj를 산출했다. ρ(Fj)는 Fj에서 신뢰도가 가장 낮은 ⌈n/3⌉ 프레임의 평균을 사용해 소수의 깨끗한 프레임이 오염 프레임을 가리는 문제를 완화했다. 모든 도구 출력은 (result, cj, Fj, {d(f)}) 형식으로 기록되어 증거 통합 단계에서 신뢰도 기반 가중치로 사용된다.
신뢰도층화 증거 합성 및 신뢰도-비용 보상으로 학습되는 호스트 VLM
모든 증거를 high/medium/low 3계층으로 분류해 고신뢰 증거가 결론을 주도하고 중간 신뢰는 일관될 때만 보조하며 저신뢰는 최후 수단으로만 사용하는 합성 규칙을 적용했다. 호스트 VLM은 Group Relative Policy Optimization GRPO로 end-to-end로 학습되며 보상에는 정답 보상, confidence-cost 보상, sub-query 효율성 보상, 형식 보상이 포함된다. 이 보상 설계는 정답 신호가 애매할 때도 유용한 그래디언트 경로를 제공해 도구 호출 전략과 분해 수준을 함께 최적화했다.
실세계 비디오 벤치마크에서의 일관된 성능 및 효율성 개선
UrbanVideo-Bench와 VSI-Bench의 8개 작업에서 Robust-TO는 Qwen3-VL-7B 기반으로 clean에서 56.4% 정확도를 기록해 가장 강한 오픈소스 베이스라인 대비 10.6%p 우위를 보였다. RoVA로 생성한 다섯 종류의 현실적 오염 하에서 평균 54.3%를 유지했고 동일 조건의 최강 오픈소스 대비 5.8%p 우위와 최소의 clean-to-corrupted 드롭을 달성했다. 또한 적응형 키 프레임 선택은 평균 처리 프레임 수를 35% 감소시키고 추론 시간을 35% 이상 줄이면서 정확도를 1.6%p 향상시켰다.
핵심 아이디어 이해하기
문제 출발점은 기존 Video-LLM이 모든 프레임을 동등하게 신뢰하는 설계에 있다. 실세계 영상에서는 일부 프레임이 모션 블러나 글레어로 심하게 열화되므로 동일한 가중치로 처리하면 오염된 신호가 추론을 왜곡한다. 따라서 프레임 수준의 품질 추정이 없으면 모델의 자기 확신(confidence)과 실제 시각 증거의 신뢰성 사이에 큰 괴리가 발생한다. 해결 원리는 프레임별 disturbance score를 먼저 계산해 신뢰도가 높은 프레임만을 도구 입력으로 선별하고, 쿼리를 원자적 sub-query로 분해해 각 sub-query에 가장 적합한 시각 도구를 호출하는 것이다. 각 도구는 자체 불확실도 c_intrinsic을 반환하고 입력 신뢰도 ρ(Fj)와 곱해 최종 신뢰도를 얻는다. 이 곱셈은 도구 출력이 열화된 입력으로부터 왔을 때 과신(overconfidence)을 억제하는 핵심 메커니즘이다. 최종 합성은 신뢰도 등급화로 동작한다. 모든 도구 출력을 high, medium, low로 그룹화해 높은 신뢰도 증거가 결론을 주도하도록 설계했고 중간 신뢰는 고신뢰와 일치할 때만 보조하며 저신뢰는 대체 근거가 없을 때만 허용한다. 이 계층화는 오염 상태에서 잘못된 증거가 결론을 바꾸는 것을 방지하고 모델의 불확실성을 명시적으로 보고하도록 만든다.
방법론
전체 파이프라인은 세 단계로 구성된다. 첫째, 각 프레임에 대해 assess_quality를 호출해 d(fi)=mean(dblur,dbright,doccl)를 계산하고 min-max 정규화를 통해 단일 disturbance score를 얻는다. 둘째, select_frames는 s(fi)=(1−d(fi))·sim(ϕ(fi),ψ(q))로 프레임 신뢰도와 쿼리 관련성을 결합해 상위 K 프레임을 선택한다. 셋째, 호스트 VLM은 q를 원자적 sub-query로 분해한 뒤 각 sub-query를 도구 라이브러리로 라우팅하고 도구가 반환한 (result,cj,Fj,{d(f)})를 축적한다. 도구 라우팅은 두 단계 규약을 따른다. 먼저 sub-query의 의미 유형으로 후보 도구를 좁히고 다음으로 Fj의 평균 disturbance 프로파일 d¯를 확인해 우세한 손상 타입에 더 강한 도구를 선택한다. 예를 들어 흐릿함이 우세하면 detect_objects보다 caption_frame을 선호하고 조명 왜곡이 우세하면 조명에 강한 도구를 선택한다. 각 도구 호출은 c_intrinsic과 입력 신뢰도 ρ(Fj)을 곱해 cj를 산출하는데 ρ(Fj)는 Fj에서 신뢰도가 가장 낮은 ⌈n/3⌉ 프레임의 평균으로 정의되어 소수의 깨끗한 프레임이 오염 프레임을 가리는 것을 방지한다. 학습은 GRPO로 수행된다. 단일 롤아웃 궤적 τ에 대해 각 호출의 Rcc(cj,Tj)=cj−λ·cost(Tj)를 평균한 confidence-cost 보상과 sub-query 효율성 보상 Rsubq, 정답 보상 Racc, 형식 보상 Rfmt를 조합해 총 보상 Rtotal=Racc + w(Rsubq + Rtotal_cc + Rfmt)를 사용한다. πest라는 동결된 VLM을 통해 질문별 목표 sub-query 수 m∗를 추정하여 과다 분해와 과소 분해를 제어했다.
주요 결과
주요 성능은 UrbanVideo-Bench와 VSI-Bench의 8개 작업에서 평가했다. Qwen3-VL-7B 기반의 Robust-TO는 clean 입력에서 56.4% 평균 정확도를 기록해 논문에 제시된 강한 오픈소스 기준선을 10.6%p 상회했고 Gemini-2.5-Pro(46.2%)보다도 우수한 성능을 보였다. RoVA로 생성한 현실적 오염 조건 다섯 가지 하에서는 평균 54.3%를 유지해 같은 조건의 최강 오픈소스 Video-R1보다 5.8%p 높은 성능을 보였다. 다수의 세부 실험에서 설계 요소의 기여를 분리했다. 신뢰도 곱셈 없이 intrinsic만 사용하면 7.6%p의 손실이 발생했고 worst-K 대신 uniform mean을 쓰면 3.3%p가 감소했다. GRPO 보상에서 confidence-cost 항을 제거하면 약 2.3%p 감소가 관찰되어 보상 설계가 도구 선택과 효율성에 중요한 영향을 미쳤다. 효율성 측면에서 적응형 키-프레임 선택은 평균 프레임 수를 32에서 20.7로 35% 감소시켰고 계산 시간과 추론 시간을 각각 크게 줄이면서 정확도를 1.6%p 향상시켰다. 이 결과는 신뢰도 기반 프레임 게이팅이 정확도와 자원 사용량을 동시에 개선함을 의미한다.
기술 상세
전체 아키텍처는 호스트 VLM 컨트롤러와 도구 라이브러리로 구성된다. 파이프라인 초기에 assess_quality로 각 프레임의 d(fi)를 계산하고 select_frames로 s(fi)=(1−d(fi))·sim(ϕ(fi),ψ(q))을 사용해 상위 K 프레임을 선택한다. 선택된 프레임과 원자적 sub-query를 기반으로 도구를 호출하고 모든 출력은 (rj,cj,Fj,{d(f)}) 형식으로 저장된다. 신뢰도 수식은 단순하지만 결정적이다. 각 도구의 c_intrinsic은 도구별 스코어(예 컨픽스 평균, 토큰 로그확률, OCR 문자 신뢰도 등)로 정의되고 final confidence cj = c_intrinsic × ρ(Fj)로 계산된다. ρ(Fj)는 Fj에서 신뢰도가 가장 낮은 ⌈n/3⌉ 프레임들의 (1−d(f)) 평균으로 정의되어 입력 집합 내 취약 프레임의 영향을 보수적으로 반영한다. 학습과 하이퍼파라미터는 논문에 명시된대로 구성된다. GRPO 학습은 4×A100-80GB로 ∼5,000 스텝을 진행했고 보상 구성은 Rtotal = Racc + w(Rsubq + Rtotal_cc + Rfmt)이며 λ=0.5, w=1/3 등 논문 값을 사용했다. 프레임 샘플링은 1fps로 최대 32프레임을 전처리하고 selection 후 최대 12프레임을 도구에 전달했다. 도구 라이브러리는 assess_quality, select_frames, retrieve_frames, detect_objects, caption_frame, track_temporal, recognize_action, read_text 등으로 구성되어 있으며 각 도구의 cost는 캡션 프레임 실행 시간을 단위로 정규화해 보상 계산에 반영했다. 모든 intrinsic score는 [0.01,1.0]로 클리핑되어 곱셈으로 인한 소거를 방지했다.
한계점
논문은 disturbance vocabulary를 blur, brightness, occlusion 세 채널로 제한했다는 한계를 명시했다. 이 제약은 적대적 교란이나 의미적 가림, 오디오-비주얼 불일치 같은 다른 오류 유형에 대해서는 즉시 확장되지 않는다. πest를 동결한 설계는 sub-query 수 추정의 품질을 πest 능력에 묶어 학습 중 보상 조작을 방지했으나 동시에 분해 품질을 πest 성능으로 제한한다. 또한 입력이 극도로 손상된 경우 프로파일링과 다수 도구 호출로 인해 실시간 배포에서 허용 가능한 지연을 초과할 위험이 있음을 논문에서 지적했다.
실무 활용
Robust-TO는 포렌식 영상 분석, 감시 비디오 리뷰, 자율주행 후검증 같은 현실 환경에서의 비디오 추론 시스템에 적용 가능하다. 프레임 수준 신뢰도를 노출해 왜 특정 결론에 도달했는지 해석 가능한 근거를 제공하므로 운영자가 결과의 신뢰성을 판단하는 데 도움을 준다. 저장소에 코드와 체크포인트가 공개되어 있어 실제 워크플로에 통합할 수 있다.
- 교통사고 분석에서 유실되거나 흐려진 프레임을 자동으로 걸러내어 정밀한 객체 및 번호판 인식을 수행하는 증거 체인을 구성할 때 사용 가능하다.
- 감시 비디오의 이벤트 검출 파이프라인에 통합해 도구 호출 비용과 검토 시간을 줄이면서 열화 구간의 잘못된 경보를 감소시킬 때 유용하다.
- 드론이나 로봇의 안전 판단 모듈에서 열화된 센서 입력을 감지해 대체 감지 전략을 자동으로 선택하는 제어 루프에 적용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Quality Profiling
- — 프레임 품질 프로파일링은 각 프레임에서 blur, brightness, occlusion 같은 신호 수준 통계를 사용해 손상 정도를 추정하는 방법이다. 입력 영상의 라플라시안 분산, HSV 평균 조도, 소벨 에지 비율 등을 계산해 세 채널별 점수를 정규화한 뒤 평균하여 disturbance score를 만든다. 이 점수는 신뢰도 기반 프레임 선택과 도구 라우팅의 기준으로 사용된다.
- Confidence-Guided Routing
- — 신뢰도 기반 도구 라우팅은 질 나쁜 프레임에서 추출된 출력의 신뢰도를 낮춰 도구 결과를 보정하는 기법이다. 각 도구는 자체 불확실도 c_intrinsic을 반환하고 입력 프레임의 보수적 평균 신뢰도 ρ(Fj)를 곱해 최종 신뢰도 cj를 계산한다. 이 신뢰도는 증거 가중치, 증거 등급화, GRPO 보상 설계에 직접 연결된다.
- Tool Orchestration
- — 도구 오케스트레이션은 객체 탐지, 캡션, 추적, OCR 등 서로 다른 시각 도구들을 쿼리 분해 결과에 따라 적절히 호출하고 통합하는 프레임워크다. 쿼리를 원자적 sub-query로 나눈 뒤 프레임별 손상 프로파일과 도구 강건성을 고려해 최적 도구를 선택한다. 각 도구는 통일된 (result, confidence) 인터페이스로 결과를 반환하여 통합 단계가 가능해진다.
- Worst-K Aggregation
- — Worst-K Aggregation은 도구 입력 프레임 집합에서 신뢰도가 낮은 상위 K개 프레임을 골라 그 평균을 입력 신뢰도로 삼는 집계 방식이다. 논문은 K=⌈n/3⌉을 사용해 소수의 깨끗한 프레임이 나머지 다수의 열화 프레임을 가리는 현상을 방지했다. 이 방식은 입력 집합에 일부 심하게 손상된 프레임이 포함될 때 도구 신뢰도를 보수적으로 낮춘다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.