본문으로 건너뛰기

Aurora: 도구를 사용하는 에이전트와 함께하는 통합 비디오 편집

다수의 비디오 편집 모델은 텍스트, 원본 비디오, 참조 이미지 등을 하나의 conditioning으로 처리한다. 그러나 실제 요청은 이러한 입력이 부족한 경우가 많아 편집 목표가 불완전하게 주어진다. Aurora는 VLM 에이전트가 원시 요청을 모델에 맞는 네 가지 필드 계획으로 확장하고, 필요시 웹 이미지 검색과 grounded segmentation으로 누락된 시각적 조건을 보충한다. 그 뒤 비디오 DiT가 단일 conditioning tuple로 이를 수용해 일관된 편집 결과를 낸다. AgentEdit-Bench를 통해 텍스트/시각적 underspecification 하에서의 전체 프레임워크를 평가하며, 동일 VLM 에이전트가 다른 비디오 편집 모델로도 전달 가능함을 보인다.

용어 해설

통합 컨디셔닝(Unified Conditioning)
텍스트, 원본 비디오, 참조 이미지 등 여러 조건 입력을 하나의 conditioning tuple로 묶어 비디오 편집 모델로 전달하는 개념으로, underspecification 문제를 해결하기 위한 기반 구조를 뜻한다.
GroundingDINO
오픈 세트 객체 탐지를 위한Grounding 방법론으로, 본 논문에서 마스크 지역 grounding에 활용된 도구 중 하나이다.
Segment Anything
세그먼트 대상의 위치를 ​​전역적으로 탐지하는 도구로, 마스크 생성에 사용된다.
LoRA
대형 모델의 가중치를 일부만 학습시키는 저순위 어댑터 방법으로, VLM 에이전트의 파인튜닝에 사용됐다.
Direct Preference Optimization
정책 간 선호 관계를 학습 신호로 삼아 에이전트의 결정 경계를 날카롭게 하는 학습 방식으로, 본 논문에서 VLM 에이전트의 계획 선호 정합에 활용됐다.
AgentEdit-벤치(AgentEdit-Bench)
텍스트 및 시각적 underspecification 하에서 에이전트가 비디오 편집을 얼마나 잘 수행하는지 평가하는 벤치마크이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 18.수집 2026. 05. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.