본문으로 건너뛰기

CoinVE-Edit의 조합형 다중 지시 영상 편집

CoinVE-Edit은 지시별 마스크로 2~5개 영상 편집을 동시에 처리한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

CoinVE-Edit은 여러 영상 편집 지시를 한 번에 처리하는 조합형 영상 편집 모델이다. 2~5개의 지시를 하나의 forward pass에서 실행하고, 지시별 mask를 lightweight mask head로 주입해 각 변경을 지정 영역에 제한한다. Replace, Add, Remove, Background Change를 조합할 수 있으며 Wan2.1-T2V-14B와 Qwen3-VL-8B를 기반으로 구축됐다. 200K개가 넘는 영상 편집 쌍으로 구성된 CoinVE-200K에서 학습됐다.

섹션별 상세

01
CoinVE-Edit은 한 번에 하나의 지시만 처리하던 기존 영상 편집 방식과 달리 2~5개의 편집 지시를 하나의 forward pass에서 함께 처리한다. 각 지시는 지정된 영역에 동시에 적용되며, 전체 영상의 일관성을 유지하도록 설계됐다. 게시물은 이 구조가 여러 변경 작업을 순차적으로 실행하지 않고 조합형 편집을 수행하게 만든다고 설명한다.
02
모델은 지시마다 별도의 마스크를 주입하는 lightweight mask head를 사용한다. 입력된 편집 지시와 공간 마스크가 연결되고, 모델은 해당 영역 안에서만 Replace, Add, Remove, Background Change 작업을 적용한다. 이 방식은 인물·객체·배경을 서로 다른 지시로 바꿀 때 편집 범위를 분리하는 핵심 구성으로 제시됐다.
03
CoinVE-Edit은 Wan2.1-T2V-14B 기반 video DiT와 Qwen3-VL-8B 기반 MLLM encoder를 결합했다. 전자는 영상의 시공간적 생성과 편집 결과 산출에 관여하고, 후자는 텍스트 지시와 영상 속 대상을 해석하는 역할을 맡는다. 학습에는 200K개가 넘는 고품질 영상 편집 쌍으로 구성된 CoinVE-200K가 사용됐으며, 게시물은 엄격한 데이터 필터링을 거쳤다고 밝혔다.

이미지 분석

CoinVE-200K의 규모와 영상 편집 작업 유형을 요약한 인포그래픽이다.
Infographic

이미지는 CoinVE-200K가 200,000개 이상의 영상 편집 데이터를 포함하고, 1080P 해상도와 최대 201프레임 영상을 다룬다고 표시한다. 편집 대상은 Human, Objects, Background로 나뉘며, 편집 원자는 Addition, Removal, Modification, Stylization으로 구성되어 CoinVE-Edit이 여러 대상과 작업을 조합하는 학습 구조를 시각화한다.

CoinVE-200K의 규모와 영상 편집 작업 유형을 요약한 인포그래픽이다.

CoinVE-200K 데이터셋의 규모, 해상도, 프레임 수와 조합형 편집 범주를 정리한 인포그래픽이다.
Infographic

두 번째 이미지는 첫 번째 이미지와 같은 CoinVE-200K 요약 인포그래픽으로, 200,000개 이상의 데이터와 1080P·최대 201프레임 조건을 함께 나타낸다. Human·Objects·Background를 편집 대상으로 삼고 Addition·Removal·Modification·Stylization을 편집 원자로 구분해 데이터셋의 구성 범위를 나타낸다.

CoinVE-200K 데이터셋의 규모, 해상도, 프레임 수와 조합형 편집 범주를 정리한 인포그래픽이다.

용어 해설

조합형 영상 편집(Compositional Video Editing)
여러 편집 지시를 한 번에 받아 영상의 서로 다른 영역에 각각 적용하는 방식이다. 각 변경 사항을 동시에 처리하면서 인물, 객체, 배경 사이의 전체적인 시각적 일관성을 유지하는 데 목적이 있다.
영역 인식 마스크 가이던스(Region-Aware Mask Guidance)
각 편집 지시와 연결된 공간 영역을 마스크로 지정해 변경 범위를 제한하는 방법이다. CoinVE-Edit은 지시별 마스크를 가벼운 mask head로 주입해 서로 다른 편집이 인접 영역에 번지는 문제를 줄인다.
순전파(Forward Pass)
입력 데이터를 모델의 여러 층에 통과시켜 출력 결과를 계산하는 한 번의 추론 과정이다. CoinVE-Edit은 2~5개의 편집 지시를 하나의 forward pass에서 함께 처리해 지시별 순차 실행 대신 동시 편집을 수행한다.
비디오 DiT(Video DiT)
Transformer 구조를 영상 생성과 편집에 적용한 확산 모델 계열이다. CoinVE-Edit에서는 Wan2.1-T2V-14B 기반 video DiT가 편집된 영상의 시공간적 내용을 생성하는 역할을 맡는다.
멀티모달 대규모 언어 모델 인코더(MLLM Encoder)
텍스트 지시와 영상 또는 이미지 정보를 함께 인코딩해 편집 모델이 의미와 시각적 대상을 연결하도록 만드는 구성 요소다. CoinVE-Edit은 Qwen3-VL-8B를 MLLM encoder로 활용해 영역별 지시 해석을 지원한다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.