TL;DR
CoinVE-Edit은 여러 영상 편집 지시를 한 번에 처리하는 조합형 영상 편집 모델이다. 2~5개의 지시를 하나의 forward pass에서 실행하고, 지시별 mask를 lightweight mask head로 주입해 각 변경을 지정 영역에 제한한다. Replace, Add, Remove, Background Change를 조합할 수 있으며 Wan2.1-T2V-14B와 Qwen3-VL-8B를 기반으로 구축됐다. 200K개가 넘는 영상 편집 쌍으로 구성된 CoinVE-200K에서 학습됐다.
섹션별 상세
이미지 분석

이미지는 CoinVE-200K가 200,000개 이상의 영상 편집 데이터를 포함하고, 1080P 해상도와 최대 201프레임 영상을 다룬다고 표시한다. 편집 대상은 Human, Objects, Background로 나뉘며, 편집 원자는 Addition, Removal, Modification, Stylization으로 구성되어 CoinVE-Edit이 여러 대상과 작업을 조합하는 학습 구조를 시각화한다.
CoinVE-200K의 규모와 영상 편집 작업 유형을 요약한 인포그래픽이다.

두 번째 이미지는 첫 번째 이미지와 같은 CoinVE-200K 요약 인포그래픽으로, 200,000개 이상의 데이터와 1080P·최대 201프레임 조건을 함께 나타낸다. Human·Objects·Background를 편집 대상으로 삼고 Addition·Removal·Modification·Stylization을 편집 원자로 구분해 데이터셋의 구성 범위를 나타낸다.
CoinVE-200K 데이터셋의 규모, 해상도, 프레임 수와 조합형 편집 범주를 정리한 인포그래픽이다.
용어 해설
- 조합형 영상 편집(Compositional Video Editing)
- — 여러 편집 지시를 한 번에 받아 영상의 서로 다른 영역에 각각 적용하는 방식이다. 각 변경 사항을 동시에 처리하면서 인물, 객체, 배경 사이의 전체적인 시각적 일관성을 유지하는 데 목적이 있다.
- 영역 인식 마스크 가이던스(Region-Aware Mask Guidance)
- — 각 편집 지시와 연결된 공간 영역을 마스크로 지정해 변경 범위를 제한하는 방법이다. CoinVE-Edit은 지시별 마스크를 가벼운 mask head로 주입해 서로 다른 편집이 인접 영역에 번지는 문제를 줄인다.
- 순전파(Forward Pass)
- — 입력 데이터를 모델의 여러 층에 통과시켜 출력 결과를 계산하는 한 번의 추론 과정이다. CoinVE-Edit은 2~5개의 편집 지시를 하나의 forward pass에서 함께 처리해 지시별 순차 실행 대신 동시 편집을 수행한다.
- 비디오 DiT(Video DiT)
- — Transformer 구조를 영상 생성과 편집에 적용한 확산 모델 계열이다. CoinVE-Edit에서는 Wan2.1-T2V-14B 기반 video DiT가 편집된 영상의 시공간적 내용을 생성하는 역할을 맡는다.
- 멀티모달 대규모 언어 모델 인코더(MLLM Encoder)
- — 텍스트 지시와 영상 또는 이미지 정보를 함께 인코딩해 편집 모델이 의미와 시각적 대상을 연결하도록 만드는 구성 요소다. CoinVE-Edit은 Qwen3-VL-8B를 MLLM encoder로 활용해 영역별 지시 해석을 지원한다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.