본문으로 건너뛰기

VOID: 물리적 상호작용을 고려한 비디오 객체 제거 모델

비디오에서 객체를 제거할 때 외형뿐만 아니라 그 객체로 인한 물리적 상호작용과 인과관계까지 수정하는 새로운 인페인팅 모델 VOID가 공개됐다.

실용적 조언

  • 비디오 편집 시 객체 제거 후 부자연스러운 물리 효과가 남는다면 VOID의 VLM 가이드 마스크 기법을 참고할 수 있다.
  • Hugging Face 데모를 통해 실제 영상에서 물리적 인과관계가 어떻게 수정되는지 직접 테스트해 볼 수 있다.

섹션별 상세

01
기존 비디오 인페인팅 모델은 객체 제거 시 픽셀은 채우지만 물리적 인과관계는 수정하지 못하는 한계가 있다. 도미노 영상에서 중간 블록을 제거해도 나머지 도미노가 계속 쓰러지거나, 충돌 직전의 차를 지워도 사고 효과가 남는 등 비현실적인 결과가 발생한다. VOID는 이러한 물리적 모순을 해결하기 위해 설계됐다.
02
모델은 반사실적(Counterfactual) 장면 진화를 모델링하여 '객체가 없었다면 영상이 어떻게 변했을까'를 예측한다. Kubric과 HUMOTO를 활용해 객체가 있는 영상과 없는 영상의 쌍으로 구성된 학습 데이터를 구축했다. 이를 통해 모델은 객체의 존재 여부에 따른 물리적 변화를 직접 학습한다.
03
VLM(시각 언어 모델) 가이드 마스크를 사용하여 제거된 객체에 의해 영향받는 영역을 정교하게 식별한다. 이후 2단계 생성 과정을 거치는데, 먼저 새로운 모션을 예측한 뒤 flow-warped 노이즈를 활용해 프레임 간 시간적 일관성을 확보한다. 이 과정은 단순한 픽셀 채우기를 넘어 장면의 동역학을 재구성한다.
04
실제 영상 대상 인간 선호도 조사에서 VOID는 64.8%의 선택을 받으며 성능을 입증했다. 비교 대상이었던 Runway(Aleph), Generative Omnimatte, ProPainter 등 기존 최신 모델들보다 물리적 타당성 면에서 우수한 평가를 받았다. 현재 프로젝트 페이지와 코드가 공개되어 재현이 가능하다.

용어 해설

비디오 인페인팅(Video Inpainting)
비디오의 특정 영역이나 객체를 제거하고 주변 배경과 어울리도록 빈 공간을 자연스럽게 채우는 기술이다. 단순히 픽셀을 채우는 것을 넘어 프레임 간의 시간적 연속성을 유지하며 움직이는 배경을 재구성하는 것이 핵심이다.
반사실적 추론(Counterfactual Reasoning)
"만약 특정 사건이 일어나지 않았다면 결과가 어떻게 달라졌을까?"를 가정하여 추론하는 방식이다. 이 모델에서는 특정 객체가 처음부터 존재하지 않았을 경우의 물리적 변화를 예측하는 데 사용된다.
시각 언어 모델(VLM (Vision-Language Model))
이미지나 비디오의 시각적 정보와 텍스트 정보를 동시에 이해하고 처리하는 AI 모델이다. 본문에서는 제거된 객체로 인해 물리적 영향이 미치는 영역을 텍스트 가이드에 따라 식별하는 역할을 수행한다.
시간적 일관성(Temporal Consistency)
비디오 프레임이 진행됨에 따라 객체의 모양, 위치, 배경이 끊김 없이 자연스럽게 이어지는 성질이다. 인페인팅 결과물이 깜빡거리거나 왜곡되지 않도록 보장하는 비디오 생성 모델의 필수 품질 지표이다.

언급된 도구

VOID추천링크

물리적 상호작용을 고려한 비디오 객체 제거 및 인페인팅

Kubric중립

반사실적 학습 데이터 생성을 위한 시뮬레이션 도구

ProPainter중립

비디오 인페인팅 베이스라인 모델

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 03.수집 2026. 04. 03.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.