본문으로 건너뛰기
Cohere조회 1

비디오 생성 모델의 사용자 의도 제어 최적화: 경계 상자 조정을 통한 정밀 제어

비디오 생성 모델에서 경계 상자를 모델의 내부 어텐션과 정렬하여 사용자 의도대로 영상을 제어하는 최적화 프레임워크.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

텍스트 기반 비디오 생성 모델은 고품질 영상을 생성하지만, 경계 상자와 같은 공간적 제어 신호를 정확히 따르는 데 한계가 있다. Daniel Ajisafe는 사용자 제공 제어 상자를 모델의 내부 어텐션 메커니즘과 정렬하고 부드러운 마스킹을 적용하는 최적화 프레임워크를 제시한다. 이 방법은 기존 베이스라인인 Peekaboo와 Trailblazer 대비 AnimalKingdom 데이터셋에서 더 나은 제어 정확도를 보였다. 별도의 재학습 없이도 사용자 의도를 반영한 영상 생성이 가능해져 제어 효율성을 높인다.

챕터별 상세

03:35

연구 배경 및 문제 정의

텍스트 투 비디오 확산 모델은 고품질 영상을 생성하지만, 사용자의 공간적 제어 의도를 정확히 반영하는 데 어려움을 겪는다. 특히 경계 상자를 통한 객체 위치 제어 시 모델이 프롬프트나 상자 제어를 무시하는 현상이 발생한다. 기존 연구들은 이러한 제어 신호를 따르지 못하거나 생성 품질이 저하되는 문제를 보였다.

확산 모델의 생성 과정에서 사용자의 제어 입력과 모델의 내부 표현 간의 불일치가 발생하여 발생하는 문제입니다.

05:30

제안하는 최적화 프레임워크

사용자가 제공한 경계 상자를 모델의 내부 어텐션 맵과 정렬하는 최적화 기법을 제안한다. 모델의 내부 U-Net 블록에서 어텐션 맵을 수정하여 제어 상자 영역을 강화하고 배경을 억제한다. 이 과정에서 부드러운 마스킹 전략을 사용하여 경계면의 불연속성을 해결하고 안정적인 최적화를 가능하게 한다.

U-Net의 어텐션 맵을 직접 수정하여 모델이 특정 영역에 집중하도록 유도하는 방식입니다.

15:05

최적화 전략: Forward 및 Backward Guidance

포워드 가이던스는 경계 상자 영역의 어텐션 활성화를 최대화하고 배경을 억제하여 제어력을 높인다. 백워드 가이던스는 손실 함수를 통해 생성된 영상이 제어 상자 내에 객체를 유지하도록 강제한다. 이 두 가지 가이던스를 결합하여 제어 정확도와 영상 품질 간의 균형을 맞춘다.

가이던스는 모델의 생성 방향을 특정 조건에 맞게 유도하는 기법입니다.

22:50

평가 및 결과 분석

AnimalKingdom 데이터셋을 사용하여 제안 모델을 기존 베이스라인인 Peekaboo, Trailblazer와 비교 평가했다. PickScore, HPSv2, mIOU 지표에서 제안 모델이 일관되게 우수한 성능을 보였다. 특히 제어 충실도와 품질 측면에서 기존 모델보다 정밀한 제어가 가능함이 확인되었다.

AnimalKingdom은 동물 행동 이해를 위한 데이터셋으로, 영상 내 객체 움직임 제어 성능을 평가하는 데 적합합니다.

35:35

한계점 및 향후 연구

모델이 학습 데이터에 없는 객체(예: 범고래)에 대해서는 제어 의도를 이해하지 못하는 한계가 있다. 또한, 역전파 기반의 최적화 과정으로 인해 생성 시간이 증가하는 비용이 발생한다. 향후 연구에서는 더 다양한 조건부 입력(궤적, 스케치 등)으로 확장하고 최적화 속도를 개선할 계획이다.

역전파를 통한 최적화는 생성 시 계산 비용을 증가시키는 트레이드오프가 있습니다.

용어 해설

확산 모델(Diffusion Model)
데이터에 노이즈를 점진적으로 추가한 뒤, 이를 역으로 제거하는 과정을 학습하여 새로운 데이터를 생성하는 생성형 AI 모델 아키텍처입니다. 비디오 생성 분야에서 고품질 영상 생성의 핵심 기술로 사용됩니다.
경계 상자(Bounding Box)
이미지나 영상 내에서 특정 객체의 위치와 크기를 나타내는 사각형 영역입니다. 본 연구에서는 이 상자를 사용하여 생성될 영상 내 객체의 위치를 제어하는 입력 신호로 활용합니다.
어텐션 메커니즘(Attention Mechanism)
모델이 입력 데이터의 특정 부분에 가중치를 두어 중요한 정보를 선택적으로 처리하게 하는 기술입니다. 본 연구에서는 사용자의 제어 신호와 모델의 내부 표현을 정렬하는 데 사용됩니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 18.수집 2026. 07. 18.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.