TL;DR
인간-객체 중심 비디오 개인화는 참조 이미지의 정체성과 객체와의 상호작용을 동시에 유지해야 하는 실무적 요구가 강한 작업이다. HOMIE는 MLLM에서 추출한 고수준 의미를 비디오 토큰에 직접 주입하고 참조 토큰을 명시적으로 구분함으로써 복잡한 상호작용과 추상적 참조(예: 로고)의 정확한 배치를 향상시켰다. 실험에서는 특히 OCR 정확도에서 기존 모델 대비 상대적 21.8% 향상이 보고되어 intra-subject 참조 활용 측면의 실효성을 확인했다.
왜 중요한가
인간-객체 중심 비디오 개인화는 참조 이미지의 정체성과 객체와의 상호작용을 동시에 유지해야 하는 실무적 요구가 강한 작업이다. HOMIE는 MLLM에서 추출한 고수준 의미를 비디오 토큰에 직접 주입하고 참조 토큰을 명시적으로 구분함으로써 복잡한 상호작용과 추상적 참조(예: 로고)의 정확한 배치를 향상시켰다. 실험에서는 특히 OCR 정확도에서 기존 모델 대비 상대적 21.8% 향상이 보고되어 intra-subject 참조 활용 측면의 실효성을 확인했다.
핵심 기여
MLLM 지식을 영상화 과정에 직접 주입하는 통합 멀티모달 입력
HOMIE는 텍스트 인코더를 유지한 채로 비디오 토큰, 참조 이미지 토큰, MLLM에서 추출한 특징을 단일 입력 스트림으로 연결했다. 이 구조는 MLLM이 텍스트-비디오 제어를 재구축하는 부담 없이 참조 관계 추론에 전념하도록 하며, 별도의 고비용 재정렬(re-alignment)을 필요로 하지 않는다. 결과적으로 참조 간의 내재적 연관성 학습이 강화되어 inter-와 intra-subject 시나리오 모두에서 성능 향상이 관측됐다.
전역 멀티모달 가이던스(GMG)를 통한 self-attention 기반 의미 주입
GMG는 MLLM의 시퀀스 특징을 시간 축으로 풀링해 전역 쿼리·키 표현을 만들고, 이 표현을 기반으로 비디오 토큰의 쿼리·키에 대해 feature-wise affine 변환을 적용한다. 이 변환은 attention 계산 이전에 비디오 잠재에 고수준 의미를 안정적으로 주입해 상호주체 상호작용과 추론 능력을 증대시켰다. Ablation 결과에서 GMG 제거는 GMEScore와 주체 일관성 지표 하락으로 연결되어 기여가 정량적으로 확인됐다.
모달리티-레퍼런스 임베딩(MRE)을 통한 토큰 분리와 intra-subject 결속
MRE는 각 토큰에 모달리티별 학습 임베딩을 더해 비디오·참조·MLLM 토큰을 명확히 구분하고, 동일한 주체 참조들에 대해서는 동일 레퍼런스 임베딩을 부여해 정체성 일관성을 확보한다. 이 기법은 OCR 맵이나 multi-view 참조가 독립적 객체로 오인되어 복제되는 현상을 억제하고 참조들 간의 의미적 연결을 강화한다. 실험에서 MRE 제거 시 OCR 관련 오류 증가와 참조 복제 현상 발생이 관찰되어 효과가 입증됐다.
광범위한 데이터 파이프라인과 실험 설정으로 검증한 HOCVP 성능 우위
저자들은 OpenS2V-5M과 PhantomData를 기반으로 300K 단일 주체, 80K 다중 주체, 고품질 20K 마스크 보강 데이터셋을 구성하고 최종적으로 약 40K의 720P 샘플을 선별해 학습에 사용했다. Wan2.1-14B 및 Wan2.2-14B 기반의 백본과 Qwen3-VL-2B-Thinking을 MLLM 피처 추출기로 사용하며 총 학습 소요는 A100 GPU 기준 약 11K GPU-시간이었다. 이러한 대규모 실험에서 HOMIE는 여러 정량 지표와 사용자 연구에서 경쟁 모델을 상회하는 결과를 보였다.
핵심 아이디어 이해하기
기존 text-to-video 또는 image-to-video 디퓨전 기반 접근은 참조 이미지의 정체성과 참조 간 상호작용을 동시에 유지하는 데 한계가 있고, 특히 추상적 참조(예: 로고)나 동일 주체의 다중 관점 정보 처리에서 오류가 발생했다. 이러한 한계는 MLLM의 고수준 추론 능력을 비디오 생성 흐름에 효과적으로 전달하지 못하거나 MLLM을 텍스트 인코더 대신으로 전면 교체하면서 재정렬 비용이 발생하는 두 경로에서 기인한다. HOMIE는 이 두 문제를 동시에 해결하기 위해 텍스트 인코더를 보존하면서 MLLM이 참조 관계 추론에 집중할 수 있는 입력/통합 패러다임을 채택했다.
방법론
HOMIE의 전체 구조는 3D VAE로 비디오를 잠재 공간으로 압축하고 DiT(Transformer 기반 diffusion) 블록에서 잠재 토큰에 대해 self- 및 cross-attention을 수행하는 방식으로 구성된다. 텍스트 조건은 기존의 텍스트 인코더(UmT5)로 처리되어 cross-attention을 통해 DiT에 삽입되며, 참조 이미지와 텍스트는 MLLM을 통해 처리되어 align 네트워크(2-layer MLP)를 거친 뒤 VAE 토큰과 연결된다. GMG는 MLLM 특징의 쿼리·키를 시간 차원으로 풀링하여 전역 표현을 얻고 두 개의 투영망(γ, β)을 통해 비디오 토큰의 쿼리와 키에 대해 feature-wise affine 변환을 적용함으로써 self-attention 계산 전에 의미 정보를 주입한다. MRE는 모달리티 임베딩과 레퍼런스 임베딩으로 구성되어 각 토큰에 모달리티별 신호를 더하고 동일 주체 참조에는 동일한 레퍼런스 임베딩을 부여해 intra-subject 결속을 보장한다. 학습은 flow matching 손실을 사용하며, 이는 시간 t에서의 잠재 속도 예측 오차의 제곱합을 기대값으로 최소화하는 방식이다.
관련 Figure

이 도식은 입력으로서 비디오 토큰, 참조 이미지 토큰, MLLM 특징을 단일 시퀀스로 연결한 후 GMG를 통해 MLLM 전역 표현을 self-attention 단계에 주입하고 MRE로 토큰별 모달리티·레퍼런스 표식을 더하는 전체 처리 흐름을 보여준다. 수식(풀링 및 affine 변환)과 토큰 병합(concatenation) 위치가 시각적으로 표시되어 GMG와 MRE가 attention 경로에서 어떤 단계에 작용하는지 이해하는 데 직접적인 근거를 제공한다.
HOMIE의 전체 파이프라인과 핵심 모듈(GMG, MRE)이 DiT 기반 생성 흐름과 어떻게 결합되는지를 도식화한 아키텍처 다이어그램이다.
주요 결과
정량 평가에서 HOMIE는 오픈 소스 기준에서 전반적인 비디오 품질과 텍스트-정렬(GMEScore) 지표에서 경쟁 우위를 확보했으며, 특히 OCR 정확도는 SkyReels-V3 대비 상대적으로 21.8% 향상이 보고되었다. 다중 관점 intra-subject 실험에서는 DINO_rec 및 DINO_acc에서 Wan2.1/2.2 기반 모델이 상위 성능을 보였고, Wan2.2 구성에서는 DINO_rec 0.696 값을 달성했다. Ablation 실험에서는 GMG와 MRE의 개별 제거가 GMEScore·Face-Sim·Obj-Sim·OCR Acc. 등의 하락으로 이어져 두 구성요소의 기여가 정량적으로 확인되었다. 사용자 연구(40명 참여)에서도 참가자 선호도에서 HOMIE가 나머지 비교 모델들을 상회해 실무적 관점의 품질 우위를 보였다.
관련 Figure

이 이미지는 여러 모델의 생성 프레임을 나란히 배열해 HOMIE가 복수 주체 처리와 로고 같은 추상 참조의 배치에서 더 정확한 결과를 내는 사례들을 직관적으로 드러낸다. 이미지 내 노란 박스와 캡션은 특정 오류 유형(주체 누락, 텍스트 손상, 참조의 복제 등)과 HOMIE가 이를 어떻게 완화했는지를 시각적으로 뒷받침한다.
다양한 비교 대상 모델들과 HOMIE의 정성적 결과를 모아 놓은 콜라주로서 inter-와 intra-subject 시나리오에서 생성 품질과 주체 일관성을 비교한 예시들을 포함한다.

이 그림은 'Plain', 'w/o GMG', 'w/o MRE', 'MLLM to UmT5' 등 구성별 출력 비교를 통해 각 모듈의 기여를 시각적으로 확인할 수 있게 한다. 로고 부착 성공 여부, OCR 보존, 다중 뷰 일관성 등 실험 변수에 따른 출력 변화를 보여주어 정량 표만으로는 확인하기 어려운 오류 유형과 개선 효과를 보완한다.
설계 결정(MLLM 통합 전략, GMG와 MRE의 유무)에 대한 정성적 ablation 결과를 모아 놓은 이미지로서 각 설정의 생성 차이를 비교하고 있다.
기술 상세
전체 아키텍처는 3D VAE로 비디오를 잠재 공간으로 인코딩하고 DiT 블록에서 토큰 수준의 attention 연산을 수행하는 구조다. 텍스트 인코더(UmT5)는 cross-attention 경로로 유지되어 제어성을 보장하며, 참조 이미지는 MLLM(Qwen3-VL-2B-Thinking)으로 처리된 후 두 층 MLP 정렬망을 통해 VAE 토큰 차원으로 투영된다. GMG의 핵심 연산은 MLLM 쿼리/키 Q_M, K_M의 시간 차원 풀링으로 전역 표현 tilde{Q}_M, tilde{K}_M를 얻은 뒤, 각각을 γ_q/β_q와 γ_k/β_k 투영망에 통과시켜 비디오 쿼리 Q_v와 키 K_v에 대해 feature-wise affine 변환을 적용하는 것이다. 이 변환은 수식적으로 Q~_v = (1+γ_q(tilde{Q}M))×Q_v + β_q(tilde{Q}M) 형태로 적용되어 attention 전 단계에서 비디오 토큰의 분포를 모듈화한다. MRE는 각 토큰에 대해 F* + ME[Proj(*)] 연산으로 모달리티 신호를 추가하고, 참조 토큰의 경우 동일 주체에 동일 RE[m]를 가산하여 intra-subject 참조들을 결속한다. 학습 손실은 flow matching ℒ_FM(θ)=E{t,z0,z1}||v_θ(z_t,t,c) - (z1 - z0)||_2^2 로 정의되며, 여기서 v_θ는 시간 t에서의 잠재 속도를 예측하고 z_t=(1-t)z0 + t z1 형태로 구성된다. 구현상 GMG는 모든 DiT 블록에 삽입되며, 참조 임베딩 수는 5로 설정되었다는 점이 재현에 필요한 세부 구성으로 언급되었다.
실무 활용
공개된 GitHub 저장소가 존재하며 코드와 데모가 제공되어 모델을 기반으로 한 실무 적용 가능성이 존재한다. 특히 브랜드 로고 보존, OCR 기반 텍스트 유지, 다중 뷰 객체 일관성 같은 실제 애플리케이션에서 활용도가 높다.
- 마케팅 영상 제작에서 로고나 패키지 디자인을 참조하여 일관성 있는 제품 노출을 생성하는 자동 합성 파이프라인 구축.
- OCR 맵을 참조해 영상 내 텍스트를 정확히 재현해야 하는 광고 및 교육 콘텐츠 자동 생성.
- 여러 뷰의 참조 이미지를 활용해 제품의 3D 회전이나 다양한 각도 표현이 필요한 전자상거래용 비디오 샘플 자동 생성.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- MLLM
- — 멀티모달 입력(이미지·텍스트 등)을 동시에 처리하여 시각적 단서와 언어적 문맥을 결합한 고수준 의미 표현을 추출하는 모델 유형이다. 본문에서는 참조 이미지와 프롬프트를 함께 입력해 객체-주체 관계를 추론하는 데 사용되며, 추출한 특징은 비디오 디퓨전 모델의 토큰 공간과 정렬되어 상호작용 정보를 제공한다.
- Global Multimodal Guidance (GMG)
- — MLLM에서 추출한 시퀀스 차원의 특징을 시간 축으로 풀링해 하나의 전역 표현으로 요약한 뒤, 이를 통해 비디오 토큰의 쿼리와 키를 affine 변환으로 조정하는 모듈이다. 이 조정은 self-attention 계산 전에 고수준 의미를 비디오 토큰에 주입하여 상호주체 상호작용과 로고 같은 추상 참조의 배치를 향상시킨다.
- Modality-Reference Embedding (MRE)
- — 비디오 잠재, 참조 이미지 잠재, MLLM 특징 토큰을 구별하기 위해 각 토큰에 할당되는 학습 가능한 모달리티 임베딩과 동일 주체 참조끼리 바인딩하는 레퍼런스 임베딩을 결합한 모듈이다. 이 기법은 이종 토큰의 분해능을 높이고 intra-subject 참조들의 정체성 결속을 보장한다.
- Flow Matching
- — 확률적 샘플을 연속적 궤적로 변환하는 속도장(velocity field)을 학습하여 prior 분포에서 데이터 분포로 매핑하는 학습 패러다임이다. 본문에서는 DiT 기반 비디오 모델의 학습 목적함수로 사용되어 시간 t에서의 잠재 속도를 예측하는 방식으로 손실을 계산한다.
- DiT
- — Transformer 기반 구조를 확산(denoising) 모델에 적용한 아키텍처로서, 공간·시간 토큰에 대한 self-/cross-attention을 통해 고해상도 비디오의 시공간적 일관성을 학습한다. HOMIE는 DiT를 백본으로 사용해 텍스트-비디오 정렬과 토큰 레벨의 다중 모달 상호작용을 수행한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
