본문으로 건너뛰기

HOMIE: MLLM 지식을 통합한 인간-객체 중심 비디오 개인화 프레임워크

HOMIE는 MLLM 특징을 전역 가이던스로 self-attention에 주입하고 모달리티·참조 임베딩으로 참조 결속을 보장해 인간-객체 중심 비디오 개인화 품질과 OCR 정확도를 동시에 개선했다.

용어 해설

멀티모달 대형 언어 모델(MLLM)
멀티모달 입력(이미지·텍스트 등)을 동시에 처리하여 시각적 단서와 언어적 문맥을 결합한 고수준 의미 표현을 추출하는 모델 유형이다. 본문에서는 참조 이미지와 프롬프트를 함께 입력해 객체-주체 관계를 추론하는 데 사용되며, 추출한 특징은 비디오 디퓨전 모델의 토큰 공간과 정렬되어 상호작용 정보를 제공한다.
전역 멀티모달 가이던스(Global Multimodal Guidance (GMG))
MLLM에서 추출한 시퀀스 차원의 특징을 시간 축으로 풀링해 하나의 전역 표현으로 요약한 뒤, 이를 통해 비디오 토큰의 쿼리와 키를 affine 변환으로 조정하는 모듈이다. 이 조정은 self-attention 계산 전에 고수준 의미를 비디오 토큰에 주입하여 상호주체 상호작용과 로고 같은 추상 참조의 배치를 향상시킨다.
모달리티-레퍼런스 임베딩(Modality-Reference Embedding (MRE))
비디오 잠재, 참조 이미지 잠재, MLLM 특징 토큰을 구별하기 위해 각 토큰에 할당되는 학습 가능한 모달리티 임베딩과 동일 주체 참조끼리 바인딩하는 레퍼런스 임베딩을 결합한 모듈이다. 이 기법은 이종 토큰의 분해능을 높이고 intra-subject 참조들의 정체성 결속을 보장한다.
플로우 매칭(Flow Matching)
확률적 샘플을 연속적 궤적로 변환하는 속도장(velocity field)을 학습하여 prior 분포에서 데이터 분포로 매핑하는 학습 패러다임이다. 본문에서는 DiT 기반 비디오 모델의 학습 목적함수로 사용되어 시간 t에서의 잠재 속도를 예측하는 방식으로 손실을 계산한다.
Diffusion Transformer(DiT)
Transformer 기반 구조를 확산(denoising) 모델에 적용한 아키텍처로서, 공간·시간 토큰에 대한 self-/cross-attention을 통해 고해상도 비디오의 시공간적 일관성을 학습한다. HOMIE는 DiT를 백본으로 사용해 텍스트-비디오 정렬과 토큰 레벨의 다중 모달 상호작용을 수행한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 20.수집 2026. 07. 22.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.