본문으로 건너뛰기

MiniMax-H3를 행동 가능한 월드 모델로 전환

H3-World는 MiniMax-H3의 텍스트 경로에 시간별 행동 명령을 주입해 캐릭터와 카메라를 정밀하게 제어합니다.

용어 해설

월드 모델(World Model)
환경이 시간에 따라 어떻게 변하는지 학습하고, 외부 행동에 따른 시각적 미래를 생성하는 모델입니다. H3-World는 캐릭터 이동과 카메라 움직임을 행동 입력으로 받아 다음 영상 구간을 생성하는 방식으로 이 개념을 구현합니다.
잠재 표현 정렬(Latent Alignment)
입력 명령과 생성 영상의 잠재 구간을 시간상 대응시키는 방법입니다. 각 행동 문장을 특정 video latent interval에 연결해 한 영상 안에서 행동이 바뀌는 시점과 생성 결과가 어긋나지 않도록 합니다.
시간적 Attention 라우팅(Temporal Attention Routing)
Self-Attention에서 각 시간 구간의 명령이 지정된 video latent에만 직접 전달되도록 정보 흐름을 제한하는 기법입니다. 서로 다른 행동의 영향이 다른 시점으로 번지는 control leakage를 줄이는 역할을 합니다.
단일 진입점 라우팅(Single-Egress Routing)
각 action span이 대응하는 하나의 video latent를 통해서만 시각 스트림에 직접 영향을 주도록 설계한 routing 구조입니다. 이후 video-to-video attention은 유지해 장면 연속성을 보존하면서 행동별 직접 진입점을 분리합니다.
저순위 적응(Low-Rank Adaptation)
기존 모델의 전체 가중치를 갱신하지 않고 저순위 행렬 업데이트만 학습하는 Fine-tuning 방식입니다. H3-World는 H3 Self-Attention의 QKV·출력 projection과 token refiner에 LoRA를 적용해 학습 가능한 파라미터를 0.199%로 제한합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 01.수집 2026. 09. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.