DANNY621/H3-World
초기 이미지와 키보드 조작을 입력받아 캐릭터·카메라 움직임이 반영된 게임 영상을 생성합니다.33B backbone, 65.6M LoRA parametersapache-2.0
MiniMax-H3 기반 LoRA로 키보드 입력에 반응하는 게임 영상을 생성
학습 방식 · MiniMax-H3 33B backbone에 ABot-World-Explorer-500h의 gameplay clip 8,000개를 사용해 rank-32 LoRA를 학습하고 directed-attention patch로 키보드 지시와 영상 latent 구간을 연결합니다.
TL;DR
H3-World는 MiniMax-H3를 기반으로 한 rank-32 LoRA형 interactive world model로, 초기 프레임과 키보드 입력을 받아 캐릭터와 카메라 움직임이 반영된 영상을 생성합니다. 키보드 상태를 미래 영상 latent마다 하나의 언어 지시로 바꾸고, directed attention routing으로 각 지시를 해당 latent 구간에 연결합니다. ABot-World-Explorer-500h의 gameplay clip 8,000개로 33B backbone의 0.199%에 해당하는 65.6M LoRA 파라미터를 학습했습니다. MiniMax-H3 기본 가중치와 H3-World의 directed-attention patch가 함께 필요해 수정하지 않은 MiniMax-H3 pipeline만으로는 같은 동작을 재현할 수 없습니다.
핵심 포인트
- 키보드 상태를 미래 영상 latent별 언어 지시로 변환하고 directed attention으로 시간 구간에 연결합니다.
- 33B MiniMax-H3 backbone 전체가 아니라 65.6M LoRA 파라미터만 학습해 0.199% 규모로 조정합니다.
- 8,000개의 gameplay clip으로 캐릭터 조작과 카메라 이동을 함께 반영하는 영상 생성을 학습합니다.
- W·A·S·D는 캐릭터를, I·J·K·L과 F는 카메라 방향과 빠른 이동을 제어합니다.
제한사항
- MiniMax-H3 기본 가중치와 H3-World의 directed-attention patch가 함께 필요합니다.
- 수정하지 않은 MiniMax-H3 pipeline에서는 README에 보고된 동작을 재현할 수 없습니다.
71
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.