본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

DANNY621/H3-World

초기 이미지와 키보드 조작을 입력받아 캐릭터·카메라 움직임이 반영된 게임 영상을 생성합니다.33B backbone, 65.6M LoRA parametersapache-2.0

MiniMax-H3 기반 LoRA로 키보드 입력에 반응하는 게임 영상을 생성

학습 방식 · MiniMax-H3 33B backbone에 ABot-World-Explorer-500h의 gameplay clip 8,000개를 사용해 rank-32 LoRA를 학습하고 directed-attention patch로 키보드 지시와 영상 latent 구간을 연결합니다.

TL;DR

H3-World는 MiniMax-H3를 기반으로 한 rank-32 LoRA형 interactive world model로, 초기 프레임과 키보드 입력을 받아 캐릭터와 카메라 움직임이 반영된 영상을 생성합니다. 키보드 상태를 미래 영상 latent마다 하나의 언어 지시로 바꾸고, directed attention routing으로 각 지시를 해당 latent 구간에 연결합니다. ABot-World-Explorer-500h의 gameplay clip 8,000개로 33B backbone의 0.199%에 해당하는 65.6M LoRA 파라미터를 학습했습니다. MiniMax-H3 기본 가중치와 H3-World의 directed-attention patch가 함께 필요해 수정하지 않은 MiniMax-H3 pipeline만으로는 같은 동작을 재현할 수 없습니다.

핵심 포인트

  • 키보드 상태를 미래 영상 latent별 언어 지시로 변환하고 directed attention으로 시간 구간에 연결합니다.
  • 33B MiniMax-H3 backbone 전체가 아니라 65.6M LoRA 파라미터만 학습해 0.199% 규모로 조정합니다.
  • 8,000개의 gameplay clip으로 캐릭터 조작과 카메라 이동을 함께 반영하는 영상 생성을 학습합니다.
  • W·A·S·D는 캐릭터를, I·J·K·L과 F는 카메라 방향과 빠른 이동을 제어합니다.

제한사항

  • MiniMax-H3 기본 가중치와 H3-World의 directed-attention patch가 함께 필요합니다.
  • 수정하지 않은 MiniMax-H3 pipeline에서는 README에 보고된 동작을 재현할 수 없습니다.

71

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.