본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

NoizAI/HelixWorld

Python0 / 0

사용자의 시점 이동에 맞춰 영상과 공간 음향을 동시에 갱신하는 실시간 world model 연구 저장소입니다.

TL;DR

HelixWorld는 이미지와 prompt를 바탕으로 사용자의 이동이나 회전에 맞춰 영상과 공간 음향을 함께 생성하는 독립형 audio-visual world model 연구 저장소입니다. 모델은 현재 상태와 사용자의 action에서 다음 화면과 소리를 예측하고, 자체 생성 이력을 이어 가는 causal rollout으로 상호작용을 처리합니다. 실시간성을 확보하려고 joint generation을 distillation한 뒤 action, decode, AV output을 pipeline으로 실행하는 구조를 사용합니다. 그러나 README 기준으로 Weights와 inference code가 아직 공개되지 않아 현재 도입 가능한 라이브러리나 실행 도구로 보기는 어렵습니다.

핵심 포인트

  • 독립형 research model repo로 분류됩니다. Python 저장소지만 현재 실행 코드는 없습니다. Weights와 기술 보고서는 추후 공개 예정입니다.
  • 이미지와 prompt를 입력하면 사용자의 이동·회전에 맞춰 영상과 소리를 함께 갱신합니다. 카메라 방향에 따라 spatial sound field도 회전합니다. 후처리 soundtrack이 아닌 joint audio-video 생성 방식입니다.
  • spatial AV data와 game-engine 캡처를 학습에 사용합니다. 현재 상태와 사용자의 action에서 다음 화면·소리를 예측합니다. 자체 생성 이력만으로 이어 가는 causal rollout을 적용합니다.
  • 실시간 처리를 위해 joint generation을 distillation합니다. action, decode, AV output을 pipeline으로 연결합니다. 다만 공개 코드·Weights·벤치마크가 없어 지금 바로 사용할 수는 없습니다.

294

STARS

22

FORKS

+209

TRENDING

0

조회수

watchers 294open issues 1Apache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.