AlayaLab/Evoke
Python0 / 0
외부 world state bank로 장면을 기억하는 3-step 장기 영상 생성 모델입니다.
TL;DR
이 저장소는 특정 생태계 플러그인이 아닌 연구용 standalone world model 구현체로, EVOKE의 3단계 CFG-free 영상 생성과 외부 world state bank 기반 장기 rollout을 실행합니다. stage3_post_distillation 모델은 H200 한 장에서 3-step으로 384×640 영상 1.5초를 2.11초마다 생성하며 v2v, i2v, t2v와 중간 prompt 변경을 지원합니다. 다만 CUDA 12.4, 개발 버전 diffusers, 필수 ViGeo 가중치와 다중 GPU 학습 구성이 필요해 바로 쓰는 라이브러리보다는 연구 재현과 world model 실험에 적합합니다. 기본 depth 의존성의 CC-BY-NC-4.0 라이선스와 distilled 모델의 zero-shot 조건을 먼저 확인해야 합니다.
핵심 포인트
- 연구용 standalone world model 구현체로, Python과 CUDA 환경에서 EVOKE의 학습·추론 파이프라인을 직접 실행하는 저장소입니다. 특정 애플리케이션 SDK나 MCP server가 아니며, Hugging Face의 공개 가중치와 함께 사용하는 연구 코드에 가깝습니다. Apache-2.0이지만 기본 depth backend인 ViGeo와 선택형 Depth-Anything-3는 CC-BY-NC-4.0이므로 상업적 사용 전 라이선스 확인이 필요합니다.
- EVOKE는 latent chunk를 autoregressive하게 생성하면서 외부 world state bank에 장면 geometry를 저장합니다. 생성된 chunk의 depth를 point cloud로 기록하고 현재 camera pose에 맞는 영역을 co-visibility로 검색한 뒤 최대 8개 source를 z-buffered scatter로 합성해 다음 입력의 warp와 visibility mask를 만듭니다. 이 구조는 긴 세션에서도 denoiser context를 bounded하게 유지하도록 설계됐습니다.
- 추론은 v2v, i2v, t2v와 rollout 중 prompt를 바꾸는 segment 모드를 지원합니다. 기본 post-distillation 모델은 384×640, 24 fps에서 36프레임씩 생성하며 NUM_CHUNKS=20이면 30초 영상을 만들고, segment 모드는 6개 chunk 중 3번째에서 조건을 바꿀 수 있습니다. 다만 모든 distilled 모델은 v2v만으로 학습돼 i2v와 t2v가 zero-shot이고, stage1_camera_control만 세 조건이 학습 분포에 포함됩니다.
- 실행에는 Python 3.10, CUDA 12.4, torch 2.4.0, deepspeed 0.14.5, flash-attn과 PyPI에 없는 개발 버전 diffusers fork가 필요합니다. ViGeo 가중치는 기본 경로에서 필수이며 ffmpeg도 후처리에 필요하고, 학습·추론 사이의 warp와 attention recipe가 다르면 오류 없이 품질이 저하됩니다. 제공된 단일 60초 clip은 실제 학습용 데이터가 아니라 파이프라인 점검용이므로, 재학습에는 별도 production dataset 설정이 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| WBench | 종합 성능 | SOTA | — |
| VBench-Long | 시각 품질 | competitive | — |
| VBench-2.0 | 시각 품질 | competitive | — |
220
STARS
13
FORKS
+206
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.