Alisa0808/vox-director
Python0 / 0
한 줄 주제로 Vox 스타일의 페이퍼 콜라주 설명 영상을 자동으로 생성하는 agent skill이다.
TL;DR
이 리포지토리는 한 줄 주제로 Vox 스타일의 페이퍼 콜라주 설명 영상을 에이전트 스킬 형태로 자동 생성하는 워크플로를 제공하며 beats.json을 중심으로 스크립트, 콜라주 포스터, 모션, TTS 내레이션, BGM, 자막·워터마크 결합까지 순차적으로 실행한다. 파이프라인은 스타일 베이크오프로 룩을 선택하고 포스터 단계에서 시각적 DNA를 확정한 뒤 image-to-video 모델 또는 로컬 키프레임 엔진으로 모션을 추가하며 최종 편집은 ffmpeg로 처리한다. Atlas Cloud 모델을 런타임에 조회해 모델 ID drift를 보정하고 Claude Code 등 코딩 에이전트와 통합해 자동화된 실행을 지원하나, 품질은 포스터 단계의 시각 완성도와 외부 모델 선택에 크게 의존한다.
핵심 포인트
- 비트당 하나의 완성된 콜라주 포스터를 생성해 시각적 DNA를 상류에서 확정함으로써 하류 모션 단계의 품질 저하를 방지한다.
- 스타일 베이크오프 절차로 동일 스토리를 서로 다른 시각 테마로 렌더링해 눈으로 직접 룩을 선택하는 인간 게이트를 제공한다.
- AI 기반 image-to-video 경로와 픽셀·프레임 단위의 로컬 키프레임 엔진을 병행 지원해 실제 인물·브랜드를 다룰 때 정밀 제어를 가능하게 한다.
- 실행 시점에 Atlas Cloud의 live model list를 조회해 모델 ID drift를 자동으로 보정하는 모델 페칭 로직을 포함한다.
이미지 분석



1.5k
STARS
221
FORKS
+204
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.