본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Alisa0808/vox-director

Python0 / 0

한 줄 주제로 Vox 스타일의 페이퍼 콜라주 설명 영상을 자동으로 생성하는 agent skill이다.

TL;DR

이 리포지토리는 한 줄 주제로 Vox 스타일의 페이퍼 콜라주 설명 영상을 에이전트 스킬 형태로 자동 생성하는 워크플로를 제공하며 beats.json을 중심으로 스크립트, 콜라주 포스터, 모션, TTS 내레이션, BGM, 자막·워터마크 결합까지 순차적으로 실행한다. 파이프라인은 스타일 베이크오프로 룩을 선택하고 포스터 단계에서 시각적 DNA를 확정한 뒤 image-to-video 모델 또는 로컬 키프레임 엔진으로 모션을 추가하며 최종 편집은 ffmpeg로 처리한다. Atlas Cloud 모델을 런타임에 조회해 모델 ID drift를 보정하고 Claude Code 등 코딩 에이전트와 통합해 자동화된 실행을 지원하나, 품질은 포스터 단계의 시각 완성도와 외부 모델 선택에 크게 의존한다.

핵심 포인트

  • 비트당 하나의 완성된 콜라주 포스터를 생성해 시각적 DNA를 상류에서 확정함으로써 하류 모션 단계의 품질 저하를 방지한다.
  • 스타일 베이크오프 절차로 동일 스토리를 서로 다른 시각 테마로 렌더링해 눈으로 직접 룩을 선택하는 인간 게이트를 제공한다.
  • AI 기반 image-to-video 경로와 픽셀·프레임 단위의 로컬 키프레임 엔진을 병행 지원해 실제 인물·브랜드를 다룰 때 정밀 제어를 가능하게 한다.
  • 실행 시점에 Atlas Cloud의 live model list를 조회해 모델 ID drift를 자동으로 보정하는 모델 페칭 로직을 포함한다.

이미지 분석

콜라주 스타일의 프레임 스틸과 하단 자막이 포함된 썸네일 이미지이다.
이 이미지는 페이퍼 콜라주 미학(찢긴 종이, 헤드라인 텍스트, 오브젝트 컷아웃)을 완성된 프레임으로 나타낸다. 하단 캡션 텍스트가 타임라인 기반 자막 배치와 서체 가독성을 확인하게 해 주며 이는 실제 출력에서 캡션 번인(하드코딩) 동작과 자막 레이아웃 정책을 검증하는 근거가 된다. 이미지의 구성은 포스터 단계에서 시각적 DNA가 확정되어야 이후 모션 단계에서 품질 저하가 발생하지 않음을 시사한다.
멕시칸 스트리트 푸드를 주제로 한 콜라주 포스터의 썸네일 스틸이다.
이 프레임은 스타일 베이크오프 결과 중 하나로서 색채·아이콘·레이아웃 변형이 어떻게 출력되는지 시각적으로 드러낸다. 중앙의 주요 오브젝트와 주변 장식 요소들이 포스터 단계에서 얼마나 풍부하게 표현되는지가 확인되며 이는 image-to-video 애니메이션 또는 로컬 키프레임 분할 시 오브젝트 단위 처리 가능성을 의미한다. 하단 자막과 타이밍 예시는 ffmpeg로 자막을 번인하고 오디오와 싱크하는 파이프라인의 출력 형태를 예측하게 한다.
돈의 역사를 주제로 한 60초 영상 예시의 콜라주 프레임과 내레이터 캡션이 포함된 이미지이다.
이 이미지는 내레이션 텍스트가 캡션으로 함께 제공되는 출력 예시로, TTS와 자막 동기화의 결과물을 확인할 수 있게 한다. 콜라주 요소의 디테일과 타이포그래피 배치는 포스터 단계에서 시각적 완성도가 높아야 모션 단계에서 자연스러운 애니메이션이 가능하다는 설계 철학을 뒷받침한다. 또한 이 프레임은 다양한 주제에 동일 파이프라인을 적용했을 때 일관된 스타일 규격으로 결과가 산출된다는 근거로 활용될 수 있다.

1.5k

STARS

221

FORKS

+204

TRENDING

0

조회수

watchers 1.5kopen issues 3MIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.