Claude Code 기반 12KB 텍스트 자동 비디오 편집
에이전트 스킬로 동작하며 텍스트 중심으로 단어 단위 타임스탬프와 on-demand 시각화를 결합해 자동으로 영상 컷·그레이딩·자막을 생성한다.
TL;DR
video-use는 Claude Code 같은 셸 접근 가능한 에이전트에 스킬로 등록되어 원본 비디오 폴더를 읽고 자동으로 편집된 final.mp4를 생성하는 파이프라인이다. 핵심 작동 원리는 ElevenLabs Scribe가 만든 단어 단위 타임스탬프와 화자 분리를 기본 텍스트 표면으로 사용하고, 모호한 판단을 위해 필요한 구간에 한해 timeline_view라는 PNG 시각화를 생성해 LLM 판단 근거를 보강하는 것이다. 이 구조는 전체 프레임을 덤프했을 때 발생하는 토큰 폭주를 피하고 각 컷 경계에서 30ms 오디오 페이드, 자동 컬러 그레이딩, 자막 번인 등 후반 작업을 자동으로 수행하도록 설계되었다. 렌더 후 self-eval 루프가 시각적 점프와 오디오 문제를 검출해 최대 세 차례까지 재렌더링을 시도하는 점이 신뢰성 확보에 기여한다. 단, ffmpeg 설치와 ElevenLabs API 키 등록이 필요하며 LLM이 실제 프레임을 직접 보지 않기 때문에 극단적으로 복잡한 비주얼 변형을 요구하는 작업에서는 한계가 있을 수 있다.
주요 기능
- 필러 단어와 불필요한 침묵을 단어 단위 타임스탬프를 기준으로 제거한다.
- 소스별로 자동 컬러 그레이드를 적용하거나 사용자 정의 ffmpeg 체인을 실행한다.
- 컷마다 30ms 오디오 페이드를 삽입하여 팝 노이즈를 억제한다.
- 각 컷 경계에서 렌더 결과를 self-eval 루프로 검증하고 문제가 있으면 최대 3회 재렌더링한다.
어떻게 동작하는가
LLM은 비디오 프레임을 직접 처리하지 않고 두 계층의 텍스트·시각적 요약을 통해 편집 결정을 내린다. 첫 번째 계층은 ElevenLabs Scribe가 생성한 단어 단위 타임스탬프와 화자 분리를 포함한 전사 파일로서 전체 테이크를 약 12KB의 텍스트로 패킹해 LLM의 주된 입력 표면으로 사용한다. 두 번째 계층은 필요 시에만 생성되는 timeline_view PNG로서 필름스트립, 파형, 단어 레이블, 무음 후보를 합성해 모호한 컷 지점이나 시각적 점검이 필요한 경우에만 LLM의 추가 판단 근거로 제공된다.
해결 문제
비디오 편집에서 전체 프레임 덤프가 초래하는 토큰 폭주와 수동 편집 반복 문제를 줄였다. 텍스트 중심의 입력과 on-demand 시각화 결합으로 LLM이 적은 텍스트와 소수의 이미지로 신뢰성 있는 컷 포인트를 산출하도록 했다. 자동화된 렌더·검증 루프를 통해 초기 편집 결과의 시청품질 문제를 발견하고 재렌더링으로 수정할 수 있게 했다.
지금 주목받는 이유
에이전트 기반 워크플로로 Claude Code 등과 통합되어 원본 폴더에 영상을 드롭하면 자동으로 final.mp4를 생성하는 실용적 파이프라인을 제공하기 때문에 주목받고 있다.
차별점
- LLM이 전체 프레임을 읽지 않고 12KB 텍스트 + 선택적 PNG만으로 편집 결정을 내리며, 이로 인해 프레임 덤프 방식의 수백만 토큰 문제를 회피한다.
- timeline_view를 필요 시에만 생성하여 시각적 근거를 제공하고 일반적인 프레임 덤프 방식보다 I/O와 토큰 비용을 크게 줄인다.
- 렌더 후 self-eval 루프를 도입하여 컷 경계의 시각적 점프와 오디오 팝을 자동으로 검출하고 최대 3회까지 수정·재렌더링을 수행한다.
사용 사례
- 토크나 인터뷰 촬영물에서 filler 제거와 화자 전환 정리를 통해 빠르게 출시 가능한 하이라이트 영상을 생성할 때 사용한다.
- 튜토리얼 및 제품 영상에서 자동 자막 삽입과 장면별 컬러 그레이딩을 적용해 일관된 브랜딩 스타일을 유지하고자 할 때 사용한다.
- VPS나 Telegram을 통한 항상-on 편집 파이프라인을 구성해 원격으로 업로드된 촬영물을 자동 처리하는 워크플로에 적용한다.
시작하기
레포를 복제한 뒤 에이전트의 skills 디렉토리에 심링크하고 의존성을 설치한 다음 ffmpeg를 시스템에 설치하고 ElevenLabs API 키를 .env에 설정하면 기본 사용이 가능하다. 빠른 시작 핵심 명령은 git clone https://github.com/browser-use/video-use ~/Developer/video-use 와 ln -sfn ~/Developer/video-use ~/.claude/skills/video-use 그리고 uv sync 또는 pip install -e . 이다. 그 후 에이전트 셸을 통해 대상 비디오 폴더로 이동하여 에이전트를 실행하면 세션이 초기화된다.
요구사항
- ffmpeg가 시스템에 설치되어야 한다.
- ElevenLabs API 키가 필요하며 .env에 ELEVENLABS_API_KEY로 설정해야 한다.
- Claude Code, Codex 등 셸 접근이 가능한 에이전트에 스킬을 등록할 실행 환경이 필요하다.
- Python 환경과 레포가 권장하는 파이썬 의존성(uv sync 또는 pip 설치)을 갖춰야 한다.
이미지 분석
17.5k
Stars
2.1k
Forks
+211
Trending
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.