본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

jd-opensource/JoyAI-Video-Edit

Python0 / 0

자연어 지시로 라이브 영상을 프레임 단위 편집하는 Python 기반 실시간 Video-to-Video 시스템입니다.

TL;DR

JoyAI-Video-Edit은 특정 프레임워크에 종속되지 않은 독립 실행형 연구·배포 도구로, 자연어 지시를 받아 라이브 또는 업로드 영상의 프레임을 도착 순서대로 편집합니다. MLLM-based condition encoder, causal video VAE, 16B MMDiT를 autoregressive diffusion 구조로 연결하고 bounded KV-state inference와 distillation으로 실시간 처리를 구현합니다. README 기준 720 × 1248에서 end-to-end 30 FPS를 기록했으며, 단일 RTX PRO 6000에서 840 × 480, 24 FPS로 동작하는 라이브 데모도 공개됐습니다. 다만 전체 학습·데이터 파이프라인과 Diffusers 지원이 아직 없고 소비자용 GPU 최적화도 TODO이므로, 현재는 충분한 GPU를 갖춘 연구·서비스 프로토타입에 우선 적합합니다.

핵심 포인트

  • 독립 실행형 연구·배포 도구로, 라이브 카메라 스트림이나 업로드 영상을 자연어 지시로 프레임 도착 순서에 맞춰 편집합니다. 전체 영상 길이를 미리 알거나 미래 프레임을 다시 읽지 않는 causal 처리 구조라 실시간 입력에 맞춘 편집 파이프라인을 구성할 수 있습니다. 특정 생태계의 plugin이나 SDK가 아니라 Python 기반 서버 애플리케이션에 가깝습니다.
  • MLLM-based condition encoder가 자연어 지시와 입력 영상을 조건으로 변환하고, causal video VAE와 16B-parameter MMDiT가 편집 프레임을 autoregressive diffusion 방식으로 생성합니다. aligned autoregressive distribution matching distillation, long-horizon optimization, bounded KV-state inference, deployment-oriented scheduling을 결합해 학습과 추론 사이의 차이와 장기 스트림의 temporal drift를 줄입니다. subject 교체·삭제, local edit, 배경 변경, style transfer, motion 변경, reference-guided editing을 하나의 지시 기반 흐름으로 처리합니다.
  • 배포 코드는 공개됐지만 전체 training framework와 data generation pipeline은 아직 공개되지 않았고, Diffusers pipeline도 TODO로 남아 있습니다. Quick Start는 Conda 환경과 deploy/requirements.txt 설치 후 Hugging Face checkpoint, MiMo-VL, ONNX detector 파일을 준비하고 deploy/run_server.sh로 localhost 서버를 실행하는 방식입니다. 따라서 모델 연구와 GPU 서버 기반 프로토타이핑에는 적합하지만, 바로 소비자용 GPU나 Diffusers 생태계에 연결하는 용도에는 추가 작업이 필요합니다.
  • README의 deployment benchmark는 720 × 1248 해상도에서 end-to-end 30 FPS를 기록하며, 공개된 라이브 데모는 단일 RTX PRO 6000 Blackwell GPU에서 840 × 480, 24 FPS로 실행됩니다. 제공된 OpenVE-Bench 이미지에서는 JoyAI-Video-Edit이 16B 모델로 overall editing quality 3.60과 DiT throughput 37.21 FPS 지점에 표시되고, human evaluation은 1.00으로 표시됩니다. 이미지 수치는 README 본문이 아니라 첨부 teaser의 그래프에서 읽은 값이며, 실제 처리량은 GPU·해상도·설정에 따라 달라질 수 있습니다.

벤치마크

벤치마크지표비교
Deployment benchmarkend-to-end throughput30 FPS at 720 × 1248
Live demostreaming throughput24 FPS at 840 × 480 on a single RTX PRO 6000 (Blackwell) GPU
OpenVE-Benchoverall editing quality3.60첨부 그래프에 표시된 JoyAI-Video-Edit 16B의 수치이며, 양자화 버전의 별도 측정치가 아님
OpenVE-BenchDiT throughput37.21 FPS첨부 그래프에 표시된 JoyAI-Video-Edit 16B의 수치이며, 전체 end-to-end 처리량과는 다른 지표
Human Evaluationevaluation score1.00첨부 그래프에 표시된 JoyAI-Video-Edit의 수치이며, 평가 절차와 표본 정보는 README에 명시되지 않음

이미지 분석

JoyAI-Video-Edit이 시간 순서에 따라 입력 영상을 실시간으로 편집하고, OpenVE-Bench와 human evaluation에서 비교 모델보다 높은 위치에 표시된 결과를 담은 teaser 이미지입니다.
왼쪽 필름 스트립은 0초부터 60초까지 입력 장면에 자연어 지시를 순차적으로 적용하는 EDIT 결과를 보여주며, 장면 변환·객체 교체·소품 추가·cartoon style 변환이 시간축을 따라 이어집니다. 오른쪽 그래프에서는 JoyAI-Video-Edit이 OpenVE-Bench의 overall editing quality 3.60, DiT throughput 37.21 FPS 지점과 human evaluation 1.00으로 표시되어 실시간성과 편집 품질을 함께 겨냥한 설계를 뒷받침합니다.

1.2k

Stars

42

Forks

+207

Trending

0

조회수

1.2k watchers8 open issuesApache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.