jd-opensource/JoyAI-Video-Edit
Python0 / 0
자연어 지시로 라이브 영상을 프레임 단위 편집하는 Python 기반 실시간 Video-to-Video 시스템입니다.
TL;DR
JoyAI-Video-Edit은 특정 프레임워크에 종속되지 않은 독립 실행형 연구·배포 도구로, 자연어 지시를 받아 라이브 또는 업로드 영상의 프레임을 도착 순서대로 편집합니다. MLLM-based condition encoder, causal video VAE, 16B MMDiT를 autoregressive diffusion 구조로 연결하고 bounded KV-state inference와 distillation으로 실시간 처리를 구현합니다. README 기준 720 × 1248에서 end-to-end 30 FPS를 기록했으며, 단일 RTX PRO 6000에서 840 × 480, 24 FPS로 동작하는 라이브 데모도 공개됐습니다. 다만 전체 학습·데이터 파이프라인과 Diffusers 지원이 아직 없고 소비자용 GPU 최적화도 TODO이므로, 현재는 충분한 GPU를 갖춘 연구·서비스 프로토타입에 우선 적합합니다.
핵심 포인트
- 독립 실행형 연구·배포 도구로, 라이브 카메라 스트림이나 업로드 영상을 자연어 지시로 프레임 도착 순서에 맞춰 편집합니다. 전체 영상 길이를 미리 알거나 미래 프레임을 다시 읽지 않는 causal 처리 구조라 실시간 입력에 맞춘 편집 파이프라인을 구성할 수 있습니다. 특정 생태계의 plugin이나 SDK가 아니라 Python 기반 서버 애플리케이션에 가깝습니다.
- MLLM-based condition encoder가 자연어 지시와 입력 영상을 조건으로 변환하고, causal video VAE와 16B-parameter MMDiT가 편집 프레임을 autoregressive diffusion 방식으로 생성합니다. aligned autoregressive distribution matching distillation, long-horizon optimization, bounded KV-state inference, deployment-oriented scheduling을 결합해 학습과 추론 사이의 차이와 장기 스트림의 temporal drift를 줄입니다. subject 교체·삭제, local edit, 배경 변경, style transfer, motion 변경, reference-guided editing을 하나의 지시 기반 흐름으로 처리합니다.
- 배포 코드는 공개됐지만 전체 training framework와 data generation pipeline은 아직 공개되지 않았고, Diffusers pipeline도 TODO로 남아 있습니다. Quick Start는 Conda 환경과 deploy/requirements.txt 설치 후 Hugging Face checkpoint, MiMo-VL, ONNX detector 파일을 준비하고 deploy/run_server.sh로 localhost 서버를 실행하는 방식입니다. 따라서 모델 연구와 GPU 서버 기반 프로토타이핑에는 적합하지만, 바로 소비자용 GPU나 Diffusers 생태계에 연결하는 용도에는 추가 작업이 필요합니다.
- README의 deployment benchmark는 720 × 1248 해상도에서 end-to-end 30 FPS를 기록하며, 공개된 라이브 데모는 단일 RTX PRO 6000 Blackwell GPU에서 840 × 480, 24 FPS로 실행됩니다. 제공된 OpenVE-Bench 이미지에서는 JoyAI-Video-Edit이 16B 모델로 overall editing quality 3.60과 DiT throughput 37.21 FPS 지점에 표시되고, human evaluation은 1.00으로 표시됩니다. 이미지 수치는 README 본문이 아니라 첨부 teaser의 그래프에서 읽은 값이며, 실제 처리량은 GPU·해상도·설정에 따라 달라질 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Deployment benchmark | end-to-end throughput | 30 FPS at 720 × 1248 | — |
| Live demo | streaming throughput | 24 FPS at 840 × 480 on a single RTX PRO 6000 (Blackwell) GPU | — |
| OpenVE-Bench | overall editing quality | 3.60 | 첨부 그래프에 표시된 JoyAI-Video-Edit 16B의 수치이며, 양자화 버전의 별도 측정치가 아님 |
| OpenVE-Bench | DiT throughput | 37.21 FPS | 첨부 그래프에 표시된 JoyAI-Video-Edit 16B의 수치이며, 전체 end-to-end 처리량과는 다른 지표 |
| Human Evaluation | evaluation score | 1.00 | 첨부 그래프에 표시된 JoyAI-Video-Edit의 수치이며, 평가 절차와 표본 정보는 README에 명시되지 않음 |
이미지 분석

1.2k
Stars
42
Forks
+207
Trending
0
조회수
1.2k watchers8 open issuesApache License 2.0
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.