meituan-longcat/LongCat-Video
Python2 / 0
텍스트·이미지 입력에서 720p 영상을 만들고 수 분 길이까지 품질 저하 없이 이어 붙이는 13.6B 파라미터 오픈소스 비디오 생성 모델.
TL;DR
LongCat-Video는 Text-to-Video, Image-to-Video, Video-Continuation 세 과제를 하나의 13.6B 파라미터 모델로 통합해 처리하고, Video-Continuation 과제로 원래부터 학습되어 있어 색 번짐이나 품질 저하 없이 수 분짜리 영상을 이어 만들 수 있다. 시간·공간 축 모두에서 coarse-to-fine 생성과 Block Sparse Attention을 적용해 720p 30fps 영상을 수 분 내에 뽑아내며, 다중 보상 GRPO로 강화학습해 내부·공개 벤치마크에서 상업용 서비스와 비슷한 수준의 품질을 낸다고 보고한다. 오디오 기반 인물 영상 생성을 위한 LongCat-Video-Avatar와, Whisper-large-v3 인코더와 8-step distillation으로 립싱크와 추론 속도를 개선한 Avatar-1.5도 함께 제공된다. 추론 코드와 HuggingFace 가중치가 공개되어 있어 긴 영상 생성이나 오디오 기반 아바타 영상 제작 파이프라인에 바로 적용할 만하다.
핵심 포인트
- Text-to-Video·Image-to-Video·Video-Continuation을 한 모델로 통합해 각 과제마다 별도 모델을 두지 않는다.
- Video-Continuation 과제로 네이티브 사전학습되어 있어 수 분짜리 장편 영상에서도 색 번짐이나 품질 저하가 적다고 보고한다.
- Block Sparse Attention과 시공간 coarse-to-fine 전략으로 720p 30fps 영상을 수 분 내에 생성하는 효율성을 확보했다.
- Avatar-1.5는 Whisper-large-v3 오디오 인코더와 8-step distillation으로 립싱크 품질과 추론 속도를 동시에 개선했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Text-to-Video MOS 평가 | Overall Quality (1-5) | 3.38 | Veo3 3.48 / PixVerse-V5 3.36 / Wan2.2-T2V-A14B 3.35 (내부 벤치마크) |
| Image-to-Video MOS 평가 | Overall Quality (1-5) | 3.17 | Seedance 1.0 3.35 / Hailuo-02 3.27 / Wan2.2-I2V-A14B 3.26 (내부 벤치마크) |
7.4k
STARS
1.3k
FORKS
+215
TRENDING
2
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.