본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

meituan-longcat/LongCat-Video

Python2 / 0

텍스트·이미지 입력에서 720p 영상을 만들고 수 분 길이까지 품질 저하 없이 이어 붙이는 13.6B 파라미터 오픈소스 비디오 생성 모델.

TL;DR

LongCat-Video는 Text-to-Video, Image-to-Video, Video-Continuation 세 과제를 하나의 13.6B 파라미터 모델로 통합해 처리하고, Video-Continuation 과제로 원래부터 학습되어 있어 색 번짐이나 품질 저하 없이 수 분짜리 영상을 이어 만들 수 있다. 시간·공간 축 모두에서 coarse-to-fine 생성과 Block Sparse Attention을 적용해 720p 30fps 영상을 수 분 내에 뽑아내며, 다중 보상 GRPO로 강화학습해 내부·공개 벤치마크에서 상업용 서비스와 비슷한 수준의 품질을 낸다고 보고한다. 오디오 기반 인물 영상 생성을 위한 LongCat-Video-Avatar와, Whisper-large-v3 인코더와 8-step distillation으로 립싱크와 추론 속도를 개선한 Avatar-1.5도 함께 제공된다. 추론 코드와 HuggingFace 가중치가 공개되어 있어 긴 영상 생성이나 오디오 기반 아바타 영상 제작 파이프라인에 바로 적용할 만하다.

핵심 포인트

  • Text-to-Video·Image-to-Video·Video-Continuation을 한 모델로 통합해 각 과제마다 별도 모델을 두지 않는다.
  • Video-Continuation 과제로 네이티브 사전학습되어 있어 수 분짜리 장편 영상에서도 색 번짐이나 품질 저하가 적다고 보고한다.
  • Block Sparse Attention과 시공간 coarse-to-fine 전략으로 720p 30fps 영상을 수 분 내에 생성하는 효율성을 확보했다.
  • Avatar-1.5는 Whisper-large-v3 오디오 인코더와 8-step distillation으로 립싱크 품질과 추론 속도를 동시에 개선했다.

벤치마크

벤치마크지표비교
Text-to-Video MOS 평가Overall Quality (1-5)3.38Veo3 3.48 / PixVerse-V5 3.36 / Wan2.2-T2V-A14B 3.35 (내부 벤치마크)
Image-to-Video MOS 평가Overall Quality (1-5)3.17Seedance 1.0 3.35 / Hailuo-02 3.27 / Wan2.2-I2V-A14B 3.26 (내부 벤치마크)

7.4k

STARS

1.3k

FORKS

+215

TRENDING

2

조회수

watchers 7.4kopen issues 75MIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.