분 단위 장영상 생성이 가능한 13.6B 비디오 생성 모델
13.6B 파라미터 기반 장기 영상 생성 모델
TL;DR
LongCat-Video는 13.6B 파라미터 기반의 통합 비디오 생성 모델로서 Text-to-Video, Image-to-Video, Video-Continuation을 하나의 아키텍처로 지원합니다. 시간·공간 축의 coarse-to-fine 생성과 Block Sparse Attention, FlashAttention 가속으로 720p 30fps 수준의 긴 비디오를 현실적인 시간 내에 생성할 수 있으며 Avatar-1.5는 Whisper-large-v3와 step distillation으로 오디오 동기화와 추론 속도를 개선합니다. 모델과 가중치가 Hugging Face에 공개되어 있어 연구 실험이나 프로토타이핑에 바로 활용할 수 있지만, 높은 연산·메모리 요구와 안전·법적 고려사항을 검토해야 합니다.
주요 기능
- 단일 모델로 Text-to-Video, Image-to-Video, Video-Continuation을 모두 지원합니다
- Video-Continuation 사전학습으로 분 단위 장영상에서 색상·품질 저하를 억제합니다
- 시간·공간 축에 대한 coarse-to-fine 생성과 Block Sparse Attention으로 효율성을 확보합니다
어떻게 동작하는가
입력으로 텍스트, 이미지, 기존 비디오 또는 오디오를 받고 모델은 시간·공간 축에서 coarse-to-fine 전략으로 프레임을 생성합니다. 연산 효율을 올리기 위해 Block Sparse Attention과 FlashAttention-2 같은 가속 라이브러리를 활용하며, Audio-driven Avatar 계열은 Wav2Vec2 또는 Whisper-large-v3 같은 오디오 인코더로 음성을 특징화한 뒤 시각적 모션과 입 모양을 동기화합니다. 학습 측면에서는 Video-Continuation 중심의 사전학습과 multi-reward Group Relative Policy Optimization(GRPO) 기반의 RLHF를 통해 장기 안정성과 주관적 품질을 개선하고, Avatar-1.5는 step distillation을 적용해 추론 스텝을 크게 줄여 실용적 응답 시간을 확보합니다.
해결 문제
장시간(분 단위) 고품질 비디오 생성에서 흔히 발생하는 색상 드리프트와 화질 저하 문제를 완화하는 것을 목표로 합니다. 이를 위해 Video-Continuation 대규모 사전학습과 시간·공간 축의 coarse-to-fine 생성 전략을 결합하여 긴 시퀀스의 일관성을 유지하면서도 계산량을 관리합니다. 또한 텍스트·이미지·비디오·오디오를 하나의 통합 아키텍처로 처리해 애플리케이션 측면에서 모델 교체 없이 다양한 입력 유형을 다룰 수 있게 합니다.
지금 주목받는 이유
해당 레포는 오픈소스 기반의 대규모 비디오 생성 모델과 그 변형(특히 오디오 기반 Avatar)을 함께 공개하여 연구·응용 모두에서 바로 실험 가능한 환경을 제공합니다. 대량의 사전학습, 효율화된 어텐션 설계, RL 기반의 품질 보정과 함께 Hugging Face에 가중치가 공개되어 있어 커뮤니티 실험과 파생 작업이 쉽습니다. 또한 Avatar-1.5의 실용적 개선(Whisper 도입, 스텝 증류, INT8 옵션)은 실제 데모·프로덕션 테스트를 유도하는 요인으로 작용합니다.
차별점
- 단일 13.6B 모델로 T2V·I2V·비디오 연속 생성 태스크를 네이티브 지원한다
- Video-Continuation으로 사전학습해 분 단위 장영상에서 시간적 안정성과 색상 일관성을 확보한다
- 시간·공간 양축의 coarse-to-fine 생성과 Block Sparse Attention으로 720p 30fps 추론을 현실적인 시간 안에 수행한다
- Avatar 계열에서 Whisper-large-v3 도입과 step distillation으로 음성 동기화와 추론 속도를 개선한 배포 옵션을 제공한다
사용 사례
- 길이 제한이 있는 기존 모델로 품질 저하가 발생하던 장시간 스토리텔링용 영상 생성 실험
- 오디오 입력을 받는 캐릭터 애니메이션과 입 모양 동기화가 필요한 가상 인간 콘텐츠 제작
- 텍스트나 이미지 프롬프트로 빠르게 프로토타입 비디오를 생성해 크리에이티브 콘셉트를 검증하는 워크플로
시작하기
레이포를 클론한 뒤 conda 환경 python=3.10을 만들고 README에 적힌 대로 PyTorch(권장 버전과 CUDA 맞춤), FlashAttention-2와 기타 requirements를 설치하면 됩니다. Hugging Face에서 제공하는 가중치를 huggingface-cli로 다운로드해 ./weights/에 배치한 다음 torchrun으로 제공된 데모 스크립트를 실행하면 단일 GPU 또는 다중 GPU 환경에서 Text-to-Video, Image-to-Video, Video-Continuation, Long-Video 데모를 바로 시도할 수 있습니다. Avatar 기능을 사용하려면 추가 avatar 요구사항(requirements_avatar.txt)과 오디오 의존성(librosa, ffmpeg)을 설치하고 model_type과 distill/int8 옵션을 적절히 설정해야 합니다.
요구사항
- Python 3.10
- torch==2.6.0+cu124, torchvision==0.21.0+cu124, torchaudio==2.6.0 (CUDA에 맞춰 설치)
- flash_attn==2.7.4.post1 (또는 사용 환경에 따라 FlashAttention-3/xformers 선택 가능)
- librosa, ffmpeg (Avatar 오디오 전처리용)
- 충분한 GPU 메모리(모델 및 해상도에 따라 다름), INT8 옵션은 VRAM 절감에 도움
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Text-to-Video Overall Quality (MOS) | Overall Quality (MOS) | 3.38 | vs Wan 2.2-T2V-A14B: 3.35 |
| Image-to-Video Overall Quality (MOS) | Overall Quality (MOS) | 3.17 | vs Wan 2.2-I2V-A14B: 3.26 |
이미지 분석

5.8k
Stars
913
Forks
+208
Trending
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.