robbyant/lingbot-world-v2-14b-causal-fast
LingBot-World V2 14B causal-fast는 14B 규모의 causal 모델을 증류해 실시간 이미지-투-비디오 생성 성능을 목표로 하며 720p 해상도에서 60fps 재생을 지향한다. 이 모델은 causal pretraining 기반의 일관된 장면 출력을 유지하면서 distillation으로 응답 지연을 낮추는 접근을 채택했다. 또한 에이전트 구조를 도입해 행동 계획과 장면 합성을 분리함으로써 상호작용의 다양성을 확장했다.
학습 방식 · 14B 규모의 causal 계열 모델을 기반으로 causal pretraining 패러다임을 적용하고, 실시간 사용을 위해 기반 모델에서 증류하여 causal-fast 실시간 변형을 만들었으며 보다 높은 품질을 위해 별도의 causal-pretrain 체크포인트도 계획되었다.
TL;DR
LingBot-World V2 14B causal-fast는 14B 규모의 causal 계열 모델을 기반으로 하여 인과적 프리트레이닝으로 시간적 일관성을 확보하고, 기반 모델을 증류해 실시간 추론을 목표로 만든 이미지-투-비디오 시스템이다. 청크 단위 프레임 처리와 KV 캐시, flash_attn 의존성으로 추론 효율을 높였으며 causal-fast 모드는 청크당 적은 샘플링 스텝으로 낮은 지연을 달성하는 반면 causal-pretrain 모드는 더 많은 스텝과 CFG로 품질 중심 추론을 수행하도록 설계되었다. 에이전트 기반의 파일럿·디렉터 분업 구조를 통해 액션 계획과 장면 합성을 분리하여 상호작용적 요소의 다양성을 확장했고 실시간 웹·모바일 데모와 기술 보고서가 공개되어 실험적 재현이 가능하다.
핵심 포인트
- causal-pretraining 기반으로 장면 일관성을 유지하도록 학습된 점이 일반적인 frame-by-frame diffusion 접근과 구별된다.
- 기반 모델에서 실시간용으로 증류된 causal-fast 변형을 제공해 720p 해상도에서 60fps에 상응하는 스트리밍 성능 목표를 명시한 점이 차별적이다.
- 파일럿·디렉터 역할을 분리한 agentic harness 구조를 도입해 행동 계획과 환경 합성을 분업화함으로써 상호작용적 요소의 다양성을 확장한 점이 독특하다.
- 증류된 causal-fast 변형을 통해 실시간 스트리밍 재생을 목표로 하며 README에서 720p 해상도에서 60fps를 달성할 만큼의 응답 시간을 보장한다고 명시되어 있어 실시간 상호작용 워크플로에 적합하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| real-time throughput | fps@720p | 60 | — |
103
LIKES
0
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.