MoE 기반 30B 비디오 생성 파이프라인과 70,000시간의 embodied 데이터로 고품질 비디오 합성
LingBot-Video는 MoE 30B-A3B와 리파이너를 결합하여 텍스트·이미지 조건 기반의 비디오를 높은 물리적 합리성과 심미성으로 생성하는 확산 기반 파이프라인이다. 이 모델은 대규모의 embodied 비디오 데이터(70,000+ 시간)를 활용하여 학습되었고 multi-reward로 품질을 최적화했다. inference 경로는 diffusers 기본 경로와 SGLang·FP8 최적화 경로를 모두 제공한다.
TL;DR
LingBot-Video는 MoE 30B-A3B 아키텍처와 리파이너를 결합한 확산 기반 비디오 생성 파이프라인으로, 70,000시간이 넘는 embodied 비디오 데이터를 학습에 통합하고 미학·물리적 합리성·작업 완료성이라는 다중 보상으로 품질을 최적화했다. 프롬프트 리라이터가 자유문을 구조화된 JSON 캡션으로 변환하고 Auto Negative가 캡션 특화 네거티브를 생성한 뒤 DiT 기반의 base 생성과 리파이너 정제 단계가 순차적으로 실행되는 두 단계 워크플로를 사용한다. 런타임은 diffusers를 기본으로 제공하며 SGLang과 FP8·그룹화된 MoE 실행으로 추론 속도를 높여 약 3배 수준의 가속을 목표로 하고, RBench 평균 0.620으로 공개 리더보드에서 상위를 기록했다. 단점으로는 대형 MoE 체크포인트 로딩 전 시스템 RAM 요구가 남아 있어 배포 시 하드웨어 구성과 FSDP 샤딩 전략을 함께 고려해야 한다.
핵심 역량
- 텍스트로부터 시간적 연속성을 갖는 비디오 프레임을 합성할 수 있으며 프레임 간 물리적 연결성과 상호작용을 유지하도록 설계되었다. 입력으로 구조화된 JSON 캡션과 선택적 첫 프레임을 받아 TI2V 시나리오를 처리할 수 있다. 리파이너 단계는 초기 출력의 디테일과 품질을 향상시켜 최종 비디오의 완성도를 높인다.
- 리라이터와 Auto Negative를 결합한 전처리 체인을 통해 자연어 프롬프트를 모델이 요구하는 캡션 스키마로 변환하고 캡션 특화 네거티브를 자동 생성하여 의도 일치도를 높일 수 있다. 이 과정은 프롬프트의 모호성을 줄이고 생성물에서 원하지 않는 객체와 스타일을 억제하는 역할을 한다. 리라이터는 LoRA 어댑터로 확장 가능한 구조를 채택하여 재사용성과 배포 유연성을 제공한다.
- 모델은 diffusers와 SGLang 두 가지 백엔드를 통해 추론을 실행할 수 있으므로 런타임 요구사항과 성능 목표에 따라 유동적으로 선택할 수 있다. SGLang 경로는 FP8·그룹화된 MoE 실행 등 고속 런타임 최적화를 지원하며 diffusers 경로는 더 넓은 생태계 호환성을 제공한다. 다중 GPU 환경에서는 FSDP를 활용한 샤딩으로 VRAM 부담을 낮추되 시스템 RAM 요구는 여전히 존재한다.
- 출력 파이프라인은 해상도·프레임레이트·스텝·가이던스 등 다양한 하이퍼파라미터를 노출하여 사용자 요구에 맞춘 품질·속도 트레이드오프를 조정할 수 있다. 리파이너 관련 하이퍼파라미터를 별도로 설정함으로써 초벌 생성과 정제 단계의 균형을 맞출 수 있다. 배치형 CFG와 CP8 같은 옵션은 다중 GPU 설정에서 처리량을 높이는 데 활용된다.
강점
- RBench 리더보드에서 평균 0.620으로 상위권에 위치하여 장기 시퀀스와 물리적 상호작용 관련 태스크에서 강점을 보였다. 이 수치는 공개 비교표에 근거한 것으로 모델의 장기 추론 능력과 다관절 동작 표현에서 경쟁력이 있음을 나타낸다. 벤치마크 표에서 일부 항목은 동종 오픈소스 모델 대비 최상위를 기록했다.
- 모델은 MoE 구조와 그룹화된 전문가 실행, FP8 런타임 경로를 결합하여 추론 속도와 용량을 균형시켰고 README는 약 3배 빠른 추론을 지향한다고 명시하고 있다. 이러한 설계는 대규모 비디오 생성에서 처리량을 높이면서도 고용량 표현을 유지할 수 있게 한다. 다만 대형 체크포인트 로딩 이전의 시스템 메모리 요구는 설계상 남아 있다.
훈련 방식
모델은 MoE(30B-A3B) 아키텍처를 스크래치에서 확장하여 학습했으며 대규모 웹 비디오와 70,000시간 이상의 embodied 데이터가 통합되었다. 학습 목표는 미학, 물리적 합리성, 작업 완료성을 반영하는 다중 보상체계로 구성되어 보상 신호 기반의 품질 최적화가 수행되었다. 추가로 일부 구성요소는 LoRA 어댑터와 같은 가벼운 어댑터로 리라이터 기능을 확장하여 배포 유연성을 확보했다.
알아두면 좋은 것
- 모델은 MoE 구조로 설계되어 추론 효율을 높이기 위해 그룹화된 전문가 실행과 FP8 런타임 옵션을 제공하며 README는 sglang 경로를 통해 속도 우선 워크플로를 권장하고 있다. 이 접근으로 MoE 실행을 가속화하고 시스템 자원 사용을 최적화할 수 있다. 다만 대형 MoE 체크포인트 로딩 전 시스템 RAM 요구를 고려해야 한다.
- 학습에 사용된 데이터 파이프라인에는 70,000시간 이상의 embodied 비디오가 통합되어 있으며 품질 평가는 미학·물리적 합리성·작업 완료성이라는 다중 보상 체계로 이루어졌다. 이 보상 설계는 단순 시각적 유사도 외에 물리적 상호작용의 합리성을 반영하도록 목표를 설정했다. 공개된 리포트와 페이퍼에서 데이터·보상 설계의 요약이 제공된다.
- 공개 벤치마크로 RBench 리더보드에서 평균 0.620으로 상위에 랭크되었으며 특정 장기 시퀀스 및 다관절(Quadruped) 평가 항목에서 경쟁 우위를 보였다. README의 표는 모델이 비교 대상들 대비 평균 점수와 일부 세부 항목에서 상위를 차지했음을 수치로 나타낸다. 벤치마크 표에는 다른 모델과의 상대적 위치를 한눈에 볼 수 있도록 정리되어 있다.
- 배포·추론 관련으로는 리라이터와 리파이너를 분리된 단계로 운영할 것을 권장하며, 리라이터는 기본 VLM에 LoRA 어댑터를 적용해 어댑터 전환 방식으로 배포할 것을 권장하고 있다. 이 방식은 단일 서버에서 어댑터 선택으로 두 단계 의미론을 유지하는 구성으로 구현될 수 있다. 고처리량 환경에서는 vLLM이나 SGLang 같은 전용 추론 엔진을 통한 배포가 권장된다.
기술적 특징
- MoE 기반 아키텍처는 입력에 따라 일부 전문가만 활성화하는 라우팅을 사용하여 전체 파라미터 용량을 유지하면서 단일 추론 경로의 연산을 줄인다. LingBot-Video는 그룹화된 전문가 실행과 FP8 런타임을 조합해 실질 추론 속도를 개선하도록 설계되었다. 이로 인해 모델은 높은 표현력을 유지하면서도 동일 작업 대비 추론 지연을 줄이는 효과를 목표로 한다.
- 데이터 엔진은 일반 웹 비디오에 더해 70,000시간 이상의 embodied 데이터를 통합하여 시공간적 상호작용과 물리적 합리성에 대한 표본을 풍부하게 확보했다. 대규모의 행동 중심 데이터는 모델이 물체 상호작용·관절 동작·장기 의도 흐름을 학습하는 데 기여한다. 학습 목표는 단순 픽셀 복원이 아니라 물리적 일관성과 과제 완수도를 함께 최적화하도록 설계되었다.
- 두 단계 추론 파이프라인은 리라이터 전처리와 DiT 기반 기본 생성, 이어서 리파이너 정제의 흐름으로 구성되어 캡션의 구조화와 출력 품질 향상을 분리한다. 리라이터는 자연어를 구조화된 JSON 캡션으로 변환하고 Auto Negative로 네거티브를 생성하여 초기 생성의 의도 일치도를 높인다. 리파이너는 초벌 결과의 디테일을 보완하여 최종 비디오의 시각적 품질을 끌어올린다.
- 런타임 최적화 측면에서 diffusers 기본 경로와 SGLang 대체 경로를 제공하며 다중 GPU 환경에서는 FSDP 샤딩과 CP8 옵션을 통해 메모리·처리량 균형을 조정할 수 있도록 구성되어 있다. SGLang 경로는 FP8과 같은 저정밀도 실행을 활용해 속도 우선 워크플로를 실현하며, diffusers 경로는 호환성과 디버깅 편의성을 유지한다. 다만 FSDP 사용 시에는 호스트 메모리에 transformer 구조가 먼저 구성되므로 시스템 RAM 요건을 검토해야 한다.
차별점
- MoE 아키텍처와 그룹화된 전문가 실행을 결합하여 대형 파라미터 용량을 유지하면서도 추론 속도를 높이는 설계적 접근을 채택했다.
- 프롬프트 리라이터와 Auto Negative를 전처리 체인으로 통합하여 구조화된 캡션 입력과 캡션 특화 네거티브를 자동화하는 엔드투엔드 워크플로를 제공한다.
- base 생성과 refiner 정제를 분리한 두 단계 파이프라인을 통해 초기 샘플의 빠른 생성과 후처리 기반 품질 향상을 동시에 달성하는 운영 모델을 채택했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| RBench (avg) | score | 0.620 | — |
| RBench (manipulation) | score | 0.578 | — |
| RBench (long-horizon) | score | 0.634 | — |
113
Likes
800
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.