본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

robbyant/lingbot-video-moe-30b-a3b

LingBot-Video는 텍스트에서 이미지 생성(T2I), 텍스트에서 비디오 생성(T2V), 이미지+텍스트에서 비디오 생성(TI2V) 및 생성 결과 리파인먼트를 수행하는 목적의 모델이다. 프롬프트 리라이터를 거쳐 구조화된 JSON 캡션을 입력으로 사용하며 Auto Negative로 네거티브 프롬프트를 캡처 특화로 생성한다. 최종 추론은 base 생성 후 refiner를 거쳐 출력 품질과 물리적 일관성을 향상시키는 두 단계 파이프라인으로 설계되었다.30B-A3Bapache-2.0

LingBot-Video는 MoE 30B-A3B와 리파이너를 결합하여 텍스트·이미지 조건 기반의 비디오를 높은 물리적 합리성과 심미성으로 생성하는 확산 기반 파이프라인이다. 이 모델은 대규모의 embodied 비디오 데이터(70,000+ 시간)를 활용하여 학습되었고 multi-reward로 품질을 최적화했다. inference 경로는 diffusers 기본 경로와 SGLang·FP8 최적화 경로를 모두 제공한다.

학습 방식 · 모델은 MoE(30B-A3B) 아키텍처를 스크래치에서 확장하여 학습했으며 대규모 웹 비디오와 70,000시간 이상의 embodied 데이터가 통합되었다. 학습 목표는 미학, 물리적 합리성, 작업 완료성을 반영하는 다중 보상체계로 구성되어 보상 신호 기반의 품질 최적화가 수행되었다. 추가로 일부 구성요소는 LoRA 어댑터와 같은 가벼운 어댑터로 리라이터 기능을 확장하여 배포 유연성을 확보했다.

TL;DR

LingBot-Video는 MoE 30B-A3B 아키텍처와 리파이너를 결합한 확산 기반 비디오 생성 파이프라인으로, 70,000시간이 넘는 embodied 비디오 데이터를 학습에 통합하고 미학·물리적 합리성·작업 완료성이라는 다중 보상으로 품질을 최적화했다. 프롬프트 리라이터가 자유문을 구조화된 JSON 캡션으로 변환하고 Auto Negative가 캡션 특화 네거티브를 생성한 뒤 DiT 기반의 base 생성과 리파이너 정제 단계가 순차적으로 실행되는 두 단계 워크플로를 사용한다. 런타임은 diffusers를 기본으로 제공하며 SGLang과 FP8·그룹화된 MoE 실행으로 추론 속도를 높여 약 3배 수준의 가속을 목표로 하고, RBench 평균 0.620으로 공개 리더보드에서 상위를 기록했다. 단점으로는 대형 MoE 체크포인트 로딩 전 시스템 RAM 요구가 남아 있어 배포 시 하드웨어 구성과 FSDP 샤딩 전략을 함께 고려해야 한다.

핵심 포인트

  • MoE 아키텍처와 그룹화된 전문가 실행을 결합하여 대형 파라미터 용량을 유지하면서도 추론 속도를 높이는 설계적 접근을 채택했다.
  • 프롬프트 리라이터와 Auto Negative를 전처리 체인으로 통합하여 구조화된 캡션 입력과 캡션 특화 네거티브를 자동화하는 엔드투엔드 워크플로를 제공한다.
  • base 생성과 refiner 정제를 분리한 두 단계 파이프라인을 통해 초기 샘플의 빠른 생성과 후처리 기반 품질 향상을 동시에 달성하는 운영 모델을 채택했다.
  • RBench 리더보드에서 평균 0.620으로 상위권에 위치하여 장기 시퀀스와 물리적 상호작용 관련 태스크에서 강점을 보였다. 이 수치는 공개 비교표에 근거한 것으로 모델의 장기 추론 능력과 다관절 동작 표현에서 경쟁력이 있음을 나타낸다. 벤치마크 표에서 일부 항목은 동종 오픈소스 모델 대비 최상위를 기록했다.

벤치마크

벤치마크지표비교
RBench (avg)score0.620
RBench (manipulation)score0.578
RBench (long-horizon)score0.634

113

LIKES

800

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.