본문으로 건너뛰기

Single-stream Diffusion Transformer와 128-Expert 희소 MoE, RL 보상을 적용한 LingBot-Video 공개

Single-stream diffusion transformer에 128개 전문가 top-8 라우팅(활성 1.4B), 여섯 가지 RL 사후훈련 보상과 VLM 기반 물리 타당성 보상을 결합한 LingBot-Video가 코드·가중치와 함께 공개되었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

LingBot-Video는 single-stream diffusion transformer에 128개 전문가 중 top-8 라우팅으로 희소 MoE를 결합하고 여섯 가지 RL 사후훈련 보상을 적용해 텍스트-투-비디오 성능을 끌어올린 모델로서 코드와 가중치가 공개되었다. 물리적 타당성 보상은 프레임을 VLM으로 채점해 보상값을 부여하는 방식으로 구현되어 보상 자동화와 더불어 VLM 한계로 인한 보상 해킹 위험을 동시에 안고 있다. 액션-투-비디오 모드는 행동 조건으로 로봇 롤아웃에 해당하는 프레임 시퀀스를 생성하지만 실제 로봇에서의 폐쇄 루프 지표는 제시되지 않아 비디오 생성기와 세계 모델·정책 평가기 사이의 경계가 불분명하다. RBench 평균 점수는 상위권에 위치했으나 reasoning 관련 차원에서는 폐쇄형 모델이 더 우수해 벤치 결과의 해석에 주의가 필요하다. 공개된 코드와 가중치를 통해 보상 취약성 재현, 폐쇄 루프 실험 연계, 라우팅·전문가 구성에 대한 ablation이 가능하다.

실용적 조언

  • VLM 기반 보상을 사용할 경우 보상 해킹을 탐지하기 위해 실제 비디오 네거티브 샘플과 추가적인 보상 항목을 함께 사용해 교차 검증하는 것이 바람직하다.
  • 액션-투-비디오 모드를 정책 검증 용도로 삼으려면 생성된 비디오를 실제 로봇 실행과 연계해 폐쇄 루프 성공률, 궤적 오차 등의 정량 지표를 수집해야 한다.
  • 공개된 Diffusers/SGLang 스택과 가중치를 활용해 라우팅 수(k)나 활성 전문가 수를 조정하는 ablation 실험을 수행하면 성능·효율 트레이드오프를 명확히 확인할 수 있다.

섹션별 상세

01
모델 아키텍처는 single-stream diffusion transformer를 기반으로 희소 MoE를 결합해 설계되었으며 입력 시퀀스에 대해 단일 스트림으로 시간·공간 축을 처리한다. 라우팅은 128개의 전문가 중 top-8을 선택하는 방식으로 동작하며 이로써 전체 13B 파라미터 중 약 1.4B만 활성화되도록 제한해 계산·메모리 효율을 확보했다. 이러한 구조적 선택은 동영상 생성의 연속성과 계산 효율 사이의 균형을 목표로 한다는 점에서 설계 타당성이 제시된다.
02
학습 전략은 사전 학습 이후 여섯 가지 보상을 사용하는 RL 기반의 사후훈련을 적용하는 점이 특징이며 보상 항목 가운데 하나가 프레임 샘플을 VLM으로 채점해 물리적 타당성을 측정하는 물리-타당성 보상이다. VLM 판정자는 프레임을 입력으로 받아 텍스트 수준의 신뢰 점수나 분류 출력을 생성하고 그 결과에 따라 보상 값을 부여하므로 보상 설계가 VLM의 판단 능력에 의존한다. 이 방식은 보상 함수를 자동화해 특정 시각적 규칙을 강화할 수 있으나 VLM의 약점을 노린 보상 해킹(Goal misalignment) 가능성도 동시에 제기된다.
03
액션-투-비디오(action-to-video) 모드는 행동과 손 자세 조건으로부터 로봇 롤아웃을 예측하는 단계로 동작하며 입력 조건을 받아 연속 프레임을 생성하는 출력이 정책의 예상 결과로 제시된다. 이 모드에서는 생성된 비디오 프레임의 품질을 주된 성능 척도로 삼아 공개된 결과들이 프레임 품질 중심으로 보고되었고 폐쇄 루프 로봇 제어 성능(예: 실제 로봇에서의 성공률, 궤적 오차)은 제공되지 않았다. 따라서 비디오 생성기가 실제 세계 모델(world model)이나 실행 가능한 정책 평가기인지 여부는 프레임 품질과 실세계 행동 성공 지표의 부재로 인해 경계가 모호해진다.
04
평가 측면에서 해당 모델은 RBench에서 평균 점수 상위를 기록했으나 추론·추리 능력이 중요한 차원에서는 폐쇄 모델이 더 높은 성능을 보였고 일반적인 텍스트-투-비디오 평가에서는 자체 평가 기준으로 2위를 기록했다. 이 결과는 평균적 생성 품질은 높지만 특정 고차원적 reasoning 능력이나 실세계 타당성은 아직 한계가 있다는 신호로 해석될 수 있다. 벤치마크 수치가 모델의 로봇 적용성 전반을 보장하지 않는다는 점이 중요한 논점으로 제기되었다.
05
오픈소스화된 점은 재현성과 검증 관점에서 의미가 크며 코드·가중치·Diffusers/SGLang 스택이 공개되어 다른 연구자들이 모델을 다운로드해 재평가하거나 보상 함수를 교체해 실험할 수 있다. 공개 리소스는 VLM 보상에 대한 취약성 재현, 폐쇄 루프 로봇 실험 연계, 또는 라우팅·전문가 구성의 수정 실험을 가능하게 한다. 공개된 자료를 통해 커뮤니티가 보상 해킹, 실제 로봇 성능, 그리고 벤치마크 해석의 정합성을 검증할 수 있다는 점이 강조된다.

용어 해설

희소 Mixture-of-Experts(Sparse MoE)
Mixture-of-Experts 구조에서 전체 전문가 집합 중 소수만 활성화하여 계산 효율을 높이는 기법이다. 입력 토큰에 대해 라우팅 네트워크가 top-k 전문가를 선택하고 선택된 전문가만 연산을 수행하므로 메모리와 연산량을 절감한다. 이 글에서는 128개 전문가 중 top-8을 라우팅해 활성 파라미터를 1.4B로 제한한 구조가 성능·효율 균형을 목적으로 사용됐다.
비전-언어 모델(VLM)
영상과 텍스트를 함께 처리하도록 학습된 모델로서 이미지 프레임을 입력으로 받아 텍스트 수준의 평가나 특성 추출을 수행한다. 본문에서는 물리적 타당성 보상(physical-plausibility reward)을 채점하는 판정자로 VLM을 사용해 프레임 기반 판단을 자동화하는 용도로 활용했다. VLM 기반 보상은 개념적으로 영상의 정합성을 측정하지만 보상 해킹 위험을 수반한다.
디퓨전 트랜스포머(Diffusion Transformer)
디퓨전 생성 과정과 Transformer 아키텍처를 결합해 시퀀스(프레임)를 생성하는 모델 패밀리로, 노이즈-역전파 단계가 Transformer 블록을 통해 수행된다. 단일 스트림(single-stream) 설계는 시간·공간 축을 연속으로 처리해 일관된 동영상 샘플을 생성하는 데 유리하다. 본 사례에서는 동영상 생성 품질과 행동 예측을 동시에 다루기 위해 해당 구조를 채택했다.
강화학습 사후훈련(RL post-training)
기본 생성 모델을 먼저 학습한 뒤 보상 함수를 정의해 정책 최적화를 추가로 수행하는 방법으로, 보상 신호에 따라 출력 특성을 조정한다. 본문에서는 여섯 가지 보상을 이용한 RL 사후훈련을 통해 물리적 타당성 등 다중 목표를 반영하려고 했다. RL 사후훈련은 목표 보상에 과도하게 최적화되면 Goodhart 현상이 발생할 위험이 있다.
RBench 벤치마크(RBench)
텍스트-투-비디오와 관련된 성능을 측정하는 벤치마크로서 여러 차원에서 모델을 비교해 평균 점수와 특정 능력별 성능을 제공한다. 본문에서는 해당 모델이 평균 점수에서 상위를 기록했으나 추론·추리 능력과 같은 Reasoning 차원에서는 폐쇄형 모델이 더 높은 점수를 얻은 점이 지적됐다. 벤치마크 결과는 모델의 생성 품질과 실제 로봇 제어 능력을 직접적으로 동일시할 수 없다는 논점과 연결된다.

언급된 도구

Diffusers중립링크

동영상/이미지 디퓨전 생성 스택으로 모델 서빙 및 샘플링을 위한 프레임워크

SGLang중립

모델 실행·서빙 스택으로 언급된 런타임 구성 요소

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 09.수집 2026. 07. 09.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.