용어 해설
- 전문가 혼합(MoE)(Mixture-of-Experts)
- — MoE는 전체 레이어를 밀집식으로 학습하지 않고 여러 전문가(서브네트워크) 중 일부만 활성화하여 계산을 줄이는 아키텍처이다. 입력별로 소수의 전문가만 선택되어 활성화되므로 파라미터 용량은 크되 실제 추론 비용은 낮은 트레이드오프를 달성할 수 있다. 대규모 비디오 모델에서 용량 확장과 추론 효율성 균형을 맞출 때 핵심적이다.
- DiT 기반 비디오 사전학습(DiT-based Video Pretraining)
- — DiT는 이미지/프레임 단위의 Transformer 기반 표현을 비디오로 확장하여 시공간적 패턴을 학습하는 백본이다. 이 논문 맥락에서는 DiT를 비디오 파운데이션 모델의 사전학습 기초로 삼아 행동과 물리적 상호작용을 학습하도록 설계되었다. DiT의 공간적 표현력을 시공간적 일관성 및 물리적 합리성과 연결하는 것이 목적이다.
- 구체화된 지능(임베디드 인텔리전스)(Embodied Intelligence)
- — Embodied Intelligence는 에이전트가 물리적 세계에서 감지·행동·상호작용을 통해 목적을 달성하는 능력을 의미한다. 비디오 모델 관점에서는 시각적 장면을 단순 생성 수준을 넘어서 물리적 합리성과 작업 완수 가능성까지 내포하는 표현을 학습해야 한다. 로봇 제어·조작·내비게이션과 직결되는 목표를 가진 연구 분야이다.
- 데이터 프로파일링 엔진(Data Profiling Engine)
- — 데이터 프로파일링 엔진은 대규모 인터넷 비디오를 로봇 지향 푸티지(조작·내비게이션·1인칭 관점)로 보강하는 자동화 파이프라인이다. 이 엔진은 비디오의 메타데이터와 장면 특성을 추출해 라벨링이나 샘플링 정책을 적용하여 학습 데이터 분포를 제어한다. 로봇 관련 동작 분포를 확보해 모델이 물리적 상호작용을 학습하도록 돕는다.
- 다차원 보상체계(Multi-Dimensional Reward System)
- — 다차원 보상체계는 미학, 프롬프트 준수, 모션 일관성 등 전통적 기준을 넘어 물리적 합리성과 작업 완수 여부를 별도 축으로 평가하는 학습 신호 체계이다. 에피소드별 혹은 샘플별로 여러 보상 항목을 결합하여 최종 학습 신호를 구성하므로 행동의 물리적 타당성과 목적 달성 가능성을 동시에 촉진한다. 비디오 생성 목적이 아닌 로봇 행동 재현을 목표로 할 때 보상 구성의 핵심적 요소이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.