본문으로 건너뛰기

LingBot-World-Infinity: 인과적 사전학습과 증류로 실시간 무한 인터랙티브 월드 생성

인과적 사전학습과 MoBA attention, 일관성·분포 정합 증류를 결합하여 720p 60fps로 장시간 드리프트 없이 상호작용 가능한 무한 월드를 실시간으로 생성한다.

용어 해설

인과적 사전학습(Causal Pretraining)
시간 축상에서 원인(과거)이 언제나 결과(미래)보다 앞선다는 가정을 모델 학습에 도입해 미래 프레임을 과거 맥락과 현재 입력에만 조건화하여 예측하는 학습 절차이다. 이 방식은 연쇄적 예측에서 발생하는 오류 누적을 줄이도록 설계되어 장시간 롤아웃 시 시각적 품질을 더 오래 유지하게 만든다. 본 논문에서는 인과적 사전학습을 통해 드리프트 억제 성질을 가진 백본을 확보하고 이를 증류 원천으로 사용하였다.
흐름 정합 손실(Flow-Matching Objective)
노이즈가 섞인 잠재 상태에서 모델이 목표 플로우(노이즈에서 클린 이미지 방향의 벡터)를 예측하도록 훈련하는 확률적 목표함수로, 입력 노이즈와 목표 클린 샘플의 차이를 예측 벡터로 정규화하여 평균 제곱오차로 최적화한다. 이 손실은 확산 기반 생성기의 연속적 샘플링 궤적을 학습하는 데 사용되어 시간-조건화 예측의 안정성을 높인다. 논문에서는 인과적 조건(c = 과거 프레임·카메라·프롬프트)을 포함한 형태로 flow-matching을 적용했다.
플뤼커 임베딩(Plücker Embedding)
픽셀별 시야 광선을 6차원 좌표계로 인코딩하는 방법으로 카메라 포즈와 뷰 관점을 수치적으로 표현해 네트워크에 입력으로 제공한다. 이 임베딩을 AdaLN 같은 모듈과 결합하면 카메라 제어 신호를 확산 기반 생성 과정에 안정적으로 주입할 수 있다. 본 논문에서는 카메라 제어의 정밀한 반영을 위해 Plücker 임베딩을 사용했다.
동적 KV-캐시 스케줄링(Dynamic KV-Cache Scheduling)
모델의 과거 키·값(키-밸류) 캐시를 고정으로 유지하지 않고 현재 제어 신호와 입력 상태에 따라 선택적으로 보존하거나 폐기하는 정책이다. 관련성 높은 과거 컨텍스트만 유지하여 주의 연산 비용을 낮추고 롤아웃 동안의 간섭을 줄이는 목적을 가진다. 논문에서는 실시간 처리와 장기 일관성 사이의 균형을 맞추기 위한 핵심 시스템 최적화로 활용되었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 08.수집 2026. 07. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.