본문으로 건너뛰기

UniVR: 순수 시각 시연으로 학습하는 통합 시각 추론 프레임워크

UniVR는 텍스트 지도 없이 순수 시각 시연으로부터 장기 계획과 물리적 추론을 학습하기 위해 VR-GRPO 보상 구조와 대규모 VR-X 데이터셋을 활용한 통합 생성 모델이다.

용어 해설

시각적 추론용 GRPO(VR-GRPO)
VR-GRPO는 전역 보상과 단계별 집중 보상을 결합한 강화학습 패러다임으로, 전체 과제 완료와 중간 단계의 물리적·논리적 일관성을 동시에 최적화한다. 생성된 여러 롤아웃 간 시점별 임베딩 분산을 계산해 불확실도가 큰 구간을 찾아내고 해당 하위구간을 VLM(pairwise)로 비교하여 세밀한 보상을 산출한다. 이 방식은 이미지-텍스트 쌍이나 과제별 휴리스틱 없이도 장기 계획과 미세 동역학을 학습하도록 설계되었다.
단계집중 보상(Step-Focal Reward)
Step-Focal Reward는 여러 생성 궤적의 시점별 특징 분산을 통해 불확실도가 최대인 구간을 식별하고 그 구간의 하위 단계를 집중 평가하는 보상 구성요소이다. 집중된 하위단계에 대해 VLM 기반의 쌍비교(pairwise) 평가를 수행해 세부적 물리 위반이나 논리적 간극을 포착한다. 이 보상은 최종 상태 점수에 치우치는 보상 해킹을 완화하고 절차적 무결성을 유지하게 한다.
벡터 양자화 오토인코더(VQ-VAE)
VQ-VAE는 연속 이미지나 텍스트 신호를 이산 토큰 공간으로 인코딩하는 오토인코더 계열이며, 본문에서는 이미지와 텍스트를 통합된 이산 어휘로 변환해 다음-토큰 예측 기반 생성에 사용되었다. 이 인코더로부터 얻은 토큰 시퀀스가 시각적 추론 궤적의 생성 단위가 된다. 통합 어휘 덕분에 모델이 시각-언어 혼합 생성과 순수 시각 생성 모두를 처리할 수 있다.
JEPA 유사도(JEPA)
JEPA는 시퀀스를 잠재 공간으로 맵핑해 분포 간 거리를 비교하는 방법이며 본문에서는 물리적 동역학의 일관성 측정 지표로 사용되었다. 생성 시퀀스와 정답 시퀀스의 잠재 분포 간 최대 평균 차이를 계산해 물리적 유사도를 산출한다. JEPA 점수는 물리적 동역학 일치도를 보완하는 자동화 지표로 활용되었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 14.수집 2026. 07. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.