본문으로 건너뛰기

VBVR-Pro로 확장하는 검증 가능한 네이티브 시각 추론

300개 과제와 검증 가능한 보상으로 시각 궤적 기반 추론을 학습하고 평가하는 VBVR-Pro

용어 해설

네이티브 시각 추론(Native Visual Reasoning)
언어로만 정답을 추론한 뒤 이미지를 출력하는 방식과 달리, 이미지와 비디오 같은 시각 상태를 추론 과정의 작업 공간으로 사용하는 접근입니다. 모델은 시각 상태를 만들고 갱신하며, 공간 관계·시간적 연속성·객체 변화를 직접 처리합니다. VBVR-Pro는 이 과정을 학습·평가·최적화 가능한 형태로 구성합니다.
검증 가능한 보상 스코어러(Verifiable Reward Scorer)
생성 결과를 픽셀 유사도가 아니라 과제별 의미 속성과 규칙으로 채점하는 평가기입니다. 색상·모양·위치·개수·궤적을 추출한 뒤 과제에 맞는 조건을 계산하므로, 동일한 입력에 항상 같은 점수를 냅니다. 이 점수는 평가뿐 아니라 Reinforcement Learning의 보상으로도 사용됩니다.
인터리브드 생성(Interleaved Generation)
텍스트와 중간 이미지를 번갈아 생성하며 시각 추론 과정을 표현하는 생성 방식입니다. 여러 중간 시각 상태를 외부 작업 공간처럼 유지해 경로·방향·객체 변환을 단계별로 기록합니다. VBVR-Pro 실험에서는 중간 이미지가 의미 있는 텍스트보다 성능에 더 큰 영향을 주었습니다.
멀티태스크 Reinforcement Learning(Multi-Task Reinforcement Learning)
여러 과제에서 얻은 과제별 보상을 하나의 정책 최적화 신호로 사용해 모델을 학습하는 방식입니다. VBVR-Pro는 50개 In-Domain 과제의 50K 샘플에서 생성 결과를 검증 가능한 스코어러로 채점하고, 그 점수를 이용해 시각적 의사결정을 갱신했습니다. 과제별 규칙이 명확하기 때문에 VLM judge보다 방향성이 분명한 보상을 제공합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 26.수집 2026. 08. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.