용어 해설
- 네이티브 시각 추론(Native Visual Reasoning)
- — 언어로만 정답을 추론한 뒤 이미지를 출력하는 방식과 달리, 이미지와 비디오 같은 시각 상태를 추론 과정의 작업 공간으로 사용하는 접근입니다. 모델은 시각 상태를 만들고 갱신하며, 공간 관계·시간적 연속성·객체 변화를 직접 처리합니다. VBVR-Pro는 이 과정을 학습·평가·최적화 가능한 형태로 구성합니다.
- 검증 가능한 보상 스코어러(Verifiable Reward Scorer)
- — 생성 결과를 픽셀 유사도가 아니라 과제별 의미 속성과 규칙으로 채점하는 평가기입니다. 색상·모양·위치·개수·궤적을 추출한 뒤 과제에 맞는 조건을 계산하므로, 동일한 입력에 항상 같은 점수를 냅니다. 이 점수는 평가뿐 아니라 Reinforcement Learning의 보상으로도 사용됩니다.
- 인터리브드 생성(Interleaved Generation)
- — 텍스트와 중간 이미지를 번갈아 생성하며 시각 추론 과정을 표현하는 생성 방식입니다. 여러 중간 시각 상태를 외부 작업 공간처럼 유지해 경로·방향·객체 변환을 단계별로 기록합니다. VBVR-Pro 실험에서는 중간 이미지가 의미 있는 텍스트보다 성능에 더 큰 영향을 주었습니다.
- 멀티태스크 Reinforcement Learning(Multi-Task Reinforcement Learning)
- — 여러 과제에서 얻은 과제별 보상을 하나의 정책 최적화 신호로 사용해 모델을 학습하는 방식입니다. VBVR-Pro는 50개 In-Domain 과제의 50K 샘플에서 생성 결과를 검증 가능한 스코어러로 채점하고, 그 점수를 이용해 시각적 의사결정을 갱신했습니다. 과제별 규칙이 명확하기 때문에 VLM judge보다 방향성이 분명한 보상을 제공합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







