본문으로 건너뛰기
HF Daily Papers조회 1

OvisOCR2 기술보고서: 0.8B 엔드투엔드 문서 파서를 위한 데이터 엔진과 훈련 레시피

OvisOCR2는 Qwen3.5-0.8B를 기반으로 한 0.8B 엔드투엔드 문서 파서로 OmniDocBench v1.6에서 96.58의 SOTA를 달성했다.

용어 해설

온-폴리시 증류(On-Policy Distillation (OPD))
교사 모델이 학생이 실제 생성한 응답 경로에 대해 토큰별 확률을 반환하고 학생은 그 지시에 맞춰 확률 분포를 맞추는 방식이다. 본문에서는 4B RL 교사가 학생의 온-폴리시 출력 토큰 상위-k 지지집합에 대해 reverse-KL로 확률을 정렬하는 형태로 구현되어 학생의 표집 분포가 교사의 보상 정렬 행동을 따르도록 한다. 이 방식은 학생에게 고분산 직접 RL 대신 안정적인 분포지도 신호를 전달해 긴 구조적 출력에서 학습 안정성을 향상시킨다.
그룹 상대 정책 최적화(Group Relative Policy Optimization (GRPO))
여러 응답 샘플을 같은 프롬프트에 대해 비교하고 그룹 상대 이점을 학습 신호로 사용하는 강화학습 알고리즘이다. 값 함수 학습을 생략하고 여러 후보 응답 중 더 나은 샘플에 정책 확률을 집중시키는 방식으로 긴 구조적 출력에서 보상 신호를 활용한다. 본문에서는 문서 파싱의 텍스트·수식·표 구성 보상을 조합한 환경에 적합하도록 사용되었다.
Tree-Edit-Distance 기반 테이블 유사도(TEDS)
테이블의 셀 구조와 내용을 트리 편집 거리 기반으로 비교해 구조적 유사도를 정량화하는 지표이다. 본문에서는 테이블 재구성의 topology와 셀 콘텐츠를 모두 반영하는 정규화 점수로 사용되어 RL 보상 컴포넌트 및 벤치마크 평가에 포함되었다. TEDS는 표 형태 오류와 누락을 식별하는 데 특히 민감하다.
Character Detection Matching(CDM)
이미지 수준에서 수식의 문자 검출 매칭을 통해 수식 인식 품질을 평가하는 지표로, 수식의 시각적 일치도를 측정한다. 본문에서는 수식 보상으로 CDM을 사용해 문자열 유사도보다 렌더링 차이를 직접 비교하는 절차를 포함시켰다. CDM은 정확한 수식 렌더링이 중요한 문서 파싱 작업에서 수식 오차를 더 정밀하게 포착한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.