본문으로 건너뛰기

문서의 시각 단서를 직접 학습하는 시각적 사전학습이 텍스트 전용 사전학습을 능가함

문서 원형 이미지에서 추출 과정을 거치지 않고 비지도 시각적 사전학습을 수행하면 동일 코퍼스에서의 텍스트 전용 사전학습보다 언어 지능 성능이 일관되게 향상되었다고 보고되었다.

용어 해설

시각적 사전학습(Visual Pretraining)
시각적 사전학습은 문서·웹페이지 등의 원시 이미지에서 텍스트 추출 과정을 거치지 않고 이미지 정보 자체를 입력으로 하여 비지도 학습 목표로 표현을 학습하는 방식이다. 이 접근은 도표·수식·레이아웃 같은 시각적 단서가 담고 있는 의미적 정보를 보존하면서 모델이 언어적 추론 능력을 획득하도록 돕는다. 결과적으로 텍스트 변환 과정에서 손실되는 정보가 복원되거나 대체되어 언어 지능 학습의 효율이 향상될 가능성이 있다.
시각 문서(Visual Document)
시각 문서는 텍스트와 함께 그림, 표, 수식, 레이아웃 정보를 포함하는 페이지 형태의 자료로서 이미지 픽셀과 공간 배치가 의미를 전달하는 매체이다. OCR로 텍스트만 추출하면 도표의 시각적 구조나 수식의 배치 정보 등이 손실되어 전체 지식의 일부가 누락된다. 본 논문 맥락에서는 이러한 시각 문서의 원시 이미지를 직접 활용하는 것이 핵심 전제이다.
조판된 수식(Typeset Equation)
조판된 수식은 LaTeX 등으로 렌더링된 수식 형태로서 단순 문자열보다 구조적·공간적 정보를 포함하여 수학적 의미를 전달한다. 수식의 기호 배치, 상하첨자·분수 구조 등은 시각적 표현 없이는 정확히 복원되기 어려워 텍스트 전용 전처리에서 손실되기 쉽다. 논문은 이러한 조판된 수식이 모델이 학습해야 할 중요한 지식원을 구성한다고 전제한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 10.수집 2026. 07. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.