추가 이미지 분석

왼쪽 플롯은 해상도 감소에 따라 스크램블 텍스트 인식 정확도가 어떻게 떨어지는지를 보여주며, 오른쪽 플롯은 의미적 텍스트와 스크램블 텍스트 간의 정확도 격차를 플롯한다. 복원 항을 포함한 모델은 해상도가 낮을 때 스크램블 정확도가 더 잘 유지되고 의미-스크램블 격차가 좁혀지는 것으로 나타나, 복원이 시각 증거 보존에 실질적 기여를 한다는 실험적 근거를 제공한다. 이 결과는 언어적 보정 없이도 시각적 근거에 기반한 인식 능력이 향상되었음을 뒷받침한다.
해상도 별로 스크램블된 텍스트 인식 정확도와 의미 유지 텍스트와의 정확도 격차를 비교한 두 개의 선형 플롯이다.
용어 해설
- 이미지-투-텍스트 생성(Image-to-Text Generation)
- — 이미지-투-텍스트 생성은 입력 문서 이미지로부터 순차적 텍스트를 생성하는 과정으로, 시각 토큰을 텍스트 디코더에 공급하여 시각 표현과 텍스트 레이블을 정렬하는 방식으로 작동한다. 이 논문에서는 시각 표현과 문자 단위의 텍스트를 밀집하게 정합시키기 위해 autoregressive cross-entropy loss로 최적화되었다. 시각적 증거가 약할 때 언어적 신호의 보완을 최소화하고 시각 기반 인식 능력을 높이는 데 핵심 역할을 한다.
- 픽셀 복원(Pixel Reconstruction)
- — 픽셀 복원은 인코더가 추출한 시각 토큰으로부터 원본 이미지를 재구성하는 작업으로, MSE 손실을 기본으로 사용하여 스트로크와 글리프 등 세부 시각 정보를 보존하게 만든다. 구조 기반 변형에서는 Sobel 에지 및 distance-to-edge 맵을 추가로 매칭하여 획 수준의 형태를 보존한다. 문서 인식 과제에서 언어 맥락이 약할 때에도 시각 증거를 유지하게 하는 핵심 수단이다.
- 구조 인식 복원(Structure-Aware Reconstruction)
- — 구조 인식 복원은 단순 픽셀 차이 외에 에지 맵과 distance-to-edge 맵을 계산하여 재구성 산출물과 원본의 구조적 유사성을 직접 비교하는 기법이다. 먼저 Sobel gradient로 soft edge map을 얻고, 반복적 min-pooling으로 distance-to-edge 맵을 근사한 뒤 L1 손실로 두 표현을 정합시킨다. 문자 획과 레이아웃 경계 같은 미세 구조를 보존하는 데 중요하다.
- CDM 지표(CDM Metric)
- — CDM은 수식 인식에서 표현의 구조적 정확성을 평가하는 지표로, 생성된 LaTeX 서열과 정답 표현의 구조적 일치도를 측정한다. 정확도뿐 아니라 수식 기호의 공간적 관계를 고려하여 복잡한 수식의 정합도를 정량화한다. 본 논문에서는 수식 인식 비교에서 CDM과 ExpRate(정확일치 비율)를 함께 사용해 성능을 보고했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






