본문으로 건너뛰기

WordArt 중심 장면 텍스트 인식 향상: 데이터셋과 방법

WordArt는 고도로 스타일화된 글자 형태와 복잡한 레이아웃으로 기존 OCR·STR 파이프라인에서 높은 실패율을 보인다. 본 논문은 대규모 합성 데이터(WATER-S)와 임의 비율 입력을 처리하는 모델(WATERec)을 결합해 WordArt 성능을 대폭 개선한다.

용어 해설

RoPE(회전 위치 인코딩)(RoPE)
RoPE는 쿼리와 키 벡터에 위치별 회전 변환을 적용해 어텐션의 내적이 상대적 위치 정보를 포함하도록 만드는 기법이다. 입력 길이가 변해도 상대적 위치 관계를 보존하므로 임의 길이/비율의 이미지 토큰열에 일반화성이 높다. 본문에서는 arbitrary-shaped input을 처리하는 비주얼 인코더에 적용되었다.
자동회귀(AR) 디코더(Autoregressive Decoder)
AR 디코더는 문자를 한 토큰씩 순차적으로 생성하면서 이전 예측을 조건으로 다음 출력을 계산하는 방식이다. 디코더는 cross-attention으로 인코더 출력을 참조해 각 생성 스텝에서 확률분포(softmax)를 계산하고 cross-entropy로 학습된다. WordArt의 비정형 읽기 순서와 복잡한 레이아웃에 적용되었다.
NaViT(임의 비율 입력 지원 비전 백본)(NaViT)
NaViT는 다양한 종횡비의 이미지를 자연스럽게 처리하도록 설계된 비전 Transformer 계열 아키텍처이다. 본문에서는 NaViT 유사 인코더 구조에 RoPE를 결합해 입력 이미지의 종횡비를 유지한 채 패치 토큰으로 변환하고, 토큰 길이 범위를 [64,256]으로 설정해 배치/학습을 안정화했다.
합성 데이터셋(Synthetic Dataset)
합성 데이터셋은 렌더링 엔진 또는 이미지 생성 모델을 이용해 인위적으로 생성한 학습용 이미지 집합이다. 본문에서는 SynthWordArt로 생성한 WATER-T(도구 기반)와 Qwen3-VL+Z-Image로 생성한 WATER-Z(모델 기반)를 합쳐 2M 규모의 WATER-S를 구성했다. 합성은 실제 수집이 어려운 WordArt 다양성 보완이 목적이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 23.수집 2026. 06. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.