TL;DR
WordArt는 고도로 스타일화된 글자 형태와 복잡한 레이아웃으로 기존 OCR·STR 파이프라인에서 높은 실패율을 보인다. 본 논문은 대규모 합성 데이터(WATER-S)와 임의 비율 입력을 처리하는 모델(WATERec)을 결합해 WordArt 성능을 대폭 개선한다.
왜 중요한가
WordArt는 고도로 스타일화된 글자 형태와 복잡한 레이아웃으로 기존 OCR·STR 파이프라인에서 높은 실패율을 보인다. 본 논문은 대규모 합성 데이터(WATER-S)와 임의 비율 입력을 처리하는 모델(WATERec)을 결합해 WordArt 성능을 대폭 개선한다.
핵심 기여
대규모 WordArt 합성 데이터셋 WATER-S 구성
도구 기반 렌더러 SynthWordArt로 생성한 WATER-T(1M)와 VLM 기반 파이프라인(Qwen3-VL로 캡션 마이닝 + Z-Image로 합성)으로 생성한 WATER-Z(1M)를 결합해 총 2M 규모의 WATER-S를 구축했다. 두 서브셋은 글꼴·레이아웃 제어성과 스타일·텍스처 다양성 측면에서 상호보완적이다.
임의 비율 입력을 지원하는 WATERec 아키텍처
비율 보존 이미지 리사이즈 → 패치 임베딩 → RoPE 기반 6-layer 비전 Transformer 인코더(토큰 차원 d=384, 패치 크기 p=4, 토큰 수 범위 [64,256]) → AR Transformer 디코더(2개 교차-어텐션 층) 구조를 도입해 WordArt의 긴·짧은·곡선형 텍스트와 비정형 읽기 순서를 효과적으로 처리한다.
합성 데이터와 모델 설계의 결합으로 SOTA 달성
WATER-R(리얼 데이터 3.2M) 위에 WATER-S(2M)를 추가해 WATERec을 학습한 결과 WordArt-Bench에서 90.40% 정확도를 기록했다. 이는 일반 VLM 및 OCR 특화 VLM 대비 큰 격차를 보이며, 합성 데이터가 다양한 STR 아키텍처에 걸쳐 일관된 이득을 준다.
프롬프트 마이닝·필터링을 통한 모델 기반 합성 파이프라인
Qwen3-VL로 실샘플에서 상세 캡션을 자동 생성하고 few-shot 방식으로 다양한 프롬프트 라이브러리(273,488개)를 만들어 Z-Image-Turbo에 투입함으로써 스타일·구성의 현실성을 높인 모델 기반 합성(WATER-Z)을 확보했다.
핵심 아이디어 이해하기
문제 정의와 기존 한계: WordArt는 글자 내부에 그래픽·텍스처·패턴이 통합되고, 종횡비와 레이아웃이 매우 다양해 기존 STR 파이프라인의 고정 템플릿(예: 32×128) 기반 리사이즈가 문자 형태를 왜곡하고 읽기 순서 가정을 깨뜨린다. 또한 실제 WordArt 데이터는 희소하며 수작업 라벨링이 어렵고 불일치가 발생하므로 학습 데이터가 부족하다.
방법론
전체 접근과 핵심 구조: 입력 이미지는 종횡비를 보존해 스케일링한 뒤 패치 크기 p=4로 분할해 토큰 수 N=(Ĥ/p)×(Ŵ/p)를 계산한다. N은 훈련/배치 제약에 따라 [64,256] 범위로 제한된다. 각 패치는 선형 프로젝션으로 d=384 차원 토큰 X∈ℝ^{N×d}이 되고, 6-layer 비전 Transformer 인코더(쿼리·키에 RoPE 적용)가 컨텍스트 피처 Z∈ℝ^{N×d}를 생성한다. 디코더는 AR Transformer로, 2개의 cross-attention 레이어를 통해 Z를 참조하며 토큰을 하나씩 예측한다.
관련 Figure

그림은 arbitrary-shaped 입력이 패치 임베딩으로 변환되어 RoPE 어텐션을 통과한 뒤 AR 디코더로 연결되는 처리를 보여준다. RoPE 블록 상세는 쿼리·키의 위치 의존적 회전 적용과 이어지는 MatMul→Scale→Softmax 연산 흐름을 명시해, 임의 길이 토큰열에서 상대 위치 정보를 보존하는 메커니즘을 보강한다.
WATERec 전체 아키텍처와 RoPE 기반 어텐션 블록을 도식화한 Figure이다.
주요 결과
메인 벤치마크 성과: WATERec을 WATER-R(3.225M) 기반으로 학습한 뒤 WATER-S(2M)를 추가하면 WordArt-Bench에서 정확도 90.40%를 달성했다. 비교 대상으로 보고된 OCR-specialized VLM 최고치는 81.54%(HunyuanOCR)이고, 일반 VLM 최고치는 78.36% 수준이었다. 합성 데이터의 영향: WATER-T 또는 WATER-Z 단독으로도 성능 향상이 관찰되며, 두 서브셋을 결합한 WATER-S가 가장 안정적 이득을 제공한다. 스케일 분석: WATER-S를 1M→2M으로 늘릴 때 일관된 개선이 있었으나 3M에서는 포화·변동 현상이 관찰되어 합성대(real 대비) 비율 약 2:3이 본 설정에서 균형적이었다.
관련 Figure

상단은 도구 기반(WATER-T)과 모델 기반(WATER-Z) 합성 샘플의 스타일 차이를 시각적으로 제시하며, 하단 막대그래프는 STR 모델군과 VLM의 WordArt-Bench 성능을 비교한다. 이 그림은 합성 데이터 추가와 WATERec 설계가 WordArt 성능 향상에 기여했다는 실험적 근거를 시각적으로 보강한다.
WATER-T/WATER-Z의 샘플 이미지와 다양한 모델·VLM의 WordArt-Bench 정확도 비교 차트가 포함된 Figure이다.
기술 상세
아키텍처 구조: 인코더는 6-layer Transformer로 구성되며 RoPE 기반 어텐션을 사용해 토큰 간 상대 위치를 내재화한다. 입력 패치 크기는 p=4, 토큰 임베딩 차원 d=384를 사용한다. 토큰 수 N은 [64,256] 범위로 강제해 배치 학습을 안정화했다. 디코더는 AR 방식으로, 교차-어텐션 레이어 2개를 통해 인코더 피처에 접근하고 각 스텝에서 softmax를 통해 문자를 예측한다.
한계점
논문에서 명시된 한계: (1) 합성 데이터의 과도한 비율은 분포 불일치와 노이즈 누적으로 성능 포화를 초래하며 3M 수준에서는 이득이 줄어들었다. (2) WATER-Z에서 생성된 이미지의 문자 가독성은 예측 불확실성을 유발할 수 있어 라벨 정확도 보장이 어려운 경우가 존재한다. (3) 현재 데이터와 실험은 주로 영어 WordArt에 집중되어 있어 다국어·다문자 스크립트로의 직접 일반화는 추가 작업이 필요하다.
실무 활용
코드 및 데이터가 공개되어 있어 연구·개발 환경에서 재현과 확장이 가능하다. 합성 데이터 파이프라인과 arbitrary-shaped 인코더는 WordArt가 많은 광고·디자인 이미지의 OCR 성능 개선에 직접 적용 가능하다.
- 광고·포스터 자동 텍스트 추출 파이프라인의 전처리·인식 모델 교체
- 도메인 특화 폰트·스타일이 많은 전자상거래·디자인 플랫폼의 텍스트 검색·태깅
- 데이터가 부족한 스크립트(다국어·비표준 서체)로의 합성 데이터 확장 실험
- OCR 성능 향상을 위한 VLM 파인튜닝 전용 합성 데이터 생성
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- RoPE
- — RoPE는 쿼리와 키 벡터에 위치별 회전 변환을 적용해 어텐션의 내적이 상대적 위치 정보를 포함하도록 만드는 기법이다. 입력 길이가 변해도 상대적 위치 관계를 보존하므로 임의 길이/비율의 이미지 토큰열에 일반화성이 높다. 본문에서는 arbitrary-shaped input을 처리하는 비주얼 인코더에 적용되었다.
- Autoregressive Decoder
- — AR 디코더는 문자를 한 토큰씩 순차적으로 생성하면서 이전 예측을 조건으로 다음 출력을 계산하는 방식이다. 디코더는 cross-attention으로 인코더 출력을 참조해 각 생성 스텝에서 확률분포(softmax)를 계산하고 cross-entropy로 학습된다. WordArt의 비정형 읽기 순서와 복잡한 레이아웃에 적용되었다.
- NaViT
- — NaViT는 다양한 종횡비의 이미지를 자연스럽게 처리하도록 설계된 비전 Transformer 계열 아키텍처이다. 본문에서는 NaViT 유사 인코더 구조에 RoPE를 결합해 입력 이미지의 종횡비를 유지한 채 패치 토큰으로 변환하고, 토큰 길이 범위를 [64,256]으로 설정해 배치/학습을 안정화했다.
- Synthetic Dataset
- — 합성 데이터셋은 렌더링 엔진 또는 이미지 생성 모델을 이용해 인위적으로 생성한 학습용 이미지 집합이다. 본문에서는 SynthWordArt로 생성한 WATER-T(도구 기반)와 Qwen3-VL+Z-Image로 생성한 WATER-Z(모델 기반)를 합쳐 2M 규모의 WATER-S를 구성했다. 합성은 실제 수집이 어려운 WordArt 다양성 보완이 목적이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.