용어 해설
- RoPE(회전 위치 인코딩)(RoPE)
- — RoPE는 쿼리와 키 벡터에 위치별 회전 변환을 적용해 어텐션의 내적이 상대적 위치 정보를 포함하도록 만드는 기법이다. 입력 길이가 변해도 상대적 위치 관계를 보존하므로 임의 길이/비율의 이미지 토큰열에 일반화성이 높다. 본문에서는 arbitrary-shaped input을 처리하는 비주얼 인코더에 적용되었다.
- 자동회귀(AR) 디코더(Autoregressive Decoder)
- — AR 디코더는 문자를 한 토큰씩 순차적으로 생성하면서 이전 예측을 조건으로 다음 출력을 계산하는 방식이다. 디코더는 cross-attention으로 인코더 출력을 참조해 각 생성 스텝에서 확률분포(softmax)를 계산하고 cross-entropy로 학습된다. WordArt의 비정형 읽기 순서와 복잡한 레이아웃에 적용되었다.
- NaViT(임의 비율 입력 지원 비전 백본)(NaViT)
- — NaViT는 다양한 종횡비의 이미지를 자연스럽게 처리하도록 설계된 비전 Transformer 계열 아키텍처이다. 본문에서는 NaViT 유사 인코더 구조에 RoPE를 결합해 입력 이미지의 종횡비를 유지한 채 패치 토큰으로 변환하고, 토큰 길이 범위를 [64,256]으로 설정해 배치/학습을 안정화했다.
- 합성 데이터셋(Synthetic Dataset)
- — 합성 데이터셋은 렌더링 엔진 또는 이미지 생성 모델을 이용해 인위적으로 생성한 학습용 이미지 집합이다. 본문에서는 SynthWordArt로 생성한 WATER-T(도구 기반)와 Qwen3-VL+Z-Image로 생성한 WATER-Z(모델 기반)를 합쳐 2M 규모의 WATER-S를 구성했다. 합성은 실제 수집이 어려운 WordArt 다양성 보완이 목적이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

