TL;DR
장문서 OCR은 페이지를 시각 토큰으로 바꾸는 입력 비용과 생성 결과가 누적되며 커지는 출력 메모리라는 두 병목을 동시에 안고 있습니다. DeepSeek OCR은 문서 패치를 광학 압축해 입력 토큰을 줄이고, Baidu의 Unlimited-OCR은 문서 시각 토큰과 프롬프트를 정적 참조 영역으로 유지하면서 최근 출력 토큰만 약 128토큰의 창에 남기는 R-SWA를 적용합니다. 이 구조에서 KV 캐시는 정적 영역 m과 최근 출력 영역 n의 합으로 유지되므로 500토큰이나 30,000토큰을 생성해도 메모리 사용량이 대체로 일정합니다. 모델은 Transformers, vLLM, SGLang에서 실행할 수 있지만 ‘Unlimited’는 무한한 처리량을 뜻하는 것이 아니라 장문서 디코딩 메모리 증가를 제한한다는 의미입니다.
섹션별 상세






pip install torch torchvision transformers Pillow matplotlib einops addict easydict pymupdf psutilTransformers 기반 Unlimited-OCR 실행에 필요한 Python 패키지를 설치합니다.
import torch
from transformers import AutoModel, AutoTokenizer
model_name = "baidu/Unlimited-OCR"
tokenizer = AutoTokenizer.from_pretrained(
model_name,
trust_remote_code=True
)
model = AutoModel.from_pretrained(
model_name,
trust_remote_code=True,
use_safetensors=True,
device_map="auto"
)Hugging Face에서 Unlimited-OCR의 Tokenizer와 모델을 불러와 자동으로 사용 가능한 장치에 배치합니다.
from transformers import pipeline
pipe = pipeline(
"image-text-to-text",
model="baidu/Unlimited-OCR",
trust_remote_code=True
)Transformers의 고수준 pipeline으로 이미지 입력과 텍스트 출력을 연결합니다.
용어 해설
- 시각 토큰(Visual Token)
- — 문서 이미지를 작은 패치로 나눈 뒤 각 패치를 수치 벡터로 변환한 표현입니다. Vision-Language Model은 이 벡터 시퀀스를 텍스트 토큰과 비슷한 입력으로 처리하며, 패치 수가 많을수록 세부 정보는 늘지만 계산량과 GPU 메모리 사용량도 증가합니다.
- KV 캐시(KV Cache)
- — Transformer가 이미 생성한 토큰의 Key와 Value 표현을 저장해 다음 토큰 생성 때 전체 시퀀스를 다시 계산하지 않도록 하는 메모리 구조입니다. 긴 문서에서는 출력 토큰이 늘어날수록 캐시가 계속 커져 GPU 메모리와 Attention 계산 비용이 증가합니다.
- 광학 압축(Optical Compression)
- — 문서 페이지를 텍스트로 변환하기 전에 시각 패치와 임베딩으로 압축하는 방식입니다. DeepSeek OCR은 페이지의 시각 정보를 더 적은 입력 토큰으로 전달해 처리 비용을 낮추지만, 압축률이 높아지면 세부 정보와 OCR 정확도가 함께 떨어집니다.
- 슬라이딩 윈도 Attention(Sliding Window Attention)
- — 각 생성 토큰이 전체 과거 토큰 대신 최근 토큰으로 구성된 고정 크기 창에 주의를 기울이도록 제한하는 Attention 방식입니다. Unlimited-OCR은 여기에 문서 시각 토큰을 영구적으로 유지하는 Reference Sliding Window Attention을 결합해 출력 길이에 따른 KV 캐시 증가를 막습니다.
- 자기회귀 디코딩(Autoregressive Decoding)
- — 모델이 앞서 생성한 토큰을 조건으로 다음 토큰을 하나씩 예측하는 생성 방식입니다. 장문서 OCR에서는 출력 토큰이 순차적으로 누적되므로 KV 캐시와 디코딩 비용이 문서 길이에 따라 증가하는 문제가 생깁니다.
기술
- Baidu
- Unlimited-OCR
- DeepSeek OCR
- Hugging Face
- Transformers
- vLLM
- SGLang
- AutoModel
- AutoTokenizer
- PyTorch
- NVIDIA GPUs
활용 사례
- 다중 페이지 문서 전사
- PDF 문서 파싱
- 장문서 OCR API
- 문서 처리 파이프라인
- RAG 파이프라인용 문서 추출
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.