baidu/Unlimited-OCR
이미지·PDF 문서를 구조화된 텍스트로 파싱하는 다국어 문서 OCR32K 컨텍스트mit
여러 페이지 문서를 한 번에 파싱하도록 만든 Baidu의 다국어 문서 OCR 모델.
TL;DR
Baidu의 Unlimited-OCR은 DeepSeek-OCR을 한 단계 더 밀어붙이는 것을 목표로 공개된 문서 파싱 모델로, 카드가 내세우는 문구는 '원샷 장기 시야 파싱(one-shot long-horizon parsing)'이며 여러 페이지 이미지를 한 번에 넘기는 멀티페이지 파싱 API(infer_multi)를 제공한다. 단일 이미지는 gundam(image_size 640, 크롭 사용)과 base(1024, 크롭 없음) 두 설정을 쓰고 다중 페이지·PDF는 base 설정만 지원하며, 최대 길이는 32,768 토큰이다. PyMuPDF로 PDF를 페이지 이미지로 변환해 그대로 멀티페이지 파싱에 넣는 워크플로가 카드에 실려 있고, Transformers·vLLM·SGLang 세 추론 경로를 모두 지원하면서 SGLang에서는 OpenAI 호환 스트리밍 API와 반복 억제용 커스텀 로짓 프로세서를 함께 쓴다. 다국어 모델로 표시돼 있고 OmniDocBench 평가용 후처리 스크립트까지 제공해, 스캔 문서를 대량으로 구조화하는 파이프라인에 맞춰져 있다.
핵심 포인트
- DeepSeek-OCR을 한 단계 더 밀어붙이는 것을 목표로, 여러 페이지를 한 번에 넘기는 파싱 API를 제공한다.
- 단일 이미지는 gundam·base 두 크롭 설정, 다중 페이지와 PDF는 base 설정만 쓰도록 나눠 안내한다.
- PyMuPDF로 PDF를 페이지 이미지로 바꿔 그대로 멀티페이지 파싱에 넣는 워크플로를 카드에 담았다.
- Transformers·vLLM·SGLang을 모두 지원하고 SGLang에서는 OpenAI 호환 스트리밍 API를 쓴다.
4.1k
LIKES
3M
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.