baidu/Unlimited-OCR
Python0 / 0
DeepSeek-OCR을 계승해 단일 이미지부터 다중 페이지 PDF까지 한 번의 추론으로 문서 구조를 파싱하는 바이두의 OCR 모델, vLLM·SGLang 서빙을 공식 지원.
TL;DR
Unlimited-OCR은 DeepSeek-OCR 계열을 잇는 문서 파싱 모델로, 단일 이미지는 gundam(고해상도 크롭)과 base 두 설정으로, 여러 페이지나 PDF는 base 설정으로 한 번에 처리해 반복 텍스트를 억제하는 no-repeat-ngram 로직과 함께 구조화된 파싱 결과를 낸다. HuggingFace transformers 외에 vLLM 공식 레시피와 SGLang용 커스텀 로짓 프로세서로 서빙을 지원해 배치·스트리밍 추론에 바로 투입할 수 있고, ms-swift로 파인튜닝도 가능하다. OmniDocBench 같은 벤치마크 평가를 위한 후처리 스크립트(<|det|> 마커 제거·블록 분리)도 함께 제공되어 연구용 평가 파이프라인에 바로 꽂을 수 있다. 스캔 문서나 다중 페이지 PDF를 구조화된 텍스트로 대량 변환해야 하는 문서 파싱 워크플로에 맞는다.
핵심 포인트
- DeepSeek-OCR을 한 걸음 더 밀겠다고 밝히며, vLLM 공식 레시피와 SGLang 커스텀 로짓 프로세서로 서빙 경로를 제공한다.
- 단일 이미지(gundam/base)와 다중 페이지 PDF(base)를 같은 모델로 처리해 문서 길이에 따라 별도 모델을 바꿔 쓰지 않는다.
- infer.py가 SGLang 서버를 자동으로 띄우고 동시성을 조절해 이미지 디렉터리나 PDF를 배치로 처리하는 실전 스크립트를 바로 제공한다.
- ms-swift 커뮤니티와의 협력으로 공식 파인튜닝 경로가 열려 있어 도메인 문서에 맞춘 추가 학습이 가능하다.
23.6k
STARS
2.4k
FORKS
+209
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.