본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

baidu/Unlimited-OCR

Python0 / 0

DeepSeek-OCR을 계승해 단일 이미지부터 다중 페이지 PDF까지 한 번의 추론으로 문서 구조를 파싱하는 바이두의 OCR 모델, vLLM·SGLang 서빙을 공식 지원.

TL;DR

Unlimited-OCR은 DeepSeek-OCR 계열을 잇는 문서 파싱 모델로, 단일 이미지는 gundam(고해상도 크롭)과 base 두 설정으로, 여러 페이지나 PDF는 base 설정으로 한 번에 처리해 반복 텍스트를 억제하는 no-repeat-ngram 로직과 함께 구조화된 파싱 결과를 낸다. HuggingFace transformers 외에 vLLM 공식 레시피와 SGLang용 커스텀 로짓 프로세서로 서빙을 지원해 배치·스트리밍 추론에 바로 투입할 수 있고, ms-swift로 파인튜닝도 가능하다. OmniDocBench 같은 벤치마크 평가를 위한 후처리 스크립트(<|det|> 마커 제거·블록 분리)도 함께 제공되어 연구용 평가 파이프라인에 바로 꽂을 수 있다. 스캔 문서나 다중 페이지 PDF를 구조화된 텍스트로 대량 변환해야 하는 문서 파싱 워크플로에 맞는다.

핵심 포인트

  • DeepSeek-OCR을 한 걸음 더 밀겠다고 밝히며, vLLM 공식 레시피와 SGLang 커스텀 로짓 프로세서로 서빙 경로를 제공한다.
  • 단일 이미지(gundam/base)와 다중 페이지 PDF(base)를 같은 모델로 처리해 문서 길이에 따라 별도 모델을 바꿔 쓰지 않는다.
  • infer.py가 SGLang 서버를 자동으로 띄우고 동시성을 조절해 이미지 디렉터리나 PDF를 배치로 처리하는 실전 스크립트를 바로 제공한다.
  • ms-swift 커뮤니티와의 협력으로 공식 파인튜닝 경로가 열려 있어 도메인 문서에 맞춘 추가 학습이 가능하다.

23.6k

STARS

2.4k

FORKS

+209

TRENDING

0

조회수

watchers 23.6kopen issues 76MIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.