0.9B 파라미터로 벤치마크 1위를 달성한 초고속 멀티모달 OCR
AI Tool·Python0 / 0
GLM-V 아키텍처를 기반으로 복잡한 문서의 레이아웃을 분석하고 텍스트, 표, 수식을 정밀하게 추출하는 경량 OCR 모델이다.
주요 기능
- OmniDocBench V1.5에서 94.62점을 기록하며 문서 이해 성능 부문 전체 1위 달성
- 0.9B 파라미터의 경량 모델로 설계되어 vLLM, SGLang, Ollama를 통한 저지연 추론 환경 구축
- PP-DocLayout-V3 기반의 레이아웃 분석 모듈을 통합하여 복잡한 표, 코드, 인장 인식 최적화
- pip install glmocr 명령어로 설치 가능한 SDK를 통해 한 줄의 코드로 OCR 기능 호출
- Multi-Token Prediction(MTP) 기법을 적용하여 텍스트 생성 속도와 인식 정확도를 동시 개선
사용 사례
- 복잡한 표와 수식이 포함된 학술 논문이나 기술 보고서의 자동 Markdown 변환
- 대규모 비정형 문서 아카이브를 검색 및 분석 가능한 구조화된 JSON 데이터로 전환
- 엣지 디바이스나 리소스가 제한된 서버 환경에서 고성능 문서 스캐닝 서비스 구현
4.7k
Stars
387
Forks
+461
Trending
0
조회수
4.7k watchers51 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.