GPT-4o를 넘어서는 성능, 복잡한 표와 손글씨까지 읽어내는 Chandra OCR 2
AI Tool·Python0 / 0
이미지와 PDF를 레이아웃 손실 없이 Markdown, HTML, JSON으로 변환하며 90개 이상의 언어와 복잡한 수식 및 필기체를 지원하는 고성능 OCR 모델이다.
주요 기능
- 90개 이상의 다국어 텍스트와 복잡한 수식 및 필기체를 높은 정확도로 인식한다.
- 문서의 시각적 레이아웃을 유지하며 Markdown, HTML, JSON 형식의 구조화된 출력을 생성한다.
- olmocr 벤치마크에서 GPT-4o 및 Gemini Flash 2를 상회하는 성능 지표를 기록했다.
- vLLM 서버 모드 활용 시 단일 H100 GPU에서 초당 약 1.44페이지의 처리량을 확보한다.
- 문서 내 이미지와 다이어그램을 자동 추출하고 구조화된 캡션 데이터를 추가한다.
어떻게 동작하는가
Hugging Face Transformers 기반의 로컬 추론 또는 vLLM 엔진을 통한 분산 추론을 지원하며, 문서의 시각적 구조를 분석하여 텍스트와 레이아웃 정보를 동시에 추출하는 비전-언어 모델 구조를 채택했다.
7.9k
Stars
780
Forks
+627
Trending
0
조회수
7.9k watchers33 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.