datalab-to/chandra
Python0 / 0
이미지와 PDF를 레이아웃 손실 없이 Markdown, HTML, JSON으로 변환하며 90개 이상의 언어와 복잡한 수식 및 필기체를 지원하는 고성능 OCR 모델이다.
핵심 포인트
- 90개 이상의 다국어 텍스트와 복잡한 수식 및 필기체를 높은 정확도로 인식한다.
- 문서의 시각적 레이아웃을 유지하며 Markdown, HTML, JSON 형식의 구조화된 출력을 생성한다.
- olmocr 벤치마크에서 GPT-4o 및 Gemini Flash 2를 상회하는 성능 지표를 기록했다.
- vLLM 서버 모드 활용 시 단일 H100 GPU에서 초당 약 1.44페이지의 처리량을 확보한다.
7.9k
STARS
780
FORKS
+627
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.