문서 전체를 마크다운으로! 동적 해상도와 시각적 인과 흐름으로 진화한 차세대 OCR
이미지 텍스트 추출 및 구조화 (OCR)apache-2.0
이미지 속 텍스트와 레이아웃을 인식하여 마크다운 등 구조화된 텍스트로 변환하는 고성능 OCR 모델입니다.
핵심 역량
- 동적 해상도 지원 (최대 6개 패치 활용)
- 마크다운(Markdown) 구조화 출력
- 시각적 그라운딩(Grounding) 기능
- 한국어 포함 다국어 텍스트 인식
- Flash Attention 2 가속 지원
- vLLM 추론 엔진 최적화
알아두면 좋은 것
- DeepSeek-VL v2 기반의 시각적 인과 흐름(Visual Causal Flow) 아키텍처 적용
- 동적 해상도(Dynamic Resolution)를 통한 고해상도 문서 이미지 처리 최적화
- 한국어를 포함한 다국어 지원 (Multilingual)
- Apache-2.0 라이선스로 상업적 이용 및 수정 가능
823
Likes
1.6M
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.