문서 파싱과 OCR을 하나로, PaddleOCR-VL-1.6 공개
이미지 내 텍스트 인식, 문서 레이아웃 분석, 표·차트·수식 해석, 이미지-텍스트 대화apache-2.0
PaddleOCR-VL-1.5를 기반으로 개선된 다국어 OCR 및 문서 이해 특화 Vision-Language 모델입니다.
핵심 역량
- 이미지 내 텍스트 인식(OCR)
- 문서 레이아웃 분석
- 표·차트·수식 데이터 추출
- 이미지 기반 다국어 대화
- 도장 및 특정 객체 탐지
강점
- 복잡한 문서 레이아웃 및 표/차트 인식 최적화
- PaddleOCR 생태계와의 높은 호환성
훈련 방식
PaddleOCR-VL-1.5 기반 파인튜닝 모델로, ERNIE 4.5 아키텍처를 활용하여 문서 이해 및 OCR 성능을 개선함.
알아두면 좋은 것
- PaddleOCR-VL-1.5 기반 파인튜닝 모델
- 영어 및 중국어 포함 다국어 지원
- Apache 2.0 라이선스 적용
- 문서 파싱 및 구조화 데이터 추출 특화
290
Likes
11.2k
Downloads
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.