문서 파싱의 혁신, 1.2B 파라미터로 구현하는 정교한 이미지-텍스트 변환
이미지 및 텍스트 기반 텍스트 생성1.2Bapache-2.0
Qwen2-VL 아키텍처를 기반으로 문서 이미지 내의 텍스트와 구조 정보를 정교하게 추출하는 1.2B 규모의 시각 언어 모델이다.
핵심 역량
- 이미지 내 텍스트 추출 및 인식
- 멀티모달 대화 수행
- 문서 구조 분석 및 텍스트 변환
- 시각적 정보 기반 질의응답
강점
- 1.2B의 경량 파라미터로 효율적인 추론 가능
- Apache 2.0 라이선스로 자유로운 활용 보장
- 검증된 Qwen2-VL 아키텍처의 시각 이해 능력 계승
훈련 방식
Qwen2-VL 아키텍처를 기반으로 한 이미지-텍스트 정렬 및 미세 조정 학습
알아두면 좋은 것
- Qwen2-VL 기반의 아키텍처 활용
- Apache 2.0 라이선스로 상업적 이용 가능
- 중국어 및 영어 다국어 지원
- Transformers 라이브러리와의 높은 호환성
58
Likes
13.2k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.