Kuaishou에서 공개한 30B 파라미터 규모의 멀티모달 비전 언어 모델 Keye-VL-2.0
이미지-텍스트 멀티모달 대화 및 이해30Bapache-2.0
이미지와 텍스트를 입력받아 대화형으로 응답하는 30B 파라미터 규모의 멀티모달 비전 언어 모델.
핵심 역량
- 이미지 기반 질의응답
- 멀티모달 대화
- 시각적 정보 추출
- 이미지 캡셔닝
알아두면 좋은 것
- Apache 2.0 라이선스 적용
- 30B 파라미터 규모의 멀티모달 모델
- 이미지-텍스트 멀티모달 이해 특화
108
Likes
2.6k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.