비디오와 이미지 이해를 위한 OpenMOSS의 멀티모달 베이스 모델 MOSS-VL
비디오 및 이미지 이해 및 특징 추출apache-2.0
비디오 및 이미지 데이터를 텍스트와 결합하여 시각적 정보를 이해하고 특징을 추출하는 멀티모달 베이스 모델이다.
핵심 역량
- 비디오 시공간 특징 추출
- 이미지 콘텐츠 이해
- 비디오 기반 텍스트 생성 기초 제공
- 멀티모달 데이터 임베딩 생성
강점
- 비디오와 이미지를 동시에 처리 가능한 멀티모달 범용성
- Apache 2.0 라이선스로 자유로운 2차 활용 가능
훈련 방식
MOSS-VL 아키텍처 기반의 비디오-텍스트 통합 학습 베이스 모델
알아두면 좋은 것
- 비디오와 이미지를 모두 지원하는 범용 시각 이해 아키텍처
- OpenMOSS 팀에서 공개한 MOSS-VL 시리즈의 베이스 체크포인트
- Apache 2.0 라이선스로 상업적 이용 및 수정 가능
- Transformers 라이브러리와 호환되는 safetensors 형식 제공
54
Likes
41
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.