비디오와 이미지 이해에 특화된 MOSS-VL-Instruct-0408 공개
비디오 및 이미지 텍스트 생성 및 이해apache-2.0
MOSS-VL-Base를 기반으로 비디오 및 이미지 이해 능력을 강화하기 위해 지시 미세 조정(SFT)을 적용한 멀티모달 모델이다.
핵심 역량
- 비디오 내용 요약 및 분석
- 이미지 기반 질의응답
- 시각적 특징 추출
- 멀티모달 지시어 이행
강점
- 비디오와 이미지를 동시에 지원하는 범용 멀티모달 구조
- Apache 2.0 라이선스로 자유로운 수정 및 배포 가능
훈련 방식
MOSS-VL-Base-0408 기반의 SFT(Supervised Fine-Tuning)를 통한 비디오-텍스트 정렬 학습
알아두면 좋은 것
- MOSS-VL-Base-0408 모델을 기반으로 파인튜닝됨
- Apache 2.0 라이선스로 상업적 이용 가능
- Transformers 라이브러리와 호환되는 Safetensors 형식 제공
- 영어 기반의 비디오-텍스트 데이터로 학습됨
78
Likes
316
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.