본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

OpenMOSS-Team/MOSS-VL-Instruct-0408

비디오 및 이미지 텍스트 생성 및 이해apache-2.0

MOSS-VL-Base를 기반으로 비디오 및 이미지 이해 능력을 강화하기 위해 지시 미세 조정(SFT)을 적용한 멀티모달 모델이다.

학습 방식 · MOSS-VL-Base-0408 기반의 SFT(Supervised Fine-Tuning)를 통한 비디오-텍스트 정렬 학습

핵심 포인트

  • 비디오와 이미지를 동시에 지원하는 범용 멀티모달 구조
  • Apache 2.0 라이선스로 자유로운 수정 및 배포 가능
  • 비디오 내용 요약 및 분석
  • 이미지 기반 질의응답

78

LIKES

316

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.