본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

OpenMOSS-Team/MOSS-VL-Base-0408

비디오 및 이미지 이해 및 특징 추출apache-2.0

비디오 및 이미지 데이터를 텍스트와 결합하여 시각적 정보를 이해하고 특징을 추출하는 멀티모달 베이스 모델이다.

학습 방식 · MOSS-VL 아키텍처 기반의 비디오-텍스트 통합 학습 베이스 모델

핵심 포인트

  • 비디오와 이미지를 동시에 처리 가능한 멀티모달 범용성
  • Apache 2.0 라이선스로 자유로운 2차 활용 가능
  • 비디오 시공간 특징 추출
  • 이미지 콘텐츠 이해

54

LIKES

41

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.