30B의 지능을 3B의 비용으로! '이미지로 생각하는' 혁신적 MoE 멀티모달 모델
멀티모달 텍스트 생성 (이미지/비디오/텍스트 입력 및 분석)30B64K 컨텍스트apache-2.0
MoE 아키텍처와 'Think with Image' 기능을 통해 고해상도 문서 및 복잡한 시각적 추론을 효율적으로 수행하는 멀티모달 모델입니다.
핵심 역량
- MoE 구조로 30B 성능을 3B 활성 파라미터 비용으로 제공
- 'Think with Image'를 통한 능동적 시각적 추론 및 CoT 지원
- 최대 2880x2880 초고해상도 이미지 입력 및 분석 지원
- 64K 토큰의 긴 컨텍스트로 다중 페이지 문서 이해 최적화
- 강화된 OCR 및 차트/다이어그램 데이터 추출 및 추론 능력
- 이미지 내 객체 좌표를 출력하는 Grounding 기능 지원
알아두면 좋은 것
- 30B 전체 파라미터 중 추론 시 약 3B만 사용하는 효율적인 MoE 아키텍처
- 64K 컨텍스트 윈도우 지원으로 정보 밀도가 높은 긴 문서 처리 가능
- 이미지 내 객체 위치를 좌표(Point/Box)로 출력하는 Grounding 기능 내장
- Apache-2.0 라이선스로 상업적 이용 및 수정이 비교적 자유로움
136
Likes
12.3k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.