Google Gemma 4 시리즈의 26B 파라미터 멀티모달 모델 등장
이미지 및 텍스트 입력 기반 텍스트 생성26Bapache-2.0
이미지와 텍스트를 동시에 이해하여 텍스트 응답을 생성하는 Google의 26B 규모 Gemma 4 기반 멀티모달 모델이다.
핵심 역량
- 이미지 캡셔닝
- 시각적 질의응답 (VQA)
- 이미지 내 텍스트 인식 및 해석
- 멀티모달 대화 수행
강점
- 26B 규모의 높은 추론 및 시각 이해 능력
- Apache 2.0 라이선스를 통한 자유로운 상용화 가능성
훈련 방식
Gemma 4 아키텍처 기반의 멀티모달 사전 학습 모델
알아두면 좋은 것
- Apache 2.0 라이선스로 상업적 이용 가능
- 26B 파라미터 규모의 멀티모달 아키텍처 채택
- Transformers 라이브러리와의 완전한 호환성
- Hugging Face Inference Endpoints 지원으로 빠른 배포 가능
206
Likes
60.3k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.