450M 파라미터로 구현한 고성능 엣지 멀티모달 AI, LFM2.5-VL
이미지 및 텍스트 입력을 통한 텍스트 생성 (VQA, 이미지 캡셔닝 등)450Mother
LiquidAI의 LFM2.5-350M 언어 모델을 기반으로 이미지 이해 능력을 결합한 4억 5천만 파라미터 규모의 초경량 멀티모달 모델이다.
핵심 역량
- 이미지 내용 분석 및 설명
- 시각적 질의응답 (VQA)
- 한국어 포함 다국어 대화
- 멀티모달 컨텍스트 이해
강점
- 450M의 극소형 파라미터로 엣지 환경 최적화
- 한국어를 포함한 광범위한 다국어 멀티모달 성능 제공
훈련 방식
LiquidAI/LFM2.5-350M 기반의 멀티모달 파인튜닝 및 이미지-텍스트 정렬 학습
알아두면 좋은 것
- 한국어, 영어, 일본어, 중국어 등 총 10개 언어 지원
- LiquidAI의 LFM2.5-350M 베이스 모델을 활용한 파인튜닝 모델
- 엣지 디바이스 배포를 목표로 하는 450M 규모의 경량 설계
- arXiv:2511.23404 연구 논문 기반의 기술 구현
152
Likes
18.3k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.