TL;DR
LiquidAI가 3.1B 규모의 Vision-Language Model인 LFM2.5-VL-3B를 공개했으며 llama.cpp, MLX, vLLM, WebGPU demo에서 완전한 로컬 실행을 지원합니다. 게시물에 따르면 Gemma-4 E4B의 59.7점보다 높은 69.4점을 기록했고, ScreenSpot-v2 Web 화면 이해 점수는 2.5에서 82.2로 상승했습니다. M5 Max에서는 228 tok/s, Galaxy S26 Ultra에서는 20 tok/s를 기록했으며 function calling과 object grounding도 지원합니다. 복잡한 reasoning에서는 대형 cloud model이 앞서지만, 문서와 화면 처리처럼 단순한 작업에서는 데이터 외부 전송과 반복 API 비용을 줄이는 로컬 배포 선택지가 됐다는 평가입니다.
섹션별 상세
이미지 분석

차트는 LFM2.5-VL-3B가 General 70.1점, Multilingual 81.2점, STEM 46.2점, Document·OCR·Chart 76.4점, Grounding 87.9점, Multi-Image 59.9점, Hallucination 68.0점, GUI 80.7점을 기록한 것으로 표시합니다. 비교 대상에는 Gemma-4 E2B-it, Gemma-4 E4B-it, InternVL 3.5 2B·4B, Qwen3.5-2B·4B가 포함돼 있어 3.1B 모델의 분야별 성능 위치를 확인할 수 있습니다.
LFM2.5-VL-3B와 Gemma, InternVL, Qwen 계열 모델의 General, Multilingual, Function calling, STEM, Document·OCR·Chart, Grounding, Multi-Image, Hallucination, GUI 평가 점수를 비교한 막대그래프입니다.
용어 해설
- 비전·언어 모델(Vision-Language Model)
- — 이미지와 텍스트를 함께 입력받아 화면, 문서, 사물 같은 시각 정보를 이해하고 언어로 응답하는 모델입니다. LFM2.5-VL-3B는 3.1B 규모로 이 기능을 로컬 환경에서 실행하도록 설계됐습니다.
- 화면 이해(Screen Understanding)
- — 스크린샷이나 앱 화면에서 버튼, 문서, 인터페이스 요소의 위치와 의미를 파악하는 기능입니다. ScreenSpot-v2 Web 점수는 모델이 실제 화면 조작에 필요한 시각 정보를 얼마나 잘 읽는지 평가합니다.
- 함수 호출(Function Calling)
- — 모델이 자연어 응답 대신 미리 정의된 함수나 도구를 호출할 구조화된 인자를 출력하는 방식입니다. 이 글에서는 LFM2.5-VL-3B의 지원 기능 중 하나로 언급됐습니다.
- 객체 위치 지정(Object Grounding)
- — 이미지 속 특정 객체를 식별한 뒤 그 위치를 좌표나 영역으로 연결하는 기능입니다. 화면이나 문서에서 사용자가 지정한 요소를 찾아야 하는 자동화 작업에 활용되며, 이 모델에 포함된 기능으로 제시됐습니다.
- ScreenSpot-v2 벤치마크(ScreenSpot-v2)
- — 화면 속 인터페이스 요소를 이해하고 찾아내는 시각 모델 평가 기준입니다. 원문은 ScreenSpot-v2 Web에서 점수가 2.5에서 82.2로 상승했다고 밝혔고, 첨부 차트에는 GUI 관련 점수가 별도로 표시돼 있습니다.
언급된 도구
LFM2.5-VL-3B를 로컬에서 실행하는 inference runtime으로 언급됐습니다.
LFM2.5-VL-3B의 로컬 실행을 지원하는 framework로 언급됐습니다.
LFM2.5-VL-3B를 로컬 또는 자체 인프라에서 serving하는 runtime으로 언급됐습니다.
브라우저에서 모델을 실행할 수 있는 demo 방식으로 언급됐습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.