본문으로 건너뛰기

LiquidAI LFM2.5-VL-3B, 로컬 VLM 성능 도약

LFM2.5-VL-3B가 로컬 실행과 화면 이해 성능을 앞세워 소형 VLM의 활용 범위를 넓혔습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

LiquidAI가 3.1B 규모의 Vision-Language Model인 LFM2.5-VL-3B를 공개했으며 llama.cpp, MLX, vLLM, WebGPU demo에서 완전한 로컬 실행을 지원합니다. 게시물에 따르면 Gemma-4 E4B의 59.7점보다 높은 69.4점을 기록했고, ScreenSpot-v2 Web 화면 이해 점수는 2.5에서 82.2로 상승했습니다. M5 Max에서는 228 tok/s, Galaxy S26 Ultra에서는 20 tok/s를 기록했으며 function calling과 object grounding도 지원합니다. 복잡한 reasoning에서는 대형 cloud model이 앞서지만, 문서와 화면 처리처럼 단순한 작업에서는 데이터 외부 전송과 반복 API 비용을 줄이는 로컬 배포 선택지가 됐다는 평가입니다.

섹션별 상세

LiquidAI가 3.1B 규모의 LFM2.5-VL-3B를 공개했으며, llama.cpp, MLX, vLLM, WebGPU demo를 통해 완전한 로컬 실행이 가능하다는 점이 핵심입니다. 로컬 환경에서 이미지와 텍스트를 처리하므로 데이터가 외부로 나가지 않는 구조를 선택할 수 있습니다. 게시물은 이를 단순한 모델 공개보다 문서와 화면 처리용 AI 기능의 배포 방식이 달라지는 사례로 평가합니다.
작은 모델임에도 평가 결과에서 Gemma-4 E4B의 59.7점보다 높은 69.4점을 기록했고 Qwen3.5-4B보다도 앞섰다고 게시물은 밝혔습니다. 특히 ScreenSpot-v2 Web 화면 이해 점수는 2.5에서 82.2로 상승했으며, 첨부 차트에는 GUI 항목에서 LFM2.5-VL-3B가 80.7점으로 표시됩니다. 이 결과는 일반 추론 전반에서 대형 클라우드 모델을 대체한다는 뜻이 아니라, 화면과 문서처럼 범위가 좁은 작업에서 소형 로컬 모델의 실용성이 높아졌다는 의미입니다.
실행 성능도 기기별로 구체적인 수치가 제시됐으며 M5 Max에서 228 tok/s, Galaxy S26 Ultra에서 20 tok/s를 기록했습니다. 모델은 function calling과 object grounding도 지원해 화면 요소를 읽은 뒤 도구 호출이나 특정 객체의 위치 지정으로 연결할 수 있습니다. 게시물은 복잡한 reasoning에서는 대형 cloud model이 여전히 우세하지만, 단순한 document와 screen task에서는 매월 API 비용을 지불하는 방식 대신 일회성 engineering 작업으로 전환할 여지가 생겼다고 평가합니다.

이미지 분석

LFM2.5-VL-3B와 Gemma, InternVL, Qwen 계열 모델의 General, Multilingual, Function calling, STEM, Document·OCR·Chart, Grounding, Multi-Image, Hallucination, GUI 평가 점수를 비교한 막대그래프입니다.
Chart

차트는 LFM2.5-VL-3B가 General 70.1점, Multilingual 81.2점, STEM 46.2점, Document·OCR·Chart 76.4점, Grounding 87.9점, Multi-Image 59.9점, Hallucination 68.0점, GUI 80.7점을 기록한 것으로 표시합니다. 비교 대상에는 Gemma-4 E2B-it, Gemma-4 E4B-it, InternVL 3.5 2B·4B, Qwen3.5-2B·4B가 포함돼 있어 3.1B 모델의 분야별 성능 위치를 확인할 수 있습니다.

LFM2.5-VL-3B와 Gemma, InternVL, Qwen 계열 모델의 General, Multilingual, Function calling, STEM, Document·OCR·Chart, Grounding, Multi-Image, Hallucination, GUI 평가 점수를 비교한 막대그래프입니다.

용어 해설

비전·언어 모델(Vision-Language Model)
이미지와 텍스트를 함께 입력받아 화면, 문서, 사물 같은 시각 정보를 이해하고 언어로 응답하는 모델입니다. LFM2.5-VL-3B는 3.1B 규모로 이 기능을 로컬 환경에서 실행하도록 설계됐습니다.
화면 이해(Screen Understanding)
스크린샷이나 앱 화면에서 버튼, 문서, 인터페이스 요소의 위치와 의미를 파악하는 기능입니다. ScreenSpot-v2 Web 점수는 모델이 실제 화면 조작에 필요한 시각 정보를 얼마나 잘 읽는지 평가합니다.
함수 호출(Function Calling)
모델이 자연어 응답 대신 미리 정의된 함수나 도구를 호출할 구조화된 인자를 출력하는 방식입니다. 이 글에서는 LFM2.5-VL-3B의 지원 기능 중 하나로 언급됐습니다.
객체 위치 지정(Object Grounding)
이미지 속 특정 객체를 식별한 뒤 그 위치를 좌표나 영역으로 연결하는 기능입니다. 화면이나 문서에서 사용자가 지정한 요소를 찾아야 하는 자동화 작업에 활용되며, 이 모델에 포함된 기능으로 제시됐습니다.
ScreenSpot-v2 벤치마크(ScreenSpot-v2)
화면 속 인터페이스 요소를 이해하고 찾아내는 시각 모델 평가 기준입니다. 원문은 ScreenSpot-v2 Web에서 점수가 2.5에서 82.2로 상승했다고 밝혔고, 첨부 차트에는 GUI 관련 점수가 별도로 표시돼 있습니다.

언급된 도구

llama.cpp중립

LFM2.5-VL-3B를 로컬에서 실행하는 inference runtime으로 언급됐습니다.

MLX중립

LFM2.5-VL-3B의 로컬 실행을 지원하는 framework로 언급됐습니다.

vLLM중립

LFM2.5-VL-3B를 로컬 또는 자체 인프라에서 serving하는 runtime으로 언급됐습니다.

WebGPU중립

브라우저에서 모델을 실행할 수 있는 demo 방식으로 언급됐습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 15.수집 2026. 08. 15.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.