본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

LiquidAI/LFM2.5-VL-3B

이미지와 텍스트를 함께 처리하는 멀티모달 생성, OCR, 객체 탐지, grounding 및 tool use3.1B 전체 규모, LFM2.5-2.6B 언어 모델과 SigLIP2 NaFlex 400M vision encoder 구성32K 컨텍스트lfm1.0

3.1B 멀티모달 모델로 grounding·OCR·tool use와 on-device 고속 추론을 함께 지원합니다.

학습 방식 · LFM2-VL-3B를 기반으로 mid-training과 post-training을 추가하고, LFM2.5-2.6B 및 SigLIP2 NaFlex vision encoder 조합으로 grounding·OCR·tool use를 보강했습니다.

TL;DR

LFM2.5-VL-3B는 LFM2-VL-3B에 mid-training과 post-training을 추가한 멀티모달 변형으로, LFM2.5-2.6B 언어 모델과 SigLIP2 NaFlex 400M vision encoder를 결합한 원본 3.1B checkpoint입니다. SigLIP2 NaFlex가 큰 이미지를 512×512 패치와 전체 이미지 thumbnail로 나눠 처리해 자연어 기반 grounding, 객체 탐지, layout annotation을 포함한 OCR을 수행합니다. RefCOCO 87.9, ScreenSpot-v2 80.7, ChartQA 81.3을 기록했으며, tool use와 multi-image 입력도 지원하지만 긴 문맥과 복잡한 시각 reasoning에는 권장되지 않습니다. 원본 모델은 Apple M5 Max에서 228 tok/s, AMD Ryzen AI Max+ 395에서 116 tok/s, 약 3GB 메모리로 동작하고 단일 H100의 높은 동시성에서 약 11K tokens/second를 기록해 문서 처리·화면 이해·edge 배포에 적합합니다.

핵심 포인트

  • LFM2.5-2.6B 언어 모델과 SigLIP2 NaFlex 400M vision encoder를 결합한 3.1B 멀티모달 모델입니다.
  • 큰 이미지를 512×512 패치와 전체 이미지 thumbnail로 나눠 처리해 문서 OCR과 고해상도 시각 입력을 지원합니다.
  • RefCOCO 87.9와 ScreenSpot-v2 80.7로 객체 위치 지정과 화면 이해 성능을 확보했습니다.
  • Apple M5 Max에서 228 tok/s, 약 3GB 메모리로 동작해 edge와 on-device 배포에 초점을 맞췄습니다.

제한사항

  • README는 긴 문맥과 reasoning-intensive 작업을 권장하지 않습니다. 시각적 웹 디자인이나 기술적인 blueprint 질의보다 단일 턴 응답에 맞춰졌습니다. 직접 reasoning을 수행하는 대신 빠르게 답하는 설계라 복잡한 다단계 추론 용도에는 제약이 있습니다.
  • OCRBenchv2 수치는 영어 전용 subset 기준입니다. 문서 OCR은 layout annotation 형식을 따르지만 모든 언어와 문서 유형에서 동일한 결과를 보장한다는 근거는 README에 없습니다. 실제 배포에서는 입력 해상도와 기기별 메모리 조건을 별도로 확인해야 합니다.

벤치마크

벤치마크지표비교
ScreenSpot-v2avg80.7InternVL 3.5 4B 84.2, Qwen3.5-4B 78.5, Gemma4 E4B 50.9 대비 공개 비교 수치
RefCOCOMacro Prec@187.9InternVL 3.5 4B 88.9, Qwen3.5-4B 86.6 대비 공개 비교 수치
BLINKscore61.5Qwen3.5-4B 65.0, InternVL 3.5 4B 57.4 대비 공개 비교 수치
MuirBenchscore58.3Qwen3.5-4B 67.0, InternVL 3.5 4B 53.4 대비 공개 비교 수치
ToolSandBoxscore59.5Qwen3.5-4B 65.0, Gemma4 E4B 61.6 대비 공개 비교 수치
BFCLv4score32.5Qwen3.5-4B 53.6, Gemma4 E4B 40.0 대비 공개 비교 수치
ChartQAaccuracy81.3InternVL 3.5 4B 86.5, Qwen3.5-4B 84.2 대비 공개 비교 수치
OCRBenchv2score47.5영어 전용 subset 기준이며 InternVL 3.5 4B 49.2, Qwen3.5-4B 58.8 대비 공개 비교 수치
POPEscore88.7InternVL 3.5 4B 88.9, Gemma4 E2B 84.0 대비 공개 비교 수치
On-device Decodetok/s228Apple M5 Max에서 측정한 원본 모델의 공개 수치이며 양자화 버전 측정치가 아님
On-device Decodetok/s116AMD Ryzen AI Max+ 395에서 측정한 원본 모델의 공개 수치이며 양자화 버전 측정치가 아님
GPU Output Throughputtokens/second약 11K단일 NVIDIA H100, vLLM, 높은 동시성 조건에서 측정한 원본 모델의 공개 수치이며 양자화 버전 측정치가 아님
Time to First Tokenmilliseconds약 34 ms단일 NVIDIA H100에서 256² 이미지 5프레임 입력으로 측정한 원본 모델의 공개 수치이며 양자화 버전 측정치가 아님

이미지 분석

LFM2.5-VL-3B와 LFM2-VL-3B 및 Gemma4, InternVL 3.5, Qwen3.5 계열을 General, Multilingual, Function calling, STEM, Document·OCR·Chart, Grounding, Multi-Image, Hallucination, GUI 영역에서 비교한 막대그래프입니다.
LFM2.5-VL-3B는 Grounding 87.9, GUI 80.7, General 70.1, Multilingual 81.2를 기록하며 특히 위치 지정과 화면 이해 영역에서 강점을 보입니다. Function calling은 46.0, Document·OCR·Chart는 76.4, Multi-Image는 59.9로 나타나 단일 모델 안에서도 작업별 편차가 있으며, 비교 모델 가운데 각 항목의 최고점은 별도로 존재합니다.
AMD Ryzen AI Max+ 395, Apple M5 Max, Qualcomm Snapdragon 기반 기기에서 LFM2.5-VL-3B와 비교 모델의 Time to First Token, Decode 속도, 메모리를 비교한 막대그래프입니다.
AMD Ryzen AI Max+ 395에서는 LFM2.5-VL-3B가 첫 토큰까지 1,409ms, Decode 116 tok/s, 메모리 3,045MB를 기록했고, Apple M5 Max에서는 각각 248ms, 228 tok/s, 3,257MB를 기록했습니다. Galaxy SM-S948U1로 표기된 Qualcomm Snapdragon 환경에서는 13,092ms, 20 tok/s, 3,056MB로 측정되어 기기별 지연과 생성 속도 차이가 크게 나타납니다.
단일 H100에서 vLLM 0.26과 BF16 조건으로 동시성에 따른 여러 vision-language 모델의 초당 출력 토큰 처리량을 나타낸 선그래프입니다.
LFM2.5-VL-3B의 처리량은 동시성 1에서 약 300 tokens/second로 시작해 동시성 512 부근에서 약 10.2K, 1,024 부근에서 약 11K까지 증가합니다. 동시성이 높아질수록 Qwen3.5-2B와 InternVL3.5-2B보다 높은 곡선을 유지하며, 2,048에서는 약 10.8K로 소폭 낮아져 대규모 배치 서비스에 적합한 처리 특성을 나타냅니다.
단일 H100에서 이미지 입력 유형별 single-stream Time to First Token을 비교한 막대그래프이며, 값이 낮을수록 빠릅니다.
LFM2.5-VL-3B는 512² 이미지와 텍스트 1,024토큰 조건에서 39ms, 512² 이미지 단독 조건에서 32ms를 기록했습니다. 256² 이미지 5프레임 조건에서는 34ms로 나타나며, 같은 조건의 Gemma4 E2B 198ms와 Gemma4 E4B 202ms보다 짧은 초기 응답 지연을 보입니다.

81

Likes

0

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.