LiquidAI/LFM2.5-VL-3B
3.1B 멀티모달 모델로 grounding·OCR·tool use와 on-device 고속 추론을 함께 지원합니다.
학습 방식 · LFM2-VL-3B를 기반으로 mid-training과 post-training을 추가하고, LFM2.5-2.6B 및 SigLIP2 NaFlex vision encoder 조합으로 grounding·OCR·tool use를 보강했습니다.
TL;DR
LFM2.5-VL-3B는 LFM2-VL-3B에 mid-training과 post-training을 추가한 멀티모달 변형으로, LFM2.5-2.6B 언어 모델과 SigLIP2 NaFlex 400M vision encoder를 결합한 원본 3.1B checkpoint입니다. SigLIP2 NaFlex가 큰 이미지를 512×512 패치와 전체 이미지 thumbnail로 나눠 처리해 자연어 기반 grounding, 객체 탐지, layout annotation을 포함한 OCR을 수행합니다. RefCOCO 87.9, ScreenSpot-v2 80.7, ChartQA 81.3을 기록했으며, tool use와 multi-image 입력도 지원하지만 긴 문맥과 복잡한 시각 reasoning에는 권장되지 않습니다. 원본 모델은 Apple M5 Max에서 228 tok/s, AMD Ryzen AI Max+ 395에서 116 tok/s, 약 3GB 메모리로 동작하고 단일 H100의 높은 동시성에서 약 11K tokens/second를 기록해 문서 처리·화면 이해·edge 배포에 적합합니다.
핵심 포인트
- LFM2.5-2.6B 언어 모델과 SigLIP2 NaFlex 400M vision encoder를 결합한 3.1B 멀티모달 모델입니다.
- 큰 이미지를 512×512 패치와 전체 이미지 thumbnail로 나눠 처리해 문서 OCR과 고해상도 시각 입력을 지원합니다.
- RefCOCO 87.9와 ScreenSpot-v2 80.7로 객체 위치 지정과 화면 이해 성능을 확보했습니다.
- Apple M5 Max에서 228 tok/s, 약 3GB 메모리로 동작해 edge와 on-device 배포에 초점을 맞췄습니다.
제한사항
- README는 긴 문맥과 reasoning-intensive 작업을 권장하지 않습니다. 시각적 웹 디자인이나 기술적인 blueprint 질의보다 단일 턴 응답에 맞춰졌습니다. 직접 reasoning을 수행하는 대신 빠르게 답하는 설계라 복잡한 다단계 추론 용도에는 제약이 있습니다.
- OCRBenchv2 수치는 영어 전용 subset 기준입니다. 문서 OCR은 layout annotation 형식을 따르지만 모든 언어와 문서 유형에서 동일한 결과를 보장한다는 근거는 README에 없습니다. 실제 배포에서는 입력 해상도와 기기별 메모리 조건을 별도로 확인해야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| ScreenSpot-v2 | avg | 80.7 | InternVL 3.5 4B 84.2, Qwen3.5-4B 78.5, Gemma4 E4B 50.9 대비 공개 비교 수치 |
| RefCOCO | Macro Prec@1 | 87.9 | InternVL 3.5 4B 88.9, Qwen3.5-4B 86.6 대비 공개 비교 수치 |
| BLINK | score | 61.5 | Qwen3.5-4B 65.0, InternVL 3.5 4B 57.4 대비 공개 비교 수치 |
| MuirBench | score | 58.3 | Qwen3.5-4B 67.0, InternVL 3.5 4B 53.4 대비 공개 비교 수치 |
| ToolSandBox | score | 59.5 | Qwen3.5-4B 65.0, Gemma4 E4B 61.6 대비 공개 비교 수치 |
| BFCLv4 | score | 32.5 | Qwen3.5-4B 53.6, Gemma4 E4B 40.0 대비 공개 비교 수치 |
| ChartQA | accuracy | 81.3 | InternVL 3.5 4B 86.5, Qwen3.5-4B 84.2 대비 공개 비교 수치 |
| OCRBenchv2 | score | 47.5 | 영어 전용 subset 기준이며 InternVL 3.5 4B 49.2, Qwen3.5-4B 58.8 대비 공개 비교 수치 |
| POPE | score | 88.7 | InternVL 3.5 4B 88.9, Gemma4 E2B 84.0 대비 공개 비교 수치 |
| On-device Decode | tok/s | 228 | Apple M5 Max에서 측정한 원본 모델의 공개 수치이며 양자화 버전 측정치가 아님 |
| On-device Decode | tok/s | 116 | AMD Ryzen AI Max+ 395에서 측정한 원본 모델의 공개 수치이며 양자화 버전 측정치가 아님 |
| GPU Output Throughput | tokens/second | 약 11K | 단일 NVIDIA H100, vLLM, 높은 동시성 조건에서 측정한 원본 모델의 공개 수치이며 양자화 버전 측정치가 아님 |
| Time to First Token | milliseconds | 약 34 ms | 단일 NVIDIA H100에서 256² 이미지 5프레임 입력으로 측정한 원본 모델의 공개 수치이며 양자화 버전 측정치가 아님 |
이미지 분석




81
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.