LiquidAI/LFM2.5-Embedding-350M
LiquidAI의 350M 파라미터 다국어 dense bi-encoder로, 1024차원 CLS 임베딩을 생성해 빠른 저용량 인덱스 기반 의미 검색과 RAG 대체를 지원한다.
학습 방식 · LFM2.5-350M-Base를 기반으로 bidirectional 패치가 적용된 백본을 사용해 dense bi-encoder 형태로 학습되었고, 훈련·추론에서 BF16 정밀도를 사용한다.
TL;DR
LFM2.5-Embedding-350M은 LiquidAI가 발표한 350M 파라미터급 다국어 dense bi-encoder로, 문서당 단일 1024차원 CLS 임베딩을 생성해 인덱스 크기와 검색 비용을 낮추는 것을 목표로 한다. 백본은 LFM2.5-350M-Base에서 파생되었고 bidirectional 패치와 BF16 정밀도를 사용해 다국어 표현을 강화했다. 모델은 비대칭 프롬프트(query:/document:)를 모델 config에 저장해 인코딩 시 자동 적용하며, FlashAttention-2를 선택적으로 활성화해 메모리와 처리량을 개선할 수 있다. 공개된 벤치마크에서 NanoBEIR NDCG@10=0.577, MKQA recall@20=0.691를 기록해 같은 계열의 ColBERT보다 약간 낮은 정확도를 보이나 인덱스·처리량 측면에서 유리하다. 결과적으로 이 모델은 RAG 파이프라인의 drop-in replacement로 활용되어 온디바이스와 엔터프라이즈 환경에서 낮은 지연과 작은 인덱스 크기를 제공한다. 트레이드오프는 정밀도를 더 필요로 하는 경우 토큰 단위 late-interaction(ColBERT)을 선택해야 인덱스·연산 비용이 증가한다는 점이다.
핵심 포인트
- 350M 크기의 경량 모델이면서 다국어 벤치에서 상위권 성능을 기록해 동급보다 작은 모델로도 실무 성능을 달성한다
- 모델 config에 비대칭 프롬프트를 내장해 인코딩 시 prompt_name 전달을 권장하는 등 파이프라인 관점에서 오류 가능성을 줄였다
- FlashAttention-2 지원과 BF16 기본 사용으로 파인튜닝·장문 처리에서 메모리·처리량 측면의 실용적 이점을 제공한다
- 동일 아키텍처 기반의 ColBERT 변형을 함께 제공해 정밀도·인덱스 크기 사이의 트레이드오프를 선택 가능하게 한다
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| NanoBEIR Multilingual Extended | NDCG@10 (avg) | 0.577 | vs LFM2.5-ColBERT-350M: 0.605 |
| MKQA-11 | Recall@20 (avg) | 0.691 | vs LFM2.5-ColBERT-350M: 0.694 |
| llama.cpp (MacBook Pro M4 Max) Query embedding | p50 (ms) | 7.3 | — |
| Enterprise GPU stack (single H100) Query embedding | p50 (ms) | 1.5 | — |
이미지 분석


124
LIKES
14.1k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.