LiquidAI/LFM2.5-ColBERT-350M
토큰별 128차원 임베딩과 MaxSim late-interaction을 사용해 11개 언어에서 높은 검색 정확도와 실시간 추론 성능을 달성한 350M 규모의 멀티링구얼 검색 모델이다.
학습 방식 · LFM2.5-350M-Base에 bidirectional 패치를 적용하고 ColBERT(토큰 단위 late-interaction) 구조로 미세조정했으며 BF16 정밀도로 훈련되었다.
TL;DR
LFM2.5-ColBERT-350M은 LiquidAI가 발표한 350M 파라미터 규모의 late-interaction(ColBERT) 멀티링구얼 검색 모델로, LFM2.5-350M-Base에 bidirectional 패치를 적용해 토큰 단위 임베딩을 생성하고 MaxSim으로 매칭한다. 문서당 토큰 임베딩을 인덱싱해 쿼리별 토큰 매칭을 수행하므로 단일 CLS 임베딩 방식보다 부분일치와 교차언어 일반화에서 우위를 보인다. 성능 지표에서 NanoBEIR NDCG@10 평균 0.605, MKQA recall@20 평균 0.694로 동급 dense bi-encoder 및 기존 late retriever 대비 상위 성능을 기록했고, 토큰당 128차원 출력과 문서 길이 512/쿼리 길이 32 토큰 설정으로 설계가 최적화되었다. 인덱싱은 FastPLAID를 사용하고 llama.cpp용 GGUF 양자화 빌드가 제공되어 로컬 환경에서도 활용 가능하다. 실행 측면에서 MacBook M4 Max 환경의 쿼리 임베딩 p50=8.1ms, 엔터프라이즈 H100 스택에서는 쿼리 임베딩 p50=1.3ms를 보고했으며 MaxSim을 포함하면 처리량과 지연시간에 눈에 띄는 비용이 발생한다. 따라서 높은 검색 정확도가 필요한 애플리케이션에서 유리하지만 인덱스 크기 증가와 MaxSim 후처리 비용이라는 트레이드오프가 존재한다.README에 인덱스·양자화·지연시간 수치가 구체적으로 제공되어 배포·성능 계획 수립에 실용적이다. (요약 근거: README의 모델 세부표, NanoBEIR/MKQA 성능 표, 로컬 및 엔터프라이즈 지연시간 표 및 관련 그래프.)
핵심 포인트
- 토큰 단위 128-dim 출력 + MaxSim late-interaction을 사용해 dense CLS 기반(1024-dim) 모델과 차별화된다
- LFM2.5-350M-Base에 bidirectional 패치를 적용해 동일 파라미터 규모에서 교차언어 성능을 끌어올렸다
- FastPLAID 인덱스와 GGUF 양자화 제공으로 로컬/엣지 및 엔터프라이즈 GPU 환경 모두에서 실용적 배포 옵션을 제공한다
- NanoBEIR NDCG@10 평균 0.605, MKQA recall@20 평균 0.694로 동일 계열의 dense bi-encoder 및 동급 late retriever 대비 우수한 벤치마크 성능을 보였다 (README 표 근거)
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| NanoBEIR ndcg@10 | NDCG@10 (AVG) | 0.605 | vs LFM2.5-Embedding-350M: 0.577 |
| MKQA recall@20 | Recall@20 (AVG) | 0.694 | vs LFM2.5-Embedding-350M: 0.691 |
| MacBook M4 Max latency (llama.cpp) | Query embedding p50 | 8.1 ms | — |
| Enterprise GPU latency (internal H100 stack) | Query embedding p50 | 1.3 ms | — |
이미지 분석


88
LIKES
3.4k
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.