본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

LiquidAI/LFM2.5-ColBERT-350M

멀티링구얼 문서 검색·유사도(토큰 단위 late-interaction 기반) 및 검색 결과 재정렬(reranking), 단문·단락 수준의 다국어 의미적 검색~353Mdocument: 512 tokens, query: 32 tokens 컨텍스트LFM Open License v1.0

토큰별 128차원 임베딩과 MaxSim late-interaction을 사용해 11개 언어에서 높은 검색 정확도와 실시간 추론 성능을 달성한 350M 규모의 멀티링구얼 검색 모델이다.

학습 방식 · LFM2.5-350M-Base에 bidirectional 패치를 적용하고 ColBERT(토큰 단위 late-interaction) 구조로 미세조정했으며 BF16 정밀도로 훈련되었다.

TL;DR

LFM2.5-ColBERT-350M은 LiquidAI가 발표한 350M 파라미터 규모의 late-interaction(ColBERT) 멀티링구얼 검색 모델로, LFM2.5-350M-Base에 bidirectional 패치를 적용해 토큰 단위 임베딩을 생성하고 MaxSim으로 매칭한다. 문서당 토큰 임베딩을 인덱싱해 쿼리별 토큰 매칭을 수행하므로 단일 CLS 임베딩 방식보다 부분일치와 교차언어 일반화에서 우위를 보인다. 성능 지표에서 NanoBEIR NDCG@10 평균 0.605, MKQA recall@20 평균 0.694로 동급 dense bi-encoder 및 기존 late retriever 대비 상위 성능을 기록했고, 토큰당 128차원 출력과 문서 길이 512/쿼리 길이 32 토큰 설정으로 설계가 최적화되었다. 인덱싱은 FastPLAID를 사용하고 llama.cpp용 GGUF 양자화 빌드가 제공되어 로컬 환경에서도 활용 가능하다. 실행 측면에서 MacBook M4 Max 환경의 쿼리 임베딩 p50=8.1ms, 엔터프라이즈 H100 스택에서는 쿼리 임베딩 p50=1.3ms를 보고했으며 MaxSim을 포함하면 처리량과 지연시간에 눈에 띄는 비용이 발생한다. 따라서 높은 검색 정확도가 필요한 애플리케이션에서 유리하지만 인덱스 크기 증가와 MaxSim 후처리 비용이라는 트레이드오프가 존재한다.README에 인덱스·양자화·지연시간 수치가 구체적으로 제공되어 배포·성능 계획 수립에 실용적이다. (요약 근거: README의 모델 세부표, NanoBEIR/MKQA 성능 표, 로컬 및 엔터프라이즈 지연시간 표 및 관련 그래프.)

핵심 포인트

  • 토큰 단위 128-dim 출력 + MaxSim late-interaction을 사용해 dense CLS 기반(1024-dim) 모델과 차별화된다
  • LFM2.5-350M-Base에 bidirectional 패치를 적용해 동일 파라미터 규모에서 교차언어 성능을 끌어올렸다
  • FastPLAID 인덱스와 GGUF 양자화 제공으로 로컬/엣지 및 엔터프라이즈 GPU 환경 모두에서 실용적 배포 옵션을 제공한다
  • NanoBEIR NDCG@10 평균 0.605, MKQA recall@20 평균 0.694로 동일 계열의 dense bi-encoder 및 동급 late retriever 대비 우수한 벤치마크 성능을 보였다 (README 표 근거)

벤치마크

벤치마크지표비교
NanoBEIR ndcg@10NDCG@10 (AVG)0.605vs LFM2.5-Embedding-350M: 0.577
MKQA recall@20Recall@20 (AVG)0.694vs LFM2.5-Embedding-350M: 0.691
MacBook M4 Max latency (llama.cpp)Query embedding p508.1 ms
Enterprise GPU latency (internal H100 stack)Query embedding p501.3 ms

이미지 분석

세 개의 막대그래프(왼: NanoBEIR ndcg@10, 중: MKQA recall@20, 오른: MKQA recall@100)로 LFM2.5-ColBERT-350M(연한 보라)이 다른 모델들보다 전반적으로 높은 성능을 기록한 수치를 보여준다.
그래프에 표시된 값은 README 표의 수치와 일치하며, LFM2.5-ColBERT-350M이 NanoBEIR NDCG@10에서 약 0.60, MKQA recall@20에서 약 0.69, recall@100에서 약 0.76 수준으로 경쟁 모델 대비 우수한 성능을 보였다. 시각적으로 late-interaction 모델(ColBERT)의 성능 우위가 강조되어 있다.
단일 H100에서 동시성(concurrency)에 따른 Queries per Second(QPS)를 라인플롯으로 나타낸 그래프. ColBERT 쿼리 임베딩(보라색 계열)은 동시성 증가에 따라 QPS가 크게 상승하는 반면, MaxSim을 포함한 워크로드는 처리량이 낮게 유지된다.
그래프 상에서 ColBERT의 쿼리 임베딩 처리량은 동시성 32에서 약 5천 QPS 수준으로 보이며, 쿼리+MaxSim 조합은 처리량이 수백~천 단위로 낮아진다. 이는 MaxSim 연산이 후처리 비용을 크게 증가시켜 전체 처리량을 제한한다는 실무적 트레이드오프를 시각적으로 보여준다. README의 엔터프라이즈 지연시간(쿼리 p50=1.3ms, 쿼리+MaxSim p50=2.5ms)과 일관된다.

88

LIKES

3.4k

DOWNLOADS

2 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.