본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

LiquidAI/LFM2.5-Embedding-350M

다국어(11개 언어) 문서·쿼리 임베딩을 이용한 의미 기반 검색 및 문서 랭킹(문장/문서 유사도 계산, RAG용 임베딩 생성)≈354M512K 컨텍스트LFM Open License v1.0

LiquidAI의 350M 파라미터 다국어 dense bi-encoder로, 1024차원 CLS 임베딩을 생성해 빠른 저용량 인덱스 기반 의미 검색과 RAG 대체를 지원한다.

학습 방식 · LFM2.5-350M-Base를 기반으로 bidirectional 패치가 적용된 백본을 사용해 dense bi-encoder 형태로 학습되었고, 훈련·추론에서 BF16 정밀도를 사용한다.

TL;DR

LFM2.5-Embedding-350M은 LiquidAI가 발표한 350M 파라미터급 다국어 dense bi-encoder로, 문서당 단일 1024차원 CLS 임베딩을 생성해 인덱스 크기와 검색 비용을 낮추는 것을 목표로 한다. 백본은 LFM2.5-350M-Base에서 파생되었고 bidirectional 패치와 BF16 정밀도를 사용해 다국어 표현을 강화했다. 모델은 비대칭 프롬프트(query:/document:)를 모델 config에 저장해 인코딩 시 자동 적용하며, FlashAttention-2를 선택적으로 활성화해 메모리와 처리량을 개선할 수 있다. 공개된 벤치마크에서 NanoBEIR NDCG@10=0.577, MKQA recall@20=0.691를 기록해 같은 계열의 ColBERT보다 약간 낮은 정확도를 보이나 인덱스·처리량 측면에서 유리하다. 결과적으로 이 모델은 RAG 파이프라인의 drop-in replacement로 활용되어 온디바이스와 엔터프라이즈 환경에서 낮은 지연과 작은 인덱스 크기를 제공한다. 트레이드오프는 정밀도를 더 필요로 하는 경우 토큰 단위 late-interaction(ColBERT)을 선택해야 인덱스·연산 비용이 증가한다는 점이다.

핵심 포인트

  • 350M 크기의 경량 모델이면서 다국어 벤치에서 상위권 성능을 기록해 동급보다 작은 모델로도 실무 성능을 달성한다
  • 모델 config에 비대칭 프롬프트를 내장해 인코딩 시 prompt_name 전달을 권장하는 등 파이프라인 관점에서 오류 가능성을 줄였다
  • FlashAttention-2 지원과 BF16 기본 사용으로 파인튜닝·장문 처리에서 메모리·처리량 측면의 실용적 이점을 제공한다
  • 동일 아키텍처 기반의 ColBERT 변형을 함께 제공해 정밀도·인덱스 크기 사이의 트레이드오프를 선택 가능하게 한다

벤치마크

벤치마크지표비교
NanoBEIR Multilingual ExtendedNDCG@10 (avg)0.577vs LFM2.5-ColBERT-350M: 0.605
MKQA-11Recall@20 (avg)0.691vs LFM2.5-ColBERT-350M: 0.694
llama.cpp (MacBook Pro M4 Max) Query embeddingp50 (ms)7.3
Enterprise GPU stack (single H100) Query embeddingp50 (ms)1.5

이미지 분석

세 개의 막대차트로 NanoBEIR ndcg@10, MKQA recall@20, MKQA recall@100을 모델별로 비교한 그래프이다. LFM2.5 계열(Embedding: 보라색, ColBERT: 회색/검정)이 대부분의 언어와 지표에서 상위권에 위치한다.
이미지의 막대 그래프는 LFM2.5-ColBERT가 전반적으로 가장 높은 성능을 보이고 LFM2.5-Embedding이 그 다음으로 근접한 성능을 보인다는 것을 시각적으로 확인시킨다. NanoBEIR와 MKQA 두 벤치에서 Embedding 모델은 Qwen3-Embedding-0.6B 등 0.6B급 밀집 임베더보다 우수한 평균 점수를 기록한다. MKQA recall@100 차트에서도 ColBERT가 소폭 우위를 보이나 Embedding은 index 크기·속도 측면에서 유리함을 시사한다.
단일 H100에서 동시성에 따른 Queries Per Second(QPS)를 보여주는 선형 그래프이다. LFM2.5 계열의 Query embedding 처리량이 동시성 증가에 따라 크게 상승하는 패턴을 보인다.
그래프는 LFM2.5-ColBERT의 Query embedding이 동시성 32에서 약 5200 QPS, LFM2.5-Embedding이 약 4700 QPS 수준을 기록해 높은 처리량을 달성함을 나타낸다. MaxSim(토큰 레벨 매칭)을 적용한 워크로드는 QPS가 크게 낮아져(약 800 QPS 전후) late-interaction의 계산 비용·지연이 더 큼을 보여준다. Query+Doc+MaxSim 조합은 문서 임베딩을 실시간 생성하는 경우 지연이 수십 밀리초대로 증가함을 시사한다.

124

LIKES

14.1k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.