350M으로 경량·고속 다국어 의미 검색
LiquidAI의 350M 파라미터 다국어 dense bi-encoder로, 1024차원 CLS 임베딩을 생성해 빠른 저용량 인덱스 기반 의미 검색과 RAG 대체를 지원한다.
TL;DR
LFM2.5-Embedding-350M은 LiquidAI가 발표한 350M 파라미터급 다국어 dense bi-encoder로, 문서당 단일 1024차원 CLS 임베딩을 생성해 인덱스 크기와 검색 비용을 낮추는 것을 목표로 한다. 백본은 LFM2.5-350M-Base에서 파생되었고 bidirectional 패치와 BF16 정밀도를 사용해 다국어 표현을 강화했다. 모델은 비대칭 프롬프트(query:/document:)를 모델 config에 저장해 인코딩 시 자동 적용하며, FlashAttention-2를 선택적으로 활성화해 메모리와 처리량을 개선할 수 있다. 공개된 벤치마크에서 NanoBEIR NDCG@10=0.577, MKQA recall@20=0.691를 기록해 같은 계열의 ColBERT보다 약간 낮은 정확도를 보이나 인덱스·처리량 측면에서 유리하다. 결과적으로 이 모델은 RAG 파이프라인의 drop-in replacement로 활용되어 온디바이스와 엔터프라이즈 환경에서 낮은 지연과 작은 인덱스 크기를 제공한다. 트레이드오프는 정밀도를 더 필요로 하는 경우 토큰 단위 late-interaction(ColBERT)을 선택해야 인덱스·연산 비용이 증가한다는 점이다.
핵심 역량
- 쿼리와 문서를 각각 인코딩해 코사인 유사도로 문서를 빠르게 랭킹한다
- 영어·스페인어·독일어·프랑스어·이탈리아어·포르투갈어·아랍어·스웨덴어·노르웨이어·일본어·한국어 등 11개 언어를 지원한다
- 한 문서당 단일 1024차원 CLS 벡터를 생성해 인덱스 크기를 작게 유지한다
- sentence-transformers 툴체인과 호환되어 파인튜닝 및 MultipleNegativesRankingLoss 기반 학습이 가능하다
- FlashAttention-2 활성화로 메모리 사용 최적화와 처리량 향상이 가능하다
강점
- 동일 계열의 ColBERT 대비 인덱스 크기와 검색 비용이 작아 실사용성·확장성이 높다(Embedding avg NanoBEIR NDCG@10=0.577, ColBERT=0.605).
- 350M급 모델치고 다국어 검색 성능이 우수해 MKQA recall@20=0.691로 경쟁 모델과 대등한 수준을 보였다.
- 온디바이스·엔터프라이즈 환경에서 낮은 지연을 보장해 RAG용 drop-in replacement로 활용 가능(엔터프라이즈 p50=1.5ms, MacBook p50=7.3ms).
훈련 방식
LFM2.5-350M-Base를 기반으로 bidirectional 패치가 적용된 백본을 사용해 dense bi-encoder 형태로 학습되었고, 훈련·추론에서 BF16 정밀도를 사용한다.
알아두면 좋은 것
- 모델 계열로 dense bi-encoder(한 문서당 1벡터)와 토큰단위 late-interaction(ColBERT) 두 가지를 제공하며, 후자는 정확도는 높지만 인덱스가 대용량이다
- 쿼리에는 "query: ", 문서에는 "document: "라는 비대칭 프롬프트가 모델 config에 저장되어 자동 적용되므로 인코딩 시 반드시 prompt_name을 전달해야 성능이 유지된다
- llama.cpp용 GGUF 양자화 아티팩트 제공으로 on-device(fp16)에서 낮은 지연으로 실행 가능하며, MacBook M4 Max에서 Query embedding p50 7.3ms를 기록했다
- 엔터프라이즈 GPU(단일 H100) 스택에서 Query embedding p50 1.5ms, ColBERT Query embedding은 1.3ms 수준으로 낮은 지연을 달성했다
기술적 특징
- 혼합 구조(10 conv + 6 attention + 1 pool)로 총 17개 레이어를 사용해 로컬 패턴 추출(conv)과 전역 문맥(attention)을 결합했다. 이 구조는 단일 CLS 임베딩(1024-dim)을 생성해 문서 단위 인덱싱 시 효율적인 저장 및 검색을 가능하게 한다.
- bidirectional 패치가 백본에 적용되어 양방향 컨텍스트 처리를 수행하며 LFM2.5-350M-Base에서 파생된 모델로서 기존 LFM 패밀리와 호환되는 표현을 유지한다. 이 접근은 다국어 문장 표현에서 일관된 임베딩을 얻는 데 기여한다.
- 비대칭 프롬프트(query:/document:)를 모델 config에 저장해 인코딩 파이프라인에서 자동 적용하도록 구성했다. 이 방식은 쿼리·문서의 역할 차이를 학습 시 명시적으로 반영해 검색 품질을 안정적으로 유지한다.
- FlashAttention-2를 선택적으로 활성화할 수 있어 긴 컨텍스트나 파인튜닝 시 메모리 사용을 줄이고 처리량을 개선한다. README의 검증에서 512토큰 기준 약 5%의 속도 향상과 BF16 동등성(정밀도 내 차이)을 보고했다.
- ColBERT late-interaction 변형은 토큰 단위(128-dim/token) 출력을 제공하고 MaxSim 매칭을 사용해 정밀도를 높였다. 단일 벡터 방식과 비교해 검색 정확도는 개선되나 인덱스와 검색 비용이 크게 증가한다.
차별점
- 350M 크기의 경량 모델이면서 다국어 벤치에서 상위권 성능을 기록해 동급보다 작은 모델로도 실무 성능을 달성한다
- 모델 config에 비대칭 프롬프트를 내장해 인코딩 시 prompt_name 전달을 권장하는 등 파이프라인 관점에서 오류 가능성을 줄였다
- FlashAttention-2 지원과 BF16 기본 사용으로 파인튜닝·장문 처리에서 메모리·처리량 측면의 실용적 이점을 제공한다
- 동일 아키텍처 기반의 ColBERT 변형을 함께 제공해 정밀도·인덱스 크기 사이의 트레이드오프를 선택 가능하게 한다
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| NanoBEIR Multilingual Extended | NDCG@10 (avg) | 0.577 | vs LFM2.5-ColBERT-350M: 0.605 |
| MKQA-11 | Recall@20 (avg) | 0.691 | vs LFM2.5-ColBERT-350M: 0.694 |
| llama.cpp (MacBook Pro M4 Max) Query embedding | p50 (ms) | 7.3 | — |
| Enterprise GPU stack (single H100) Query embedding | p50 (ms) | 1.5 | — |
이미지 분석


124
Likes
14.1k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.