350M 파라미터로 다국어 검색 정확도 상위 달성
토큰별 128차원 임베딩과 MaxSim late-interaction을 사용해 11개 언어에서 높은 검색 정확도와 실시간 추론 성능을 달성한 350M 규모의 멀티링구얼 검색 모델이다.
TL;DR
LFM2.5-ColBERT-350M은 LiquidAI가 발표한 350M 파라미터 규모의 late-interaction(ColBERT) 멀티링구얼 검색 모델로, LFM2.5-350M-Base에 bidirectional 패치를 적용해 토큰 단위 임베딩을 생성하고 MaxSim으로 매칭한다. 문서당 토큰 임베딩을 인덱싱해 쿼리별 토큰 매칭을 수행하므로 단일 CLS 임베딩 방식보다 부분일치와 교차언어 일반화에서 우위를 보인다. 성능 지표에서 NanoBEIR NDCG@10 평균 0.605, MKQA recall@20 평균 0.694로 동급 dense bi-encoder 및 기존 late retriever 대비 상위 성능을 기록했고, 토큰당 128차원 출력과 문서 길이 512/쿼리 길이 32 토큰 설정으로 설계가 최적화되었다. 인덱싱은 FastPLAID를 사용하고 llama.cpp용 GGUF 양자화 빌드가 제공되어 로컬 환경에서도 활용 가능하다. 실행 측면에서 MacBook M4 Max 환경의 쿼리 임베딩 p50=8.1ms, 엔터프라이즈 H100 스택에서는 쿼리 임베딩 p50=1.3ms를 보고했으며 MaxSim을 포함하면 처리량과 지연시간에 눈에 띄는 비용이 발생한다. 따라서 높은 검색 정확도가 필요한 애플리케이션에서 유리하지만 인덱스 크기 증가와 MaxSim 후처리 비용이라는 트레이드오프가 존재한다.README에 인덱스·양자화·지연시간 수치가 구체적으로 제공되어 배포·성능 계획 수립에 실용적이다. (요약 근거: README의 모델 세부표, NanoBEIR/MKQA 성능 표, 로컬 및 엔터프라이즈 지연시간 표 및 관련 그래프.)
핵심 역량
- 토큰 단위 임베딩(128-dim)으로 세밀한 쿼리-문서 매칭을 수행해 late-interaction 기반 검색 성능을 제공한다
- 사전 계산된 문서 임베딩을 인덱스에 저장하고 빠르게 검색해 온디바이스 및 서버 환경에서 저지연 검색을 지원한다
- 첫-단계 검색 결과에 대해 재정렬(rerank) 기능을 제공해 상위 결과의 관련도를 추가로 개선한다
- 11개 언어(영어·스페인어·독일어·프랑스어·이탈리아어·포르투갈어·아랍어·스웨덴어·노르웨이어·일본어·한국어)를 지원하는 다국어/교차언어 검색을 제공한다
강점
- NanoBEIR NDCG@10 평균 0.605, MKQA recall@20 평균 0.694로 동일 계열의 dense bi-encoder 및 동급 late retriever 대비 우수한 벤치마크 성능을 보였다 (README 표 근거)
- 토큰 단위 매칭(128-dim)으로 부분 일치와 교차언어 일반화에서 유리하며, GGUF 양자화와 FastPLAID 인덱스를 통해 로컬(llama.cpp) 및 엔터프라이즈 GPU 환경에서 빠른 응답 시간을 달성한다
훈련 방식
LFM2.5-350M-Base에 bidirectional 패치를 적용하고 ColBERT(토큰 단위 late-interaction) 구조로 미세조정했으며 BF16 정밀도로 훈련되었다.
알아두면 좋은 것
- 백본은 LFM2.5-350M-Base에 bidirectional 패치를 적용한 구조이며 출력은 토큰당 128차원이다
- 문서 최대 길이 512토큰, 쿼리 최대 길이 32토큰을 기준으로 최적화되었고 훈련 정밀도는 BF16이다
- 인덱싱에 FastPLAID를 사용하며 llama.cpp용 GGUF 양자화 빌드가 별도로 제공되어 로컬 추론을 지원한다
- NanoBEIR 및 MKQA 벤치마크에서 동일 규모 모델 대비 우수한 성능을 보였고, 로컬·엔터프라이즈 환경 모두에 맞춘 지연시간 최적화 수치가 공개되었다
기술적 특징
- 토큰 단위 late-interaction(ColBERT) 구조를 사용해 쿼리와 문서를 각각 토큰 임베딩으로 표현한 뒤 MaxSim으로 토큰 간 최고 유사도를 집계한다. 이 방식은 단일 CLS 벡터 방식보다 부분일치와 세부 매칭에서 정확도가 향상된다.
- 백본은 LFM2.5-350M-Base에 bidirectional 패치를 적용한 구조이며 총 약 353M 파라미터, 17개 레이어(10 conv + 6 attn + 1 dense)를 사용해 경량화된 추론과 표현력을 균형시켰다. 문서 쪽은 문서 토큰별 임베딩을 인덱싱하고 쿼리 시에 MaxSim을 적용해 점수를 계산한다.
- 출력은 토큰당 128차원으로 설계되어 인덱스 크기가 dense CLS(1024-dim)보다 커지는 트레이드오프가 존재하지만, 토큰 단위 세밀 매칭으로 NDCG·Recall 계열에서 성능 우위를 확보한다.
- 인덱스는 FastPLAID를 통해 문서 임베딩 저장·검색을 최적화했으며, llama.cpp용 GGUF 양자화 빌드 제공으로 로컬 FP16/양자화된 추론이 가능하다. 이로 인해 데스크톱/엣지 환경에서 낮은 레이턴시를 달성한다.
- 실측 지연시간과 처리량을 공개해 실무 배포 특성을 명확히 제시했다. 예컨대 MacBook M4 Max에서 쿼리 임베딩 p50=8.1ms, 엔터프라이즈 GPU 스택에서 쿼리 임베딩 p50=1.3ms, 쿼리+MaxSim p50=2.5ms로 보고되었다.
차별점
- 토큰 단위 128-dim 출력 + MaxSim late-interaction을 사용해 dense CLS 기반(1024-dim) 모델과 차별화된다
- LFM2.5-350M-Base에 bidirectional 패치를 적용해 동일 파라미터 규모에서 교차언어 성능을 끌어올렸다
- FastPLAID 인덱스와 GGUF 양자화 제공으로 로컬/엣지 및 엔터프라이즈 GPU 환경 모두에서 실용적 배포 옵션을 제공한다
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| NanoBEIR ndcg@10 | NDCG@10 (AVG) | 0.605 | vs LFM2.5-Embedding-350M: 0.577 |
| MKQA recall@20 | Recall@20 (AVG) | 0.694 | vs LFM2.5-Embedding-350M: 0.691 |
| MacBook M4 Max latency (llama.cpp) | Query embedding p50 | 8.1 ms | — |
| Enterprise GPU latency (internal H100 stack) | Query embedding p50 | 1.3 ms | — |
이미지 분석


88
Likes
3.4k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.