Nemotron-3-Embed 1.14B 다국어 임베딩 성능 최적화 모델
Nemotron-3-Embed-1B-BF16는 2048차원 다국어 임베딩을 생성하며 RTEB에서 72.38 Avg. NDCG@10을 달성한 1.14B 경량화 Transformer 임베딩 모델이다.
TL;DR
이 모델은 NVIDIA가 Ministral-3-3B-Instruct-2512를 기반으로 구조적 프루닝과 교사-학생 증류를 결합해 만든 1.14B 규모의 다국어 임베딩 모델이다. 구조 탐색은 ModelOpt NAS로 숨김 너비·FFN·헤드·깊이를 조정했고 증류는 COS와 MSE 손실을 결합해 프루닝으로 손실된 표현력을 회복했다. 모델은 평균 풀링으로 2048차원 임베딩을 출력하고 앞부분 슬라이싱과 L2 정규화를 통해 저장·전송 비용을 낮출 수 있게 설계되었다. 평가에서 RTEB 기준 72.38 Avg. NDCG@10을 기록해 같은 표의 경량 후보들보다 우수한 성능을 보였고 BF16·FlashAttention 지원과 vLLM·Sentence Transformers 통합으로 실무 배포 경로가 확보되어 있다.
핵심 역량
- 다국어 텍스트를 2048차원 밀집 벡터로 인코딩해 질의-문서 유사도 계산과 밀집 검색에 사용한다. 입력 길이는 최대 32768 토큰까지 처리할 수 있으나 더 긴 텍스트는 청크 분할이나 트렁케이션이 필요하다. 출력 벡터는 L2 정규화되어 dot product와 cosine 연산이 동일한 의미를 갖는다.
- 임베딩 차원을 앞부분에서 슬라이싱해 1024·512차원 등으로 동적 축소할 수 있으며 슬라이스 후에 L2 정규화를 적용하면 실무에서 저장·전송 비용을 낮출 수 있다. 이 방식은 인덱스 크기와 검색 지연을 줄이는 실용적 절충을 제공한다. 슬라이싱 유지 성능은 사후 정규화로 보전된다.
- PyTorch, vLLM, Sentence Transformers와 통합되어 로컬 GPU 환경 또는 vLLM 서빙에서 바로 배포가 가능하다. BF16 체크포인트를 권장하며 FlashAttention-2가 있을 때 최적화된 추론 성능을 확보한다. vLLM의 /v2/embed와 OpenAI 호환 /v1/embeddings 엔드포인트를 통해 온라인 서빙이 가능하다.
강점
- 다국어 검색 벤치마크에서 높은 NDCG 수치를 기록해 다언어 질의-문서 검색에 실질적 이득을 제공한다. README에 제시된 RTEB 72.38, MMTEB 71.04, ViDoRe-V3 텍스트 57.74는 동일 표에서 다른 후보 대비 우위를 의미한다. 이와 함께 모델은 상용 사용을 염두에 둔 라이선스와 NVIDIA 하드웨어 최적화 설정을 제공해 배포와 운영 측면에서 실용적 이점을 갖춘다.
훈련 방식
기반 모델은 Ministral-3-3B-Instruct-2512이며 두 차례의 구조적 프루닝과 교차 증류 파이프라인으로 축소·튜닝되었다. 첫 단계에서 NAS 기반 ModelOpt mcore_minitron으로 구조 후보를 탐색해 3B에서 2B로 프루닝했고 50k 도메인 캘리브레이션 코퍼스로 후보를 평가해 중요도를 추정했다. 이후 Nemotron-3-Embed-8B-BF16 교사 모델로부터 COS+MSE 손실을 결합한 증류를 수행해 최종 1.14B 크기의 임베딩 모델을 얻었다.
알아두면 좋은 것
- 모델은 Ministral-3-3B-Instruct-2512를 기반으로 ModelOpt mcore_minitron NAS를 사용해 구조 탐색과 프루닝을 수행한 뒤 교사 모델 기반의 증류로 정확도를 회복했다는 점이 핵심이다. 프루닝 단계에서 숨김 너비·FFN 크기·어텐션 헤드·깊이를 탐색해 파레토 최적 후보를 선정했고 50k 도메인 캘리브레이션 코퍼스로 후보를 평가했다. 이 절차는 경량화와 표현력 유지라는 두 목표를 동시에 만족시키기 위한 설계였다.
- 증류는 Nemotron-3-Embed-8B-BF16 교사 모델을 사용했고 손실 함수로 cosine distance와 mean squared error를 결합해 임베딩 유사도를 직접 학습했다는 점이 기술적 포인트이다. 증류 데이터는 다국어 도메인 혼합으로 구성되었으며, 합성 질의-문서 페어와 공개 데이터가 혼합되어 사용되었다. 이 과정으로 프루닝 후 손실된 정확도를 회복했다는 근거가 README에 포함되어 있다.
- 평가 설정에서 모델은 RTEB, MMTEB(검색), ViDoRe-V3 텍스트 등 여러 다국어 검색 벤치마크에 대해 평균 NDCG@10 기준에서 높은 점수를 기록했다는 점이 강조되어 있다. RTEB에서 72.38의 Avg. NDCG@10을 보고했고 동일 테이블에 비교 모델로 61.98 값이 제시되어 성능 우위를 확인할 수 있다. 평가 시퀀스 길이는 4096으로 설정해 결과를 산출했다는 기술적 정보가 포함되어 있다.
- 라이선스는 OpenMDW-1.1이며 상업적 사용 가능하다는 표기가 README에 명시되어 있다. BF16 체크포인트는 Transformers 5.2.0 이상과 호환되며 NVIDIA 컨테이너 환경에서의 테스트가 권장된다. 환경에 따라 FlashAttention-2 유무에 따라 attn_implementation 설정을 조정해야 한다는 실무적 제약이 있다.
기술적 특징
- 구조적 프루닝은 ModelOpt mcore_minitron NAS를 통해 숨김 너비, FFN 크기, 어텐션 헤드, 레이어 깊이를 탐색하고 상위 파레토 후보를 선택하는 방식으로 수행되었다. 후보 평가는 교사 모델 표현과의 유사도를 50k 도메인 캘리브레이션 코퍼스로 측정해 중요도를 추정했고 이 데이터를 기반으로 최적화된 구조를 결정했다. 이 절차는 단순한 가중치 제거가 아니라 설계 공간 탐색과 데이터 기반 평가를 결합한 접근이다.
- 증류는 대형 Nemotron-3-Embed-8B-BF16 교사로부터 학생 모델로 임베딩 표현을 전이하는 방식으로 이루어졌으며 cosine distance와 MSE 손실을 결합해 표현의 각도를 유지하면서 절대값 오차를 제한했다. 학습 데이터는 다국어 도메인 혼합과 합성 질의-문서 페어로 구성되어 언어 간 및 도메인 간 일반화를 강화했다. 이로써 프루닝으로 손실된 표현 능력을 회복하면서도 경량화를 달성했다.
- 출력 임베딩은 토큰별 최종 히든 상태에 평균 풀링을 적용해 얻어지며 결과 벡터는 2048차원이다. 임베딩은 앞부분을 잘라서 1024·512차원 등으로 동적 축소할 수 있고, 이 경우 반드시 L2 정규화로 재정규화해야 실무적 검색 성능을 보장한다. 평균 풀링 방식은 단일 고정 길이 벡터를 얻는 간단하고 효율적인 파이프라인을 제공한다.
- 실행 측면에서 BF16 체크포인트를 권장하며 FlashAttention-2 사용 시 attn_implementation="flash_attention_2"와 같은 설정으로 연산 효율을 개선한다. vLLM, PyTorch 및 Sentence Transformers와의 통합을 통해 온라인 서비스(vLLM /v2/embed)와 로컬 배포 모두에서 사용 가능하며 NVIDIA 컨테이너 환경에서 검증된 설정을 제공한다. 하드웨어는 NVIDIA Ampere·Hopper 등에서 최적화된 성능을 보이도록 설계되었다.
차별점
- ModelOpt NAS 기반의 구조 탐색과 데이터 기반 중요도 평가를 결합한 구조적 프루닝을 적용했다.
- 교사 모델로부터 cosine distance와 MSE를 결합한 증류를 수행해 프루닝 손실을 회복했다.
- 출력 벡터를 앞에서 슬라이스해 동적 차원 축소를 지원하며 슬라이스 후 L2 정규화로 실무적 절충을 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| RTEB | Avg. NDCG@10 | 72.38 | vs llama-nemotron-embed-vl-1b-v2: +10.40 (61.98) |
| ViDoRe-V3 text | Avg. NDCG@10 | 57.74 | — |
| MMTEB (Retrieval) | Avg. NDCG@10 | 71.04 | — |
107
Likes
205.7k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.