본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/Nemotron-3-Embed-1B-BF16

이 모델은 문장 임베딩과 문서-쿼리 유사도 계산을 위한 sentence-similarity 및 retrieval 태스크에 특화되어 있다. 입력 텍스트를 토크나이즈한 뒤 Transformer 인코더로 처리해 평균 풀링으로 2048차원 밀집 벡터를 생성하고 L2 정규화로 검색 시스템에서 바로 사용 가능한 표현을 출력한다. 다국어 쿼리와 문서 간 의미적 매칭을 요구하는 RAG·검색·시맨틱 서치 파이프라인에 통합되는 용도로 설계됐다.1.14B32K 컨텍스트openmdw-1.1

Nemotron-3-Embed-1B-BF16는 2048차원 다국어 임베딩을 생성하며 RTEB에서 72.38 Avg. NDCG@10을 달성한 1.14B 경량화 Transformer 임베딩 모델이다.

학습 방식 · 기반 모델은 Ministral-3-3B-Instruct-2512이며 두 차례의 구조적 프루닝과 교차 증류 파이프라인으로 축소·튜닝되었다. 첫 단계에서 NAS 기반 ModelOpt mcore_minitron으로 구조 후보를 탐색해 3B에서 2B로 프루닝했고 50k 도메인 캘리브레이션 코퍼스로 후보를 평가해 중요도를 추정했다. 이후 Nemotron-3-Embed-8B-BF16 교사 모델로부터 COS+MSE 손실을 결합한 증류를 수행해 최종 1.14B 크기의 임베딩 모델을 얻었다.

TL;DR

이 모델은 NVIDIA가 Ministral-3-3B-Instruct-2512를 기반으로 구조적 프루닝과 교사-학생 증류를 결합해 만든 1.14B 규모의 다국어 임베딩 모델이다. 구조 탐색은 ModelOpt NAS로 숨김 너비·FFN·헤드·깊이를 조정했고 증류는 COS와 MSE 손실을 결합해 프루닝으로 손실된 표현력을 회복했다. 모델은 평균 풀링으로 2048차원 임베딩을 출력하고 앞부분 슬라이싱과 L2 정규화를 통해 저장·전송 비용을 낮출 수 있게 설계되었다. 평가에서 RTEB 기준 72.38 Avg. NDCG@10을 기록해 같은 표의 경량 후보들보다 우수한 성능을 보였고 BF16·FlashAttention 지원과 vLLM·Sentence Transformers 통합으로 실무 배포 경로가 확보되어 있다.

핵심 포인트

  • ModelOpt NAS 기반의 구조 탐색과 데이터 기반 중요도 평가를 결합한 구조적 프루닝을 적용했다.
  • 교사 모델로부터 cosine distance와 MSE를 결합한 증류를 수행해 프루닝 손실을 회복했다.
  • 출력 벡터를 앞에서 슬라이스해 동적 차원 축소를 지원하며 슬라이스 후 L2 정규화로 실무적 절충을 제공한다.
  • 다국어 검색 벤치마크에서 높은 NDCG 수치를 기록해 다언어 질의-문서 검색에 실질적 이득을 제공한다. README에 제시된 RTEB 72.38, MMTEB 71.04, ViDoRe-V3 텍스트 57.74는 동일 표에서 다른 후보 대비 우위를 의미한다. 이와 함께 모델은 상용 사용을 염두에 둔 라이선스와 NVIDIA 하드웨어 최적화 설정을 제공해 배포와 운영 측면에서 실용적 이점을 갖춘다.

벤치마크

벤치마크지표비교
RTEBAvg. NDCG@1072.38vs llama-nemotron-embed-vl-1b-v2: +10.40 (61.98)
ViDoRe-V3 textAvg. NDCG@1057.74
MMTEB (Retrieval)Avg. NDCG@1071.04

107

LIKES

205.7k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.