nvidia/Nemotron-3-Embed-8B-BF16
NVIDIA의 Nemotron-3-Embed-8B-BF16은 Minstral-3 기반 Transformer encoder로 4096차원 BF16 임베딩을 생성해 다국어 검색과 RAG에 최적화된 성능을 제공한다.
학습 방식 · Ministral-3-8B-Instruct-2512 기반의 Transformer encoder를 출발점으로 하여 공개 데이터와 합성 데이터 50M+ 샘플로 파인튜닝했으며, 학습 과정에서 bidirectional attention masking을 적용하고 문장-문서 쌍 기반의 쿼리-패시지 학습을 수행했다. 합성 데이터는 여러 상위 LLM을 사용해 쿼리-문서 페어를 생성함으로써 희소 언어와 도메인 다양성을 보강했다. 이 접근은 다국어 및 크로스-링구얼 검색 성능을 높이는 데 목적을 두고 있다.
TL;DR
Nemotron-3-Embed-8B-BF16은 Minstral-3-8B-Instruct-2512 기반의 Transformer encoder로 구현된 다국어 임베딩 모델로, 평균 풀링과 L2 정규화를 통해 4096차원 BF16 임베딩을 생성한다. 이 모델은 공개 및 합성 데이터 50M+ 샘플로 파인튜닝되어 RTEB 등 retrieval 벤치마크에서 높은 점수를 달성했으며 README에서 RTEB 78.46, MMTEB 75.45 등 구체적 수치를 제공한다. BF16 체크포인트와 FlashAttention-2 권장 조합, vLLM·PyTorch 예시가 포함되어 NVIDIA 가속 환경에서의 실무 배포 경로가 명확하며, 임베딩 슬라이스 기능을 통해 메모리·저장 비용을 조정할 수 있다. 그러나 긴 입력은 청킹 또는 잘라서 처리해야 하고, 평가 결과는 모델 시퀀스 길이를 조정한 설정에 기반해 산출되었으므로 배포 전 사용 사례별 재검증이 필요하다.
핵심 포인트
- RTEB 리더보드에서 상위권 성능을 기록하며 다국어 retrieval 벤치마크에서 우수한 점수가 공개되어 있다.
- 4096차원 고차원 임베딩을 기본으로 제공하며 필요에 따라 선형 슬라이스와 재정규화를 통해 유연하게 임베딩 크기를 줄일 수 있다.
- BF16 체크포인트와 FlashAttention-2 권장 조합을 통해 NVIDIA GPU 환경에서의 실무적 가속 경로가 명확하게 제시되어 있다.
- RTEB leaderboard에서 2026-07-16 기준 최상위 성능을 기록한 점이 README에 명시되어 있어 다국어 retrieval 성능이 우수함이 확인됐다. 이 점은 Nemotron-3-Embed-8B-BF16이 다언어 환경에서의 쿼리-문서 매칭에 강점을 가진 근거로 작용한다. 벤치마크 표에서 RTEB 78.46, ViDoRe-V3 텍스트 60.60, MMTEB 75.45의 수치가 제공되어 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| RTEB 16 | Avg. NDCG@10 | 78.46 | — |
| ViDoRe-V3 text | Avg. NDCG@10 | 60.60 | — |
| MMTEB (Retrieval) | Avg. NDCG@10 | 75.45 | — |
72
LIKES
15.4k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.