nvidia/Nemotron-3-Embed-1B-NVFP4
NVFP4로 양자화된 NVIDIA의 1.14B 임베딩 체크포인트로 vLLM에서 2048차원 다국어 임베딩을 효율적으로 제공한다.
학습 방식 · 기반 모델 Nemotron-3-Embed-1B-BF16을 출발점으로 post-training quantization을 수행하고, NVFP4 적용에 따른 성능 회복을 위해 Quantization-Aware Distillation을 20k 샘플 규모로 실시했으며 캘리브레이션에는 512개 샘플을 사용했다.
TL;DR
이 모델은 Nemotron-3-Embed-1B-BF16을 기반으로 NVIDIA Model Optimizer로 NVFP4 형태로 post-training quantization을 적용한 1.14B 임베딩 체크포인트로, bidirectional attention masking과 평균 풀링으로 2048차원 임베딩을 생성한다. Quantization-Aware Distillation과 512개 캘리브레이션 샘플을 포함한 보정 절차를 통해 NVFP4 적용 후에도 RTEB 평균 NDCG@10 72.00을 기록해 BF16(72.38)과 거의 동등한 검색 정확도를 유지했다. vLLM에서의 직접 서빙과 NVIDIA 하드웨어 검증, 긴 시퀀스(최대 32,768 토큰) 지원 및 임베딩 슬라이스와 재정규화 지침이 제공되어 실무 환경에서 효율적인 배포와 점진적 모델 교체가 가능하나, 모델 교체 전 대표 샘플로 검색 품질을 검증할 것을 권고한다.
핵심 포인트
- NVFP4 포맷으로 양자화를 수행해 NVIDIA 가속기에서의 서빙 효율을 높이면서도 BF16 기반 모델과 임베딩 공간을 공유해 인덱스 호환성을 유지한다. 이러한 설계는 모델 교체 시 대규모 인덱스 재생성을 피할 수 있게 하며, README에서 상호 교환 가능성을 명시했다. 따라서 운영 환경에서 비용 효율적 전환이 용이하다.
- 양자화 대상은 선형 계층의 가중치와 활성화로 제한되어 있어 비선형 연산과 중요한 구성은 고정밀로 유지함으로써 성능 저하를 최소화하는 전략을 채택했다. 이 접근은 NVFP4의 효율성과 모델 표현력 사이의 균형을 맞추는 실용적 설계 선택이다. 결과적으로 검색 품질이 BF16 대비 근접한 수치로 보고되었다.
- Quantization-Aware Distillation과 512개 캘리브레이션 샘플을 포함한 보정 파이프라인을 결합해 긴 시퀀스에서의 정확도 손실을 보정했다는 점이 차별점이다. README는 QAD 적용과 캘리브레이션 데이터 구성을 구체적으로 명시해 양자화 후의 품질 회복 절차를 투명하게 제공했다. 이러한 절차는 긴 문서 검색 시 실제 성능 유지에 기여한다.
- RTEB 평가에서 NVFP4 체크포인트는 평균 NDCG@10 72.00을 기록해 동일 아키텍처의 BF16 버전(72.38)과 거의 동등한 검색 정확도를 유지했다는 수치적 근거가 README에 포함되어 있다. 이 수치는 양자화 적용 후에도 실무 수준의 검색 품질을 기대할 수 있음을 시사한다. 따라서 임베딩 모델을 양자화해 배포 비용을 낮추려는 환경에서 NVFP4 체크포인트가 현실적인 대안이 된다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Retrieval Embedding Benchmark (RTEB) — Avg. NDCG@10 | Avg. NDCG@10 | 72.00 | vs Nemotron-3-Embed-1B-BF16: 72.38 |
| Retrieval Embedding Benchmark (RTEB) — Avg. NDCG@10 (BF16 baseline) | Avg. NDCG@10 | 72.38 | — |
64
LIKES
7.4k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.