NVFP4 양자화된 Nemotron 3 임베딩 1B, RTEB 72.00 성능
NVFP4로 양자화된 NVIDIA의 1.14B 임베딩 체크포인트로 vLLM에서 2048차원 다국어 임베딩을 효율적으로 제공한다.
TL;DR
이 모델은 Nemotron-3-Embed-1B-BF16을 기반으로 NVIDIA Model Optimizer로 NVFP4 형태로 post-training quantization을 적용한 1.14B 임베딩 체크포인트로, bidirectional attention masking과 평균 풀링으로 2048차원 임베딩을 생성한다. Quantization-Aware Distillation과 512개 캘리브레이션 샘플을 포함한 보정 절차를 통해 NVFP4 적용 후에도 RTEB 평균 NDCG@10 72.00을 기록해 BF16(72.38)과 거의 동등한 검색 정확도를 유지했다. vLLM에서의 직접 서빙과 NVIDIA 하드웨어 검증, 긴 시퀀스(최대 32,768 토큰) 지원 및 임베딩 슬라이스와 재정규화 지침이 제공되어 실무 환경에서 효율적인 배포와 점진적 모델 교체가 가능하나, 모델 교체 전 대표 샘플로 검색 품질을 검증할 것을 권고한다.
핵심 역량
- 입력 텍스트를 2048차원 실수 벡터로 인코딩해 쿼리와 문서 간의 내적 또는 코사인 유사도 기반 검색에 사용할 수 있다. 이 임베딩은 다국어 코퍼스(README에 기재된 34개 언어)를 지원하도록 학습·검증되어 멀티링구얼 검색 파이프라인에 적용 가능하다. 출력 벡터는 앞쪽 차원만 슬라이싱해(예: 1024, 512) 하위 차원 임베딩으로도 활용할 수 있으며 슬라이스 후에는 L2 정규화를 권장한다.
- 긴 입력 문서를 처리할 수 있도록 최대 시퀀스 길이 32,768 토큰을 지원하며 필요 시 입력을 청크로 나누어 임베딩을 계산하는 워크플로를 적용할 수 있다. README는 평가와 예제에서 보수적으로 4096 토큰을 사용하도록 권고하며 CUDA graph 캡처 크기 설정을 통해 배치 효율을 조정하도록 안내한다. 긴 컨텍스트 환경에서는 캡처 사이즈와 배치 토큰 예산을 워크로드에 맞게 조율해야 한다.
- NVFP4 포맷으로 양자화된 체크포인트는 vLLM에서 직접 로드해 추론할 수 있도록 메타데이터가 포함되어 있으며 vLLM 특정 버전(vllm==0.25.0)과 컨테이너에서 검증되었다. 이로 인해 NVIDIA 하드웨어(Ampere/Blackwell/Hopper/Lovelace 계열) 상에서 효율적으로 서빙할 수 있는 구성이 가능하다. 배포 시에는 권장 vLLM 버전과 CUDA graph 캡처 설정을 맞춰 성능과 스타트업 시간의 균형을 확보해야 한다.
강점
- RTEB 평가에서 NVFP4 체크포인트는 평균 NDCG@10 72.00을 기록해 동일 아키텍처의 BF16 버전(72.38)과 거의 동등한 검색 정확도를 유지했다는 수치적 근거가 README에 포함되어 있다. 이 수치는 양자화 적용 후에도 실무 수준의 검색 품질을 기대할 수 있음을 시사한다. 따라서 임베딩 모델을 양자화해 배포 비용을 낮추려는 환경에서 NVFP4 체크포인트가 현실적인 대안이 된다.
- 이 체크포인트는 vLLM에서의 직접 로딩과 서빙을 염두에 둔 메타데이터와 테스트가 포함되어 있어 운영 환경에서의 호환성과 검증성이 확보되어 있다. README에 권장된 vLLM 버전과 컨테이너 이미지를 따를 경우 예측 가능한 동작과 재현 가능한 성능을 얻을 수 있다. 특히 NVIDIA 하드웨어(A100, GB200, H100, L40/L4 등)와의 호환성이 명시되어 있어 가속기 기반 배포에서 우위를 가진다.
- 임베딩 차원 2048과 평균 풀링 전략은 긴 문서와 짧은 쿼리를 동일한 벡터 공간으로 매핑할 때 일관된 표현을 제공하며, 슬라이스 후 재정규화 방식을 통해 하위 차원으로의 유연한 활용을 허용한다. BF16과 임베딩 공간을 공유하므로 기존 인덱스와의 호환성을 확보하기 쉬우며 모델 교체 시 대표 샘플 검증만으로 품질 유지 여부를 확인할 수 있다. 이 특성은 점진적 교체와 A/B 테스트에 유리하다.
훈련 방식
기반 모델 Nemotron-3-Embed-1B-BF16을 출발점으로 post-training quantization을 수행하고, NVFP4 적용에 따른 성능 회복을 위해 Quantization-Aware Distillation을 20k 샘플 규모로 실시했으며 캘리브레이션에는 512개 샘플을 사용했다.
알아두면 좋은 것
- 이 체크포인트는 Nemotron-3-Embed-1B-BF16을 기반으로 NVidia Model Optimizer(nvidia-modelopt v0.45.0)를 사용해 NVFP4로 post-training quantization을 수행한 결과물이다. Quantization-Aware Distillation(QAD)을 적용해 긴 시퀀스에서 발생할 수 있는 성능 손실을 부분적으로 회복하도록 설계되었으며 README에 QAD 적용과 캘리브레이션 절차가 기술되어 있다. 모델과 구성 파일은 OpenMDW-1.1 라이선스하에 공개되어 상업적 사용이 가능하다는 안내가 포함되어 있다.
- 캘리브레이션 데이터셋은 abisee/cnn_dailymail에서 추출한 256개의 쿼리와 256개의 패시지, 총 512 샘플로 구성되었으며 이는 NVFP4 양자화 보정에 직접 사용되었다. QAD 학습은 총 20k 샘플을 사용해 수행되었고 공개 데이터와 합성 데이터 혼합으로 구성되었다는 점이 명시되어 있다. README는 합성 데이터 생성에 사용된 상위 모델 목록과 시드 데이터셋을 참조 링크로 제공하고 있다.
- 이 체크포인트는 vLLM 런타임에서의 사용을 염두에 두고 검증되었으며 권장 vLLM 버전과 NVIDIA 제공 컨테이너 이미지가 명확히 지정되어 있다. README는 CUDA graph 캡처 사이즈와 배치 토큰 예산의 트레이드오프를 구체적인 예시와 함께 제공해 운영 시 재현 가능한 튜닝 지침을 제공한다. 또한 BF16 베이스 모델과 임베딩 공간을 공유하므로 모델 교체 전 대표 샘플에서 검색 품질을 확인할 것을 권고한다.
- 평가 파트에서는 Retrieval Embedding Benchmark(RTEB)를 사용해 NVFP4 체크포인트의 평균 NDCG@10을 보고했으며 BF16 대비 소폭의 차이를 수치로 제시했다. README에는 평가 시퀀스 길이를 4096으로 고정하고 NVIDIA GB200 GPU에서 평가를 수행한 메타 정보가 포함되어 있다. 성능 수치는 NVFP4가 BF16에 매우 근접한 검색 정확도를 유지함을 보여준다.
기술적 특징
- NVidia Model Optimizer(nvidia-modelopt v0.45.0)를 사용해 선형 레이어의 가중치와 활성화만을 NVFP4로 양자화한 점이 핵심이다. 이 방식은 비선형 연산과 일부 구조적 메타데이터는 고정밀로 유지해 극단적 손실을 줄이는 전략을 취한다. 양자화 적용 대상과 범위를 제한함으로써 추론 중 효율을 확보하면서도 임베딩 품질 저하를 최소화하려는 설계 선택이다.
- Quantization-Aware Distillation(QAD)이 NVFP4 적용 후 긴 시퀀스에서의 정확도 회복을 위해 적용되었다. QAD는 고정밀 BF16 교사 모델의 출력을 이용해 저정밀 학생 모델을 추가로 튜닝하는 방식으로, README에서는 QAD가 긴 입력 시퀀스의 손실을 보완하는 데 사용되었다고 명시되어 있다. QAD 훈련에는 20k 샘플 규모가 사용되었고 캘리브레이션은 512 샘플로 수행되었다.
- 모델 아키텍처는 Ministral-3-3B-Instruct-2512 기반의 pruned encoder를 참조한 구조이며, 토큰별 표현에 bidirectional attention masking을 적용한 뒤 평균 풀링으로 최종 임베딩을 생성한다. 평균 풀링은 입력 길이에 무관하게 고정 차원 벡터를 생성하므로 검색 인덱스에 쉽게 통합할 수 있다. 은닉 크기 2048과 최종 임베딩 차원 2048을 맞춤으로써 높은 표현력을 유지하도록 설계되었다.
- 긴 컨텍스트 처리를 위한 vLLM 통합 지침과 CUDA graph 캡처 사이즈 튜닝이 README에 구체적으로 포함되어 있다. 예제와 권고값(보수적 기본 4096 토큰, 최대 32768 토큰 지원)은 추론 성능과 스타트업 시간의 균형을 맞추기 위한 운영 지침을 제공한다. 또한 vLLM 특정 버전과 컨테이너에서의 검증 내역이 명시되어 실무 적용 시 호환성 위험을 줄였다.
차별점
- NVFP4 포맷으로 양자화를 수행해 NVIDIA 가속기에서의 서빙 효율을 높이면서도 BF16 기반 모델과 임베딩 공간을 공유해 인덱스 호환성을 유지한다. 이러한 설계는 모델 교체 시 대규모 인덱스 재생성을 피할 수 있게 하며, README에서 상호 교환 가능성을 명시했다. 따라서 운영 환경에서 비용 효율적 전환이 용이하다.
- 양자화 대상은 선형 계층의 가중치와 활성화로 제한되어 있어 비선형 연산과 중요한 구성은 고정밀로 유지함으로써 성능 저하를 최소화하는 전략을 채택했다. 이 접근은 NVFP4의 효율성과 모델 표현력 사이의 균형을 맞추는 실용적 설계 선택이다. 결과적으로 검색 품질이 BF16 대비 근접한 수치로 보고되었다.
- Quantization-Aware Distillation과 512개 캘리브레이션 샘플을 포함한 보정 파이프라인을 결합해 긴 시퀀스에서의 정확도 손실을 보정했다는 점이 차별점이다. README는 QAD 적용과 캘리브레이션 데이터 구성을 구체적으로 명시해 양자화 후의 품질 회복 절차를 투명하게 제공했다. 이러한 절차는 긴 문서 검색 시 실제 성능 유지에 기여한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Retrieval Embedding Benchmark (RTEB) — Avg. NDCG@10 | Avg. NDCG@10 | 72.00 | vs Nemotron-3-Embed-1B-BF16: 72.38 |
| Retrieval Embedding Benchmark (RTEB) — Avg. NDCG@10 (BF16 baseline) | Avg. NDCG@10 | 72.38 | — |
64
Likes
7.4k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.