nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
이 모델은 Nemotron-3-Super에서 출발해 Iterative Puzzle 단계별 압축과 지식증류·강화학습 복구·사후 양자화를 결합하여 120.7B/12.8B에서 75.3B/9.3B(활성)로 파라미터를 줄이면서 실서비스용 추론 처리량을 우선 최적화한 배포 지향 LLM이다. 하이브리드 Latent MoE(Mamba+MoE+Attention) 아키텍처와 Multi-Token Prediction을 유지하여 추론 시 서버 처리량과 동시성에서 유의한 이득을 얻도록 설계되었다. NVFP4 체크포인트는 Blackwell 계열 GPU에서의 서빙을 목표로 하고 FP8 체크포인트는 Hopper 계열을 겨냥한 배포 옵션을 제공한다.
학습 방식 · 모델은 Nemotron-3-Super-120B-A12B를 출발점으로 Iterative Puzzle 후처리 압축을 적용한 뒤 단계별 지식증류로 품질을 회복했다. 압축 단계마다 MoE 가중치와 Mamba SSM 상태를 축소한 후 각각 24B, 43.2B, 52.8B 토큰 단위의 지식증류로 복구했고 최종 장기 문맥 복구에서는 128Ki 및 512Ki 시퀀스 길이로 최대 100B 토큰을 사용했다. 이후 소프트웨어 엔지니어링·에이전트 태스크 중심의 RL 복구와 사후 양자화(NVFP4/FP8)를 통해 배포 성능을 확보했다.
TL;DR
이 모델은 Nemotron-3-Super-120B를 출발점으로 Iterative Puzzle이라는 단계적 압축·회복 파이프라인을 적용해 총 파라미터와 활성 파라미터를 120.7B/12.8B에서 약 75.3B/9.3B로 축소한 배포 최적화형 LLM이다. 설계는 Latent MoE(Mamba+MoE+Attention) 아키텍처와 Multi-Token Prediction을 유지하면서 층별 비균질 MoE 채널·활성 전문가 수 감소와 Mamba SSM 상태 축소를 통해 디코드 효율을 높였고, 각 압축 단계 뒤에 24B·43.2B·52.8B 토큰 단위의 지식증류와 후속 RL 복구로 성능을 회복했다. 그 결과 동일 사용자 처리량 제약에서 8×B200 단일 노드 기준 약 2배 처리량을 보고했고 1M 토큰 환경에서 H100 단일 인스턴스의 동시 요청을 1에서 8로 늘리는 개선이 나타났으며 NVFP4/FP8 양자화 옵션으로 Blackwell·Hopper 계열 GPU에 맞춘 배포를 지원한다. 다만 일부 벤치마크에서 BF16 대비 소폭의 성능 차이가 존재하므로 품질·지연·인프라 비용의 트레이드오프를 운영 환경에서 검증해야 한다.
핵심 포인트
- Iterative Puzzle의 단계적 프루닝·지식증류·RL 복구를 결합해 압축 후 품질 회복을 체계화한 점이 차별화 요소이다.
- 층별 비균질 MoE 채널과 활성 전문가 수 조절을 통해 민감한 층에는 용량을 보존하면서 전체 활성 파라미터를 크게 줄인 구조적 설계가 적용되었다.
- Mamba SSM 상태 축소와 MTP의 결합으로 긴 문맥 디코드와 speculative decoding에서 서빙 처리량을 동시에 개선하도록 설계되었다.
- 하드웨어별 포맷(FP8 for Hopper, NVFP4 for Blackwell)을 제공해 실제 인프라에서의 배포 효율을 높였다는 점이 실무적 차별점이다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Pro | accuracy | 82.2 | vs Nemotron-Labs-3-Puzzle-75B-A9B-BF16: 82.4 |
| AIME25 (no tools) | accuracy | 89.9 | vs BF16: 89.7 |
| HMMT Feb25 (no tools) | accuracy | 92.9 | vs BF16: 93.4 |
| LiveCodeBench (v5 2024-07↔2024-12) | accuracy | 79.9 | vs BF16: 81.1 |
| RULER @ 1M | accuracy | 93.2 | vs BF16: 92.2 |
| MMLU-ProX (avg over langs) | accuracy | 76.5 | vs BF16: 77.5 |
| WMT24++ (en→xx) | accuracy | 85.1 | vs BF16: 85.2 |
119
LIKES
41.8k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.