Nemotron Puzzle 75B NVFP4, 2× 서버 처리량 최적화 모델
이 모델은 Nemotron-3-Super에서 출발해 Iterative Puzzle 단계별 압축과 지식증류·강화학습 복구·사후 양자화를 결합하여 120.7B/12.8B에서 75.3B/9.3B(활성)로 파라미터를 줄이면서 실서비스용 추론 처리량을 우선 최적화한 배포 지향 LLM이다. 하이브리드 Latent MoE(Mamba+MoE+Attention) 아키텍처와 Multi-Token Prediction을 유지하여 추론 시 서버 처리량과 동시성에서 유의한 이득을 얻도록 설계되었다. NVFP4 체크포인트는 Blackwell 계열 GPU에서의 서빙을 목표로 하고 FP8 체크포인트는 Hopper 계열을 겨냥한 배포 옵션을 제공한다.
TL;DR
이 모델은 Nemotron-3-Super-120B를 출발점으로 Iterative Puzzle이라는 단계적 압축·회복 파이프라인을 적용해 총 파라미터와 활성 파라미터를 120.7B/12.8B에서 약 75.3B/9.3B로 축소한 배포 최적화형 LLM이다. 설계는 Latent MoE(Mamba+MoE+Attention) 아키텍처와 Multi-Token Prediction을 유지하면서 층별 비균질 MoE 채널·활성 전문가 수 감소와 Mamba SSM 상태 축소를 통해 디코드 효율을 높였고, 각 압축 단계 뒤에 24B·43.2B·52.8B 토큰 단위의 지식증류와 후속 RL 복구로 성능을 회복했다. 그 결과 동일 사용자 처리량 제약에서 8×B200 단일 노드 기준 약 2배 처리량을 보고했고 1M 토큰 환경에서 H100 단일 인스턴스의 동시 요청을 1에서 8로 늘리는 개선이 나타났으며 NVFP4/FP8 양자화 옵션으로 Blackwell·Hopper 계열 GPU에 맞춘 배포를 지원한다. 다만 일부 벤치마크에서 BF16 대비 소폭의 성능 차이가 존재하므로 품질·지연·인프라 비용의 트레이드오프를 운영 환경에서 검증해야 한다.
핵심 역량
- 복잡한 추론과 장기 문맥 대화 생성이 가능하다. Mamba SSM과 MoE 혼합 구조를 통해 수십만 토큰 단위의 컨텍스트를 유지하면서도 디코드 단계 효율을 확보하도록 설계되었다. 다국어와 코드 생성 태스크에서도 실무 수준의 응답을 목표로 한다.
- 대화형 에이전트와 도구 호출 시나리오에서 높은 동시성 처리와 낮은 평균 지연을 제공하도록 최적화되었다. MTP와 speculative decoding 설정을 통해 배치·지연 상황에 맞춰 토큰 생성 작업을 병렬화하며 서버 처리량을 개선한다. README에 제시된 설정에서는 num_speculative_tokens=3이 권장값으로 제시되었다.
- 코드 생성 및 소프트웨어 엔지니어링 관련 RL 복구를 포함한 파이프라인으로 도구 사용과 멀티턴 상호작용에서의 안정성을 목표로 한다. 여러 RL 러닝레이트로 학습한 체크포인트 가중치 평균을 통해 최종 성능을 획득했다. 이로 인해 압축 후에도 에이전트적 태스크에 필요한 행위 기반 성능이 유지되도록 했다.
- 서빙 친화적 환경에서 높은 처리량을 얻을 수 있다. NVFP4와 FP8 같은 포맷을 통해 Blackwell/Hopper 계열 GPU에 맞춘 배포 최적화를 제공하며 vLLM과 Transformers 런타임에서의 실행을 지원한다. 모델은 상용 사용 허가(openmdw-1.1 라이선스 명시)를 포함해 배포 준비가 되어 있다.
강점
- 동일 사용자 처리량 제약 하에서 8×B200 단일 노드에서 약 2배의 서버 처리량을 보였다는 점은 배포 효과가 실증된 결과이다. 이 성과는 활성 파라미터·전문가 수를 층별로 줄이고 Mamba SSM 상태를 축소한 구조적 압축이 추론 병목을 완화했기 때문이다. 또한 MTP와 서빙 최적화로 동시성 처리량이 크게 개선되었다.
- 1M 토큰 장기 문맥 환경에서 H100 단일 시스템의 지속 가능한 동시 요청 수를 1에서 8로 늘린 점은 대화형·장기 컨텍스트 서비스에서 동시성 측면의 실무적 이득을 의미한다. 이 증가는 Mamba SSM 캐시 I/O 감소와 활성 전문가 수 축소를 통한 디코드 단계 효율화가 결합된 결과이다. 장기 문맥 관련 지표(RULER @1M 등)도 높은 수치를 유지하고 있어 긴 문맥 복원이 성공적으로 이루어진 것으로 나타났다.
- 다양한 추론·코드·다국어 벤치마크에서 Nemotron-3-Super 대비 큰 성능 손실 없이 배포 효율을 달성한 점은 압축-회복 파이프라인의 균형점을 찾았다는 근거가 된다. 벤치마크 표의 값들은 BF16/FP8/NVFP4 버전 간의 미세한 성능 차이를 보여주며 NVFP4에서도 비교적 일관된 성능을 유지했다. README는 구체적 평가 도구와 재현성 자료 위치를 명시하여 수치 신뢰도를 보강했다.
훈련 방식
모델은 Nemotron-3-Super-120B-A12B를 출발점으로 Iterative Puzzle 후처리 압축을 적용한 뒤 단계별 지식증류로 품질을 회복했다. 압축 단계마다 MoE 가중치와 Mamba SSM 상태를 축소한 후 각각 24B, 43.2B, 52.8B 토큰 단위의 지식증류로 복구했고 최종 장기 문맥 복구에서는 128Ki 및 512Ki 시퀀스 길이로 최대 100B 토큰을 사용했다. 이후 소프트웨어 엔지니어링·에이전트 태스크 중심의 RL 복구와 사후 양자화(NVFP4/FP8)를 통해 배포 성능을 확보했다.
알아두면 좋은 것
- 모델은 Nemotron-3-Super-120B-A12B에서 파생된 후처리 압축체로, Iterative Puzzle 파이프라인을 통해 총 파라미터와 활성 파라미터를 각각 120.7B/12.8B에서 75.3B/9.3B 수준으로 감소시켰다. 압축 과정은 층별 비균질 MoE 채널·활성 전문가 수 조정과 Mamba SSM 상태 축소를 포함하며 각 단계에서 지식증류로 품질을 회복했다. 이 설계는 고동시성·대량 워크로드에서 서버 처리량을 우선하는 배포 목표를 반영한다.
- 성능 벤치마크에서 동일 사용자 처리량 제약 조건 하에 8×B200 단일 노드에서 약 2배 높은 서버 처리량을 달성했고 1M 토큰 환경에서 H100 단일 인스턴스의 동시 처리 요청 수를 1에서 8로 증가시킨 것으로 보고되었다. 벤치마크 표에는 MMLU-Pro, AIME25, RULER 등 다양한 추론·장기문맥·다국어 지표가 포함되어 있다. 벤치마크는 Nemo Evaluator SDK와 Nemo Skills Harness를 사용해 수집되었다.
- 학습 파이프라인은 세 단계의 Iterative Puzzle 압축(각 단계별로 MoE 용량과 Mamba SSM을 축소)과 장기 문맥 지식증류(128Ki→512Ki, 최대 100B 토큰), 이후 RL 복구와 사후 양자화를 포함한다. 지식증류 복구 단계에서 24B, 43.2B, 52.8B 토큰 단위의 회복 훈련이 명시되어 있으며 최종 장기 문맥 회복을 위해 대규모 토큰을 사용했다. 양자화 타깃으로는 FP8(대상: Hopper)과 NVFP4(대상: Blackwell)가 명시되어 있다.
- 서빙 관련 권장사항으로 vLLM 설정(권장 tp=2 또는 4, MTP 시 num_speculative_tokens=3 권장)과 Transformers ≥ 5.3.0 사용, trust_remote_code=True 설정을 권장하고 있다. 기본 Hugging Face 구성은 256k 컨텍스트로 설정되어 있으나 모델은 최대 1M 토큰까지 지원한다. 상용 사용 가능 라이선스(openmdw-1.1)가 부여되어 있다.
기술적 특징
- Iterative Puzzle 압축 파이프라인은 여러 단계의 프루닝과 지식증류 회복을 반복해 모델을 점진적으로 축소하고 품질을 복원하는 방식이다. 첫 단계에서 MoE 용량과 Mamba SSM 상태를 75%로 축소한 뒤 24B 토큰 지식증류로 회복했고, 두 번째 단계에서는 60%로 축소 후 43.2B 토큰 회복, 최종 단계에서는 활성 전문가 예산을 50%로 제한하고 52.8B 토큰으로 최종 회복을 수행했다. 이 접근은 대규모 하이브리드 MoE 모델에서 구조적 축소와 성능 회복 사이의 트레이드오프를 관리하기 위해 설계되었다.
- 하이브리드 아키텍처는 interleaved Mamba, MoE, Attention 레이어를 결합한 Latent MoE 형태를 사용하며 층별로 전문가 중간 채널과 활성 전문가 수를 비균질하게 조정했다. 전문가 중간 채널은 부모 모델의 2688에서 층별로 1280–2688 범위로 축소되었고, 활성 전문가 수는 22에서 층별로 4–18로 줄어 활성 파라미터와 계산량을 낮추었다. 이러한 비균질 프루닝은 민감한 층에는 용량을 보존하고 덜 민감한 층을 더 공격적으로 축소하는 방식으로 품질을 유지하도록 설계되었다.
- Mamba SSM 상태 크기를 128에서 96으로 줄여 Mamba 캐시 I/O를 감소시키고 디코드 단계 효율을 개선했다. 상태 크기 축소는 디코드 시의 메모리·대역폭 비용을 줄여 대규모 배치와 긴 디코드 시나리오에서 실질적 이득을 제공한다. README는 또한 Mamba 캐시에 대해 stochastic rounding과 Philox 라운드 설정 같은 서빙 최적화 파라미터를 권장한다.
- 사후 양자화와 continued MTP 훈련을 결합해 배포 시의 처리량을 추가로 높였다. FP8은 Hopper 계열을 대상으로 하고 NVFP4는 Blackwell 계열을 대상으로 하여 하드웨어별 양자화 타깃을 제공하며, MTP speculative decoding을 통해 서빙 처리량을 향상시키도록 설정되었다. README는 vLLM 서빙 명령어와 권장 num_speculative_tokens 값을 구체적으로 제시해 실무 적용성을 높였다.
차별점
- Iterative Puzzle의 단계적 프루닝·지식증류·RL 복구를 결합해 압축 후 품질 회복을 체계화한 점이 차별화 요소이다.
- 층별 비균질 MoE 채널과 활성 전문가 수 조절을 통해 민감한 층에는 용량을 보존하면서 전체 활성 파라미터를 크게 줄인 구조적 설계가 적용되었다.
- Mamba SSM 상태 축소와 MTP의 결합으로 긴 문맥 디코드와 speculative decoding에서 서빙 처리량을 동시에 개선하도록 설계되었다.
- 하드웨어별 포맷(FP8 for Hopper, NVFP4 for Blackwell)을 제공해 실제 인프라에서의 배포 효율을 높였다는 점이 실무적 차별점이다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Pro | accuracy | 82.2 | vs Nemotron-Labs-3-Puzzle-75B-A9B-BF16: 82.4 |
| AIME25 (no tools) | accuracy | 89.9 | vs BF16: 89.7 |
| HMMT Feb25 (no tools) | accuracy | 92.9 | vs BF16: 93.4 |
| LiveCodeBench (v5 2024-07↔2024-12) | accuracy | 79.9 | vs BF16: 81.1 |
| RULER @ 1M | accuracy | 93.2 | vs BF16: 92.2 |
| MMLU-ProX (avg over langs) | accuracy | 76.5 | vs BF16: 77.5 |
| WMT24++ (en→xx) | accuracy | 85.1 | vs BF16: 85.2 |
119
Likes
41.8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.