본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4

이 모델은 주로 텍스트 생성과 대화형 추론, 장기 문맥 유지, 코드 및 다국어(영어·프랑스어·독일어·이탈리아어·일본어·스페인어·중국어) 작업을 수행하도록 설계되었다. Multi-Token Prediction과 전문가 병렬 구성을 활용해 대화형 에이전트·RAG·장기 추론 워크로드에서 높은 처리량을 기대하도록 구성되었다. 또한 소프트웨어 엔지니어링 및 에이전트 행위에 민감한 태스크를 위해 RL 기반 복구를 거쳐 도메인 특화 성능을 확보했다.75.3B total / 9.3B activeup to 1M tokens (Hugging Face default config: 256k) 컨텍스트openmdw-1.1

이 모델은 Nemotron-3-Super에서 출발해 Iterative Puzzle 단계별 압축과 지식증류·강화학습 복구·사후 양자화를 결합하여 120.7B/12.8B에서 75.3B/9.3B(활성)로 파라미터를 줄이면서 실서비스용 추론 처리량을 우선 최적화한 배포 지향 LLM이다. 하이브리드 Latent MoE(Mamba+MoE+Attention) 아키텍처와 Multi-Token Prediction을 유지하여 추론 시 서버 처리량과 동시성에서 유의한 이득을 얻도록 설계되었다. NVFP4 체크포인트는 Blackwell 계열 GPU에서의 서빙을 목표로 하고 FP8 체크포인트는 Hopper 계열을 겨냥한 배포 옵션을 제공한다.

학습 방식 · 모델은 Nemotron-3-Super-120B-A12B를 출발점으로 Iterative Puzzle 후처리 압축을 적용한 뒤 단계별 지식증류로 품질을 회복했다. 압축 단계마다 MoE 가중치와 Mamba SSM 상태를 축소한 후 각각 24B, 43.2B, 52.8B 토큰 단위의 지식증류로 복구했고 최종 장기 문맥 복구에서는 128Ki 및 512Ki 시퀀스 길이로 최대 100B 토큰을 사용했다. 이후 소프트웨어 엔지니어링·에이전트 태스크 중심의 RL 복구와 사후 양자화(NVFP4/FP8)를 통해 배포 성능을 확보했다.

TL;DR

이 모델은 Nemotron-3-Super-120B를 출발점으로 Iterative Puzzle이라는 단계적 압축·회복 파이프라인을 적용해 총 파라미터와 활성 파라미터를 120.7B/12.8B에서 약 75.3B/9.3B로 축소한 배포 최적화형 LLM이다. 설계는 Latent MoE(Mamba+MoE+Attention) 아키텍처와 Multi-Token Prediction을 유지하면서 층별 비균질 MoE 채널·활성 전문가 수 감소와 Mamba SSM 상태 축소를 통해 디코드 효율을 높였고, 각 압축 단계 뒤에 24B·43.2B·52.8B 토큰 단위의 지식증류와 후속 RL 복구로 성능을 회복했다. 그 결과 동일 사용자 처리량 제약에서 8×B200 단일 노드 기준 약 2배 처리량을 보고했고 1M 토큰 환경에서 H100 단일 인스턴스의 동시 요청을 1에서 8로 늘리는 개선이 나타났으며 NVFP4/FP8 양자화 옵션으로 Blackwell·Hopper 계열 GPU에 맞춘 배포를 지원한다. 다만 일부 벤치마크에서 BF16 대비 소폭의 성능 차이가 존재하므로 품질·지연·인프라 비용의 트레이드오프를 운영 환경에서 검증해야 한다.

핵심 포인트

  • Iterative Puzzle의 단계적 프루닝·지식증류·RL 복구를 결합해 압축 후 품질 회복을 체계화한 점이 차별화 요소이다.
  • 층별 비균질 MoE 채널과 활성 전문가 수 조절을 통해 민감한 층에는 용량을 보존하면서 전체 활성 파라미터를 크게 줄인 구조적 설계가 적용되었다.
  • Mamba SSM 상태 축소와 MTP의 결합으로 긴 문맥 디코드와 speculative decoding에서 서빙 처리량을 동시에 개선하도록 설계되었다.
  • 하드웨어별 포맷(FP8 for Hopper, NVFP4 for Blackwell)을 제공해 실제 인프라에서의 배포 효율을 높였다는 점이 실무적 차별점이다.

벤치마크

벤치마크지표비교
MMLU-Proaccuracy82.2vs Nemotron-Labs-3-Puzzle-75B-A9B-BF16: 82.4
AIME25 (no tools)accuracy89.9vs BF16: 89.7
HMMT Feb25 (no tools)accuracy92.9vs BF16: 93.4
LiveCodeBench (v5 2024-07↔2024-12)accuracy79.9vs BF16: 81.1
RULER @ 1Maccuracy93.2vs BF16: 92.2
MMLU-ProX (avg over langs)accuracy76.5vs BF16: 77.5
WMT24++ (en→xx)accuracy85.1vs BF16: 85.2

119

LIKES

41.8k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.