본문으로 건너뛰기

NVIDIA, 하이브리드 Mamba-Transformer 구조의 Nemotron 3 Nano 4B 공개

NVIDIA가 Mamba와 Transformer를 결합한 4B 규모의 Nemotron 3 Nano 4B를 출시하여, 엣지 기기에서 최상위권의 명령 이행 및 도구 사용 성능을 구현했다.

섹션별 상세

Nemotron 3 Nano 4B는 Mamba의 효율적인 시퀀스 처리 능력과 Transformer의 강력한 주의 집중 메커니즘을 결합했다. 이를 통해 긴 문맥에서도 낮은 연산 비용을 유지하면서 높은 정확도를 확보했다.
기존 9B 모델에서 처음부터 학습하는 대신 라우터 기반의 구조적 프루닝과 지식 증류를 결합한 Nemotron Elastic 기술을 사용했다. 라우터는 Mamba 헤드 수, 임베딩 차원, FFN 채널, 레이어 깊이 등 4가지 축을 최적화하여 4B 파라미터 예산 내에서 최적의 성능을 내는 구조를 찾아냈다.
압축 후 정확도 회복을 위해 8K 단기 문맥 증류와 49K 장기 문맥 확장 증류 과정을 거쳤다. 이후 Megatron-LM을 이용한 SFT와 NeMo-RL을 활용한 3단계 강화학습을 통해 에이전트로서의 능력을 극대화했다.
FP8 및 Q4_K_M GGUF 형식을 지원하며 ModelOpt 라이브러리를 통한 사후 양자화(PTQ)를 적용했다. 정확도 유지에 핵심적인 Self-attention 레이어와 특정 Mamba 레이어를 BF16으로 유지하는 선택적 양자화 전략을 통해 성능 하락 없이 처리량을 최대 1.8배 향상했다.
Jetson Orin Nano 8GB 환경에서 Llama.cpp를 사용할 때 초당 18개 토큰을 생성하며 이는 상위 모델인 9B v2 대비 2배 높은 처리량이다. RTX 4070 GPU에서도 동급 모델 중 가장 낮은 VRAM 점유율과 빠른 첫 토큰 생성 시간(TTFT)을 기록했다.

용어 해설

네모트론 엘라스틱(Nemotron Elastic)
NVIDIA가 개발한 모델 압축 프레임워크로, 라우터를 통해 최적의 프루닝 축을 결정하고 지식 증류를 동시에 수행하여 효율적인 소형 모델을 생성하는 기술이다.
맘바(Mamba)
상태 공간 모델(SSM) 기반의 아키텍처로, Transformer의 어텐션 메커니즘과 달리 시퀀스 길이에 따라 선형적으로 연산량이 증가하여 추론 효율이 매우 높다.
구조적 프루닝(Structured Pruning)
가중치 행렬의 개별 요소가 아닌 헤드, 채널, 레이어와 같은 구조적 단위를 제거하는 기법으로, 하드웨어 가속기에서 실제 추론 속도 향상을 즉각적으로 얻을 수 있다.
선택적 양자화(Selective Quantization)
모델의 모든 레이어를 동일한 비트로 양자화하지 않고, 오차에 민감한 특정 레이어는 고정밀도(BF16 등)로 유지하여 정확도 손실을 최소화하는 전략이다.
첫 토큰 생성 시간(TTFT)
Time To First Token의 약자로, 사용자의 입력 후 첫 번째 토큰이 출력될 때까지 걸리는 시간을 의미하며 실시간 상호작용 성능의 핵심 지표이다.

기술

  • Nemotron 3 Nano 4B
  • Mamba
  • Transformer
  • Nemotron Elastic
  • Megatron-LM
  • NeMo-RL
  • ModelOpt
  • Llama.cpp

활용 사례

  • 로컬 대화형 에이전트
  • 게임 내 AI 에이전트
  • 임베디드 로보틱스
  • 개인정보 보호 중심 챗봇
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 18.수집 2026. 03. 18.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.