본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16

텍스트 생성 및 대화형 AI120B (Active 12B)other

Latent-MoE와 Multi-Token Prediction 기술을 적용하여 효율성과 성능을 극대화한 NVIDIA의 차세대 대규모 언어 모델이다.

학습 방식 · Nemotron-3 기반 Latent-MoE 아키텍처와 Multi-Token Prediction 기법 적용, NVIDIA 전용 데이터셋으로 사전 학습 및 SFT/DPO 수행

핵심 포인트

  • 120B급 모델의 성능을 12B급 연산 비용으로 구현
  • NVIDIA 하드웨어 가속 및 TensorRT-LLM 최적화에 특화
  • MTP 적용으로 기존 MoE 모델 대비 높은 토큰 처리 효율 확보
  • 다국어 텍스트 생성 및 번역

297

LIKES

125.5k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.