nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16
텍스트 생성 및 대화형 AI120B (Active 12B)other
Latent-MoE와 Multi-Token Prediction 기술을 적용하여 효율성과 성능을 극대화한 NVIDIA의 차세대 대규모 언어 모델이다.
학습 방식 · Nemotron-3 기반 Latent-MoE 아키텍처와 Multi-Token Prediction 기법 적용, NVIDIA 전용 데이터셋으로 사전 학습 및 SFT/DPO 수행
핵심 포인트
- 120B급 모델의 성능을 12B급 연산 비용으로 구현
- NVIDIA 하드웨어 가속 및 TensorRT-LLM 최적화에 특화
- MTP 적용으로 기존 MoE 모델 대비 높은 토큰 처리 효율 확보
- 다국어 텍스트 생성 및 번역
297
LIKES
125.5k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.