본문으로 건너뛰기

NVIDIA의 오픈소스 LLM, Nemotron 3 Ultra 분석

NVIDIA의 Nemotron 3 Ultra는 MoE와 Mamba-2 아키텍처를 결합하여 효율성과 속도를 극대화한 오픈소스 LLM이다.

챕터별 상세

00:00

Nemotron 3 Ultra 개요

NVIDIA가 Nemotron 3 Ultra를 공개했다. 이 모델은 완전한 오픈소스 모델로 가중치, 연구 논문, 학습 데이터 및 레시피가 모두 공개되었다. 텍스트 전용 모델이며 멀티모달 기능은 포함되지 않았다.
00:17

성능 및 벤치마크

다양한 벤치마크에서 Nemotron 3 Ultra의 성능을 측정했다. 550B 파라미터 규모로, 추론 시 토큰당 약 10%의 파라미터만 활성화하여 계산 효율을 높였다. 벤치마크 결과는 기존 오픈소스 모델들과 경쟁 가능한 수준이다.
00:36

코딩 및 추론 능력

코드 생성 및 디버깅 능력을 테스트했다. 3D 렌더링 장면을 생성하는 자바스크립트 코드를 작성하고, 복잡한 물리 시뮬레이션 로직을 구현했다. 터미널 환경에서 스스로 오류를 수정하고 테스트를 통과하는 능력을 보였다.
javascript
const scene = new Scene();
const white = new Lambertian(new Vec3(0.73, 0.73, 0.73));
const green = new Lambertian(new Vec3(0.65, 0.05, 0.05));
const red = new Lambertian(new Vec3(0.12, 0.45, 0.15));
const light = new DiffuseLight(new Vec3(15, 15, 15));

Nemotron 3 Ultra가 생성한 3D 렌더링 장면의 재질 및 조명 설정 코드

02:27

라이선스 정책

Nemotron 3 Ultra는 OpenMDW 라이선스를 채택했다. 이는 Apache 2.0과 유사하게 상업적 이용과 파생 작업이 가능하며, 모델 가중치와 학습 데이터까지 포함하는 개방성을 보장한다. NVIDIA의 기존 독점 라이선스보다 훨씬 개방적이다.
05:17

아키텍처: MoE와 Mamba-2

모델은 Mixture of Experts(MoE)와 Mamba-2 레이어를 결합한 구조이다. MoE는 전문가 네트워크를 선택적으로 활성화하여 효율을 높이고, Mamba-2는 선형적인 복잡도로 긴 시퀀스를 처리한다. 이를 통해 메모리 사용량을 줄이고 추론 속도를 향상시켰다.

용어 해설

전문가 혼합(MoE)
Mixture of Experts의 약자로, 모델 전체가 아닌 입력 토큰에 따라 필요한 일부 전문가 네트워크만 활성화하는 아키텍처이다. 추론 시 계산 효율성을 극대화한다.
맘바(Mamba)
상태 공간 모델(SSM) 기반의 아키텍처로, Transformer의 어텐션 메커니즘 대신 선형적인 복잡도로 긴 시퀀스를 처리하여 추론 속도와 메모리 효율을 높인다.
NVIDIA FP4(NVFP4)
NVIDIA가 제안한 4비트 부동소수점 데이터 형식이다. 모델 가중치를 4비트로 양자화하여 메모리 사용량을 줄이고 추론 처리량을 향상시킨다.
OpenMDW 라이선스(OpenMDW)
머신러닝 모델 가중치, 학습 데이터, 레시피를 모두 포함하는 오픈소스 배포를 위해 설계된 라이선스이다. Apache 2.0과 유사한 허용적 조건을 제공한다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 15.수집 2026. 06. 15.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.