본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16

블록 단위 마스크 디퓨전과 AR 병행을 통한 고속 텍스트 생성(text-generation) 및 mock-AR/AR 호환 생성 모드 지원~60B total (30B per tower, released checkpoint 포함)128K 컨텍스트nvidia-open-model-license

Nemotron-Labs TwoTower는 frozen AR 문맥 타워와 trainable 디노이저 타워로 구성된 블록 단위 mask-diffusion 생성 방식을 사용해 AR 대비 98.7% 품질을 유지하면서 최대 2.42배 생성 처리량을 달성한 모델이다.

학습 방식 · 사전학습된 Nemotron-3-Nano 30B A3B 백본을 초기화로 사용해 AR/context 타워는 고정하고 diffusion/denoiser 타워만 약 2.1T 토큰으로 마스크-디퓨전 목적함수로 추가 학습해 블록 복원 능력을 적응시켰다.

TL;DR

Nemotron-Labs TwoTower는 사전학습된 Nemotron-3-Nano 30B A3B 백본을 기반으로 AR 문맥 타워를 고정하고 trainable diffusion/denoiser 타워를 추가해 블록 단위 mask-diffusion 생성을 수행하는 모델이다. 디노이저는 블록 내 양방향 self-attention과 레이어 정렬 교차어텐션, 문맥 시드된 Mamba-2 상태를 사용해 마스크된 토큰을 반복적으로 복원하며 adaLN-single로 시간 조건화를 적용해 단계별 거동을 조절한다. 기본 운영점(block_size=16, γ=0.8, BF16, 2×H100)에서 집계 품질은 AR 기준의 98.7%를 유지하면서 wall-clock 생성 처리량은 2.42배에 도달해 속도와 품질 사이의 유의미한 트레이드오프를 제공한다. 이 설계는 프롬프트를 한 번만 인코딩해 블록별 반복에서 중복 계산을 줄이며 디노이저만 적응시키는 접근으로 대규모 생성 워크로드에서 처리량 개선을 노리는 응용에 적합하다. 한편 신뢰도 임계값과 블록 크기의 조정은 품질과 속도의 균형을 직접 좌우하므로 사용자는 운영점 튜닝을 통해 요구 성능에 맞춰야 한다.

핵심 포인트

  • AR 문맥 타워는 고정한 채로 디노이저 타워만 학습시키는 설계로 문맥 재사용을 통해 반복 생성의 계산 비용을 절감한다.
  • 블록 단위 mask-diffusion과 신뢰도 기반 언마스킹(confidence unmasking)을 결합해 반복당 다수 토큰을 확정함으로써 AR 대비 실시간 처리량을 크게 높였다.
  • 디노이저의 레이어 정렬 교차어텐션과 문맥 기반 Mamba-2 시딩을 통해 레이어별 중간 표현을 직접 활용하는 점이 일반적인 단일타워 디퓨전 접근과 구별된다.
  • 기본 운영점에서 AR 기반 백본의 집계 품질의 98.7%를 유지하면서 전체 생성의 wall-clock 처리량을 2.42배까지 향상한 점이 검증되어 실사용 처리량 이점을 제공한다.

벤치마크

벤치마크지표비교
Aggregate Quality Retainedquality retained (%)98.7%vs AR baseline (Nemotron-3-Nano-30B-A3B Base)
Generation Throughputrelative throughput (× AR baseline)2.42×vs AR baseline
MMLU (5-shot, acc)accuracyMMLU 78.24 (diffusion) vs 78.56 (AR baseline)
HumanEval (0-shot)pass rate / accuracy75.58 (diffusion) vs 79.27 (AR baseline)

이미지 분석

막대 그래프는 Nemotron-3-Nano AR 기준 모델과 Nemotron-Labs-TwoTower diffusion 모델의 과업별 정확도 비교와 별도의 처리량 비교를 병행해 제시하고 있다.
그래프의 과업별 정확도 막대는 일반 지식, 코드, 수학, 다국어, 상식 등 여러 범주에서 두 모델의 점수를 나란히 비교하며 일부 과업에서는 diffusion이 근접하거나 약간 낮은 성능을 보이고 일부 과업에서는 동등하거나 소폭 높은 성능을 보인다. 우측의 처리량 비교는 AR 기준을 1.0으로 두고 diffusion이 2.42로 표시되어 wall-clock 생성 처리량에서 약 2.4배 향상이 관측된다는 점을 시각적으로 확인할 수 있다. 그래프는 전반적으로 TwoTower 디퓨전이 처리량 측면에서 명확한 이점을 제공하면서도 종합 품질은 AR 대비 약간의 손실만 있는 운영점으로 설정되어 있음을 보여준다.

135

LIKES

10.9k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.