600M 멀티링구얼 스트리밍 ASR, 40개 로케일
Nemotron 3.5 ASR는 cache-aware FastConformer-RNNT 아키텍처를 사용한 600M 파라미터의 멀티링구얼 스트리밍 ASR로 40개 로케일을 저지연으로 전사하고 높은 동시처리 성능을 제공한다.
TL;DR
Nemotron 3.5 ASR는 NVIDIA가 배포한 600M 파라미터의 멀티링구얼 스트리밍 음성인식 모델로, cache-aware FastConformer 인코더와 RNN-T 디코더를 결합해 낮은 지연과 높은 동시처리량을 목표로 설계되었다. 언어-ID 프롬프트를 특징 축에 브로드캐스트하여 단일 체크포인트로 40개 로케일을 처리하며 target_lang=auto 모드에서 발화 언어 태그를 자동으로 출력한다. 모든 인코더 레이어의 캐시를 재사용하는 비중첩 처리와 청크 크기(80ms~1.12s) 조절로 동일 H100에서의 동시 스트림 처리량이 크게 향상되며 README 측정치에서는 80ms에서 약 17×, 1.12s에서 약 6×의 처리량 우위를 보고했다. 운영 관점에서는 문장 부호·대소문자 포함 출력과 NeMo/Transformers 양쪽의 실행 예제가 제공되어 배포와 파인튜닝 통합이 용이하지만 일부 로케일은 추가 도메인 적응이 필요하고 텍스트 정규화 차이로 인해 보고된 WER이 다소 보수적으로 계상되었을 가능성이 존재한다.
핵심 역량
- 멀티링구얼 스트리밍 전사 기능을 제공하며 단일 체크포인트로 40개 언어 로케일을 처리할 수 있다. 모델은 언어 프롬프트를 입력으로 받아 언어별 전사를 유도할 수 있고, 자동 감지 모드에서는 각 발화 말미에 언어 태그를 추가한다. 출력에는 문장 부호와 대소문자 표기가 포함되어 후처리 비용을 줄인다.
- 저지연 스트리밍 처리가 가능하도록 설계되어 80ms에서 1.12s까지 여러 청크 크기를 지원한다. 작은 청크는 응답성을 우선하고 큰 청크는 정확도를 향상시키는 지연·정확도 트레이드오프를 사용자가 런타임에 선택할 수 있다. att_context_size 파라미터로 좌우 컨텍스트를 제어해 청크 크기를 동적으로 설정할 수 있다.
- 캐시 재사용을 통해 인코더의 중복 계산을 제거하므로 동일 GPU에서 더 많은 동시 스트림을 처리할 수 있다. README의 측정 결과에 따르면 Nemotron은 Parakeet RNNT 1.1B 대비 같은 H100에서 훨씬 높은 동시 스트림을 유지했다. 이 효율성은 운영 비용과 인프라 효율화에 직접적인 이익을 제공한다.
- NeMo 및 Transformers 양쪽 인터페이스에서 사용 가능하며 NeMo 예제 스크립트로 cache-aware streaming 추론을 바로 실행할 수 있다. Transformers 인터페이스에서는 processor의 language 인자를 통해 언어를 지정하거나 auto 모드를 사용할 수 있다. 설치와 실행을 위한 구체적 명령과 스트리밍 예제가 README에 포함되어 있다.
강점
- 동일 H100에서 Parakeet 1.1B 대비 높은 동시처리량을 유지하는 운영 효율성이 공개 성능 자료로 입증되어 있다. 예컨대 80ms 설정에서 Nemotron은 240개의 동시 스트림을 유지한 반면 Parakeet은 14개만 유지했다는 수치가 README에 포함되어 있다. 이 수치는 캐시 재사용에 따른 중복 연산 제거가 실사용 비용 절감으로 이어짐을 보여준다.
- 단일 600M 체크포인트로 40개 로케일을 다루는 멀티링구얼 전사 기능을 제공한다는 점이 실용적 이점이다. 언어-ID 프롬프트와 자동 감지 모드로 혼합 언어 트래픽에서 언어 라벨을 자동으로 부여할 수 있어 전처리 파이프라인 단순화가 가능하다. 출력에 문장 부호와 대소문자가 포함되어 후속 파이프라인의 복잡도가 낮아진다.
- 저지연 스트리밍을 위해 좌우 컨텍스트를 런타임에 조정할 수 있어 다양한 레이턴시-정확도 요구사항을 단일 모델로 커버할 수 있다. att_context_size 매개변수로 프레임 기반의 청크 크기를 설정해 80ms부터 1.12s까지 조절 가능하다. 이 유연성은 음성 에이전트나 대량 배치 처리 등 여러 운영 시나리오에서 유용하다.
훈련 방식
기반은 Nemotron 영어 스트리밍 0.6B 모델이며 멀티링구얼 확장을 위해 대규모 공개·사내 데이터의 동적 블렌드를 사용해 추가 학습했다. 라벨링에는 인간 라벨과 앙상블 기반의 합성 라벨이 혼합되었고, 문장 부호·대소문자 표기는 Qwen3-32B를 통해 생성된 후 학습에 반영되었다. 파인튜닝을 통해 적응 준비 상태인 일부 로케일은 도메인 데이터로 추가 학습해 전사 품질을 높이도록 설계되었다.
알아두면 좋은 것
- 라이선스는 OpenMDW 1.1(openmdw-1.1)로 명시되어 있고 상업적 사용을 염두에 둔 배포 정책을 갖고 있다. 학습 데이터는 공개 데이터와 NVIDIA 내부의 독점 데이터가 혼합된 동적 블렌드로 구성되며, 데이터 정규화가 문장 부호와 대소문자 표기를 포함하도록 처리되었다. 합성 라벨 생성에는 여러 ASR 앙상블과 Qwen3-32B를 사용해 문장 부호를 생성한 점이 명시되어 있다.
- 모델은 Transcription-ready, Broad-coverage, Adaptation-ready의 3개 티어로 40개 로케일을 분류하여 제공한다. 상위 19개 로케일은 바로 전사 가능한 상태이며 나머지 로케일은 도메인 파인튜닝으로 완전 전사를 활성화해야 한다. 이 티어링은 제품 배포 시 기본 품질 기대치와 추가 적응 요구 사항을 명확히 한다.
- 구현 관점에서 모든 인코더 self-attention 및 convolution 레이어의 캐시를 유지하는 캐시-어웨어 설계가 핵심이다. 이 설계는 각 청크를 비중첩 방식으로 처리하여 중복 연산을 제거하고, 그 결과 동일한 하드웨어에서 더 많은 동시 스트림을 처리할 수 있게 한다. Throughput 비교 그래프는 동일 H100에서의 동시 스트림 수치 차이를 근거로 효율성을 수치화했다.
- FLEURS 등 다수의 다국어 벤치마크로 평가했고, 청크 크기 증가에 따라 WER이 일관되게 감소하는 경향이 보고되었다. 일본어·한국어 등 일부 언어는 CER로 평가된 점이 표준 관행과 일치한다. 성능 수치는 텍스트 정규화 과정의 잔여 불일치로 인해 일부 과대계상 가능성이 있음을 README에서 명시했다.
기술적 특징
- 캐시-어웨어 FastConformer 인코더는 모든 self-attention과 convolution 레이어에서 이전 활성화를 보관하여 다음 청크 처리 시 재사용한다. 이로 인해 기존의 buffered streaming에서 발생하는 중복 연산이 제거되어 동일한 하드웨어에서 더 많은 동시 스트림을 유지할 수 있게 된다. Nemotron은 이 접근을 통해 각 프레임을 비중첩 방식으로 처리하도록 설계되었다.
- 언어 조건화는 128차원 one-hot 언어 벡터를 시간 축으로 브로드캐스트한 뒤 인코더 출력과 특징 축에서 연결(concatenation)하고 프로젝션 레이어로 매핑하는 방식으로 구현되었다. 이 파이프라인은 단일 모델이 여러 로케일을 지원하면서도 언어별 전사 성향을 유지하도록 한다. 자동 감지 모드에서는 모델이 발화 언어를 판별해 출력 말미에 언어 태그를 추가한다.
- 인코더 구성은 24개 레이어의 FastConformer이며 디코더는 RNN-T 구조를 사용한다. 이 결합은 스트리밍 환경에서 국소적 시간-주파수 특징과 시퀀스 정렬 특성을 모두 확보해 실시간 토큰 생성을 가능하게 한다. 전체 모델은 약 600M 파라미터로 설계되어 파라미터 대비 운영 효율을 우선시했다.
- 청크 크기와 att_context_size 매핑을 통해 런타임에서 레이턴시와 정확도 사이의 운영 포인트를 선택할 수 있다. 제공되는 청크 옵션(80ms~1.12s)은 작은 지연이 필요한 음성 에이전트와 높은 정확도가 필요한 배치 전사 모두를 지원한다. 각 청크는 비중첩으로 처리되므로 우측 컨텍스트만 필요에 따라 추가해 지연을 제어한다.
- 학습 데이터 파이프라인은 공개 및 독점 데이터의 동적 블렌드를 사용하고, 합성 라벨 생성 과정에 앙상블 ASR 모델과 대형 LLM을 도입해 문장 부호를 생성했다. 이러한 데이터 조합은 여러 언어·악조건에서의 강건성을 확보하는 데 기여했다는 표기가 README에 포함되어 있다. 데이터 규모는 문서에서 '10,000 to 1 Million Hours' 범위로 기술되어 있다.
차별점
- 모든 인코더 레이어에 대한 캐시-어웨어 스트리밍 설계로 중복 연산을 제거하여 동시처리량을 극대화한 점이 차별화 요소이다. 이 접근은 기존의 buffered 방식과 달리 동일한 하드웨어에서 수배에서 수십배의 병렬 스트림을 유지하게 해 운영 비용을 절감한다. README의 H100 측정치는 이 효율성을 수치로 뒷받침한다.
- 언어-ID 프롬프트를 특징 축에 브로드캐스트하여 단일 체크포인트로 40개 로케일을 지원하는 멀티링구얼 조건화 설계가 특징이다. 이 설계는 별도의 외부 언어 식별 컴포넌트 없이도 혼합 언어 발화를 처리하고 자동 태깅을 제공할 수 있다. 결과적으로 다국어 파이프라인 통합 비용이 낮아진다.
- 600M이라는 비교적 작은 파라미터 수로 고효율을 달성하도록 설계되어 파라미터 대비 처리량 우위가 존재한다. Nemotron은 0.6B 모델 크기임에도 읽기 준비된 출력(문장 부호·대소문자)을 제공하므로 후처리 단계가 줄어든다. 이 조합은 엣지에서의 배포 또는 대규모 서비스 운영에서 실용적 이점을 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| FLEURS (English) 1.12s LangID | WER | 7.91 | — |
| FLEURS (Spanish) 1.12s LangID | WER | 4.11 | — |
| FLEURS (French) 1.12s LangID | WER | 9.03 | — |
| FLEURS (Italian) 1.12s LangID | WER | 4.25 | — |
| FLEURS (Portuguese) 1.12s LangID | WER | 5.48 | — |
| FLEURS (German) 1.12s LangID | WER | 8.31 | — |
| FLEURS (Hindi) 1.12s LangID | WER | 6.81 | — |
| FLEURS (Korean) 1.12s LangID | CER | 7.12 | — |
이미지 분석




960
Likes
960.5k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.