섹션별 상세
기존 다국어 ASR은 언어별 모델을 개별 배포하거나 후처리 모델을 추가해야 하는 비효율이 존재한다. Nemotron 3.5 ASR은 단일 모델로 40개 언어를 처리하고 구두점과 대문자를 기본 제공하여 이러한 파이프라인 복잡성을 제거한다.
모델은 Cache-Aware FastConformer-RNNT 아키텍처를 사용하여 오디오 프레임을 중복 계산 없이 한 번만 처리한다. 이를 통해 스트리밍 환경에서 연산 효율을 높이고 엔드투엔드 지연 시간을 획기적으로 낮췄다.
python
python ${NEMO_ROOT}/examples/asr/asr_cache_aware_streaming/speech_to_text_cache_aware_streaming_infer.py \
model_path=${MODEL_PATH} \
dataset_manifest=${MANIFEST_PATH} \
output_path=${OUTPUT_FOLDER} \
target_lang=es-ES \
att_context_size="[56,3]" \
strip_lang_tags=trueNemotron 3.5 ASR 모델을 사용하여 특정 언어(스페인어)로 음성을 텍스트로 변환하는 추론 실행 예시

인퍼런스 시점에 att_context_size 설정을 통해 지연 시간과 정확도 사이의 운영 지점을 선택할 수 있다. 80ms의 초저지연 모드부터 1.12초의 고정밀 모드까지 동일 체크포인트로 대응 가능하다.
파인튜닝을 통해 특정 도메인, 억양, 혹은 데이터가 부족한 언어에 대한 성능을 개선할 수 있다. 그리스어와 불가리아어 대상 실험에서 파인튜닝 후 단어 오류율(WER)이 각각 32%, 31% 감소하는 성과를 보였다.
용어 해설
- 자동 음성 인식(ASR)
- — Automatic Speech Recognition의 약자로, 음성 신호를 텍스트로 변환하는 기술이다. 실시간 스트리밍 환경에서는 지연 시간과 정확도 사이의 균형이 핵심 성능 지표로 작용한다.
- 패스트컨포머(FastConformer)
- — Conformer 아키텍처를 효율적으로 개선한 모델 구조로, 선형적으로 확장 가능한 어텐션 메커니즘을 사용하여 연산 효율을 높인 것이 특징이다.
- RNN 트랜스듀서(RNNT)
- — Recurrent Neural Network Transducer의 약자로, 오디오가 입력되는 즉시 프레임 단위로 텍스트를 출력하는 스트리밍 음성 인식에 최적화된 디코더 구조이다.
- 단어 오류율(WER)
- — Word Error Rate의 약자로, 음성 인식 모델의 성능을 측정하는 지표이다. 실제 전사된 텍스트와 모델이 출력한 텍스트 간의 차이를 계산하며, 낮을수록 정확도가 높음을 의미한다.
기술
- NVIDIA NeMo
- FastConformer
- RNNT
활용 사례
- 실시간 다국어 회의 자막
- 콜센터 분석
- 음성 에이전트
- 온디바이스 음성 인식
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 04.수집 2026. 06. 04.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.