nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
Nemotron Nano v2 9B 기반의 11B 통합 실시간 음성 대화 모델
학습 방식 · 모델은 음성과 텍스트를 함께 학습하는 멀티모달 방식으로 구축되었고, 약 550k 시간의 오디오 데이터와 대규모 텍스트 코퍼스를 혼합하여 학습했습니다. Fast Conformer 스트리밍 음성 인코더로 입력 오디오를 오디오 토큰으로 인코딩하고, Nemotron Nano v2 9B LLM 백본이 인코더 출력을 받아 텍스트 토큰을 예측하며, 예측된 텍스트 토큰은 TTS 디코더로 전달되어 에이전트 음성 코드를 생성합니다. 또한 도구 호출 스크립트를 출력하는 별도 채널을 학습 데이터와 손실로 병렬 구성해 실시간 도구 호출 시나리오를 지원하는 통합 학습 파이프라인을 구성했습니다.
TL;DR
NemotronLabs VoiceChat은 Nemotron Nano v2 9B를 백본으로 통합한 11B 규모의 엔드투엔드 실시간 전이중 음성 대화 모델로, Fast Conformer 스트리밍 인코더→LLM 텍스트 예측→TTS/코덱 디코더로 이어지는 통합 파이프라인을 사용합니다. 이 구조는 별도 ASR·LLM·TTS 연쇄를 제거해 엔드투엔드 지연을 줄이며, 바지인 처리와 자연스러운 턴테이킹을 지원하고 도구 호출을 별도 채널로 처리해 도구 실행 중에도 대화 흐름을 유지하도록 설계되어 있습니다. VoiceBench와 Full-Duplex-Bench에서 상위권(#2)을 기록했고 턴테이킹 지연은 약 448–450 ms로 보고되었으므로, 실시간 음성 에이전트 연구·프로토타입에 적합하지만 NVIDIA GPU 기반 런타임과 추가 검증이 필요합니다.
핵심 포인트
- NVIDIA NemotronLabs VoiceChat은 11B 규모의 단일 엔드투엔드 아키텍처로 오디오 입력을 바로 처리하여 에이전트 음성을 생성하는 데 집중합니다. Fast Conformer 기반의 스트리밍 음성 인코더가 입력 파형을 오디오 토큰으로 변환하고, Nemotron Nano v2 9B LLM 백본이 이 토큰에서 텍스트 토큰을 예측한 뒤 별도의 TTS/코덱 디코더가 음성 코드를 생성하는 파이프라인을 사용합니다. 이 통합 흐름은 전통적인 ASR→LLM→TTS 연쇄 스택을 대체하여 엔드투엔드 지연을 줄이고 실시간 전이중 상호작용을 가능하게 합니다.
- 모델은 실시간 전이중(full duplex) 대화, 자연스러운 턴테이킹, 사용자 끼어들기(barge-in) 처리와 라이브 도구 호출(function/tool calling)을 지원하도록 설계되었습니다. LLM 출력에서 도구 호출을 별도 채널로 분리하여 도구 호출 스크립트를 생성하고, 각 도구별로 'on-hold' 에이전트 발화 메시지를 정의해 도구 실행 중에도 대화 흐름을 유지할 수 있습니다. 이 설계는 음성 기반 에이전트가 외부 API·도구와 상호작용할 때 사용자 경험의 끊김을 줄이는 목적을 가집니다.
- 공개 벤치마크에서 낮은 지연과 경쟁력 있는 성과를 보이며 VoiceBench와 Full-Duplex-Bench에서 상위권을 기록했습니다. 대표 성능 지표로 평균 턴테이킹 지연 약 448~450 ms, VoiceBench 및 Full-Duplex-Bench에서 오픈 모델 중 #2 순위를 보고하고 있습니다. 다만 README가 명시하는 바와 같이 연구 목적으로 사용하도록 권장되고 배포·운영은 NVIDIA GPU 환경(vLLM, Triton 등)에서 최적화된 런타임을 전제로 합니다.
- 대용량 멀티테이터(음성+텍스트) 학습과 합성 음성 데이터 혼합으로 훈련되어 일반 음성 인식과 TTS 데이터셋을 결합한 실무형 대화 능력을 목표로 합니다. 약 55만 시간 규모의 오디오 학습 데이터와 여러 공개·내부 텍스트·합성 코퍼스가 사용되었고, Nemotron 사전학습·SFT 텍스트 데이터가 학습 파이프라인에 포함되어 있습니다. 이러한 데이터 혼합은 다양한 발화 스타일과 도구 호출 패턴을 커버해 실시간 대화 환경에서의 유연성을 높입니다.
제한사항
- 배포와 실시간 인터랙션은 NVIDIA GPU 기반의 인프라(vLLM, Triton, CUDA 등)를 전제로 최적화되어 있으며, README가 권고하는 하드웨어(A100/H100/H200 등) 없이 동일 성능을 재현하기 어렵습니다. 따라서 GPU 자원이 제한된 환경에서는 레이턴시와 처리량이 README에 보고된 값보다 낮아질 가능성이 있습니다. 배포 전에 사용 사례별 성능·안전성 검증이 필요합니다.
- 도구 호출 관련 평가지표에서 도구 인자 정확도(Argument accuracy)가 44.2%로 제한적인 면이 있고, AU Harness 기반의 도구 호출 평균 성능이 56.1% 수준으로 완전한 생산 환경 신뢰도를 보장하지는 않습니다. 이 때문에 중요한 외부 조작이나 실시간 자동화 작업에 투입하기 전에 추가 검증과 후처리 로직이 요구됩니다. 도구 실패 시 재시도 정책과 사용자 안내 문구 설계가 운영상 핵심 고려사항입니다.
- 모델은 연구 목적으로 제공되며 상용 배포 전 라이선스(openmdw-1.1)와 윤리·보안 검토가 필요합니다. README에 명시된 입력·출력 형식(ASCII-only tool responses, TTS 친화적 문장 등)과 오프라인/인터렉티브 모드의 제약들을 준수해야 하며, 오프라인 함수 호출은 사전 준비된 JSON 응답을 필요로 하므로 실서비스 연동 시 추가 엔지니어링이 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Smooth Turn Taking | TOR / Smoothness | 0.82 | Latency 약 448 ms |
| Turn-taking Latency | Latency | 448 ms | 실시간 전이중 환경에서 약 450 ms 응답시간으로 보고됨 |
| AU Harness BFCL-v3 (tool calling) | Average | 56.1% | 도구 호출 정확도 부문에서 첫 공개 전이중 모델 기능 지원 |
| Full-Duplex-Bench v3 (tool calling) | Tool Selection | 82.5% | Pass@1 33%, argument accuracy 44.2% |
이미지 분석

81
Likes
80
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.