0.24초의 응답 속도, 끼어들기까지 완벽하게 대응하는 실시간 음성 AI 혁신
실시간 음성-음성 대화 (Audio-to-Audio)7Bnvidia-open-model-license
음성과 텍스트 프롬프트로 페르소나를 제어하며 실시간으로 상호작용하는 7B 규모의 음성-음성 모델입니다.
핵심 역량
- 실시간 풀 듀플렉스(Full-Duplex) 대화 지원
- 음성 프롬프트를 통한 제로샷 목소리 복제 및 스타일 제어
- 텍스트 프롬프트 기반의 정교한 페르소나 및 역할 설정
- 24kHz 샘플 레이트의 고품질 오디오 스트리밍
- 사용자 끼어들기(Barge-in) 시 0.24초의 초저지연 반응
- Mimi 코덱을 활용한 효율적인 오디오 토큰 생성
알아두면 좋은 것
- FullDuplexBench 벤치마크에서 타 오픈소스 및 상용 모델 대비 우수한 대화 역동성 기록
- 사용자 끼어들기(User Interruption) 지연 시간 0.24초로 업계 최고 수준의 반응성 확보
- NVIDIA A100/H100 GPU 및 PyTorch 환경에 최적화된 추론 성능 제공
- 영어(EN) 음성 및 텍스트 데이터로 학습되어 높은 언어 이해도 보유
2.4k
Likes
482.4k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.