Tencent가 선보인 텍스트 없는 실시간 음성 대화 모델 Covo-Audio-Chat
오디오-투-오디오 음성 생성
텍스트 변환 없이 음성 입력을 직접 음성 출력으로 처리하여 실시간 대화를 가능하게 하는 Tencent의 오디오-투-오디오 모델이다.
핵심 역량
- 실시간 음성 대화 생성
- 오디오 신호 직접 처리 및 변환
- 영어 및 중국어 다국어 음성 응답
훈련 방식
Audio-to-Audio End-to-End 학습 방식, 영어 및 중국어 음성 코퍼스 활용
알아두면 좋은 것
- Tencent에서 공개한 오디오 전용 대화 모델
- 영어 및 중국어 다국어 환경 지원
- Arxiv 2602.09823 논문 기반 기술 적용
- Safetensors 포맷을 통한 모델 가중치 제공
66
Likes
546
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.