본문으로 건너뛰기

FireRedAudio와 FireRedTTS3의 통합 음성 모델

FireRedAudio와 FireRedTTS3가 장시간 음성 이해부터 다국어 복제·자연어 편집까지 통합합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

FireRedAudio는 9B-parameter LLM을 공유 backbone으로 사용하면서 Audio Encoder와 RedAE-Patch 경로를 분리해 음성 이해와 생성을 처리하는 통합 음성 언어 모델입니다. ASR, 일반·세부 음성 이해, zero-shot TTS, Instruct TTS, 음성 편집을 한 모델에 결합하고 최대 1시간 녹음의 내용과 시간 위치를 연결합니다. FireRedTTS3는 24개 언어와 21개 중국어 방언의 zero-shot voice cloning을 지원하며, 평가에서 평균 WER/CER 3.754%와 3.04%, 화자 유사도 84.8%와 78.8%를 기록했습니다. Instruct 변형은 참조 음성 없이 자연어로 음성을 설계하고 의미·음향 특성을 편집합니다.

실용적 조언

  • 음성 이해와 음성 생성을 한 시스템에서 시험하려면 FireRedAudio의 HuggingFace 모델과 Demo를 먼저 확인할 수 있습니다. 최대 1시간 녹음의 시간 정렬, 내용 검색, grounded summary 같은 기능을 평가할 때 입력 길이와 시간 위치 정확도를 함께 측정하는 방식이 적합합니다.
  • 자연어 기반 음성 설계와 편집을 확인하려면 FireRedTTS3-Instruct Demo를 사용할 수 있습니다. 참조 음성 없이 만든 음성의 화자 특성, 의미 편집의 정확성, 속도·음높이·음량 변경 결과를 분리해 비교하면 기능별 차이를 확인하기 쉽습니다.

섹션별 상세

FireRedAudio는 이해와 생성을 서로 다른 연속 표현 경로로 분리하면서 9B-parameter LLM backbone을 공유하는 구조를 사용합니다. Audio Encoder가 ASR과 일반·세부 음성 이해를 맡고, RedAE-Patch 경로가 음성 합성을 담당해 한 모델 안에서 기능별 표현의 충돌을 줄이는 방식입니다. 게시글은 이 모델이 MMAU, MMSU, Seed-TTS-Eval, InstructTTSEval, Ming-Freeform-Audio-Edit에서 경쟁력 있거나 선도적인 결과를 냈다고 밝히며, 최대 1시간 녹음의 내용과 시간 위치를 함께 처리하는 용도를 강조합니다.
FireRedAudio가 장시간 음성 입력, 다국어 음성 인식, 일반 음성 이해, 초 단위 위치 파악, 음성 편집, 지시 기반 합성, zero-shot 음성 합성을 지원한다는 구성을 파형과 아이콘으로 나타낸 인포그래픽입니다.
Infographic중앙의 FireRedAudio 파형을 기준으로 상단에는 1시간 미만 장음성 입력, 다국어 음성 인식, 일반 음성 이해가 배치되고 하단에는 초 단위 위치 파악, 음성 편집, 지시 제어 합성, zero-shot 음성 합성이 연결되어 있습니다. 게시글의 핵심인 하나의 음성 언어 모델이 이해·검색·편집·생성을 함께 처리한다는 기능 범위를 시각적으로 묶은 자료이며, 세부 성능 수치나 내부 경로는 담고 있지 않습니다.
FireRedAudio의 입력·이해·시간 정렬·합성·편집 기능을 여러 음성 파형과 연결선으로 요약한 인포그래픽입니다.
Infographic이미지 1과 동일한 도식으로, 장시간 음성을 입력받아 다국어 인식과 일반 음성 이해를 수행하고 시간 위치를 찾은 뒤 음성을 편집하거나 합성하는 흐름을 표현합니다. 본문에 적힌 FireRedAudio의 통합 음성 처리 범위와 직접 연결되지만, 9B-parameter LLM이나 Decoupled Continuous Representations 같은 구현 정보는 이미지에서 확인되지 않습니다.
FireRedTTS3는 음성 생성과 편집을 semantically enriched continuous speech representations 위에서 통합한 두 가지 변형으로 구성됩니다. FireRedTTS3-Base는 24개 언어와 21개 중국어 방언에서 zero-shot voice cloning을 수행하고, FireRedTTS3-Instruct는 참조 음성 없이 자연어로 음성을 설계하거나 발화 내용과 속도·음높이·음량을 편집합니다. 게시글의 평가 수치는 MiniMax-MLS-Test에서 평균 WER/CER 3.754%와 화자 유사도 84.8%, Seed-TTS-eval에서 cloning WER/CER 3.04%와 유사도 78.8%입니다.
게시자는 FireRedAudio와 FireRedTTS3를 개별 모델이 아니라 음성·영상·이미지 생성과 인식 프로젝트를 잇는 공개 생태계의 일부로 묶어 소개합니다. 같은 프로젝트 페이지에는 FireRedASR, FireRedTTS-1S, FireRedChat, FireRedTTS-2와 OpenStoryline, InstantID, DynamicPose 등이 함께 나열되어 있어 음성 인식부터 대화형 음성, 장문 음성 생성까지 이어지는 연구 방향을 확인할 수 있습니다. 다만 각 주변 프로젝트의 성능 수치나 구현 세부사항은 이 게시글에 별도로 제시되지 않았습니다.

용어 해설

분리형 연속 표현(Decoupled Continuous Representations)
이해와 생성을 하나의 표현 공간에 억지로 통합하지 않고, Audio Encoder는 음성 이해를 맡고 RedAE 경로는 음성 생성을 맡도록 분리하는 구조입니다. 두 경로는 서로 다른 표현을 유지하면서도 동일한 언어·추론 backbone을 공유합니다.
제로샷 음성 합성(Zero-shot TTS)
참조 음성으로 별도 학습이나 Fine-tuning을 거치지 않고, 짧은 음성 샘플의 화자 특성을 바탕으로 새로운 문장을 합성하는 방식입니다. FireRedTTS3-Base는 24개 언어와 21개 중국어 방언에서 음성 복제를 지원합니다.
음성 디자인(Voice Design)
참조 오디오 없이 성별, 나이, 음색, 감정, 속도, 억양 같은 자연어 조건을 입력해 새로운 음성을 만드는 기능입니다. FireRedTTS3-Instruct는 합성 전에 텍스트 계획 단계를 거쳐 조건을 반영합니다.
시간 위치 정렬(Temporal Grounding)
녹음 속 특정 내용이 발생한 시간 위치를 음성 내용과 연결하는 처리 방식입니다. FireRedAudio는 최대 1시간 길이의 녹음을 시간표 구조로 정리하고, 시간으로 내용을 찾거나 내용으로 시간을 찾는 작업을 지원합니다.
음향 편집(Acoustic Editing)
음성의 의미를 바꾸지 않고 속도, 음높이, 음량 같은 음향 특성을 조정하는 편집 방식입니다. FireRedTTS3-Instruct는 자연어 지시를 받아 의미 편집과 음향 편집을 하나의 모델에서 처리합니다.

언급된 도구

HuggingFace추천링크

FireRedAudio와 FireRedTTS3의 모델 파일과 사용 정보를 제공하는 배포 경로입니다.

GitHub추천링크

FireRedAudio와 FireRedTTS3의 소스 코드 및 프로젝트 구현을 확인하는 경로입니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.