KRAFTON/A.X-K2-Raon-Speech-21B-A3B
한국어 우수성에 초점을 둔 21B급 통합 음성 SL 모델
학습 방식 · 훈련은 먼저 A.X K2 Light 백본을 동결한 상태에서 스피치 모듈 정렬을 수행하고, 이후 텍스트·교차모달 데이터를 섞어 joint multimodal supervised fine-tuning을 진행합니다. 그 다음에는 A.X K2 Light로부터의 텍스트·교차모달 지식 증류(text and cross-modal distillation), 음성 조건 도구 사용을 위한 tool-use fine-tuning, 그리고 감정·화자 특성 강화를 위한 on-policy self-distillation(ParaBridge 스타일)을 적용합니다. 마지막으로 TTS 품질 개선을 위해 Direct Preference Optimization을 활용해 장음·반복·미완료 종결과 같은 실제 생성 결함을 완화하도록 조정했습니다.
TL;DR
A.X K2 Raon-Speech는 A.X K2 Light 20B-A3B MoE 텍스트 백본을 기반으로 AuT 인코더와 Mimi 스타일 코덱을 통합한 21.2B 규모의 엔드투엔드 음성 멀티모달 모델입니다. STT, TTS, SpeechQA, SpokenQA, 도구 호출 등 any-to-any 파이프라인을 단일 체크포인트로 지원하며 스피커 조건화·TTS 연속 생성·패럴링귀스틱 처리를 포함합니다. 훈련 과정에는 백본 동결 기반 정렬, 교차모달 증류, 도구-튜닝, 자기증류, 그리고 TTS DPO가 포함되어 실제 도메인 지표(예: 도구 호출 0.543→0.740, TTS 에러 3.6%→3.1%) 개선을 목표로 삼았습니다. 공개된 비교에서는 한국어 집계 0.72로 동급 공개 모델 중 1위를 기록했고 배포를 위해서는 BF16 체크포인트(약 42.4GB)와 고메모리 GPU(권장 80GB)가 필요합니다.
핵심 포인트
- A.X K2 Light 20B-A3B MoE 텍스트 백본을 핵심으로 삼는 21.2B 규모의 멀티모달 모델이며 활성화되는 파라미터는 약 3.5B 수준입니다. 텍스트 백본은 top-8 routing의 128개 전문가를 가진 Mixture-of-Experts 구조로 설계되어 다중 작업을 효율적으로 분기·집중 처리합니다. 이 구조는 텍스트·교차모달 지식 전달과 대규모 맥락(최대 131,072 토큰) 유지에 유리합니다.
- 음성 전용 모듈은 KRAFTON에서 독립 학습한 AuT 기반 스피치 인코더(약 317M)와 Mimi 스타일의 뉴럴 오디오 코덱(약 96M)을 포함하며, 이 두 모듈은 텍스트 백본과 정렬된 후 엔드투엔드 경로에서 직접 연결됩니다. 입력 오디오는 먼저 AuT 인코더로 SpeechLM 코드 또는 텍스트 표현으로 변환되고, 백본에서 처리된 출력은 필요 시 코덱을 통해 직접 오디오로 합성됩니다. 이렇게 모듈을 독립 훈련한 뒤 정렬하는 방식은 음성 인식·합성 품질을 동시에 끌어올리는 데 기여합니다.
- 다중 작업·다국어 성능과 패럴링귀스틱(감정·화자) 처리가 주요 차별점이며, 스피커 참조를 받아 음성 조건화된 TTS와 레퍼런스 오디오로부터 자연스럽게 연결되는 TTS 연속 생성(prefill-based continuation)을 지원합니다. 훈련 파이프라인에 도구 호출 파인튜닝, 자기교사식(distillation) 기법, 그리고 TTS Direct Preference Optimization이 포함되어 특정 결함(장음·중복·불완전한 종결)을 감소시키도록 설계되어 있습니다. 공개된 비교에서는 한국어 종합 점수 0.72로 같은 규모 이하 공개 모델 중 1위를 기록하고 영어 종합 점수 0.75로 3위 안에 들며 실사용 가능한 균형을 목표로 합니다.
제한사항
- 체크포인트는 BF16으로 약 42.4GB의 가중치를 포함하며 단일 서버 배포 시 80GB급 GPU 또는 다중 GPU 구성이 권장됩니다. vLLM-Omni 배포용 검증 프로필은 특수한 KV-cache(192-wide) 헤드를 사용하므로 VLLM_MLA_DISABLE=1 설정이 필요하며, 이와 같은 하드웨어·소프트웨어 제약이 실서비스 도입 장벽을 높입니다. 따라서 즉시 경량 환경에서 운영하기 위해서는 추가적인 양자화·분할·추론 파이프라인 변경이 필요합니다.
- 배포 및 사용 허가는 CC BY-NC 4.0 라이선스 범위로 제한되어 상업적 이용에는 제약이 있습니다. 연구·비상업적 프로토타이핑을 목표로 공개된 체크포인트라는 점을 사용자가 확인해야 하며, 상업적 통합을 계획하면 별도의 라이선스 협의가 필요합니다. 공개 문서에 명시된 의무(예: 음성 조건화에 앞선 동의 확보)를 준수해야 합니다.
- 음성 컨디셔닝·음성 복제 기능은 식별 가능한 화자의 목소리를 재생성할 수 있으므로 개인정보·윤리적 고려가 요구됩니다. README에서도 식별 가능한 화자 관련 생성 시 사전 동의를 받아야 한다고 명시하고 있고, 실서비스에서는 프라이버시·동의 관리와 악용 방지 대책을 병행해야 합니다. 또한 공개 벤치마크는 비교 지표를 정규화해 제시하므로 특정 도메인·악조건 노이즈 환경에서의 성능은 추가 검증이 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Korean aggregate score | normalized score (0–1) | 0.72 | 공개된 30B 이하 음성 SL 모델 중 1위 |
| English aggregate score | normalized score (0–1) | 0.75 | 공개된 30B 이하 음성 SL 모델 중 3위 |
| AuT speech encoder overall (SpeechLM, Qwen AuT=100%) | relative % | 99.2% | — |
| Speech codec overall (relative to Mimi=100%) | relative % | 95.9% | Mimi = 100% |
이미지 분석


67
Likes
1.6k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.