왜 중요한가
미디어 제작 현장에서는 레퍼런스가 없는 캐릭터 음성을 처음부터 설계하고 자연어로 성격과 연기 스타일을 지정하는 워크플로우가 자주 발생합니다. SwanTale은 캡션 기반의 instruct 조건과 참조 오디오 기반의 zero-shot 조건을 같은 모델에서 모두 수용하면서 환경음·로컬 효과·다중 화자까지 하나의 웨이브폼으로 합성하도록 설계되었습니다. 이 통합적 접근은 음성·장면 효과의 타이밍·음량·공간감 불일치를 줄이고 재사용 가능한 목소리 디자인과 높은 표현 통제를 가능하게 만듭니다.
핵심 기여
SwanData-Caption 고밀도 캡션 파이프라인
SwanData-Caption은 원시 미디어 오디오를 분리·발화구간 정제·다중 레벨 캡션으로 변환하는 네 단계 파이프라인을 구성합니다. 캡션은 Environment, Speakers, Content 세 필드를 갖추며, 스타일-페르소나 라이브러리와 합성 소스(노인음성, 단발 발화, 발음 어려운 표적)를 포함해 희귀 커버리지를 보강합니다. 파형 필터링과 인간 감사로 품질·표현력 기준을 유지하며 약 7천만 캡션 레코드를 확보했습니다.
SwanVAE: 고해상도 웨이브폼 잠재공간
SwanVAE는 48 kHz 입력을 25 Hz, 96차원 연속 잠재로 인코딩하는 VAE로 설계되어 로컬 파형 세부를 디코더 측에 집중시킵니다. 디코더는 SAME에서 파생된 Transformer Resampling Block으로 각 잠재 프레임당 6개의 패치를 합성해 위상 연속성과 고주파 디테일을 확보합니다. 학습 시에는 multi-resolution STFT·multi-band Mel·에너지 손실과 MPD/MRD/MBCSD 판별기를 결합해 재구성 품질을 강화했습니다.
Unified MoE와 Engram을 결합한 조건형 DiT
SwanTale의 DiT 백본은 Engram 기반 캡션 메모리와 품질-조건, 그리고 Unified MoE의 이중 라우팅을 통합합니다. Unified MoE는 샘플 수준 task-router와 프레임 수준 audio-router(Top-P 동적 라우팅, null expert 포함)를 사용해 시간에 따른 연산 예산을 조정하고 프레임별 전문화된 변환을 제공합니다. 이 구조는 음성, 환경음, 로컬 효과, 음악 등 이질적 오디오 패턴 사이의 용량 경쟁을 줄이는 동시에 참조-기반과 캡션-기반 조건을 동일 네트워크에서 유지합니다.
커리큘럼 학습과 GRPO 기반 품질 향상
학습은 제로-샷 기반의 발화 우선 단계, 정제된 음성에서의 dense caption 적응, 전체 캡션 혼합에서의 Unified MoE 학습, 고품질 SFT로 이어지는 커리큘럼으로 구성됩니다. 마지막으로 Flow-GRPO 변형을 통해 발음 정확도·발생 안정성·캡션-속성 제어를 목표로 그룹 상대 보상 최적화를 수행하며 anchor replay와 참조 정책 KL 제약으로 기능 소실을 방지합니다. 이 절차는 supervised 학습으로 확보하기 어려운 미세한 발음·속성 보정을 가능하게 합니다.
핵심 아이디어 이해하기
음성과 장면 오디오는 시간적 구조와 스케일이 크게 다른 신호들이 혼재하므로 하나의 모델에서 단일 방식으로 처리하면 표현 충돌이 발생합니다. 이를 해결하기 위해 로컬 파형 디테일은 SwanVAE의 고해상도 잠재에 맡기고, 긴 범위의 구조와 조건-의존적 변화를 flow-matching 기반의 비인과적 DiT가 잠재 시퀀스 위에서 예측하도록 분리했습니다. 캡션은 Qwen 계열 인코더와 Engram 메모리를 통해 고정 패턴을 효율적으로 인코딩하고 Unified MoE가 시간·프레임·태스크에 따라 동적으로 용량을 배분해 이질적 오디오 패턴을 전문 처리합니다.
방법론
데이터 측면에서는 미디어 중심의 실녹음과 세 가지 합성 서브셋을 결합한 SwanData-Caption을 구축해 환경·스피커·콘텐츠를 다중 레벨로 캡션화하고, 분리·diarization·ASR·정렬을 거쳐 캡션 주석과 인간 감사로 품질을 보정합니다. 모델 측면에서는 48 kHz→96-d 25 Hz 잠재를 생성하는 SwanVAE를 먼저 학습·고정한 뒤, DiT 기반 flow-matching 생성기로 캡션·텍스트·스피커 턴·참조 오디오를 조건으로 지도학습합니다. 학습 루틴은 단계별 커리큘럼(제로-샷 기초 → 캡션 적응 → Unified MoE 혼합 → 고품질 SFT)과 GRPO 기반 포스트 트레이닝을 결합해 안정성과 발음·속성 제어를 강화합니다.
관련 Figure

이 도식은 네 단계(coverage design, SwanData-Speech preprocessing, caption annotation, data refinement)의 전처리 흐름과 각 단계에서 수행되는 주요 작업을 보여줍니다. coverage design에서 내부 미디어와 합성 서브셋을 결합해 희귀 스타일을 확보하고, preprocessing에서 separation·diarization·ASR·alignment를 거쳐 캡션 주석과 인간 감사로 품질을 보정하는 전체 파이프라인 구조가 한눈에 드러납니다. 캡션 출력 스키마(Environment, Speakers, Content)와 데이터 정제 규칙(파형 필터·정규화·감사)이 명확히 연결되어 있어 데이터 품질 관리의 흐름을 이해하는 데 유용합니다.
그림 1: SwanData-Caption 파이프라인 개요

왼쪽 패널은 SwanTale 전반 구조를 보여주며 SwanVAE 인코더/디코더, 텍스트·캡션 토크나이저, flow-based Transformer 흐름과 참조 웨이브 잠재의 활용을 시각화합니다. 오른쪽 패널은 Unified MoE의 두 수준 라우팅 설계(task router와 audio router)와 Top-P 라우팅을 통해 task-expert, audio-expert, null-expert가 어떻게 결합되는지를 상세히 나타냅니다. 이 그림은 캡션-참조 병행 학습과 시간·프레임 기반 동적 용량 할당의 메커니즘을 직관적으로 파악하게 합니다.
그림 2: SwanTale 아키텍처와 Unified MoE 구성
주요 결과
논문은 SwanTale가 SwanBench-Speech, InstructTTSEval, SwanBench-Scene 등에서 zero-shot과 instruct 과제의 핵심 지표에서 선도적 성능을 보였고, 두 과제에서 표현성(expressiveness) 점수가 최고였다고 보고합니다. 또한 고품질 하위집합으로 supervised fine-tuning을 한 뒤 GRPO로 발음·안정성·속성 제어가 추가 개선되었다고 기술합니다. 실험 세부 수치와 음성 품질 평가 절차는 본문과 부록의 벤치마크 섹션에 정리되어 있습니다.
기술 상세
SwanVAE는 48 kHz 단일채널을 25 Hz, 96차원 연속 잠재로 인코딩하며 인코더·가우시안 VAE 병목·Transformer Resampling Block 기반의 디코더를 사용합니다. SwanVAE 파라미터는 총 407.0M이며 디코더가 355.0M를 차지하고, 학습은 약 100,000시간 분량의 내부 오디오로 수행되었습니다. SwanTale 본체는 flow-matching DiT를 사용하며 캡션은 Qwen-family 인코더로 처리하고 Engram 메모리와 Unified MoE(샘플 수준 task-router + 프레임 수준 Top-P audio-router)를 도입해 동적 용량 할당을 구현합니다. 학습 파이프라인은 23M시간 규모의 단일-화자 프리트레인, 70M 캡션 적응 데이터, 10M 혼합 캡션 샘플 등 단계를 거쳤고 최종 supervised fine-tuning과 GRPO가 뒤따릅니다.
관련 Figure

상단은 anti-aliased CNN 인코더와 Transformer 기반 디코더(Resampling Block)를 포함한 VAE의 전반 구조를 보여주고, 중앙은 generative alignment(Flow-matching)와 auto-regressive 예측의 결합을 나타냅니다. 우측 하단의 acoustic readouts는 밴드별 에너지·다중 스케일 chroma 등 잠재에서 예측되는 목표들을 시각화해 posterior mean에 정렬 제약을 추가하는 방식을 보여줍니다. 이 구성은 잠재가 로컬 음향과 조화·주파수 할당 정보를 보존하도록 설계된 이유를 명확히 합니다.
그림 3: SwanVAE 아키텍처와 정렬·음향 읽기값 구조
한계점
데이터 파이프라인은 대규모의 내부 미디어와 인간 감사에 크게 의존하므로 동일한 품질을 재현하려면 큰 라벨링·인프라 비용이 필요합니다. 저자는 diarization 정확도의 한계를 인정하며, 이 때문에 diarization은 거친 분할 용도로만 사용되고 최종 스피커 결정은 캡션 단계의 감사에 의존합니다. 또한 Unified MoE와 GRPO 같은 고급 구성은 추론·학습 비용과 복잡도를 증가시키므로 경량 추론 버전이나 저자원 환경에서의 적용에 제약이 있을 수 있습니다.
실무 활용
SwanTale은 애니메이션 더빙, 오디오 드라마, 광고, 게임, 팟캐스트 등에서 레퍼런스가 없거나 재사용 가능한 목소리를 자연어로 설계하고 장면음과 함께 합성할 때 유용합니다. 캡션 기반 제어로 페르소나·감정·로컬 효과를 세밀하게 지정하고, 추후 동일 목소리를 참조 오디오로 사용해 zero-shot 복제가 가능합니다. 생산 환경에서는 캡션-주도 디자인→샘플 감사→zero-shot 재사용의 워크플로우로 통합될 수 있습니다.
- 애니메이션 캐릭터의 목소리를 자연어 페르소나로 설계하고 해당 페르소나로 장면 대사를 생성
- 오디오 드라마에서 다중 화자 대화와 배경 효과를 하나의 웨이브폼으로 동시 합성
- 광고 및 디지털 휴먼에서 특정 톤·발음 지시를 캡션으로 제어해 대사 녹음 자동화
코드 공개 여부: 미확인
키워드
용어 해설
- flow-matching(Flow-matching)
- — Flow-matching은 연속시간 노이즈-투-데이터 맵핑을 목표로 하는 비정규화된 생성 손실 프레임워크로, 노이즈된 잠재 벡터와 목표 속도(velocity)를 예측하는 방식으로 학습합니다. SwanTale은 비인과적(Non-causal) DiT 백본에 flow-matching을 적용하여 반복 생성의 불안정성을 줄이면서 전체 잠재 궤적을 복원합니다. 이 접근은 autoregressive 반복생성 대신 한 번에 전체 시퀀스 구조를 다루며 지역적 음향 세부는 VAE 디코더에 맡깁니다.
- Engram 메모리(Engram memory)
- — Engram은 캡션 내에 자주 반복되는 고정 패턴(예: 'energetic girl')을 해시 테이블 기반의 n-gram 슬롯으로 저장하여 캡션 인코더 출력과 결합하는 외부 메모리 기법입니다. SwanTale은 2-gram과 3-gram 창을 사용해 해시 조회를 수행하고, gating 연산으로 메모리 기여도를 조정하여 고정형 표현을 인식하기 쉽게 만듭니다. 이 방식은 긴 캡션에서 반복 패턴을 안정적으로 복원하고 cross-attention의 부담을 낮춥니다.
- 품질 캡션 기반 제어(Reward-conditioned quality control)
- — 품질 캡션 기반 제어는 데이터 파이프라인에서 추출한 STOI, PESQ, SI-SDR, MOS 계열 점수를 캡션으로 인코딩하고 학습 조건으로 공급해 모델이 품질 수준을 조건으로 학습하도록 만드는 방식입니다. 학습 중에는 classifier-free dropout을 섞어 고품질 조건을 모방할 수 있게 하고, 추론 시에는 최고 품질 플래그를 고정해 생성 출력을 고품질 쪽으로 유도합니다. 이 방식은 별도 보상모델이나 롤아웃 없이 품질 편향을 구현합니다.
- GRPO (Group-relative Policy Optimization)(GRPO)
- — GRPO는 동일 조건에서 K개의 후보를 샘플링해 그룹 내부 상대 순위를 기준으로 보상을 정규화하여 정책을 갱신하는 방법입니다. SwanTale은 Flow-GRPO 변형을 사용해 확률적 SDE 롤아웃을 만들어 전이 확률을 계산하고, 클리핑된 비율 기반 목적함수로 발음·안정성·속성 제어 보상을 최적화합니다. 이 절차는 값 함수 없이도 조건별 난이도 차이를 보정하며, 동시에 anchor replay로 기능 보존을 강제합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
