본문으로 건너뛰기

AuK, 음성 생성과 편집을 하나로 묶다

AuK는 MLLM·VAE·Hybrid Flow Transformer를 결합해 음성 생성·편집·분리·향상을 처리하고, AuK -Flash는 4단계 CFG-free 추론으로 4.5배 속도를 확보합니다.

용어 해설

Rectified Flow
Gaussian noise에서 목표 오디오 latent로 이동하는 경로를 학습하는 생성 방식입니다. 학습 시 중간 상태의 목표 속도를 예측하고, 추론 시 이 속도장을 ODE solver로 적분해 오디오 latent를 복원합니다. AuK는 이 구조로 생성과 편집을 같은 Transformer 안에서 처리합니다.
Variational Autoencoder(VAE)
오디오 파형을 압축된 latent sequence로 바꾸고 다시 파형으로 복원하는 인코더·디코더 구조입니다. AuK-VAE는 24 kHz 오디오를 64차원 latent로 변환하며, 50 Hz의 latent frame rate를 사용해 생성 모델의 연산 부담을 낮추면서 음향 정보를 보존합니다.
MMDiT
서로 다른 조건 스트림 사이에서 Attention을 수행하는 Diffusion Transformer 구조입니다. AuK에서는 semantic stream과 acoustic stream을 별도 residual 경로로 유지한 채 Joint Attention으로 정보를 교환한 뒤, Single-Stream DiT가 결합된 sequence를 추가로 정제합니다.
Flow Matching
무작위 noise와 정답 latent 사이의 이동 방향을 직접 학습하는 생성 학습 방식입니다. AuK는 중간 latent와 목표 속도를 만들고 모델이 예측한 속도와의 masked mean-squared error를 줄여, 추론 단계에서 noise를 오디오 latent로 변환하는 velocity field를 학습합니다.
Classifier-Free Guidance
별도의 분류기 없이 조건부 예측과 무조건부 예측의 차이를 이용해 생성 조건의 영향력을 키우는 방식입니다. AuK 전체 모델은 guidance scale 2.0으로 32회 function evaluation을 수행하지만, AuK -Flash는 증류를 통해 CFG 없이 4회 평가만 수행합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.