용어 해설
- Rectified Flow
- — Gaussian noise에서 목표 오디오 latent로 이동하는 경로를 학습하는 생성 방식입니다. 학습 시 중간 상태의 목표 속도를 예측하고, 추론 시 이 속도장을 ODE solver로 적분해 오디오 latent를 복원합니다. AuK는 이 구조로 생성과 편집을 같은 Transformer 안에서 처리합니다.
- Variational Autoencoder(VAE)
- — 오디오 파형을 압축된 latent sequence로 바꾸고 다시 파형으로 복원하는 인코더·디코더 구조입니다. AuK-VAE는 24 kHz 오디오를 64차원 latent로 변환하며, 50 Hz의 latent frame rate를 사용해 생성 모델의 연산 부담을 낮추면서 음향 정보를 보존합니다.
- MMDiT
- — 서로 다른 조건 스트림 사이에서 Attention을 수행하는 Diffusion Transformer 구조입니다. AuK에서는 semantic stream과 acoustic stream을 별도 residual 경로로 유지한 채 Joint Attention으로 정보를 교환한 뒤, Single-Stream DiT가 결합된 sequence를 추가로 정제합니다.
- Flow Matching
- — 무작위 noise와 정답 latent 사이의 이동 방향을 직접 학습하는 생성 학습 방식입니다. AuK는 중간 latent와 목표 속도를 만들고 모델이 예측한 속도와의 masked mean-squared error를 줄여, 추론 단계에서 noise를 오디오 latent로 변환하는 velocity field를 학습합니다.
- Classifier-Free Guidance
- — 별도의 분류기 없이 조건부 예측과 무조건부 예측의 차이를 이용해 생성 조건의 영향력을 키우는 방식입니다. AuK 전체 모델은 guidance scale 2.0으로 32회 function evaluation을 수행하지만, AuK -Flash는 증류를 통해 CFG 없이 4회 평가만 수행합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



