본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

0xShug0/audio.cpp

C++0 / 0

ggml 기반 C++ 런타임으로 TTS·ASR·음성 변환·음악 생성을 CLI와 서버에서 실행하는 오디오 프레임워크

TL;DR

audio.cpp는 ggml을 기반으로 여러 음성·오디오 모델을 하나의 C++ 런타임에서 실행하는 프레임워크이며, 동시에 CLI 도구와 HTTP 서버 및 내장 WebUI를 제공한다. 사용자는 Python 의존성 없이 CUDA, CPU, Vulkan, Metal, HIP/ROCm 중 빌드한 백엔드를 선택하고, 모델 매니저와 GGUF 패키지로 모델을 준비한 뒤 TTS·ASR·VC·음악 생성·분리 같은 작업을 호출한다. 장기 세션 재사용과 CUDA 최적화를 통해 README 측정에서 일부 TTS 경로가 Python reference보다 1.8배에서 5.03배 빠르게 실행됐고, Supertonic 장문 합성은 187.62배 실시간 속도를 기록했다. 다만 모델별 백엔드·정밀도 지원이 다르고 GGUF 양자화가 품질 저하나 실패를 일으킬 수 있어, 특정 모델을 운영하려면 지원 표와 실제 장비 테스트가 필요하다.

핵심 포인트

  • audio.cpp는 단순 모델 데모가 아니라 ggml 위에서 TTS, ASR, VAD, 음성 변환, 음악 생성 등을 공통 실행 경로로 묶은 C++ 오디오 추론 프레임워크이다. 모델 로더와 세션을 재사용하고 CLI·서버·WebUI에서 같은 런타임을 호출해 Python 환경을 모델마다 따로 구성하는 부담을 줄인다. 여러 오디오 모델을 하나의 네이티브 서비스로 운영하려는 경우에 특히 적합하다.
  • CUDA를 중심으로 CPU, Vulkan, Metal, HIP/ROCm 백엔드를 제공해 Windows, Linux, macOS와 NVIDIA·AMD·Apple Silicon 환경을 폭넓게 겨냥한다. 사용자는 --backend와 --model-set으로 실행 백엔드와 필요한 모델 패밀리만 선택하고, custom 빌드에서는 qwen3_tts,pocket_tts,qwen3_asr처럼 로더를 제한할 수 있다. 다만 백엔드와 모델별 지원 범위 및 성능은 서로 다르므로 실제 배포 장비에서 검증해야 한다.
  • audiocpp_cli는 TTS·ASR·VC·VAD·정렬 같은 작업을 단일 명령으로 처리하고, audiocpp_server는 /v1/audio/speech와 /v1/audio/transcriptions 같은 HTTP API를 제공한다. JSON pipeline은 긴 오디오를 분할한 뒤 전사·합성·병합하는 작업을 연결하며, 내장 SvelteKit WebUI는 추론 바이너리에 포함돼 별도 frontend 파일 없이 실행된다. 로컬 음성 서비스, 배치 변환, 긴 형식 내레이션을 CLI에서 API와 UI까지 확장하기 쉽다.
  • README 기준 지원 모델은 49개 패밀리와 70개 이상의 변형으로 TTS·Clone·ASR·Diarization·분리·음악·MIDI까지 넓지만, 일부 기능은 experimental 또는 community surface에 머문다. GGUF 16/Q8/Q4와 safetensors 경로를 모델별로 제공하며, 양자화는 모델에 따라 품질 저하나 런타임 실패가 발생할 수 있다. 따라서 모델 수가 많다는 이유만으로 호환성을 가정하지 말고 지원 표와 해당 모델 문서를 먼저 확인해야 한다.

벤치마크

벤치마크지표비교
Python 대비 TTS one-shot vevo2상대 속도5.03x faster, wall time 80.11% 감소Ubuntu·NVIDIA GeForce RTX 5090·CUDA에서 동일 Python reference path와 비교한 README 측정치이며, 최신 최고 성능을 보장하는 수치는 아님
Python 대비 TTS one-shot pocket tts상대 속도3.68x faster, wall time 72.80% 감소Ubuntu·NVIDIA GeForce RTX 5090·CUDA에서 동일 Python reference path와 비교한 README 측정치이며, CLI 오버헤드는 포함하지 않음
Supertonic 장문 TTS실시간 대비 속도187.62x faster than real time, RTF 0.0056,026자·1,028단어 입력의 장문 테스트에서 CUDA로 측정한 audio.cpp 수치이며, CPU 측정치는 6.18x faster than real time
VibeVoice 1.5B 팟캐스트생성 시간93.9분 오디오를 18.2분에 생성, 약 5.15x faster than real time10 diffusion steps·비양자화 실행의 README 공개 수치로, 측정 환경의 세부 GPU 정보는 해당 항목에 명시되지 않음
GGUF Q8 메모리·속도Q8 효과최대 1.53x faster, peak VRAM 최대 약 37% 감소Higgs Audio·Fish Audio·Voxtral 경로의 테스트 보고서 수치이며, 양자화 버전 자체가 기반 모델의 공개 성능을 그대로 재현한다는 의미는 아님

1.6k

Stars

200

Forks

+204

Trending

0

조회수

1.6k watchers11 open issuesOther

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.