본문으로 건너뛰기

AMD 7900 XTX에서 Chatterbox TTS를 구동한 기록

ROCm에서 Chatterbox TTS를 막은 ctranslate2와 torchcodec를 각각 우회하는 방법

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Ubuntu 24.04와 ROCm 7.2.1을 사용하는 AMD Radeon 7900 XTX에서 Chatterbox TTS의 생성 기능은 정상 작동하지만, 두 CUDA 전용 의존성이 별도 장애를 일으킨다. faster-whisper는 ctranslate2에 ROCm 지원이 없어 UI의 “Bypass Whisper Checking”으로 자동 검증을 건너뛰어야 한다. torchaudio의 저장·로드 경로는 CUDA 전용 torchcodec 대신 soundfile 래퍼로 교체하면 되며, 이 문제들은 Chatterbox TTS 자체보다 하위 의존성 구조에서 발생한다.

실용적 조언

  • ROCm 7.2 환경에서 faster-whisper 오류가 발생하면 CUDA 패키지를 추가로 찾기보다 ctranslate2의 ROCm 지원 여부를 먼저 확인하고, Chatterbox TTS UI의 “Bypass Whisper Checking”으로 검증 단계를 비활성화한다. 이 선택은 음성 생성은 유지하지만 자동 품질 확인과 재시도를 제거한다.
  • torchaudio.save()와 torchaudio.load()가 torchcodec를 호출해 실패하면 soundfile을 사용한 save_audio_sf()와 load_audio_sf()를 만들고 모든 호출부를 같은 인자 순서로 교체한다. 저장할 때는 Tensor를 CPU NumPy 배열로 변환하고 (channels, samples)를 (samples, channels)로 전치하며, 로드할 때는 항상 2차원으로 읽은 배열을 다시 전치해 Float Tensor로 반환한다.

섹션별 상세

01
AMD 7900 XTX에서 Ubuntu 24.04, ROCm 7.2.1, gfx1100 조합으로 Chatterbox TTS 자체는 정상 실행됐지만 faster-whisper 검증 단계에서 CUDA 오류가 발생했다. faster-whisper가 사용하는 ctranslate2에 ROCm 지원이나 AMD용 빌드가 없어, UI에서 “Bypass Whisper Checking”을 선택해 생성 음성의 자동 텍스트 검증과 재시도만 건너뛰는 방식으로 우회했다. 이 방법은 검증 기능은 잃지만 TTS 생성 자체는 계속 수행한다.
02
ROCm 환경의 두 번째 장애물은 최신 torchaudio가 save()와 load()를 기본적으로 torchcodec 경로로 보내는 구조였다. torchcodec 사전 빌드는 libcuda 계열 라이브러리를 요구하고 ldd에서 lib ע?

용어 해설

ROCm
AMD GPU에서 PyTorch 같은 머신러닝 소프트웨어를 실행하도록 지원하는 컴퓨팅 플랫폼이다. 이 글에서는 Ubuntu 24.04와 ROCm 7.2.1을 7900 XTX의 gfx1100 환경에 설치해 CUDA 대신 AMD GPU에서 Torch 연산을 처리하는 기반으로 쓰였다.
gfx1100 GPU 아키텍처 식별자(gfx1100)
AMD GPU의 그래픽 아키텍처와 실행 대상을 식별하는 코드다. Radeon 7900 XTX가 gfx1100으로 인식되며, ROCm 7.2에서는 별도 gfx override 없이 공식 지원 대상으로 Torch를 실행할 수 있다는 점이 핵심이다.
faster-whisper
Whisper 기반 음성 인식 결과를 빠르게 생성하는 도구다. Chatterbox TTS Extended fork에서는 생성 음성을 입력 텍스트와 자동 검증하는 데 쓰이지만, 내부 실행 계층인 ctranslate2가 CUDA만 지원해 ROCm 환경에서는 실행되지 않는다.
ctranslate2
Transformer 모델 추론을 실행하는 라이브러리다. faster-whisper가 이 라이브러리에 의존하지만 ROCm 빌드가 제공되지 않고 NVIDIA CUDA만 지원하므로, AMD에서는 Whisper 검증 기능 전체를 우회해야 한다.
torchcodec
Torchaudio의 최신 save()와 load() 호출 경로에서 오디오 코덱 처리를 맡는 라이브러리다. 제공되는 사전 빌드가 CUDA 전용 라이브러리에 연결되어 ROCm 환경에서 로드되지 않으므로 soundfile 기반 함수로 교체해야 한다.
soundfile
오디오 파일을 읽고 쓰는 Python 라이브러리다. 이 프로젝트의 기존 의존성으로 포함되어 있으며, Tensor를 CPU NumPy 배열로 바꾸고 채널·샘플 축을 변환한 뒤 sf.write()와 sf.read()로 torchaudio의 저장·로드 작업을 대체한다.

코드 예제

python
def save_audio_sf(path, wav, sr):

import numpy as np

arr = wav.detach().cpu().numpy() if hasattr(wav, "detach") else wav

if arr.ndim == 2:

arr = arr.T  # torchaudio: (channels, samples) -> soundfile: (samples, channels)

sf.write(path, arr, sr)



def load_audio_sf(path):

import torch

arr, sr = sf.read(path, always_2d=True)

arr = arr.T

waveform = torch.from_numpy(arr).float()

return waveform, sr

soundfile을 사용해 torchaudio.save()와 torchaudio.load()를 대체하는 오디오 저장·로드 래퍼다.

언급된 도구

Chatterbox TTS중립

AMD 7900 XTX에서 ROCm으로 실행한 TTS 시스템이며 Extended fork의 긴 텍스트 자동 청킹과 Whisper 기반 음성 검증 기능이 함께 언급됐다.

faster-whisper비추천

생성 음성을 입력 텍스트와 자동 대조하는 Whisper 기반 검증 구성 요소다.

ctranslate2비추천

faster-whisper의 추론 실행 계층으로 사용되지만 CUDA만 지원해 ROCm에서는 검증 기능을 실행하지 못한다.

torchcodec비추천

최신 torchaudio의 오디오 저장·로드 경로에 사용되지만 CUDA 전용 사전 빌드 때문에 ROCm에서 동작하지 않는다.

soundfile추천

torchcodec를 우회해 오디오 파일을 저장하고 읽는 대체 라이브러리다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 23.수집 2026. 08. 23.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.