TL;DR
MiniMax-H3를 MLX 포트로 Apple Silicon M5 Max에서 실행해 텍스트 프롬프트로 최대 15초짜리 비디오를 생성한 실험 기록이다. Hugging Face Hub에서 uvx로 약 115GB의 모델 파일을 내려받았고 비디오 합성에 약 45분이 소요되었으며 생성물은 시각적으로는 괜찮았지만 오디오는 별도 오디오 프롬프트가 없어 말처럼 들리지만 무의미한 음성이 생성되었다. MLX 포트와 체크포인트 경로 지정, 프롬프트 가이드의 오디오 지침이 로컬 실험에서 중요한 요소로 확인되었다.
섹션별 상세
용어 해설
- MiniMax-H3 모델(MiniMax-H3)
- — MiniMax-H3는 텍스트·이미지·오디오·비디오 입력을 받아 최대 15초 길이의 비디오 클립을 생성할 수 있는 옴니모달 생성 시스템으로 소개되었다. 원문은 이 모델을 ‘general-purpose, omni-modal generative system’으로 분류하고 있다.
- MLX 런타임(MLX)
- — MLX는 Apple Silicon 환경에서 모델을 구동하기 위한 실행 도구군으로, 글쓴이는 MiniMax-H3를 MLX로 포팅한 Python 패키지를 사용해 M5 Max에서 모델을 실행했다. 원문에서는 MLX를 통해 로컬에서 비디오를 생성한 절차가 기술되어 있다.
- uvx 다운로드 도구(uvx)
- — uvx는 Hugging Face Hub에서 모델 파일을 내려받는 명령줄 도구로 본문 예시에서 MiniMaxAI/MiniMax-H3와 pipenetwork/MiniMax-H3-MLX-8bit 저장소의 파일을 각각 다운로드하는 데 사용되었다.
- 텍스트→비디오 생성(text-to-video)
- — text-to-video는 텍스트 프롬프트를 입력으로 받아 영상과 음성을 생성하는 기술 영역을 뜻하며, 원문에서는 MiniMax-H3로 최대 15초 길이의 비디오 클립을 생성한 예가 제시되었다.
- Hugging Face 허브(Hugging Face Hub)
- — Hugging Face Hub는 모델과 체크포인트를 호스팅하는 저장소로, 글쓴이는 hf download 명령을 통해 MiniMax-H3 관련 파일을 허브에서 내려받는 절차를 실행했다.
코드 예제
uvx --from huggingface_hub hf download MiniMaxAI/MiniMax-H3 \
--include 'FL2VA/*' --exclude 'FL2VA/transformer/*'
uvx --from huggingface_hub hf download pipenetwork/MiniMax-H3-MLX-8bit이 명령은 Hugging Face Hub에서 MiniMax-H3 관련 파일들을 내려받기 위해 실행한 다운로드 단계이다. 첫 줄은 MiniMaxAI 레포에서 FL2VA 관련 파일을 포함해 필요한 체크포인트만 선택적으로 가져오며, 두 번째 줄은 MLX용으로 변환된 8비트 체크포인트를 내려받는다. 로컬에 대용량 파일이 생성되므로 저장 공간과 다운로드 시간을 고려해야 한다.
uv run --with mlx-vlm \
--with-requirements requirements.txt python scripts/generate.py \
"a rainbow colored skunk leaps over a mossy log in a supermarket" \
-o skunk.mp4 \
-c ~/.cache/huggingface/hub/models--MiniMaxAI--MiniMax-H3/snapshots/fa9c8ab1eaa21c8ae25e7e40b83b2e6002f340af/FL2VA \
-t ~/.cache/huggingface/hub/models--pipenetwork--MiniMax-H3-MLX-8bit/snapshots/3ac52081470b0488921c3ec3ba84a39097bf2361이 실행 명령은 MLX 런타임을 사용해 generate.py 스크립트를 통해 프롬프트로부터 비디오를 생성하는 전체 파이프라인을 호출한다. -o 플래그는 출력 파일명을 지정하고, -c와 -t 옵션은 각각 FL2VA 체크포인트 경로와 MLX용 8비트 체크포인트 경로를 명시해 모델 가중치를 로드하도록 한다. 이 과정은 종속성 설치와 환경 준비가 완료된 상태에서 수행되어야 하며, 본문에서는 M5 Max 노트북에서 약 45분이 소요된 것으로 보고되었다.
근거 모음
- MiniMax-H3는 텍스트·이미지·오디오·비디오를 입력으로 받아 최대 15초 길이의 비디오를 생성할 수 있다. — 본문 첫머리에서 MiniMax-H3를 'general-purpose, omni-modal generative system'이며 'generate up to 15 second video clips with audio included'로 기술.
- 글쓴이는 MLX 포트를 사용해 M5 Max MacBook Pro에서 모델을 실행했다. — 본문에서 'I got it running on my M5 Max MacBook Pro'라는 실행 기록과 함께 실행 명령 예시가 제공됨.
- 모델 파일 다운로드로 약 115GB를 사용했고 비디오 생성에는 약 45분이 걸렸다. — 본문에서 'It downloaded ~115 GB of model files, and the video generation took just under 45 minutes.'라는 수치가 명시됨.
- 오디오는 프롬프트로 오디오 지침을 주지 않아 말처럼 들리지만 무의미한 결과가 나왔다. — 본문에서 'the audio is weird speech-like garbage, because I didn't provide any prompt guidance as to what the audio should be'라고 기술.
기술
- MiniMax-H3
- MLX
- uvx
- Hugging Face Hub
- Python
활용 사례
- 텍스트 프롬프트로 단일 장면의 짧은 비디오 클립을 로컬에서 생성해 시각 결과를 빠르게 검토하는 실험
- Apple Silicon 노트북에서 대형 멀티모달 모델을 포팅해 비용 효율적으로 프로토타이핑하는 용도
- 프롬프트 튜닝을 통해 비디오 시각과 오디오 출력을 동시에 개선하는 연구·개발
- MLX 기반 8비트 체크포인트를 활용해 모델 실행 메모리 사용량을 낮춘 실험적 배포
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.