lightx2v/MiniMax-H3-Prompt-Rewriter-LoRA
Qwen3.6-27B 기반 MiniMax-H3 T2VA 프롬프트 재작성용 LoRA 어댑터
학습 방식 · 이 릴리스는 PEFT 기반의 LoRA 어댑터로 Qwen3.6-27B 위에 미세조정되어 H3 T2VA 프롬프트 재작성 작업을 학습한 형식입니다. 어댑터 가중치만 safetensors로 배포되며 학습 과정과 하이퍼파라미터 세부 정보는 README에서 제공되지 않습니다. 결과적으로 사용자는 베이스 모델을 로드한 뒤 해당 LoRA를 적용해 프롬프트 재작성 파이프라인을 구성해야 하며 실제 멀티미디어 생성은 MiniMax-H3와 LightX2V 조합으로 수행해야 합니다.
TL;DR
Qwen3.6-27B를 베이스로 한 PEFT LoRA 어댑터로 짧은 텍스트 프롬프트와 재생 시간 및 화면 비율을 받아 MiniMax-H3에서 바로 소비 가능한 구조화된 T2VA 프롬프트로 확장합니다. 어댑터는 integrated_multimodal_description, overall_soundscape, non_diegetic_music 같은 구획을 생성하여 장면 구성과 사운드 동기화를 상세화하고 최종 비디오와 오디오는 LightX2V가 제공하는 MiniMax-H3 인퍼런스로 생성해야 합니다. 정량적 벤치마크는 제공되지 않고 README의 정성적 비교 갤러리가 품질 차이를 보여주므로 실제 적용 전 재작성 결과를 검토하고 베이스 모델 및 인퍼런스 설정을 함께 조정해야 합니다.
핵심 포인트
- 이 어댑터는 LoRA 방식으로 Qwen3.6-27B에 추가되어 짧은 텍스트 프롬프트를 샷 단위의 장면 구성, 타이밍, 카메라 모션, 동기화된 현장음 그리고 비현실적 배경음악까지 포함하는 구조화된 H3 프롬프트로 확장합니다. 입력은 원문 프롬프트와 해상도 비율 및 재생 시간을 포함하고 처리 결과로 JSON 형태의 재작성 프롬프트가 출력됩니다. 이렇게 구조화된 프롬프트를 MiniMax-H3에 전달하면 LightX2V가 동기화된 비디오와 스테레오 오디오를 생성할 수 있습니다.
- 실사용 통합은 LightX2V와의 결합을 전제로 설계되어 있습니다. 어댑터는 경량의 LoRA 가중치만 제공하며 MiniMax-H3 생성 모델 본체와 최적화된 인퍼런스 도구인 LightX2V가 별도로 필요합니다. LightX2V는 메모리 오프로딩, tensor 및 sequence parallelism, 양자화 체크포인트 같은 실행 최적화를 제공하므로 대형 베이스 모델을 실제 환경에서 운영할 때 필수 구성 요소로 작동합니다.
- 모델 저장 형식과 메타데이터는 PEFT와 safetensors 태그를 포함하고 있어 LoRA 어댑터로 배포된 점을 명확히 합니다. README와 메타데이터가 명시하는 바에 따르면 베이스는 Qwen3.6-27B이고 어댑터는 MiniMax-H3 T2VA 작업에 특화되어 미세조정되었습니다. 어댑터만 다운로드할 경우 Qwen3.6-27B 본체를 함께 불러와 병합 적용해야 하며 어댑터 자체에는 MiniMax-H3 생성 가중치가 포함되어 있지 않습니다.
- 정성적 비교 갤러리가 제공되어 No Rewrite, 공식 Context-IR, Qwen 베이스 리라이터와 이 어댑터의 출력을 동일한 MiniMax-H3 체크포인트와 동일한 인퍼런스 설정에서 비교합니다. README에 포함된 예제 비디오 링크들은 어댑터 적용 시 샷 구성과 사운드 동기화가 더 구체적으로 확장되는 경향을 보인다는 점을 보여줍니다. 수치화된 벤치마크는 공개되어 있지 않으므로 품질 평가는 제공된 예시 영상의 정성적 차이를 기반으로 판단해야 합니다.
제한사항
- 현 버전은 텍스트 입력만 지원하며 이미지나 비디오, 오디오 레퍼런스를 입력으로 처리하지 않습니다. 프롬프트에 레퍼런스 미디어를 포함해야 하는 작업에는 본 어댑터를 사용할 수 없으므로 워크플로 제약을 고려해야 합니다. 멀티모달 입력 지원은 향후 로드맵 항목으로 표기되어 있으며 현재는 대기 상태입니다.
- 이 어댑터는 학습된 근사치로서 공식 H3 Context-IR 서비스의 오픈 소스 복제본이 아니며 완전히 동일한 출력을 보장하지 않습니다. 짧은 프롬프트를 확장할 때 추가 세부 정보를 보강하는 경향이 있어 신원, 대사, 정확한 타이밍이 엄격히 요구되는 작업에서는 재작성 결과를 반드시 검토해야 합니다. 최종 영상 품질은 재작성 결과와 MiniMax-H3 인퍼런스 설정이 결합된 결과이므로 파이프라인 전체를 함께 튜닝해야 합니다.
- 어댑터 파일에는 MiniMax-H3 생성 가중치가 포함되어 있지 않으며 Qwen3.6-27B 베이스 모델을 별도로 확보해야 합니다. README가 권장하는 LightX2V 환경에서의 최적화 연산자와 양자화 설정이 없으면 대형 모델 배포가 현실적으로 어렵습니다. 또한 MiniMax-H3 사용은 upstream 리포지토리의 라이선스와 사용 약관을 따릅니다.
69
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.