ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot
Qwen3-VL-32B 기반 MiniMax-H3 conditioning encoder의 INT8 ConvRot 양자화 패키지
학습 방식 · 원본 BF16 모델을 silveroxides/convert_to_quant(버전 1.3.1) 툴체인으로 변환했고, 단순 반올림이 아닌 AdamW 기반 AdaRound 최적화와 plateau 조기중단을 사용해 row-wise INT8 ConvRot 양자화를 수행했다. 변환 시 convrot-group-size 256, num-iter 4000, optimizer adamw 등으로 세밀하게 튜닝했고, 시각 모듈(vision tower)은 정확도 보전을 위해 제외 레이어로 지정하여 BF16으로 그대로 보존했다. generation tail은 별도 레이어 구성으로 따로 변환해 LM head는 row-wise ConvRot로 청크 평가가 가능하도록 처리했으며, 이로 인해 생성시 임시 메모리 피크를 낮추는 설계가 적용되었다.
TL;DR
Qwen3-VL-32B 기반의 ComfyUI용 MiniMax-H3 체크포인트로, 언어층 0–49와 vision tower를 BF16으로 보존한 conditioning encoder와 언어층 50–63+LM head를 별도 INT8 ConvRot generation tail로 분리 제공한다. AdamW AdaRound로 학습형 ConvRot row-wise INT8 양자화를 수행하고 token embedding만 단순 INT8로 처리해 약 24.55 GiB의 INT8 패키지를 실현했으며, 필요시 tail을 임시 로드해 생성 피크를 줄이는 워크플로를 적용한다. Heretic 편집(언어층 31–40)과 provenance 검증이 포함되어 uncensoring 편집이 반영되어 있지만 거부 동작 완전 제거는 보장되지 않으며 권장 ComfyUI/PyTorch 환경에서의 사용이 권장된다.
핵심 포인트
- 이 패키지는 llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic를 기반으로 한 ComfyUI용 MiniMax-H3 체크포인트로, 언어층 0–49와 vision tower를 포함한 conditioning encoder를 주 파일로 제공하고 언어층 50–63과 LM head를 별도의 generation tail 파일로 분리 제공한다. 분리된 tail은 필요 시에만 로드되어 prompt enhancement 용도로 동작하고, 사용 후에는 언어층을 다시 50층으로 유지하면서 언로드된다. 이런 분할 설계로 평상시 인코딩 시 VRAM 사용을 낮추고 생성 단계에서만 추가 레이어를 임시로 불러오는 운영 유연성을 확보한다.
- 양자화 방식은 ConvRot 그룹화와 learned row-wise INT8 스케일을 이용한 AdamW AdaRound 최적화를 적용한 변환 파이프라인으로 구현되어 있으며, 전체 언어 블록 행렬 중 350개(메인)와 98개(테일)의 learned ConvRot 행렬을 INT8로 저장한다. 토큰 임베딩은 ComfyUI 요구사항 때문에 단순 tensorwise INT8 레이아웃으로 유지되며, vision tower와 모든 norm 계층은 BF16으로 보존되어 정확도 손실을 최소화한다. ConvRot group size는 256으로 고정되어 있고, 양자화 과정에서 351개의 FP32 스케일과 ComfyUI용 메타데이터가 함께 저장되어 런타임에서의 복원성과 검증이 가능하다.
- 런타임 검증은 RTX 5090(32GB)와 PyTorch 2.8.0+cu128 환경에서 수행되었고, 인코딩 단계에서 약 24.7 GiB가 할당된 상태에서 정상 동작이 확인되었다. ComfyUI 특정 커밋과 comfy-kitchen/comfy-aimdo 버전 조합으로 테스트했고, no-tail 경로와 tail 로드·언로드 경로 모두에서 유한한 인코딩 및 생성 출력이 관찰되어 프로덕션 환경에서의 기본 호환성을 확보했다. 다만 로컬 빌드된 CUDA/PyTorch 조합에 따라 fallback 연산이 발생할 수 있으므로 권장되는 최신 ComfyUI 및 PyTorch 빌드를 사용해야 한다.
- 출처 모델의 Heretic v1.2.0 ARA 편집(언어층 31–40의 attn.o_proj 수정)은 이 체크포인트의 유지된 0–49 범위에 포함되어 uncensoring 관련 변경이 반영되어 있다. upstream 모델은 거부율(refusal rate) 4/100, 원본 대비 거부율 변화(원본 99/100), KL divergence 0.0421, PIQA 92.87%, MMLU 79.87% 수치를 보고하고 있으며 이 패키지는 그 소스를 기반으로 구조와 무결성을 검증한 상태이다. 하지만 abliterated/uncensored 특성은 일부 거부 동작을 낮출 수 있으나 모든 안전 필터링 문제를 제거한다고 보장하지는 못한다.
제한사항
- uncensored·abliteration 편집은 출처 모델의 거부 반응을 크게 줄였지만 모든 거부나 안전 관련 동작을 완전히 제거한다고 보장할 수 없다. 소스 리포트에서 4/100 거부율은 개선을 시사하지만 환경과 프롬프트에 따라 거부 행위가 여전히 발생할 가능성이 남아 있다. 따라서 안전 정책이나 규정 준수가 필요한 서비스에 적용할 때는 별도의 거버넌스와 필터링 계층을 병행해야 한다.
- 양자화 빌드는 특정 ComfyUI 버전과 comfy-kitchen/comfy-aimdo 조합에 의존하며, 권장 PyTorch/CUDA 조합(CUDA 13.0+ 권장)이 아닌 경우 fallback 연산이 발생해 성능이나 안정성이 저하될 수 있다. README의 런타임 검증은 PyTorch 2.8.0+cu128에서 fallback을 동반한 성공 사례를 보고하지만, 최적 성능과 커널 지원을 원하면 권장 환경으로 업그레이드해야 한다. 또한 이 패키지는 ComfyUI용 checkpoint로 제공되며 Transformers API로 바로 쓰는 완전한 생성 레포지토리는 아니어서 통합 작업이 추가로 필요하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU | accuracy | 79.87% | — |
| PIQA | accuracy | 92.87% | — |
| Refusal rate | rate | 4/100 | vs original: 99/100 |
88
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.