ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot
H3 0–49 엔코더와 선택적 50–63 generation tail을 분리 제공하는 Qwen3‑VL‑32B ComfyUI 패키지
학습 방식 · 변환·양자화 워크플로우 중심이며 학습 자체는 상위에 고정된 llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic 리비전에서 가져왔습니다. Heretic v1.2.0의 ARA 편집(attn.o_proj in layers 31–40)이 0–49 범위에 포함되어 있어 uncensoring 관련 편집 결과가 H3 엔코더에 반영되어 있습니다. 원본 수치(예: 4/100 refusal, KL 0.0421, PIQA 92.87%, MMLU 79.87%)는 모델 카드에 기록되어 있으나 abliteration이 거부 행동을 완전히 제거한다고 보장하지는 않습니다.
TL;DR
ComfyUI용 H3 conditioning encoder(embedding + layers 0–49 + vision tower)와 선택적 generation tail(언어층 50–63·final norm·LM head)을 분리 제공하는 Qwen3‑VL‑32B 파생 패키지로, 기반 모델은 llmfan46/Qwen3‑VL‑32B‑Instruct‑ultra‑uncensored‑heretic이며 BF16 원본과 학습된 row‑wise INT8 ConvRot 양자화(ConvRot group size 256) 버전을 함께 배포합니다. H3 엔코더는 layer 49 직후의 정규화되지 않은 히든을 출력하고 tail은 생성 중에만 임시 로드되어 생성 완료 후 언로드되므로 32GB급 GPU에서 엔코더를 상주시킨 채로 낮은 메모리로 텍스트·비전 생성 파이프라인을 운영할 수 있습니다. 변환은 AdamW AdaRound 기반의 학습적 양자화 워크플로우로 수행되었고 중요한 BF16 텐서는 원본과 바이트 일치 검증을 통과해 양자화 메타데이터 무결성이 확보되어 있습니다.
핵심 포인트
- 이 패키지는 ComfyUI H3 conditioning encoder(embedding + language layers 0–49 + vision tower)와 선택적으로 연결해 쓰는 generation tail(언어층 50–63·final norm·LM head)을 따로 제공해 Qwen3‑VL 32B 기반 생성 파이프라인을 분리하여 운영하게 구성되어 있습니다. H3는 layer 49 직후의 정규화되지 않은 히든 스테이트를 소비하도록 설계되어 tail을 임시로 로드해 생성한 뒤 안전하게 언로드할 수 있습니다.
- 정밀도·포맷별로 BF16 원본과 INT8 ConvRot 양방향 빌드가 제공되며, encoder BF16 원본은 약 47.97 GiB이고 INT8 ConvRot는 약 24.55 GiB로 용량 절감과 실행 가능성을 동시에 노렸습니다. generation tail은 BF16, INT8 ConvRot, NVFP4/AWQ 포맷으로 나뉘며 각각 크기와 런타임 메모리 요구가 크게 다릅니다.
- Quantization 변환은 silveroxides/convert_to_quant 도구에서 AdamW AdaRound 최적화(4000iter, convrot 그룹사이즈 256)를 사용해 수행되었고, 비전 타워는 BF16으로 보존하여 시각 모달리티 품질을 유지했습니다. 보호된 BF16 텐서와 양자화 메타데이터는 바이트 단위로 원본과 일치하도록 검증되어 형식적 무결성이 확보되어 있습니다.
제한사항
- H3 체크포인트가 언어층 50–63, 최종 언어 norm 및 LM head를 의도적으로 생략하고 있어 단독으로는 완전한 생성 모델이 되지 않습니다. 따라서 생성용으로는 대응하는 generation tail을 임시로 로드해야 하며 tail 없는 경로는 연결된 CLIP이 이미 완전한 생성 모델일 때만 동작합니다.
- INT8 ConvRot 빌드는 메모리를 크게 낮추지만 일부 행렬은 학습된 ConvRot로 양자화되어 있고 임베딩은 단순 INT8 텐서 형태로 남아 있어 특정 ComfyUI 노드/레이아웃 제약을 따릅니다. 최적의 커널 성능을 위해서는 ComfyUI가 권장하는 PyTorch/CUDA 환경(CUDA 13.0+ 권장)을 사용하는 편이 안정적입니다.
- Heretic/abliteration 편집은 거부 응답 빈도를 낮추는 방향으로 조정되었으나 품질 저하나 안전성 변경이 발생할 수 있으므로 배치 전 자체 평가와 정책 검토가 필요합니다.
279
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.