Qwen3.6 35B 무검열 Aggressive 변형
이미지와 텍스트 입력을 함께 받아 텍스트 형식으로 응답을 생성하는 멀티모달 image-text-to-text 작업을 수행한다.35B total parameters; ~3B active per forward pass (MoE)262K 컨텍스트apache-2.0
Qwen3.6-35B-A3B 기반의 HauhauCS 무검열 Aggressive 변형으로 MoE 아키텍처와 K_P 커스텀 양자화로 멀티모달 이미지-텍스트 출력을 지원한다.
TL;DR
HauhauCS의 Qwen3.6-35B-A3B Uncensored Aggressive 변형은 원본 Qwen3.6-35B-A3B의 기능과 데이터 기반을 유지하면서 모든 거부 응답을 제거한 멀티모달 이미지-텍스트-투-텍스트 모델이다. 아키텍처는 MoE로 설계되어 전체 35B 파라미터 중 토큰당 약 3B만 활성화하고 256개의 전문가와 토큰당 8개 라우팅을 사용하며 하이브리드 어텐션(선형:softmax = 3:1)과 네이티브 262K 컨텍스트를 특징으로 한다. 배포 측면에서는 K_P 커스텀 양자화와 중요도 행렬(imatrix)을 통해 양자화 품질을 유지하면서 파일 크기를 5~15% 수준으로 관리한 여러 GGUF 양자화 변형을 제공하며 대부분의 GGUF 호환 런타임에서 사용 가능하다. 실무적 고려로는 시각 처리에 mmproj 보조 파일이 필요하고 무검열 특성으로 인해 기존 안전 거부가 제거되어 응답 내용의 위험성 관리가 사용자의 몫으로 남는다는 한계가 존재한다.
핵심 역량
- 이미지와 텍스트를 결합한 멀티모달 입력을 받아 텍스트 응답을 생성하는 기능을 제공한다. 이 모델은 mmproj 보조 파일을 사용해 시각 입력을 처리하며 GGUF 호환 런타임에서 이미지-텍스트 파이프라인을 구동할 수 있다. 대화형 컨텍스트와 멀티턴 상호작용도 지원되어 대화형 이미지 설명이나 질의응답에 활용될 수 있다.
- 대규모 컨텍스트를 활용해 장거리 의존성을 유지하는 처리 능력을 제공한다. 모델은 네이티브 262K 토큰 컨텍스트를 지원하며 README에서는 사고력 유지를 위해 최소 128K 컨텍스트 사용을 권장하고 있다. 긴 문맥을 필요로 하는 문서 요약이나 장편 대화에서 유리한 동작을 보일 가능성이 있다.
- 고용량 파라미터와 MoE 구조를 통해 복잡한 추론 패턴을 처리할 수 있는 능력이 설계되어 있다. 전체 파라미터 수는 35B지만 토큰당 활성화되는 파라미터는 약 3B 수준으로 제한되어 계산 효율을 높인다. 이 구조는 다양한 토큰 패턴마다 다른 전문가 집합을 활용해 영역별 표현력을 유지한다.
- 다양한 양자화 버전과 호환 런타임을 통해 실무 환경에서 선택적으로 성능과 용량을 조정할 수 있다. Q8_K_P, Q6_K_P, Q5_K_P 등 K_P 기반 양자화 파일이 제공되어 파일 크기와 정밀도 사이의 균형을 조정할 수 있다. 대부분의 GGUF 호환 런타임에서 로드 가능하므로 배포 유연성이 높다.
강점
- 원본 Qwen3.6-35B-A3B의 기능을 유지하면서 검열 거부를 제거한 변형이라는 점이 이 모델의 핵심 강점이다. README에서 'No changes to datasets or capabilities'를 명시해 원본의 성능·데이터 기반 특성을 그대로 유지하고 있음을 밝히고 있다. 따라서 기존 Qwen 사용자들이 원본 동작을 기대하면서 거부 응답 없이 콘텐츠를 생성할 수 있다는 점에서 실무적 연속성이 존재한다.
알아두면 좋은 것
- 이 모델은 원본 Qwen3.6-35B-A3B의 기능을 유지한 무검열 변형으로서 거부 응답이 제거된 상태로 배포되어 있으며 README 상에 '0/465 Refusals'가 명시되어 있다. 무검열 설정은 기본 안전 거절을 제거한 결과로서 완전한 콘텐츠 생성을 목표로 하고 있고 일부 경고문이 본문에 포함될 수 있다고 안내되어 있다. 보수적인 검열을 유지하는 Balanced 변형이 추후 제공될 수 있다고 함께 언급되어 있다.
- K_P quants는 각 모델에 맞춘 최적화된 양자화 프로필로서 중요도가 높은 가중치를 선택적으로 보존해 양자화 품질을 1~2단계 끌어올리되 파일 크기는 약 5~15%만 증가시키는 설계라고 명시되어 있다. K_P quants는 llama.cpp와 LM Studio 및 기타 GGUF 호환 런타임과의 호환성을 유지한다고 안내되어 있으며 일부 툴에서 K_P를 '?'로 표시하는 UI 표시 문제만 존재한다고 경고하고 있다. 중요도 기반 행렬(imatrix)을 사용해 가중치 훼손을 최소화한 것이 표에 표시된 여러 양자화 파일과 함께 설명되어 있다.
- 모델은 시각 입력 지원을 위해 mmproj 보조 파일이 필요하며 mmproj 파일 예시(f16)가 리포지터리에 포함되어 있어 시각 파이프라인을 동시에 로드해야 정상적으로 동작한다고 명시되어 있다. README의 사용 예시에서 llama-cli 실행 시 --mmproj 플래그와 --jinja 템플릿 옵션을 함께 사용하도록 권장하고 있으며 시각 처리를 위한 추가 파일이 없으면 이미지 기능이 제한될 수 있다. 이 점은 실무 배포 시 파일 누락으로 인한 동작 실패를 방지하기 위한 중요한 전제 조건이다.
- 권장 설정으로 'Thinking mode'와 'Non-thinking mode'의 온도, top_p, top_k 등 파라미터 조합이 제공되어 있어 추론 성격에 따라 출력을 조정할 수 있다. 특히 사고력 유지를 위해 충분한 컨텍스트(권장 128K 이상)를 확보할 것을 명시하고 있고 llama.cpp에서 --jinja 플래그로 채팅 템플릿 처리를 활성화할 것을 권고하고 있다. 이러한 권장치는 모델이 원래 의도한 동작 특성을 재현하기 위한 실무 설정 지침으로 역할을 한다.
기술적 특징
- MoE 아키텍처 구성은 모델의 핵심 설계 결정으로서 256명의 전문가를 두고 토큰당 8개의 전문가만 라우팅해 단일 포워드 패스에서 활성 파라미터를 약 3B로 유지한다. 이 방식은 전체 파라미터 수를 35B로 크게 두면서도 토큰 단위 계산 부담을 줄이는 효과를 제공한다. 결과적으로 영역별 표현력을 확보하면서도 추론 시 필요한 연산을 제한하는 균형을 달성한다.
- 하이브리드 어텐션 구성은 선형 어텐션과 전체 softmax 어텐션을 결합해 3:1 비율로 혼용하는 설계를 취하고 있다. 이 설계는 긴 시퀀스 처리에서 메모리와 계산 비용을 낮추는 동시에 특정 구간에서는 정밀한 softmax 어텐션을 사용해 표현력을 보존하려는 목적을 갖는다. 하이브리드 구성이 긴 컨텍스트와 정밀 추론 간의 실용적 트레이드오프를 조정하는 수단으로 작동한다.
- K_P 양자화와 중요도 행렬(imatrix)은 양자화 과정에서 품질을 보존하기 위한 구현적 기법이다. 모델별 최적화 프로필을 만들어 중요도가 높은 파라미터를 선택적으로 보존함으로써 양자화 단계에서 생기는 성능 저하를 최소화하고 파일 크기 증가는 5~15% 수준으로 제한한다. 이 접근은 GGUF 기반 런타임과의 호환성을 유지하면서도 고품질 양자화를 달성하는 데 기여한다.
- 네이티브 멀티모달 지원과 초대형 컨텍스트는 모델 사용성 측면의 기술적 하이라이트이다. 모델은 텍스트·이미지·비디오 입력을 네이티브로 수용한다고 되어 있으며 262K 토큰의 네이티브 컨텍스트를 제공해 장거리 의존성 처리에서 이점을 가진다. 다만 시각 처리에는 mmproj 보조 파일이 필요하므로 멀티모달 동작을 완전하게 활용하려면 추가 파일 로드가 필수적이다.
차별점
- 무검열 Aggressive 변형으로서 README에 '0/465 Refusals'가 명시되어 있어 원본 대비 거부 응답이 제거된 상태로 배포된 점이 차별화 요소다. 이로 인해 모델은 거부 없이 응답을 생성하도록 구성되어 있으며 일부 짧은 면책문구만 삽입될 수 있다고 안내되어 있다. 보수적 안전장치를 유지하는 Balanced 변형과 대비되는 위치를 취한다.
- K_P 커스텀 양자화와 importance matrix를 통해 양자화 품질을 우선 보전하도록 구성된 점이 다른 공개 양자화 배포본과 구별되는 요소다. README에서는 K_P가 기본 양자화 대비 1~2단계 품질 향상을 제공하면서도 파일 크기 증가를 5~15%로 억제한다고 명시하고 있다. 또한 대부분의 GGUF 호환 런타임에서 별도 빌드 없이 로드 가능하다고 안내되어 있어 배포 편의성도 확보되어 있다.
- 대규모 MoE 구성과 하이브리드 어텐션의 결합이 아키텍처 차별화를 만든다. 256 전문가, 토큰당 8개 라우팅, 40개 레이어와 같은 구체적 설계 수치가 공개되어 있어 모델의 확장성과 활성 파라미터 제어 방식이 명확하게 드러난다. 이러한 설계는 대규모 파라미터 기반에서 계산 효율과 표현력을 동시에 노리는 전략적 선택이다.
3.2k
Likes
1.8M
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.