LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF
Qwen3.6‑35B 기반의 Genesis 텐서 수리형 멀티모달 MoE GGUF
학습 방식 · 이 배포는 전통적 Fine-tuning이 아니라 파일 내부 텐서의 수치적 보정 과정을 적용한 후처리 워크플로우입니다. 구현은 ssm_conv1d 텐서의 헤드 균형을 조정하고, token_embd.weight·output.weight·일차원 텐서·bias·norms 등은 제외한 채로 커스텀 SVD를 적용해 노이즈를 줄이되 학습된 신호와 그래디언트를 보존하는 방식으로 진행됩니다. 추가로 Hermes 데이터에서 약 2k 블록을 FFN expert 텐서 두 곳으로부터 전이해온 기록을 결합해 Hermes 에이전트 동작과의 적합도를 높이려는 시도가 포함되어 있습니다.
TL;DR
Qwen3.6-35B-A3B Uncensored 기반의 GGUF 배포본으로, 별도 재학습 없이 텐서 수준의 수치적 수리(Genesis)로 내부 노이즈를 줄여 안정성과 지시 따름 능력을 개선하려는 목적의 베이스 모델입니다. 아키텍처는 35B 파라미터·MoE(256 experts, 8 active + 1 shared)·하이브리드 DeltaNet/softmax attention을 사용하며 네이티브 컨텍스트 262K와 멀티모달 비전 지원을 명시하고 있어 이미지-텍스트-텍스트 파이프라인에 적합합니다. 배포는 GGUF 포맷이며 llama.cpp·LM Studio 등에서 동작하고 APEX 양자화 권장 설정 및 RTX 3060 최적화 가이드가 포함되어 있으므로 로컬 실험과 에이전트용 테스트에 곧바로 활용할 수 있습니다.
핵심 포인트
- 이 모델은 Qwen3.6-35B-A3B Uncensored 기반의 35B MoE 모델을 Genesis 후처리로 정제한 GGUF 배포본이며, Genesis 처리 과정이 모델 파일의 텐서 자체를 수치적으로 '수리'하도록 설계되어 있습니다. Genesis는 ssm_conv1d와 일부 FFN 관련 텐서를 스캔하고 사용자 정의 SVD 절차로 노이즈를 줄이며 학습 신호의 약 99%와 그래디언트를 보존한다고 모델 페이지에서 밝히고 있습니다. 결과적으로 별도 재학습 없이도 출력의 안정성·지시 따름·문맥 기억 능력을 개선하려는 목적을 가지고 있습니다.
- 아키텍처는 MoE(hybrid MoE) 기반으로 설계되어 있으며 전체 파라미터는 35B이지만 한 포워드에서 활성화되는 실질 파라미터는 약 3B로 표기되어 있습니다. 전문가 수는 256개이고 토큰당 라우팅되는 활성 전문가는 8개(plus 1 shared)로 명시되어 있어 대규모 Mixture-of-Experts 라우팅이 핵심 성능 요소입니다. 또한 Gated DeltaNet linear attention과 full softmax attention을 혼용하는 하이브리드 어텐션(3:1 비율)과 40개 레이어 패턴을 갖추어 멀티모달·대맥락 처리에 초점을 맞춥니다.
- 멀티모달·비전 기능과 Hermes 에이전트 데이터와의 호환을 강조하며 NousResearch/hermes-function-calling-v1 데이터셋에서 파생된 블록을 일부 이전했다고 명시되어 있습니다. 배포판은 GGUF 포맷으로 제공되어 llama.cpp, LM Studio, koboldcpp 등 GGUF 호환 런타임에서 동작하며 APEX 양자화 권장 설정과 RTX 3060용 오프로드·캐시 설정 가이드가 포함되어 있습니다. 또한 네이티브 컨텍스트는 262K이며 YaRN을 통해 1M까지 확장 가능하다고 표기되어 있어 긴 문맥 유지가 요구되는 애플리케이션에 적합합니다.
제한사항
- 배포판은 'uncensored' 태그가 명시된 uncensored 기반 모델을 그대로 계승하고 있어 상업적 공개 엔드포인트나 규제가 엄격한 환경에서는 안전성·콘텐츠 정책 측면의 리스크가 존재할 수 있습니다. README에 0/465 refusals라는 문구가 있어 거부 정책이 적용되지 않은 응답 행동을 보일 가능성이 큽니다. 따라서 운영 환경에 투입하기 전 별도의 검열·필터링 레이어를 추가하는 것이 권장됩니다.
- MoE 구조와 대용량 컨텍스트를 활용하기 위해 특정 런타임 설정과 하드웨어 오프로드가 필요하다고 명시되어 있습니다. RTX 3060(12GB)을 위한 APEX quant 프로파일과 K/V 캐시 설정, 일부 레이어에 대해 MoE 가중치를 CPU로 강제하는 설정 등 구체적 권장값이 제공되므로 권장값을 따르지 않으면 메모리 부족이나 불안정 실행이 발생할 수 있습니다. 또한 비전 기능은 mmproj 파일을 GGUF와 같이 배치해야 동작하므로 멀티모달 워크플로우 구성 시 추가 파일 관리가 필요합니다.
- Genesis 절차는 재학습을 수반하지 않는 수치적 수리 방식이며 저자가 제시한 보존 비율(신호 99% 등)은 구현 세부에 따라 달라질 수 있으므로 완전한 성능 재현성은 보장되지 않습니다. README는 Genesis가 노이즈 게이트를 해소한다고 주장하지만 공개된 대규모 벤치마크 수치가 포함되어 있지 않아 외부 검증이 필요합니다. 따라서 프로덕션 채택 전에 자체적인 안정성·품질 벤치마크를 수행하는 것이 필요합니다.
384
Likes
308.9k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.