Genesis-SVD로 텐서 손상 복구한 Qwen3.6 35B 멀티모달 베이스
Qwen3.6-35B 기반 멀티모달 베이스 모델로서 SVD 기반의 수치적 텐서 복구(Genesis-SVD)를 통해 재학습 없이 손상된 가중치와 스케일 불일치를 정리해 안정성을 개선한 모델이다.
TL;DR
이 모델은 HauhauCS의 Qwen3.6-35B-A3B-Uncensored를 기반으로 한 멀티모달 베이스 모델이며 저자는 재학습 없이 Genesis-SVD라는 SVD 기반 수치 복원 절차로 손상된 텐서 블록과 스케일 불일치를 수리해 안정성을 개선했다. 기술적으로는 35B 전체 파라미터에 256개 전문가를 둔 MoE 구조를 사용해 전방 패스당 약 3B만 활성화하고, DeltaNet 선형 어텐션과 full softmax 어텐션을 3:1로 혼합한 하이브리드 설계를 적용해 효율성과 표현력을 균형시킨다. 기본 컨텍스트는 262K로 매우 길며 Vision 지원은 mmproj 보조 파일을 요구하고 GGUF 형식으로 여러 로컬 런타임과 호환되며 APEX/Q8_K_P 양자화를 권장한다. 이러한 접근은 재학습 부담을 피하면서 손상된 가중치의 수치적 정합성을 회복할 수 있는 반면, 수리 절차와 MoE 라우팅·오프로딩 설정은 런타임 구성과 검증이 필요하다는 한계가 있다.
핵심 역량
- 텍스트와 이미지를 함께 입력받아 텍스트 응답을 생성할 수 있다.
- 대규모 컨텍스트(기본 262K 토큰, 확장 시 1M) 내에서 긴 대화와 문서 기반 추론을 처리할 수 있다.
- MoE 구조를 이용해 토큰별로 소수 expert만 활성화하면서 대형 모델 용량을 활용해 복잡한 생성·이해 작업을 수행할 수 있다.
강점
- MoE 구조로 전체 파라미터는 35B에 달하지만 토큰별 활성화가 약 3B로 유지되어 대형 용량과 실사용 가능한 전방 패스 비용을 동시에 확보한다.
- Genesis-SVD는 재학습 없이 손상된 텐서 블록을 같은 이름·형태의 다른 청크로 교체하고 스케일을 정규화해 수치적 불안정을 직접 보정하는 수학적 처리 흐름을 적용했다.
- Apache-2.0 라이선스로 공개되어 상업적 이용과 배포에서 라이선스 장벽이 낮다.
훈련 방식
기반 모델은 HauhauCS의 Qwen3.6-35B-A3B-Uncensored이며 저자는 재학습을 수행하지 않고 Genesis-SVD라는 SVD 기반 수치 복원 절차로 손상된 텐서 블록을 탐지·대체·정규화해 모델 신호를 복구하는 접근을 사용했다.
알아두면 좋은 것
- 이 모델은 HauhauCS의 Qwen3.6-35B-A3B-Uncensored 기반을 바탕으로 하며 기여자는 Genesis-SVD로 불리는 수치적 텐서 복원 기법을 적용해 신호 손상을 수리했다고 명시되어 있다.
- 모델 스펙은 35B 전체 파라미터에 전방 패스당 약 3B만 활성화되는 MoE 구조, 하이브리드(DeltaNet 선형 어텐션과 full softmax 어텐션 3:1) 아키텍처, 262K 기본 컨텍스트를 갖춘 멀티모달 구성을 포함한다.
- 런타임 및 배포 관련 권장은 APEX 또는 Q8_K_P 양자화, GGUF 호환 런타임(예: llama.cpp, LM Studio, koboldcpp)과의 호환성, 그리고 Vision 지원을 위해 mmproj 파일을 동봉할 것을 요구한다.
기술적 특징
- Genesis-SVD는 특정 텐서(예: ssm_out.weight, attn_*.weight 등)를 블록 단위로 스캔해 같은 이름과 형태를 가진 청크들 중 분포에 가장 적합한 청크로 손상된 구간을 대체하는 방식으로 동작한다. 이 절차는 SVD 기반 재구성 및 스케일 정규화를 결합해 제로 블록이나 과도한 스케일로 인한 신호 왜곡을 줄이며 재학습 없이 파일 수준에서 수치적 복구를 달성한다.
- 모델 아키텍처는 40 레이어 구조로서 패턴적으로 10번 반복되는 블록 안에 3개의 DeltaNet-MoE 계층과 1개의 Attention-MoE 계층을 배치해 계산 효율과 표현력을 조합했다. DeltaNet 선형 어텐션은 장기 의존성 처리 비용을 낮추는 반면 일부 계층의 full softmax 어텐션은 정밀한 문맥 통합을 보장해 정확도와 효율성을 균형시킨다.
- MoE 구성은 총 256개의 전문가를 보유하고 토큰당 8개의 활성 전문가와 1개의 공유 전문가를 라우팅해 전방 패스당 활성 파라미터를 줄이면서도 모델 용량을 키우는 설계를 따른다. 이로 인해 추론 시 메모리·연산 요구가 감소하는 반면 라우팅과 전문가 관리에서 추가적인 런타임 제어(예: 일부 레이어를 CPU에 강제 배치)가 필요하다.
- 긴 컨텍스트 설계(기본 262K, YaRN으로 1M 확장 가능)는 대규모 문서 및 대화 상태를 유지하는 멀티모달 응용에 적합하며 SSM 관련 텐서의 스케일과 분포를 정규화하는 것이 이러한 긴 문맥에서의 안정성 유지에 중요하다. Vision 입력을 지원하려면 GGUF와 함께 mmproj 같은 보조 파일이 요구되어 배포 시 파일 구성 관리가 필요하다.
차별점
- 파일 수준에서 SVD 기반 청크 탐지·대체로 손상된 가중치를 복구하는 Genesis-SVD 수리 절차를 적용했다.
- DeltaNet 선형 어텐션과 full softmax 어텐션을 3:1 비율로 혼합한 하이브리드 어텐션 설계를 채택했다.
- 256개의 전문가를 보유한 MoE 구조로 총 35B 파라미터지만 전방 패스당 약 3B만 활성화되는 설계를 사용한다.
- 기본 컨텍스트 길이가 262K로 대규모 문서·대화 유지에 초점을 맞추었으며 YaRN으로 1M까지 확장이 가능하다.
186
Likes
83.7k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.