MoE 구조에 최적화된 특수 양자화로 성능 저하를 최소화한 35B 로컬 실행 모델
텍스트 생성 및 대화형 AI35B
Qwen3.5-35B-A3B의 MoE 아키텍처를 분석하여 FFN 텐서를 효율적으로 압축한 고성능 GGUF 양자화 모델입니다.
핵심 역량
- MoE 아키텍처 특화 혼합 양자화 적용
- imatrix 기반의 정밀한 가중치 압축
- Q4_K_M 기준 약 20.61 GiB의 효율적인 용량
- 낮은 Perplexity(PPL) 손실 유지
- GGUF 포맷을 통한 폭넓은 로컬 런타임 호환성
알아두면 좋은 것
- FFN UP, GATE, DOWN 텐서에 특화된 혼합 양자화 기법 적용
- Q4_K_M 양자화 시 베이스 모델 대비 PPL 증가율을 0.5055% 수준으로 억제
- IQ3_S(12.64 GiB)부터 Q8_0(34.36 GiB)까지 다양한 비트레이트 옵션 제공
- KLD(Kullback-Leibler Divergence) 분석을 통한 파레토 최적화 데이터 제공
56
Likes
22.2k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.