35B의 성능을 3B의 비용으로, FP8 양자화로 완성된 Qwen3.5 멀티모달 MoE
이미지 및 텍스트 이해 기반 텍스트 생성35B (3B Activated)262K 컨텍스트apache-2.0
35B 파라미터 중 3B만 활성화하는 MoE 구조와 FP8 양자화로 속도와 성능을 극대화한 멀티모달 모델입니다.
핵심 역량
- 35B 파라미터 중 3B만 활성화하는 MoE 구조
- 262K 기본 컨텍스트 (최대 1M 확장 지원)
- FP8 정밀도 양자화로 메모리 점유 및 지연 시간 단축
- 한국어 포함 201개 언어 및 방언 지원
- vLLM, SGLang, KTransformers 즉시 호환
- 시각적 이해와 논리적 추론의 통합 성능
알아두면 좋은 것
- MMLU-Pro 85.3 및 IFEval 91.9 기록 (고성능 지식 및 지시 이행)
- 한국어 포함 201개 언어 지원으로 글로벌 범용성 확보
- FP8 양자화 적용에도 원본 모델과 거의 동일한 벤치마크 성능 유지
- Gated Delta Networks 기반 하이브리드 구조로 추론 처리량 극대화
98
Likes
779k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.