35B의 지능을 3B의 비용으로, 100만 토큰을 처리하는 Qwen3.5 멀티모달 MoE 베이스 모델
이미지 및 텍스트 입력 기반 텍스트 생성 (멀티모달 이해 및 추론)35B (3B Activated)262K 컨텍스트apache-2.0
Gated DeltaNet과 MoE를 결합하여 3B 파라미터 수준의 비용으로 35B급 성능을 내는 초장문 지원 멀티모달 베이스 모델입니다.
핵심 역량
- 35B 전체 파라미터 중 3B 활성화로 고효율 추론 가능
- 최대 1,010,000 토큰의 초장문 컨텍스트 확장 지원
- 이미지-텍스트 통합 학습(Early Fusion) 기반 멀티모달 처리
- 한국어를 포함한 201개 이상의 글로벌 언어 및 방언 지원
- Gated DeltaNet과 MoE 결합을 통한 낮은 지연 시간 구현
알아두면 좋은 것
- 총 35B 파라미터 중 3B만 활성화되는 효율적인 MoE 구조
- 네이티브 262K, 최대 1M 토큰까지 확장 가능한 컨텍스트 길이
- 한국어 포함 201개 언어 지원으로 글로벌 서비스 적합성 확보
- Apache 2.0 라이선스로 상업적 활용 및 수정에 유연함
113
Likes
7.6k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.