11B 활성 파라미터로 초당 350개 토큰 생성, 유료 모델급 추론 성능의 MoE 혁신
텍스트 생성, 코드 생성, 복합 추론 및 AI 에이전트 작업196B (11B Active)256K 컨텍스트apache-2.0
196B MoE 구조와 MTP-3 기술을 통해 초고속 추론과 강력한 에이전트 성능을 제공하는 고효율 오픈소스 모델입니다.
핵심 역량
- 196B MoE 아키텍처 (토큰당 11B 활성화로 효율 극대화)
- MTP-3 기술 기반 초당 100~350개 토큰의 초고속 생성
- 256K 컨텍스트 윈도우 지원 (3:1 Sliding Window Attention 적용)
- SWE-bench Verified 74.4%의 최상위권 코딩 성능
- AIME 2025 97.3% 달성으로 입증된 강력한 수학적 추론
- vLLM, SGLang, llama.cpp 등 다양한 로컬 배포 환경 지원
알아두면 좋은 것
- AIME 2025 97.3%, SWE-bench 74.4% 등 주요 벤치마크에서 유료 모델급 성능 기록
- 한국어와 영어를 포함한 다국어 지원 및 Apache 2.0 라이선스로 상업적 활용 가능
- FP8 및 BF16 양자화를 지원하여 고사양 소비자 하드웨어에서 로컬 실행 최적화
- 3-way Multi-Token Prediction을 통해 단일 패스에서 4개 토큰 동시 예측
647
Likes
305k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.