100만 토큰도 거뜬하게! 1조 파라미터급 성능과 초고속 추론의 결합
텍스트 생성 및 초장거리 문맥 추론1T (63B Active)1K 컨텍스트mit
하이브리드 선형 어텐션 구조를 통해 1M 컨텍스트를 지원하며, 기존 모델 대비 4배 적은 토큰 소모로 동급의 추론 성능을 제공합니다.
핵심 역량
- 1M(100만) 토큰 초장거리 컨텍스트 지원
- 하이브리드 선형 어텐션 아키텍처로 추론 효율 극대화
- 63B 활성 파라미터 기반의 고성능 연산
- BFCL-V4 벤치마크 상위권의 도구 호출 능력
- SGLang 기반의 멀티 노드 분산 추론 지원
- 29T 토큰 규모의 최신 사전 학습 코퍼스 적용
알아두면 좋은 것
- 1M 컨텍스트 구간에서 우수한 NIAH 성능 및 RULER 벤치마크 결과 보유
- DeepSeek V3.2 대비 긴 문장 생성 시 유의미한 처리량(Throughput) 우위 확인
- YaRN 기법을 활용한 안정적인 컨텍스트 윈도우 확장
- MIT 라이선스 적용으로 자유로운 연구 및 상업적 이용 가능
98
Likes
1.8k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.