unsloth/Kimi-K3
세계 최초 오픈 3T급 MoE로 100만 토큰 컨텍스트와 네이티브 멀티모달을 지원하는 에이전틱 모델
학습 방식 · Kimi Delta Attention(KDA)과 Attention Residuals(AttnRes) 기반 Stable LatentMoE로 896개 전문가 중 16개를 라우팅하며, 처음부터 MXFP4 가중치·MXFP8 활성값의 양자화 인지 학습(QAT)으로 훈련했다.
TL;DR
Kimi K3는 2.8T 총 파라미터 중 104B만 활성화하는 세계 최초의 오픈 3T급 MoE로, Kimi Delta Attention(KDA)과 Attention Residuals(AttnRes) 기반 Stable LatentMoE로 896개 전문가 중 16개만 라우팅해 이전 세대 Kimi K2 대비 스케일링 효율을 약 2.5배 개선했다. 텍스트·이미지·비디오를 하나의 모델에서 처리하는 네이티브 멀티모달리티와 100만 토큰 컨텍스트를 지원해 장기 엔지니어링 세션, 대형 리포지토리 탐색, 터미널 도구 오케스트레이션 같은 장기 에이전틱 작업에 쓰도록 설계됐다. 처음부터 MXFP4 가중치·MXFP8 활성값으로 양자화 인지 학습을 마쳐 별도 사후 양자화 없이도 저정밀 서빙이 가능하며, GPQA Diamond 93.5·AA-LCR 74.7 등에서 Claude Opus 4.8 등 비공개 프런티어 모델과 근접한 점수를 낸다. Kimi K3 라이선스로 웨이트가 전면 공개돼 연구·배포·추가 개발에 자유롭게 쓸 수 있다.
핵심 포인트
- 2.8T 중 104B만 활성화하는 세계 최초의 오픈 3T급 MoE로, 896개 전문가 중 16개만 라우팅하는 Stable LatentMoE 구조를 쓴다.
- KDA와 Attention Residuals로 이전 세대(Kimi K2) 대비 스케일링 효율을 약 2.5배 개선했다.
- 텍스트·이미지·비디오를 같은 모델에서 처리하는 네이티브 멀티모달리티와 100만 토큰 컨텍스트를 지원한다.
- MXFP4 가중치로 처음부터 학습해 별도 사후 양자화 없이 저정밀 서빙이 가능하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPQA Diamond | accuracy | 93.5 | Claude Opus 4.8 91.0, GPT-5.6 Sol 94.1 |
| AA-LCR | accuracy | 74.7 | GLM-5.2 71.3 |
| CritPt | score | 23.4 | GPT-5.6 Sol 32.3 |
242
LIKES
1.3k
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.