moonshotai/Kimi-K3
Moonshot AI의 2.8T 파라미터 오픈 웨이트 모델로 신규 KDA/AttnRes 아키텍처와 104B 활성 파라미터, 1M 토큰 컨텍스트, 네이티브 멀티모달을 결합한 최고 성능 Kimi다.
학습 방식 · KDA·AttnRes 기반의 새 아키텍처와 896개 전문가·16개 활성 라우팅의 Stable LatentMoE를 처음부터 학습했고, SFT 단계부터 MXFP4 가중치/MXFP8 활성화 양자화 인식 학습(QAT)을 적용했다.
TL;DR
Kimi K3는 Moonshot AI가 공개한 2.8T 총 파라미터·104B 활성 파라미터 규모의 오픈 웨이트 모델로, Kimi Delta Attention(KDA)과 Attention Residuals(AttnRes)를 새로 도입하고 896개 전문가 중 16개만 활성화하는 Stable LatentMoE로 K2 대비 약 2.5배의 스케일링 효율을 달성했다고 밝힌다. 텍스트·이미지·비디오를 하나의 모델에서 이해하며 1M 토큰 컨텍스트를 네이티브로 지원해, 최소한의 인간 개입으로 대규모 리포지토리를 탐색하고 터미널 도구를 오케스트레이션하는 장기 코딩 세션을 유지할 수 있다. GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2 등에서 Claude Opus 4.8·GPT-5.5와 대등하거나 앞서는 결과를 보였고, SFT 단계부터 MXFP4 가중치/MXFP8 활성화 양자화를 적용한 QAT로 광범위한 하드웨어에서 서빙 가능하도록 만들었다. Kimi Code CLI와 함께 쓰면 GPU 커널 최적화부터 칩 설계까지 아우르는 장기 엔지니어링 작업에 적합하다.
핵심 포인트
- KDA+AttnRes와 896개 중 16개만 쓰는 Stable LatentMoE로 K2 대비 약 2.5배 스케일링 효율을 낸다.
- 1M 토큰 네이티브 컨텍스트와 텍스트·이미지 통합 처리로 장기 코딩 세션을 유지한다.
- GPQA Diamond 93.5·Terminal-Bench 2.1 88.3·BrowseComp 91.2로 Claude Opus 4.8을 앞선다.
- SFT 단계부터 MXFP4/MXFP8 양자화 인식 학습(QAT)을 적용해 넓은 하드웨어에서 서빙할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPQA Diamond | score | 93.5 | Claude Opus 4.8 91.0 |
| Terminal-Bench 2.1 | score | 88.3 | Claude Opus 4.8 84.6 |
| BrowseComp | score | 91.2 | Claude Opus 4.8 84.3 |
11.3k
LIKES
2.3M
DOWNLOADS
10 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.