1백만 토큰과 2.8T 파라미터로 장기 코딩·에이전트 작업을 겨냥한 공개형 멀티모달 모델
Kimi K3는 2.8T 파라미터의 MoE 기반 네이티브 멀티모달 모델로 1백만 토큰 컨텍스트와 MXFP4 양자화를 통해 대규모 장기 작업과 에이전트 활용을 지원한다.
TL;DR
Kimi K3는 Moonshot AI가 공개한 2.8T 파라미터급 네이티브 멀티모달 모델로서 Kimi Delta Attention과 Attention Residuals, Stable LatentMoE를 결합해 대규모 파라미터를 유지하면서 활성화되는 연산을 제한하도록 설계되었다. 모델은 MoonViT-V2 비전 인코더를 통합해 이미지와 텍스트를 동일한 컨텍스트 창에서 처리하며 1백만 토큰의 장기 컨텍스트를 지원하고 SFT 단계부터 MXFP4 가중치와 MXFP8 활성화를 적용한 양자화 인식 학습을 사용해 하드웨어 호환성을 확보했다. 벤치마크에서는 GPQA 93.5, BrowseComp 91.2 등 에이전트·멀티모달 항목에서 높은 성능을 기록했고 README는 K2 대비 약 2.5배의 스케일링 효율 향상을 보고하고 있다. 전체 가중치를 Kimi K3 License로 공개하고 플랫폼 API와 여러 추론 엔진용 레시피를 제공해 연구와 배포에 접근성을 열어두었으나 라이선스 조건과 실환경 추론 비용·자원 요구는 공개 문서로 확인해야 한다.
핵심 역량
- Kimi K3는 텍스트와 이미지를 동시 입력으로 받아서 긴 문서와 대규모 코드베이스를 아우르는 응답을 생성할 수 있다. 네이티브 멀티모달 파이프라인과 1백만 토큰 컨텍스트를 결합해 멀티턴 대화에서 이전 상태를 유지하고 문맥 전반을 이용한 종합적 판단을 수행한다. 또한 도구 호출과 reasoning_content 보존을 통해 외부 툴 연동과 복합 작업 흐름을 지원한다.
- 모델은 에이전트형 작업에서 터미널 명령 실행, 레포지토리 탐색, 코드 최적화 같은 실무 지향적 워크플로를 수행하도록 설계되었다. Kimi Code 같은 에이전트 프레임워크와 결합하면 터미널 조작과 Python 실행을 포함한 작업을 모델이 길게 이어가는 세션에서 자동화할 수 있다. 이러한 설계는 장기 코딩 세션과 대규모 프로젝트 오케스트레이션에 적합하다.
- 비전 관련 작업에서는 MoonViT-V2로 추출한 이미지 표현을 텍스트 흐름에 직접 결합해 문서 이해, VQA, 도면·CAD 관련 질의응답을 처리할 수 있다. 멀티모달 벤치마크에서 높은 점수를 기록한 항목들이 존재하며 비전-텍스트 결합 처리 능력이 모델의 실용성을 뒷받침한다. 이 과정에서 quantization-aware training으로 양자화된 가중치와 활성화를 사용해 하드웨어 호환성을 확보했다.
강점
- Kimi K3는 2.8T라는 대규모 총 파라미터 수와 LatentMoE를 결합해 활성화된 파라미터를 104B 수준으로 유지하면서도 대용량 컨텍스트를 다루는 설계를 제시한다. README에 따르면 Stable LatentMoE로 전문가 선택을 최적화해 Kimi K2 대비 약 2.5배의 스케일링 효율 향상을 달성했다고 보고했다. 또한 MXFP4/MXFP8 기반의 양자화 인식 학습을 통해 넓은 하드웨어 호환성을 확보하려는 의도가 강점으로 작용한다.
훈련 방식
기반 모델 아키텍처에 대해 SFT 단계부터 quantization-aware training을 적용해 MXFP4 가중치와 MXFP8 활성화를 사용하면서 MoE와 KDA/AttnRes 설계를 결합해 멀티모달·장기 컨텍스트 능력을 특화했다.
알아두면 좋은 것
- Kimi K3는 Kimi K3 License로 전체 가중치를 공개한 3T급 공개 모델이라고 명시되어 있다. 공개 라이선스는 연구와 배포, 추가 혁신을 위해 전체 가중치 접근을 허용하는 점을 의도한 것으로 보인다. README에 공개된 자료와 풀 리포트 링크가 포함되어 있어 상세한 기술 문서를 참조할 수 있다.
- 모델 아키텍처는 Kimi Delta Attention(KDA), Attention Residuals(AttnRes), 그리고 Stable LatentMoE 프레임워크를 결합한 형태로 구성되어 있다. 이 설계로 896개 전문가 중 토큰당 16개를 활성화하는 방식으로 작동하며 README에서는 K2 대비 약 2.5배의 스케일링 효율 향상을 제시했다. 아키텍처 구성은 높은 총 파라미터 수와 비교해 활성화되는 연산량을 제한해 실제 추론 비용을 절감하려는 의도를 반영한다.
- 학습과정에서는 SFT 단계부터 양자화 인식 학습(quantization-aware training)을 적용해 MXFP4 가중치와 MXFP8 활성화를 사용했다고 명시되어 있다. 이 접근은 다양한 하드웨어에서의 실행 호환성을 목표로 하며 모델을 양자화 상태로 유지한 채 성능을 보존하는 데 중점을 둔다. README는 MXFP4/MXFP8 조합을 통해 넓은 하드웨어 호환성을 확보했다고 기술하고 있다.
- 배포 측면에서는 플랫폼 API(kimi.ai)와 OpenAI/Anthropic 호환 API를 제공하며 vLLM, SGLang, TokenSpeed 등을 권장 추론 엔진으로 명시했다. Quickstart와 Thinking Effort 가이드, 기술 보고서와 풀 리포트 링크가 함께 제공되어 실전 도입 시 참조할 수 있는 자료가 풍부하다. preserved thinking 모드(assistant의 reasoning_content 보존)와 관련된 메시지 포맷 요구사항도 명시되어 있어 도구 연동 시 주의점이 명확하다.
기술적 특징
- Kimi Delta Attention(KDA)는 어텐션 연산에 델타 성분을 도입해 긴 문맥에서의 정보 흐름을 안정화하도록 설계되었다. 이 구조는 기존 어텐션의 메모리·계산 비용을 줄이면서 1백만 토큰급 컨텍스트를 처리할 수 있도록 어텐션 구성비를 조정하는 역할을 한다. README에서는 KDA가 69개 층에서 사용되며 Gated MLA와 함께 복합 어텐션 구성을 이루는 것으로 기술되어 있다.
- Attention Residuals(AttnRes)는 어텐션 블록의 잔차 경로를 수정해 학습 안정성과 장기 의존성 보존을 강화하는 방식으로 적용되었다. 이 처리는 긴 대화 히스토리나 대규모 코드베이스 탐색 중에 정보 소실을 줄이는 데 목적이 있으며, KDA와 결합해 장문 처리에서의 수렴을 돕는다. 결과적으로 장기 컨텍스트 유지가 필요한 에이전트적 워크플로에서 성능 저하를 제한하는 기능을 제공한다.
- Stable LatentMoE 프레임워크는 전문가 선택 비용을 줄이기 위해 잠재 표현을 활용해 활성화될 전문가를 결정하는 계층을 포함한다. Kimi K3는 896개의 전문가 중 토큰당 16개를 활성화하고 활성화 파라미터를 104B로 운영해 전체 2.8T 파라미터의 이점을 유지하면서도 실제 연산량을 제한했다. 이 설계는 대규모 파라미터를 지닌 모델을 현실적인 추론 자원으로 운영하기 위한 핵심 트릭이다.
- 비전 통합은 MoonViT-V2라는 401M 규모의 비전 인코더를 통해 이루어지며 이미지 표현을 텍스트 흐름으로 직접 결합한다. 이미지에서 추출된 특징은 텍스트 토큰과 동일한 컨텍스트 창에서 처리되어 멀티모달 질의응답, 문서 해석, 도면 관련 작업 등에서 단일 모델로 일관된 처리를 가능하게 한다. 이 통합은 비전-텍스트 파이프라인에서 별도 전처리 없이도 긴 문맥과 결합된 멀티모달 추론을 지원하는 근거가 된다.
- 양자화 인식 학습은 SFT 단계부터 MXFP4 가중치와 MXFP8 활성화를 적용해 훈련 및 파인튜닝 과정에서 저정밀 포맷을 고려한 최적화를 수행한 점이 특징이다. 이 접근은 다양한 하드웨어에서 실행 호환성을 확보하고 추론 시 메모리·대역폭 요구를 낮추기 위한 설계 선택이다. README는 이 조합이 광범위한 하드웨어와의 호환성을 제공한다고 명시하고 있다.
차별점
- Kimi K3는 총 2.8T 파라미터 규모와 토큰당 16개의 활성 전문가를 사용하는 LatentMoE 조합으로 대형 파라미터를 유지하면서 활성화 연산을 제한하는 구조적 차이를 보인다.
- 네이티브 멀티모달 설계로 MoonViT-V2를 통합해 이미지와 텍스트를 동일한 모델 흐름에서 처리하며 1백만 토큰 컨텍스트를 지원해 장기 멀티턴 작업에서의 일관성을 제공한다.
- 학습 과정에서 SFT 단계부터 양자화 인식 학습을 적용해 MXFP4/MXFP8 조합을 사용하는 점이 배포·추론 호환성 측면에서 차별화된다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPQA Diamond | accuracy | 93.5 | — |
| Terminal-Bench 2.1 | accuracy | 88.3 | — |
| BrowseComp | accuracy | 91.2 | — |
| Video-MME (w. sub) | accuracy | 90.0 | — |
| OmniDocBench | accuracy | 91.1 | — |
175
Likes
766
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.