2.8T 파라미터, 1M 토큰 컨텍스트와 MXFP4 양자화를 탑재한 멀티모달 에이전트 모델
텍스트·이미지를 입력으로 받아 장기 문맥 기반의 생성, 코드 작성 및 에이전트식 도구 오케스트레이션을 수행하는 image-text-to-text 멀티모달 태스크를 담당한다.2.8T1M 컨텍스트kimi-k3
Kimi K3는 MoE 기반의 2.8T 파라미터 멀티모달 모델로 1백만 토큰 컨텍스트와 MXFP4 양자화를 통해 장기 문맥과 실무형 에이전트 워크로드를 목표로 설계되었다.
TL;DR
Kimi K3는 Moonshot AI가 공개한 MoE 기반의 2.8T 파라미터 멀티모달 모델로, Kimi Delta Attention과 Attention Residuals를 결합해 1백만 토큰의 초장기 컨텍스트를 네이티브로 지원한다. LatentMoE 라우팅으로 896개의 전문가 가운데 토큰당 16개를 활성화해 활성화 파라미터를 104B 수준으로 제한하고 SFT 단계부터 양자화 인식 학습을 적용해 MXFP4 가중치와 MXFP8 활성화를 목표로 배포 효율을 확보했다. 모델은 텍스트·이미지 입력을 단일 흐름에서 처리하며 Kimi Code 등 에이전트 프레임워크와 결합해 장기 코드 작업과 도구 오케스트레이션에서 높은 성능을 보였고 여러 공개 벤치에서 상위권 점수를 기록했다. 다만 2.8T 규모와 MoE 라우팅의 복잡성, 그리고 운영 시 양자화·추론 엔진 선택에 따른 환경 의존성이 존재한다.
핵심 역량
- 장기 문맥 이해와 유지에 최적화된 응답을 생성할 수 있다. 1백만 토큰 컨텍스트를 통해 대규모 코드베이스나 문서 집합을 한 번에 처리할 수 있으며, 보존된 사고 모드로 내부 추론 상태를 유지해 연속적인 도구 호출과 복잡한 워크플로를 이어갈 수 있다. 이러한 설계는 긴 세션에서의 일관성과 상태 보존을 중시하는 자동화 작업에 적합하다.
- 에이전트식 도구 사용과 터미널 조작을 포함한 코드 중심 워크로드를 수행할 수 있다. Kimi Code 같은 에이전트 프레임워크와 결합하면 터미널 명령 실행, 리포지토리 탐색, 컴파일 또는 GPU 커널 최적화 같은 반복적이고 긴 파이프라인을 자동화할 수 있다. 모델의 고유한 thinking 보존 방식은 도구 호출의 맥락을 지속적으로 전달하는 작업에서 예측 가능성을 높인다.
- 이미지 입력을 함께 처리하는 멀티모달 생성 능력을 보유하고 있다. MoonViT-V2 비전 인코더를 통합해 이미지와 텍스트를 동일한 모델 흐름에서 처리하며 문서 이해, 시각적 질문응답, 시각적 코드 분석 등 복합 입력 태스크에서 활용할 수 있다. 비전-인-루프 작업이나 대화형 시각화 생성에도 적용 가능하다.
강점
- 대규모 MoE 구조와 1백만 토큰 컨텍스트를 결합해 긴 대화와 대형 코드·문서베이스를 한 번에 처리할 수 있는 점이 경쟁 우위로 작용한다. 활성화되는 파라미터는 104B 수준으로 설계되어 전체 파라미터 대비 계산 효율을 높였고 Stable LatentMoE로 라우팅 안정성을 확보했다. 또한 SFT 이후 양자화 인식 학습을 통해 실무적 배포 환경에서 효율성과 호환성을 동시에 제공한다.
훈련 방식
moonshotai/Kimi-K3를 기반으로 SFT 단계부터 quantization-aware training을 적용해 MXFP4 가중치와 MXFP8 활성화를 사용하도록 학습했으며 MoE 라우팅과 장기 컨텍스트를 다루는 추가적인 최적화가 병행되었다.
알아두면 좋은 것
- 모델 가중치가 Kimi K3 라이선스 하에 공개되어 연구와 배포·확장에 사용 가능하다. 공개된 전체 가중치에는 양자화된 GGUF 변형과 더불어 원시 풀 프리시전 설정을 위한 안내가 포함되어 있으며, Q8과 Q4 같은 형식별 저장 크기 차이가 명시되어 있다. 라이선스 정보와 문서는 GitHub와 Moonshot AI 도메인에서 참조 가능한 링크로 제공된다.
- 양자화 인식 학습을 SFT 단계부터 적용해 MXFP4 가중치와 MXFP8 활성화를 기본 설정으로 채택했다. 이 방식은 추론 시 하드웨어 호환성을 확보하면서도 양자화로 인한 성능 저하를 줄이기 위해 훈련 단계에서 양자화 효과를 반영하는 접근이다. 문서는 Unsloth Dynamic 2.0 GGUF 및 자체 양자화 벤치마크 링크를 통해 구체적 지침을 제공한다.
- vLLM, SGLang, TokenSpeed 등 주요 추론 엔진을 권장하며 OpenAI/Anthropic 호환 API를 제공한다. 권장 레시피와 쿡북 링크가 공개되어 있어 실제 배포 환경에서 엔진별 설정 가이드를 따를 수 있게 설계되었다. 플랫폼 API는 reasoning_effort와 reasoning_content를 포함한 보존된 사고 인터페이스를 지원한다.
기술적 특징
- Mixture-of-Experts 구조를 896개의 전문가로 구성하고 토큰당 16개의 전문가를 활성화하도록 설계해 전체 파라미터는 2.8T이지만 활성화 파라미터는 104B 수준으로 유지한다. 이 설계는 동일한 모델 크기에서 계산·메모리 비용 대비 표현력을 향상시키려는 목적이며 라우팅 알고리즘과 LatentMoE 프레임워크로 활성화 분포의 불균형을 완화한다. 결과적으로 K2 대비 약 2.5배의 스케일링 효율 향상을 목표로 했다.
- Kimi Delta Attention(KDA)와 Attention Residuals(AttnRes)를 도입해 긴 문맥 처리 중에도 정보 보존과 수렴 안정성을 확보했다. 델타 기반 처리로 연속적 토큰 간 변화만 모델링하고 잔차 경로로 장기 의존성을 보완하므로 1백만 토큰 수준의 컨텍스트에서도 학습과 추론의 수치적 안정성이 유지된다. 어텐션 블록 구성은 KDA 69개와 Gated MLA 24개로 분리되어 다양한 패턴의 문맥을 처리하도록 조정되었다.
- Stable LatentMoE 프레임워크는 대규모 전문가 집합을 안정적으로 작동시키기 위해 라우팅을 잠재 표현 공간에서 수행하고 활성화 균형화를 적용한다. 이 방식은 희소 전문가 구조에서 흔히 발생하는 '전문가 편향' 문제를 줄이고 학습 중 특정 전문가에 과도한 부하가 쏠리는 현상을 완화한다. 그 결과 대규모 MoE를 더 높은 신뢰도로 확장할 수 있다.
- 비전 처리 파이프라인으로 MoonViT-V2를 통합해 단일 모델 내에서 이미지·텍스트를 함께 인코딩하고 융합하는 멀티모달 흐름을 구현했다. 비전 인코더의 파라미터는 약 401M으로 분리되어 있으며 이미지 입력은 텍스트 시퀀스와 병렬로 처리되어 멀티모달 작업에서 latency와 표현력의 균형을 맞춘다. 이 통합은 문서 이미지화, 시각적 질의 응답, 비전-인-루프 편집 등 응용을 직접 지원한다.
- 양자화 인식 학습을 SFT 단계부터 적용해 MXFP4 가중치와 MXFP8 활성화를 목표로 한 설계로, 훈련 시 양자화 효과를 반영해 추론 단계의 정밀도 손실을 최소화하도록 조정했다. 이 접근은 다양한 하드웨어에서 GGUF 형식으로 배포 가능하게 하며 Q8·Q4 등 저장 크기 옵션을 문서화해 운영자가 정밀도와 저장 요구 사이의 트레이드오프를 선택할 수 있게 한다. 배포 가이드는 Unsloth Dynamic 2.0 GGUF 벤치마크 링크를 통해 구체적 수치를 제공한다.
차별점
- 풀 가중치 공개와 Kimi K3 전용 라이선스를 통해 3T급 모델의 원시 가중치를 연구자와 개발자가 직접 활용할 수 있게 했다. 공개된 가중치는 양자화 변형을 포함하고 있어 연구뿐 아니라 실제 배포·재현 환경에서 다양한 실험을 진행할 수 있게 한다. 이 공개 정책은 동일 스케일의 폐쇄형 모델과 다른 접근을 취한다.
- 1백만 토큰의 초장기 컨텍스트를 네이티브로 지원해 대규모 코드베이스, 문서 집합, 또는 장기 대화 상태를 한 번에 입력으로 처리할 수 있도록 설계되었다. 컨텍스트 접근을 위해 KDA와 AttnRes가 결합되어 수치적 안정성과 정보 보존을 동시에 달성한다. 이로 인해 긴 세션에서의 작업 자동화와 연속적 추론 워크로드에서 효용이 높아진다.
- Stable LatentMoE를 통해 매우 많은 수의 전문가(896)를 운영하면서도 토큰당 활성 전문가를 제한해 계산 효율을 확보하였다. 라우팅을 잠재 표현에서 수행함으로써 전문가 편향을 줄이고 확장 시 안정성을 확보했다. 그 결과 동일 계열 이전 모델 대비 스케일 효율 개선을 목표로 했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPQA Diamond | score | 93.5 | — |
| Terminal-Bench 2.1 | score | 88.3 | — |
| ProgramBench | score | 77.8 | — |
| DeepSWE | score | 67.5 | — |
| BrowseComp | score | 91.2 | — |
| OmniDocBench | score | 91.1 | — |
| Video-MME (w. sub) | score | 90.0 | — |
| MathVision | score | 94.3 / 97.8 | — |
| GPQA CritPt | score | 23.4 | — |
206
Likes
12.2k
Downloads
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.