1T 파라미터 MoE·256K 컨텍스트로 장기 코드 작업에 최적화된 Kimi K2.7 Code
Kimi K2.7 Code는 MoE 아키텍처(총 1T, 활성화 32B)와 256K 컨텍스트, MoonViT 시각 인코더, 강제 preserve_thinking 설계로 장기·멀티모달 코드 에이전트 작업을 겨냥한 모델이다.
TL;DR
Kimi K2.7 Code는 코드 중심의 장기 에이전트 워크플로우에 초점을 맞춘 대형 멀티모달 LLM이다. 모델은 Kimi K2.6을 기반으로 MoE 아키텍처(전체 1T, 활성화 32B), MoonViT 비전 인코더(약 400M), SwiGLU 활성화, MLA 어텐션을 결합해 코드·문서·이미지·비디오 입력을 처리하도록 설계되었다. 모델은 토큰당 최대 8개의 전문가를 선택하는 384-expert MoE와 256K 컨텍스트를 통해 긴 코드베이스와 다단계 도구 호출을 유지한다. Thinking 모드와 preserve_thinking가 강제되어 내부 추론을 세션 간 보존하고 Interleaved Thinking 및 Multi-Step Tool Call 패턴을 공식 지원한다. 네이티브 INT4 양자화와 Unsloth GGUF 워크플로를 통해 대형 모델의 배포·메모리 트레이드오프를 제어한다. 공식 벤치마크에서 K2.6 대비 전반적 성능 향상이 보고되었으나 GPT-5.5·Claude Opus 4.8와 비교하면 일부 벤치에서는 격차가 존재한다. 또한 전체 파라미터 규모와 높은 컨텍스트 지원은 저장·메모리 요구를 크게 증가시키므로 양자화와 같은 추가 최적화가 배포에서 필수적이다.
핵심 역량
- 장기 컨텍스트(256K)에서의 코드 생성 및 유지·수정
- 멀티모달 입력(이미지·비디오)을 텍스트 응답으로 변환
- 에이전트형 도구 호출과 다단계 작업 흐름(Interleaved Thinking·Multi-Step Tool Call) 처리
- Thinking 모드와 preserve_thinking로 추론 과정(reasoning)을 유지해 연속적 의사결정 지원
- 대규모 MoE로 고용량 표현력을 유지하면서 활성화 파라미터만으로 추론 비용을 관리
강점
- 자사 이전 버전(Kimi K2.6) 대비 코딩 벤치마크에서 유의미한 개선을 보고함(예: Kimi Code Bench v2 50.9 → 62.0), 실사용 코드 워크플로우 성능을 끌어올렸음
- 256K 컨텍스트와 preserve_thinking 설계로 장기적인 멀티스텝 에이전트 작업에서 상태 보존과 연속적 추론을 지원함
- 네이티브 INT4 양자화 및 GGUF 연동으로 대형 모델을 양자화하여 배포·추론 비용을 낮출 수 있는 옵션을 제공함
알아두면 좋은 것
- 아키텍처는 Mixture-of-Experts(MoE)이며 전체 파라미터 1T, 토큰당 선택 전문가 8개로 활성화 파라미터는 32B로 표기됨
- 컨텍스트 길이 256K와 Thinking/preserve_thinking 모드 강제 적용으로 장기 에이전트 작업과 연속적 추론 내용 보존에 초점
- 네이티브 INT4 양자화 지원을 명시하고 Unsloth의 GGUF/quantization 가이드 및 벤치마크와 연계함
- 시각 입력 처리를 위한 MoonViT(약 400M 파라미터)를 포함해 이미지·비디오 입력을 통한 멀티모달 작업을 지원
기술적 특징
- MoE 확장으로 표현력과 계산 효율을 분리했다. 전체 파라미터는 1T이나 토큰당 8개의 전문가만 활성화해 활성화 파라미터를 32B로 유지하므로 대형 파라미터의 표현력을 확보하면서 추론 시 필요한 실제 계산량을 통제한다.
- 장기 컨텍스트(256K)를 제공하며 MLA 기반 어텐션을 사용해 긴 문서와 소스코드의 연속성을 유지한다. 긴 컨텍스트는 다중 파일·장기간 에이전트 상호작용에서 상태 보존과 문맥 추적을 용이하게 한다.
- 추론 설계로 Thinking 모드와 preserve_thinking를 강제해 내부 추론(Reasoning)을 세션 간 보존한다. 이로 인해 다단계 도구 호출과 연속적 디버깅 과정에서 중간 사고 과정을 재활용할 수 있다.
- 멀티모달 처리용으로 MoonViT 비전 인코더(약 400M)를 통합해 이미지·비디오 입력을 임베딩으로 변환한다. 이 구성은 코드 관련 문서·스크린샷을 포함한 멀티모달 증거를 해석하는 워크플로우에 직접 연결된다.
- 네이티브 INT4 양자화를 채택하고 GGUF/Unsloth 양자화 툴체인과 연결해 대형 모델의 저장·메모리 요구를 낮추는 선택지를 제공한다. 문서에는 Q8(UD-Q8_K_XL) 풀프리시전 옵션과 Q4 대비 용량 차이를 수치로 제시해 배포 트레이드오프를 명시했다.
차별점
- MoE 아키텍처(384 experts, 토큰당 8개 선택)로 전체 파라미터는 1T이지만 활성화 파라미터를 32B로 관리
- 256K의 매우 긴 컨텍스트 길이로 장기 에이전트·코드 작업에 초점
- preserve_thinking 모드를 강제해 추론 과정(reasoning)을 세션 간 보존하고 Interleaved Thinking·Multi-Step Tool Call 패턴을 공식 지원
- MoonViT 시각 인코더 통합으로 이미지·비디오 입력을 네이티브하게 처리
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Kimi Code Bench v2 | score | 62.0 | vs Kimi K2.6: 50.9; vs GPT-5.5: 69.0; vs Claude Opus 4.8: 67.4 |
| Program Bench | score | 53.6 | vs Kimi K2.6: 48.3; vs GPT-5.5: 69.1; vs Claude Opus 4.8: 63.8 |
| MLS Bench Lite | score | 35.1 | vs Kimi K2.6: 26.7; vs GPT-5.5: 35.5; vs Claude Opus 4.8: 42.8 |
| Kimi Claw 24/7 Bench | score | 46.9 | vs Kimi K2.6: 42.9; vs GPT-5.5: 52.8; vs Claude Opus 4.8: 50.4 |
| MCP Atlas | score | 76.0 | vs Kimi K2.6: 69.4; vs GPT-5.5: 79.4; vs Claude Opus 4.8: 81.3 |
| MCP Mark Verified | score | 81.1 | vs Kimi K2.6: 72.8; vs GPT-5.5: 92.9; vs Claude Opus 4.8: 76.4 |
152
Likes
48.6k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.