1T 파라미터 MoE 기반 코드 에이전트, 256K 컨텍스트와 Thinking 보존
Kimi K2.7 Code는 Moonshot AI가 발표한 코드 중심의 MoE 기반 대규모 모델로, 1T 파라미터와 256K 컨텍스트를 지원하며 preserve_thinking을 강제해 장기 에이전트 작업에 최적화되었다.
TL;DR
Kimi K2.7 Code는 Moonshot AI가 Kimi K2.6을 기반으로 개선한 코드 중심의 에이전트형 모델로, Mixture-of-Experts 구조와 MoonViT 비전 인코더를 결합해 멀티모달 장기 작업을 목표로 한다. 모델은 전체 파라미터 1T, 활성화 파라미터 32B, 전문가 수 384, 토큰당 선택 전문가 8, 컨텍스트 길이 256K 등으로 설계되어 긴 컨텍스트와 복잡한 코드 워크플로우를 처리하도록 최적화되었다. README에 따르면 K2.6 대비 thinking-token 사용량을 약 30% 절감했고 자체 코딩 벤치마크에서 점수 향상을 기록했으나 공개된 비교 대상 모델들(GPT-5.5, Claude Opus 4.8)과는 일부 태스크에서 격차가 존재한다. 네이티브 INT4 양자화와 vLLM/SGLang/KTransformers와의 배포 권장은 대규모 MoE 모델의 실무 배포 비용을 낮추려는 설계 결정을 반영하며 비디오 기능은 현재 실험적 상태로 제한이 존재한다. preserve_thinking이 기본으로 강제되어 다중 턴에서 내부 추론을 보존함으로써 연속적 에이전트 작업에서의 일관성과 툴 연동 성능을 높이도록 설계되었다가 README에서 확인된다.
핵심 역량
- 장기 컨텍스트와 멀티스텝 툴 호출을 포함하는 에이전트형 워크플로에서 연속적인 사고 흐름을 보존하며 복잡한 소프트웨어 엔지니어링 태스크를 실행할 수 있다.
- 이미지와 비디오 입력을 수용하는 멀티모달 인터페이스를 통해 시각 자료를 참조한 코드 설명과 분석, 리팩터링 지침 생성이 가능하다.
- 코드 생성, 바이너리 기반 재구현, 테스팅 주도 개발 및 다양한 프로그래밍 언어에서의 실무적 구현을 목표로 하는 벤치마크에서 성능을 발휘하도록 설계되었다.
강점
- 동일 계열인 Kimi K2.6 대비 실사용 장기 코딩 시나리오에서 토큰 효율성 향상을 목표로 설계되어 README에 따르면 thinking-token 사용량을 약 30% 절감했다. 이 수치는 모델 소개에서 명시되어 있으며 Kimi Code Bench v2 등 내부 코딩 벤치마크에서 K2.6보다 수치상 향상을 기록했다. 또한 네이티브 INT4 양자화와 vLLM/SGLang과 같은 추론 엔진 권장을 통해 대규모 MoE 모델의 실무 배포 비용 절감 가능성을 제공한다.
알아두면 좋은 것
- Kimi K2.7 Code는 Kimi K2.6을 기반으로 하여 아키텍처적 연속성을 유지하며 MoE 구조와 MoonViT 비전 인코더를 결합해 멀티모달 코드 에이전트 용도를 목표로 한다. README는 모델이 Thinking 모드를 기본으로 작동하고 preserve_thinking을 강제한다고 명시하고 있어 다중 턴에서 내부 추론을 보존하도록 설계되었음을 분명히 한다. 또한 네이티브 INT4 양자화를 채택해 배포 효율성을 높였다고 표기되어 있다.
- 모델 사양 테이블에는 전체 파라미터 1T, 활성화 파라미터 32B, 레이어 수 61, 전문가 수 384, 토큰당 선택 전문가 8, 컨텍스트 길이 256K, 비전 인코더 파라미터 400M 등이 명시되어 있어 MoE 기반의 대규모·긴 컨텍스트 처리 설계를 명확히 드러낸다. Attention 메커니즘으로 ‘MLA’가 사용되며 활성화 함수는 SwiGLU로 표기되어 있어 내부 연산 스타일과 설계 선택을 확인할 수 있다. README는 또한 배포 권장 런타임(vLLM, SGLang, KTransformers)과 transformers 버전 요구사항을 명시해 실무 적용 경로를 제시한다.
- 성능 표에서 Kimi K2.7 Code는 자체 Kimi Code Bench v2에서 62.0 점을 기록해 K2.6의 50.9보다 높은 성능을 보였고 여러 에이전트 및 코딩 벤치마크에서 개선을 보였다고 보고되어 있다. 다만 공개 비교 대상인 GPT-5.5 및 Claude Opus 4.8과의 표에는 여전히 격차가 존재하며 README의 footnote는 평가 설정(temperature, top-p, thinking 모드 등)을 상세히 명시해 평가 조건 차이가 결과에 영향을 줄 수 있음을 나타낸다. 비디오 채팅 기능은 실험적이라고 표기되어 있어 일부 멀티미디어 동작은 공식 API에서만 지원된다.
기술적 특징
- Kimi K2.7 Code는 Mixture-of-Experts 아키텍처를 채택해 전체 파라미터를 1T로 유지하면서도 토큰별로 소수의 전문가만 활성화해 활성화 파라미터를 32B 수준으로 관리하도록 설계되었다. 라우팅을 통해 토큰당 8개의 전문가를 선택하며 전문가 수는 384개로 구성되어 있어서 모델의 표현력을 높이면서도 매 토큰마다 실제 계산되는 파라미터 규모를 줄인다. 이 설계는 복잡한 장기 코딩 작업에서의 용량과 효율성의 균형을 맞추기 위한 핵심적 선택이다.
- 모델은 256K의 매우 긴 컨텍스트 길이를 지원하며 README에서는 Attention 메커니즘으로 MLA를 명시해 긴 시퀀스 상호작용을 처리하도록 최적화된 어텐션 설계를 사용함을 나타낸다. 대규모 어텐션 헤드(64개)와 큰 은닉 차원(7168)을 조합해 긴 문맥에서의 토큰 간 관계를 더 잘 포착하도록 설계되었으며 이로 인해 장거리 코드 의존성과 다단계 플로우를 다루는 데 유리하다. 긴 컨텍스트는 도메인 특화 작업과 다중 툴 호출을 포함하는 에이전트 워크플로에서 연속성 유지에 기여한다.
- 멀티모달 처리를 위해 400M 파라미터 규모의 MoonViT 비전 인코더를 통합해 이미지 및 비디오 입력을 모델의 텍스트 추론 파이프라인으로 수용하도록 구성했다. 이 비전 인코더는 이미지·비디오를 특징 벡터로 변환해 내부의 Thinking 모드와 결합함으로써 시각적 단서 기반 코드 생성과 설명 작업을 가능하게 한다. README는 이미지와 비디오 입력 예시를 통해 API 레벨에서 해당 입력 유형을 전달하고 응답을 받는 흐름을 명확히 제시하고 있다.
- 추론 및 배포 효율화를 위해 네이티브 INT4 양자화를 채택했으며 README는 Kimi-K2 계열과 동일한 INT4 방식을 사용한다고 명시했다. 이 양자화는 대규모 MoE 모델을 실무 환경에서 실행할 때 필요한 메모리와 대역폭을 절감하도록 설계되어 vLLM, SGLang, KTransformers 같은 추론 엔진과의 호환성을 고려한 배포 경로를 제공한다. README는 또한 transformers 버전 요구사항을 명시해 실제 환경에서의 종속성 관리를 돕고 있다.
차별점
- Kimi K2.7 Code는 토큰당 8개의 전문가를 선택하는 384-expert MoE 구성으로 설계되어 1T 파라미터 규모에서 활성화 파라미터를 32B 수준으로 운용하는 점이 주요 차별점이다. 이 구조는 대규모 모델의 용량을 유지하면서도 실제 추론 시 계산 자원을 줄여 장기 에이전트 작업에서의 효율성을 높인다. 또한 활성화 전문가 수와 공유 전문가 전략은 고빈도·저빈도 패턴을 구분해 처리 성능을 개선하도록 설계되었다.
- 모델은 256K의 극장 컨텍스트와 MLA 어텐션을 조합해 장거리 의존성을 다루는 데 초점을 맞추었으며 이는 기존 K2 시리즈보다 긴 문맥에서의 연속적 사고와 툴 기반 상호작용에 더 적합하게 만든다. 긴 컨텍스트 지원은 복잡한 소프트웨어 엔지니어링 시나리오에서 여러 파일·로그·툴 출력을 동시에 고려해야 하는 작업에 유리하다. README는 또한 생각 보존(preserve_thinking)을 기본으로 켜 두어 다중 턴에서의 추론 재사용을 보장한다.
- 멀티모달 통합을 위해 MoonViT 비전 인코더를 내장하고 이미지와 비디오 입력을 공식적으로 지원하는 점이 차별화 요소로 작용한다. README에 이미지·비디오 예제 코드와 함께 비디오 채팅 기능의 실험적 상태를 명시해 멀티미디어 입력 처리 파이프라인의 존재와 한계를 동시에 제시한다. 마지막으로 네이티브 INT4 양자화 호환성을 통해 대규모 MoE 모델의 실무 배포 비용과 메모리 요구를 줄이는 전략을 채택했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Kimi Code Bench v2 | score | 62.0 | Kimi K2.6: 50.9; GPT-5.5: 69.0; Claude Opus 4.8: 67.4 |
| Program Bench | score | 53.6 | Kimi K2.6: 48.3; GPT-5.5: 69.1; Claude Opus 4.8: 63.8 |
| MLS Bench Lite | score | 35.1 | Kimi K2.6: 26.7; GPT-5.5: 35.5; Claude Opus 4.8: 42.8 |
| Kimi Claw 24/7 Bench | score | 46.9 | Kimi K2.6: 42.9; GPT-5.5: 52.8; Claude Opus 4.8: 50.4 |
| MCP Atlas | score | 76.0 | Kimi K2.6: 69.4; GPT-5.5: 79.4; Claude Opus 4.8: 81.3 |
| MCP Mark Verified | score | 81.1 | Kimi K2.6: 72.8; GPT-5.5: 92.9; Claude Opus 4.8: 76.4 |
1.3k
Likes
631.8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.