TL;DR
Moonshot AI의 Kimi K3는 2.8T 파라미터 중 토큰당 896개 Expert 가운데 16개만 활성화하는 Open-weight MoE 모델로, Kimi Delta Attention과 Attention Residuals를 이용해 1,048,576 토큰 Context Window를 지원합니다. 사용자는 Kimi App에서 무료로 시험하거나 Fireworks AI API를 통해 Standard 기준 입력 1M 토큰당 $3.00, Cached Input $0.30, Output $15.00에 연결할 수 있으며, Python 예제는 이미지 설명과 Haiku를 JSON으로 반환합니다. Coding 벤치마크에서 K3는 일부 Proprietary 모델과 경쟁하고 특정 평가에서 앞서지만, 프로그래밍과 장기 Agent 작업에 강점이 집중되므로 실제 업무용 자체 평가가 필요합니다. 자체 호스팅에는 최소 64개 Accelerator가 권장되어 대부분의 개발자는 App이나 API를 통한 접근부터 시작하는 편이 적합합니다.
섹션별 상세
- Kimi K3는 2.8T 파라미터와 1,048,576 토큰 Context Window를 가진 Open-weight MoE 모델이다. — 본문의 What Makes K3 Different 표에 Total Parameters, Context Window, Modality, License가 정리되어 있습니다.
- Kimi K3는 896개 Expert 중 토큰당 16개를 활성화한다. — 본문의 What Makes K3 Different 표에 Active Experts per Token이 16 of 896, 약 1.8%로 제시되어 있습니다.

import requests
import json
url = "https://api.fireworks.ai/inference/v1/chat/completions"
payload = {
"model": "accounts/fireworks/models/kimi-k3",
"max_tokens": 4096,
"top_k": 40,
"presence_penalty": 0,
"frequency_penalty": 0,
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": (
"Look at this image. First describe what's in it in one paragraph. "
"Then write a 4-line haiku inspired by it. "
"Return your answer as JSON with keys 'description' and 'haiku'."
)
},
{
"type": "image_url",
"image_url": {
"url": "https://images.unsplash.com/photo-1582538885592-e70a5d7ab3d3?ixlib=rb-4.0.3&ixid=M3wxMjA3fDB8MHxwaG90by1wYWdlfHx8fGVufDB8fHx8fA%3D%3D&auto=format&fit=crop&w=1770&q=80"
}
}
]
}
]
}
headers = {
"Accept": "application/json",
"Content-Type": "application/json",
"Authorization": f"Bearer "
}
response = requests.post(
url,
headers=headers,
data=json.dumps(payload)
)
result = response.json()
print(result["choices"][0]["message"]["content"])Fireworks AI의 OpenAI 호환 Chat Completions API에 이미지를 보내고 설명과 Haiku를 JSON으로 받는 Python 호출 코드입니다.
- Fireworks AI의 Standard 경로는 Uncached Input $3.00 / M, Cached Input $0.30 / M, Output $15.00 / M이다. — How to Access K3 and What it Costs? 절의 Fireworks 요금표에 Standard, Priority, Fast별 입력·출력 단가가 제시되어 있습니다.
- Moonshot AI는 K3 자체 호스팅에 최소 64개 Accelerator를 갖춘 Supernode를 권장한다. — API 비용 설명 뒤의 자체 호스팅 문단에 64 accelerators와 700B–1.6T 모델보다 큰 인프라 요구사항이 적혀 있습니다.


- K3는 Coding 및 Agentic 작업에서 일부 Proprietary 모델과 경쟁하며, 특정 Coding 평가에서 앞선다. — How K3 Performs Against Other AI Models? 절의 Artificial Intelligence Analysis Index, Front-end coding blind assessment, Moonshot 평가 비교 문단과 벤치마크 이미지가 근거입니다.
- K3는 프로그래밍과 Long-horizon Agency에 특히 적합하므로 실제 사용 목적에 맞춘 자체 평가가 필요하다. — 성능 비교 절 후반의 결론 문단에서 Leaderboard만 의존하지 말고 자체 Eval Suite를 실행하라고 권고합니다.
용어 해설
- Mixture-of-Experts
- — 여러 전문가 네트워크 중 일부만 선택해 토큰을 처리하는 Sparse 모델 구조입니다. Kimi K3는 전체 896개 Expert 가운데 토큰당 16개만 활성화해 거대한 총 파라미터 수를 유지하면서 추론 시 실제 계산량을 줄입니다. 이 방식은 모델 규모와 추론 비용 사이의 균형을 맞추는 데 중요합니다.
- Linear Attention
- — 입력 길이가 늘어날 때 Attention 계산량이 제곱으로 증가하는 문제를 완화하는 Attention 방식입니다. Kimi Delta Attention은 기존 Quadratic Attention 대신 선형적인 처리 경로를 사용해 1M 토큰 Context Window를 지원하는 기반으로 쓰입니다. 긴 코드와 문서 처리에서 메모리 부담을 낮추는 것이 핵심입니다.
- Attention Residuals
- — 표준 Residual Connection을 대신해 여러 층의 Attention 결과를 누적하는 모델 연결 방식입니다. Kimi K3 구조에서는 이전 Block의 요약과 Embedding 같은 Depth Sources를 가중합으로 결합해 다음 Block에 전달합니다. Moonshot AI는 모델이 커질수록 결과의 일관성을 높이는 설계로 설명합니다.
- Open-weight 모델(Open-weight Model)
- — 학습된 모델 가중치를 공개해 사용자가 직접 내려받거나 자체 인프라에서 실행할 수 있는 모델입니다. Kimi K3는 2.8T 파라미터와 Text·Vision 입력을 지원하며 Open-weight 형태로 제공됩니다. 다만 자체 실행에는 최소 64개 Accelerator를 갖춘 Supernode가 필요하다고 안내됩니다.
- Context Window
- — 모델이 한 번의 요청에서 입력과 출력을 함께 처리할 수 있는 토큰 범위입니다. Kimi K3의 Context Window는 1,048,576 토큰으로, 긴 코드베이스나 대규모 문서와의 작업을 겨냥합니다. 이 규모를 실용적으로 유지하기 위해 Kimi Delta Attention과 Sparse Expert 활성화가 함께 사용됩니다.
기술
- Kimi K3
- Moonshot AI
- Mixture-of-Experts
- Kimi Delta Attention (KDA)
- Attention Residuals
- Kimi App
- kimi.com
- Kimi Work
- Fireworks AI
- Python
- requests
- JSON
- OpenAI-compatible API
- Gated Multi-head Latent Attention
- Kimi Delta Attention
활용 사례
- 단일 HTML 파일 기반 Typing Speed Test 생성
- 이미지 설명과 Haiku를 JSON으로 반환하는 Multimodal API 파이프라인
- 스크린샷 기반 Web UI Margin과 Contrast 점검
- 긴 코드베이스와 문서를 처리하는 Long-context Coding
- Coding 및 Agentic Workflow 통합
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

