TL;DR
Kimi Agent는 단일 제품이 아니라 2.8조 파라미터 Kimi K3 모델, Agent Swarm, Goal, Kimi Work, Kimi Claw, Kimi Code 등을 묶은 제품군입니다. K3는 100만 토큰 Context Window와 OpenAI 호환 API를 제공하고, Agent Swarm은 최대 300개 하위 에이전트와 4,000회 이상의 도구 호출을 활용하지만 serial collapse와 fake parallelism이라는 실패 조건도 지닙니다. 긴 PDF 교차 참조와 비용 민감형 coding에서는 강점이 확인됐고, 가격은 입력 100만 토큰당 3달러, 출력 15달러이며 캐시 입력은 0.30달러입니다. 반면 독립 FlowGraph 테스트에서 K3는 68점으로 Claude의 91점에 못 미쳤고, 공급 중단·과도한 자율성·세션 이력 호환성·중국 기반 서버·비OSI 라이선스가 실제 도입 전 검토 사항으로 남습니다.
섹션별 상세


- Kimi Agent는 하나의 제품이 아니라 Kimi K3와 여러 에이전트 및 실행 제품을 묶어 부르는 이름이다. — 기사 도입부에서 Kimi K3, Agent Swarm, Goal, OK Computer, Kimi Work, Kimi Claw, Kimi Code의 역할을 구분한 문단
- Agent Swarm은 최대 300개의 동시 하위 에이전트와 단일 작업 4,000회 이상의 도구 호출을 지원하며 Moonshot은 순차 처리보다 4.5배 빠르다고 밝혔다. — Agent Swarm의 K2.6 출시 용량과 속도 수치가 제시된 문단
import os
import json
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
MODEL = "kimi-k3"
TOOLS = [{
"type": "function",
"function": {
"name": "count_words",
"description": "Counts the number of words in a block of text.",
"parameters": {
"type": "object",
"properties": {"text": {"type": "string"}},
"required": ["text"],
},
},
}]
def count_words(text: str) -> int:
return len(text.split())
def run_task(task: str, max_turns: int = 6) -> dict:
"""Runs a task through Kimi K3, executing any tool calls it makes, and returns a small report of what happened."""
messages = [{"role": "user", "content": task}]
total_prompt_tokens = 0
total_completion_tokens = 0
turns_used = 0
for turn in range(max_turns):
turns_used = turn + 1
response = client.chat.completions.create(
model=MODEL,
max_tokens=1024,
tools=TOOLS,
messages=messages,
reasoning_effort="max", # K3 replaced the old `thinking` param with this
)
usage = response.usage
total_prompt_tokens += usage.prompt_tokens
total_completion_tokens += usage.completion_tokens
message = response.choices[0].message
if response.choices[0].finish_reason != "tool_calls":
return {
"answer": message.content,
"turns_used": turns_used,
"prompt_tokens": total_prompt_tokens,
"completion_tokens": total_completion_tokens,
}
messages.append(message.model_dump(exclude_none=True))
for tool_call in message.tool_calls:
if tool_call.function.name == "count_words":
args = json.loads(tool_call.function.arguments)
result = count_words(args["text"])
messages.append({
"role": "tool",
"tool_call_id": tool_call.id,
"content": str(result),
})
return {"answer": None, "turns_used": turns_used, "error": "Hit max_turns without finishing"}OpenAI 호환 API에서 Kimi K3의 Tool Calling 응답을 받아 함수를 실행하고 결과를 다음 대화 턴에 전달하는 예제입니다.

- 무료 요금제는 동시 에이전트 작업을 한 개로 제한하고 전체 agentic 기능은 월 39달러 이상에서 열린다. — TechRadar Pro hands-on review를 인용한 무료 요금제 문단
- Kimi API는 OpenAI 호환 API이며 K3의 reasoning_effort에서 기사 작성 시점에 max만 지원된다. — Hands-On With the API 절의 Python 코드와 reasoning_effort 설명
- K3는 독립 FlowGraph 테스트에서 68점을 기록해 Claude의 91점보다 낮았고 격차가 다중 에이전트 조정에 집중됐다. — 비교 표의 Independent hard-task benchmark result 행
- K3 가중치는 OSI가 인정한 Open Source 라이선스가 아닌 별도 Kimi K3 License로 배포된다. — 라이선스와 도입 시 주의사항을 설명한 Rough Edges 절의 마지막 부분
용어 해설
- Mixture-of-Experts
- — 여러 개의 전문 하위 모델인 expert 중 일부만 토큰마다 선택해 계산하는 구조입니다. Kimi K3는 896개 expert 중 16개를 활성화해 전체 2.8조 파라미터를 매번 모두 계산하지 않으며, 대규모 모델 용량과 추론 효율을 함께 확보하려는 방식입니다.
- Agent Swarm
- — 하나의 작업을 여러 하위 에이전트에 나누고 결과를 조정하는 병렬 에이전트 아키텍처입니다. 순차 처리 대신 수십 또는 수백 개의 하위 에이전트가 검색과 도구 호출을 나눠 수행하지만, 작업 간 의존성이 높으면 병렬화 이점이 사라질 수 있습니다.
- Context Window
- — 모델이 한 요청과 대화에서 처리할 수 있는 입력 토큰의 범위입니다. Kimi K3는 100만 토큰 Context Window를 제공해 긴 문서 여러 개를 한 대화에 넣고 구간 간 관계를 유지하며 질의할 수 있도록 설계됐습니다.
- Tool Calling
- — 언어 모델이 답변만 생성하지 않고 외부 함수나 도구를 호출하도록 요청하는 기능입니다. 기사 속 Python 예제에서는 K3가 count_words 호출을 반환하고, 프로그램이 함수를 실행한 뒤 결과를 대화에 다시 넣어 다음 턴을 진행합니다.
- Prefix Caching
- — 반복되는 대화 앞부분의 계산 결과를 저장해 후속 요청에서 재사용하는 최적화입니다. K3의 캐시된 입력 토큰 가격은 일반 입력보다 낮은 100만 토큰당 0.30달러로 책정돼 긴 문서와 다중 턴 대화의 비용 구조를 바꿀 수 있습니다.
기술
- Kimi K3
- Moonshot AI
- Agent Swarm
- Goal
- OK Computer
- Kimi Work
- WebBridge
- Kimi Claw
- Kimi Code
- Kimi API
- OpenAI Python SDK
- Python
- FlowGraph
- Claude Code
활용 사례
- 긴 PDF 여러 개의 구간 교차 참조
- 비용에 민감한 대규모 coding 작업
- Python 코드 리팩터링
- 여러 하위 에이전트를 활용한 병렬 검색
- 컴퓨터 브라우저에서 검색·스크롤·양식 입력을 수행하는 데스크톱 작업
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
