본문으로 건너뛰기

Kimi Agent의 구조와 실제 성능 검증

Kimi Agent는 긴 문서와 비용 효율성에서 강점을 보였지만 다중 에이전트 조정 성능에는 뚜렷한 격차가 남았다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Kimi Agent는 단일 제품이 아니라 2.8조 파라미터 Kimi K3 모델, Agent Swarm, Goal, Kimi Work, Kimi Claw, Kimi Code 등을 묶은 제품군입니다. K3는 100만 토큰 Context Window와 OpenAI 호환 API를 제공하고, Agent Swarm은 최대 300개 하위 에이전트와 4,000회 이상의 도구 호출을 활용하지만 serial collapse와 fake parallelism이라는 실패 조건도 지닙니다. 긴 PDF 교차 참조와 비용 민감형 coding에서는 강점이 확인됐고, 가격은 입력 100만 토큰당 3달러, 출력 15달러이며 캐시 입력은 0.30달러입니다. 반면 독립 FlowGraph 테스트에서 K3는 68점으로 Claude의 91점에 못 미쳤고, 공급 중단·과도한 자율성·세션 이력 호환성·중국 기반 서버·비OSI 라이선스가 실제 도입 전 검토 사항으로 남습니다.

섹션별 상세

01
Kimi Agent라는 이름은 하나의 제품이 아니라 Kimi K3 모델과 여러 실행 환경 및 에이전트 기능을 묶어 부르는 범주입니다. Kimi K3는 Moonshot AI가 개발한 2.8조 파라미터 Mixture-of-Experts 모델로, 896개 expert 중 토큰마다 16개를 활성화하고 100만 토큰 Context Window를 사용합니다. 그 위에 Agent Swarm의 병렬 하위 에이전트 구조, Goal의 자율 다단계 작업, Kimi 채팅 인터페이스의 OK Computer, 데스크톱 앱 Kimi Work와 클라우드형 Kimi Claw, 코딩 CLI인 Kimi Code가 각각 다른 역할로 결합됩니다.
Kimi Agent를 중심으로 Web Search, Document Analysis, Data Insights, Code Execution, Task Automation, Smart Reasoning이 연결된 개념 이미지입니다.
Diagram이미지는 Kimi Agent가 단순 대화형 모델이 아니라 검색, 문서 처리, 데이터 인사이트, 코드 실행, 작업 자동화, 추론 기능을 연결하는 에이전트 인터페이스라는 기사의 제품군 설명과 맞닿아 있습니다. 중앙의 Kimi 로고와 주변 기능 노드는 Agent Swarm이나 Goal 같은 기능이 여러 작업 도구와 결합된다는 인상을 시각화하지만, 동시 에이전트 수나 벤치마크 수치는 담고 있지 않습니다.
KIMI 대시보드에서 New Chat, Scheduled Tasks, Swarm, Slides, Deep Research, Websites, Docs, Sheets, Design, Kimi Code 등의 기능 메뉴를 보여주는 화면입니다.
Screenshot화면 왼쪽 메뉴에는 일반 채팅 외에 예약 작업, Swarm, Slides, Deep Research, Websites, Docs, Sheets, Design, Kimi Code가 함께 배치돼 있습니다. 이는 기사에서 Kimi Agent라는 이름 아래 여러 작업 모드와 제품 기능이 공존한다고 설명한 부분을 뒷받침하며, 중앙 입력창의 에이전트 작업 프롬프트는 자연어 목표를 입력하는 Goal형 사용 흐름과 연결됩니다.
근거
  • Kimi Agent는 하나의 제품이 아니라 Kimi K3와 여러 에이전트 및 실행 제품을 묶어 부르는 이름이다. 기사 도입부에서 Kimi K3, Agent Swarm, Goal, OK Computer, Kimi Work, Kimi Claw, Kimi Code의 역할을 구분한 문단
02
Agent Swarm은 작업을 미리 정한 역할에 따라 순차 처리하는 대신 여러 하위 에이전트에 나눠 실행하고 결과를 조정하는 구조입니다. 2026년 4월 K2.6에서 동시 하위 에이전트 300개와 단일 작업 4,000회 이상의 도구 호출을 지원했으며, Moonshot은 동일 작업의 순차 단일 에이전트보다 4.5배 빠르다고 밝혔습니다. 다만 오케스트레이터가 작업을 분산해도 하위 에이전트가 서로 기다리는 serial collapse와 독립성이 부족한 fake parallelism이 발생할 수 있어, 모든 작업에 병렬화를 적용하는 구조는 아닙니다.
근거
  • Agent Swarm은 최대 300개의 동시 하위 에이전트와 단일 작업 4,000회 이상의 도구 호출을 지원하며 Moonshot은 순차 처리보다 4.5배 빠르다고 밝혔다. Agent Swarm의 K2.6 출시 용량과 속도 수치가 제시된 문단
03
무료 사용자는 Google 계정만으로 가입할 수 있지만 Agent Swarm의 대규모 기능을 충분히 시험하기에는 제약이 있습니다. TechRadar Pro의 체험 결과 무료 요금제는 동시 에이전트 작업을 한 개로 제한하고, 전체 agentic 기능은 월 39달러 이상에서 열립니다. 병렬 하위 에이전트가 핵심 가치인 서비스에서 동시 작업 한 개 제한은 기능의 장점을 검증하려는 사용자에게 직접적인 진입 장벽이 됩니다.
python
import os
import json
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

MODEL = "kimi-k3"
TOOLS = [{
    "type": "function",
    "function": {
        "name": "count_words",
        "description": "Counts the number of words in a block of text.",
        "parameters": {
            "type": "object",
            "properties": {"text": {"type": "string"}},
            "required": ["text"],
        },
    },
}]

def count_words(text: str) -> int:
    return len(text.split())

def run_task(task: str, max_turns: int = 6) -> dict:
    """Runs a task through Kimi K3, executing any tool calls it makes, and returns a small report of what happened."""
    messages = [{"role": "user", "content": task}]
    total_prompt_tokens = 0
    total_completion_tokens = 0
    turns_used = 0
    for turn in range(max_turns):
        turns_used = turn + 1
        response = client.chat.completions.create(
            model=MODEL,
            max_tokens=1024,
            tools=TOOLS,
            messages=messages,
            reasoning_effort="max", # K3 replaced the old `thinking` param with this
        )
        usage = response.usage
        total_prompt_tokens += usage.prompt_tokens
        total_completion_tokens += usage.completion_tokens
        message = response.choices[0].message
        if response.choices[0].finish_reason != "tool_calls":
            return {
                "answer": message.content,
                "turns_used": turns_used,
                "prompt_tokens": total_prompt_tokens,
                "completion_tokens": total_completion_tokens,
            }
        messages.append(message.model_dump(exclude_none=True))
        for tool_call in message.tool_calls:
            if tool_call.function.name == "count_words":
                args = json.loads(tool_call.function.arguments)
                result = count_words(args["text"])
                messages.append({
                    "role": "tool",
                    "tool_call_id": tool_call.id,
                    "content": str(result),
                })
    return {"answer": None, "turns_used": turns_used, "error": "Hit max_turns without finishing"}

OpenAI 호환 API에서 Kimi K3의 Tool Calling 응답을 받아 함수를 실행하고 결과를 다음 대화 턴에 전달하는 예제입니다.

KIMI 요금제 화면에서 Moderato, Allegretto, Allegro, Vivace의 월간 가격과 에이전트 크레딧, Deep Research, Swarm 등의 제공 항목을 비교합니다.
Screenshot화면은 네 요금제가 각각 월 15달러, 31달러, 79달러, 159달러로 표시되고, 요금제별 agent credits와 Swarm, Deep Research, 예약 작업 등의 제공 범위를 나눠 보여줍니다. 기사 본문의 무료 요금제 동시 작업 제한과 월 39달러 이상에서 전체 agentic 기능이 열린다는 설명을 확인할 때 참고할 수 있지만, 이미지의 가격 표시와 본문에 인용된 구독 조건은 시점이나 상품 구성이 다를 수 있습니다.
근거
  • 무료 요금제는 동시 에이전트 작업을 한 개로 제한하고 전체 agentic 기능은 월 39달러 이상에서 열린다. TechRadar Pro hands-on review를 인용한 무료 요금제 문단
04
Kimi API는 OpenAI 호환 chat-completions 계약을 따르므로 기존 openai Python SDK에서 base URL과 모델 이름을 바꾸는 방식으로 접근할 수 있습니다. 예제 코드는 kimi-k3를 호출하고 finish_reason이 tool_calls일 때 message.tool_calls의 함수명을 확인한 뒤 count_words를 실행해 결과를 tool 메시지로 되돌립니다. K3에서는 K2 계열의 thinking 파라미터가 reasoning_effort로 바뀌었고, 기사 작성 시점에 지원되는 값은 max 하나였으며, 입력 가격은 100만 토큰당 3달러, 출력은 15달러, 캐시 입력은 0.30달러입니다.
근거
  • Kimi API는 OpenAI 호환 API이며 K3의 reasoning_effort에서 기사 작성 시점에 max만 지원된다. Hands-On With the API 절의 Python 코드와 reasoning_effort 설명
05
독립적인 사용 결과는 Kimi K3가 긴 문서 처리와 비용 민감형 coding에서 실용적인 강점을 보이지만 가장 어려운 에이전트 협업 과제에서는 Claude와 GPT 계열에 뒤처진다는 쪽으로 모입니다. TechRadar Pro는 긴 PDF 두 개의 특정 구간을 교차 참조하는 작업에서 정확하고 정리된 응답과 후속 질문 대응을 확인했으며, Kimi Code의 Python 리팩터링 결과도 구조적 추론은 유지했지만 Claude Code보다 설명이 덜 체계적이라고 평가했습니다. 독립 FlowGraph 테스트에서는 K3가 68점, Claude가 91점을 기록했고, 격차는 특히 다중 에이전트 조정 영역에 집중됐습니다.
근거
  • K3는 독립 FlowGraph 테스트에서 68점을 기록해 Claude의 91점보다 낮았고 격차가 다중 에이전트 조정에 집중됐다. 비교 표의 Independent hard-task benchmark result 행
06
실제 도입 전에는 공급 용량, 자율성, 세션 호환성, 데이터 위치를 함께 확인해야 합니다. Moonshot은 수요 급증으로 GPU 용량 한도에 도달하자 2026년 7월 20일 신규 K3 구독을 일시 중단했고, 모호한 상황에서 질문하지 않고 결정을 내리는 excessive proactiveness도 관찰 행동으로 문서화했습니다. 또한 에이전트 harness가 추론 이력을 제대로 되돌려 보내지 않거나 다른 모델로 시작한 세션을 K3로 바꾸면 품질이 저하될 수 있으며, 호스팅 API가 중국 기반 서버를 거치고 K3 가중치도 OSI가 인정한 Open Source 라이선스가 아닌 별도 Kimi K3 License로 배포된다는 점이 규제 산업과 라이선스 검토에서 중요합니다.
근거
  • K3 가중치는 OSI가 인정한 Open Source 라이선스가 아닌 별도 Kimi K3 License로 배포된다. 라이선스와 도입 시 주의사항을 설명한 Rough Edges 절의 마지막 부분

용어 해설

Mixture-of-Experts
여러 개의 전문 하위 모델인 expert 중 일부만 토큰마다 선택해 계산하는 구조입니다. Kimi K3는 896개 expert 중 16개를 활성화해 전체 2.8조 파라미터를 매번 모두 계산하지 않으며, 대규모 모델 용량과 추론 효율을 함께 확보하려는 방식입니다.
Agent Swarm
하나의 작업을 여러 하위 에이전트에 나누고 결과를 조정하는 병렬 에이전트 아키텍처입니다. 순차 처리 대신 수십 또는 수백 개의 하위 에이전트가 검색과 도구 호출을 나눠 수행하지만, 작업 간 의존성이 높으면 병렬화 이점이 사라질 수 있습니다.
Context Window
모델이 한 요청과 대화에서 처리할 수 있는 입력 토큰의 범위입니다. Kimi K3는 100만 토큰 Context Window를 제공해 긴 문서 여러 개를 한 대화에 넣고 구간 간 관계를 유지하며 질의할 수 있도록 설계됐습니다.
Tool Calling
언어 모델이 답변만 생성하지 않고 외부 함수나 도구를 호출하도록 요청하는 기능입니다. 기사 속 Python 예제에서는 K3가 count_words 호출을 반환하고, 프로그램이 함수를 실행한 뒤 결과를 대화에 다시 넣어 다음 턴을 진행합니다.
Prefix Caching
반복되는 대화 앞부분의 계산 결과를 저장해 후속 요청에서 재사용하는 최적화입니다. K3의 캐시된 입력 토큰 가격은 일반 입력보다 낮은 100만 토큰당 0.30달러로 책정돼 긴 문서와 다중 턴 대화의 비용 구조를 바꿀 수 있습니다.

기술

  • Kimi K3
  • Moonshot AI
  • Agent Swarm
  • Goal
  • OK Computer
  • Kimi Work
  • WebBridge
  • Kimi Claw
  • Kimi Code
  • Kimi API
  • OpenAI Python SDK
  • Python
  • FlowGraph
  • Claude Code

활용 사례

  • 긴 PDF 여러 개의 구간 교차 참조
  • 비용에 민감한 대규모 coding 작업
  • Python 코드 리팩터링
  • 여러 하위 에이전트를 활용한 병렬 검색
  • 컴퓨터 브라우저에서 검색·스크롤·양식 입력을 수행하는 데스크톱 작업
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.