본문으로 건너뛰기

Kimi K3 2.8T 모델 활용법

Kimi K3의 구조와 App·API 활용법, Coding 성능을 정리합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Moonshot AI의 Kimi K3는 2.8T 파라미터 중 토큰당 896개 Expert 가운데 16개만 활성화하는 Open-weight MoE 모델로, Kimi Delta Attention과 Attention Residuals를 이용해 1,048,576 토큰 Context Window를 지원합니다. 사용자는 Kimi App에서 무료로 시험하거나 Fireworks AI API를 통해 Standard 기준 입력 1M 토큰당 $3.00, Cached Input $0.30, Output $15.00에 연결할 수 있으며, Python 예제는 이미지 설명과 Haiku를 JSON으로 반환합니다. Coding 벤치마크에서 K3는 일부 Proprietary 모델과 경쟁하고 특정 평가에서 앞서지만, 프로그래밍과 장기 Agent 작업에 강점이 집중되므로 실제 업무용 자체 평가가 필요합니다. 자체 호스팅에는 최소 64개 Accelerator가 권장되어 대부분의 개발자는 App이나 API를 통한 접근부터 시작하는 편이 적합합니다.

섹션별 상세

01
Kimi K3는 Moonshot AI가 공개한 2.8T 파라미터 규모의 Open-weight MoE 모델로, 모든 파라미터를 매 토큰마다 계산하지 않고 896개 Expert 중 16개만 활성화합니다. 이 Sparse Routing은 전체 모델 규모를 키우면서 토큰당 실제 연산량을 제한하는 방식이며, 모델에는 Native Text와 Vision 입력이 함께 들어갑니다. 글은 이 구조와 1,048,576 토큰 Context Window를 바탕으로 K3를 Proprietary 모델의 대안으로 평가합니다.
근거
  • Kimi K3는 2.8T 파라미터와 1,048,576 토큰 Context Window를 가진 Open-weight MoE 모델이다. 본문의 What Makes K3 Different 표에 Total Parameters, Context Window, Modality, License가 정리되어 있습니다.
  • Kimi K3는 896개 Expert 중 토큰당 16개를 활성화한다. 본문의 What Makes K3 Different 표에 Active Experts per Token이 16 of 896, 약 1.8%로 제시되어 있습니다.
02
1M 토큰 Context Window를 실용적으로 처리하기 위해 Kimi Delta Attention과 Attention Residuals가 핵심 구조로 배치됩니다. Kimi Delta Attention은 Quadratic Attention을 대체하는 Hybrid Linear Attention으로 긴 입력에서 계산 증가를 완화하고, Attention Residuals는 표준 Residual Connection 대신 여러 Depth Source와 Block 결과를 결합합니다. 글에 포함된 구조도는 KDA와 Gated Multi-head Latent Attention을 Attention Sublayer에 배치하고, FFN 또는 LatentMoE와 함께 반복하는 흐름을 나타냅니다.
Kimi K3의 전체 Transformer Block과 Kimi Delta Attention, Gated Multi-head Latent Attention, FFN 또는 LatentMoE의 연결 구조를 나타낸 다이어그램입니다.
Diagram다이어그램은 Tokenized Text와 Token Embedding Layer에서 시작해 93개 Block을 거치는 흐름을 보여주며, 첫 층은 Dense이고 이후 층은 LatentMoE로 구성됩니다. 오른쪽 확대도에서 KDA는 Gated Delta Rule, Conv, L2 Norm, Sigmoid Gate를 거치고, Gated Multi-head Latent Attention은 Latent 표현을 Q·K·V로 변환해 Attention을 수행합니다. 그림 하단에는 1M 토큰 Context 지원과 Kimi Delta Attention 대 MoE의 3:1 Layer 비율이 함께 표시되어 본문의 구조 설명을 보강합니다.
03
사용자는 Kimi App과 Fireworks AI API라는 두 경로로 K3를 이용할 수 있습니다. iOS·Android의 Kimi App, kimi.com, Kimi Work Desktop에서는 Developer Account 없이 Free Tier로 대화를 시작할 수 있고, API는 OpenAI 호환 Endpoint에 Pay-per-token 방식으로 연결합니다. Fireworks AI 요금은 Standard 기준 Uncached Input이 1M 토큰당 $3.00, Cached Input이 $0.30, Output이 $15.00이며, Priority와 Fast 경로는 더 높은 비용으로 신뢰성 또는 지연시간을 조정합니다.
python
import requests
import json
url = "https://api.fireworks.ai/inference/v1/chat/completions"
payload = {
    "model": "accounts/fireworks/models/kimi-k3",
    "max_tokens": 4096,
    "top_k": 40,
    "presence_penalty": 0,
    "frequency_penalty": 0,
    "messages": [
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": (
                        "Look at this image. First describe what's in it in one paragraph. "
                        "Then write a 4-line haiku inspired by it. "
                        "Return your answer as JSON with keys 'description' and 'haiku'."
                    )
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://images.unsplash.com/photo-1582538885592-e70a5d7ab3d3?ixlib=rb-4.0.3&ixid=M3wxMjA3fDB8MHxwaG90by1wYWdlfHx8fGVufDB8fHx8fA%3D%3D&auto=format&fit=crop&w=1770&q=80"
                    }
                }
            ]
        }
    ]
}
headers = {
    "Accept": "application/json",
    "Content-Type": "application/json",
    "Authorization": f"Bearer "
}
response = requests.post(
    url,
    headers=headers,
    data=json.dumps(payload)
)
result = response.json()
print(result["choices"][0]["message"]["content"])

Fireworks AI의 OpenAI 호환 Chat Completions API에 이미지를 보내고 설명과 Haiku를 JSON으로 받는 Python 호출 코드입니다.

근거
  • Fireworks AI의 Standard 경로는 Uncached Input $3.00 / M, Cached Input $0.30 / M, Output $15.00 / M이다. How to Access K3 and What it Costs? 절의 Fireworks 요금표에 Standard, Priority, Fast별 입력·출력 단가가 제시되어 있습니다.
  • Moonshot AI는 K3 자체 호스팅에 최소 64개 Accelerator를 갖춘 Supernode를 권장한다. API 비용 설명 뒤의 자체 호스팅 문단에 64 accelerators와 700B–1.6T 모델보다 큰 인프라 요구사항이 적혀 있습니다.
04
Kimi App 실습에서는 일반 지식 질문보다 Typing Speed Test를 만드는 작은 프로젝트를 입력해 Coding과 Agentic 능력을 확인하도록 권합니다. 제시된 Prompt는 Random Sentence 출력, 첫 입력 시 Timer 시작, Words-per-minute와 Accuracy 계산, 단일 HTML 파일 생성을 요구하며, K3는 코드를 내놓기 전에 계획을 표시하는 Thinking State로 동작한다고 글은 적습니다. 완성된 화면을 다시 이미지 입력으로 보내 Margin과 Contrast를 평가하게 하면 코드 생성과 Vision 처리를 한 흐름에서 시험할 수 있습니다.
05
Fireworks AI API 실습은 이미지 URL을 입력으로 보내 한 문단의 이미지 설명과 4행 Haiku를 JSON으로 생성하는 절차를 사용합니다. Python 코드에서 accounts/fireworks/models/kimi-k3 Model ID와 max_tokens 4096, top_k 40을 지정하고, Text와 Image URL을 하나의 User Message에 넣은 뒤 결과의 choices 경로에서 Content를 꺼냅니다. 글은 이 과정에서 JSON이 주석으로 감춰지지 않는지와 사실 묘사 및 창작 결과의 품질을 따로 확인하도록 권하지만, 제시된 코드의 Authorization 값에는 실제 API Key가 들어 있지 않습니다.
Fireworks AI API 호출 뒤 이미지 설명과 Haiku를 JSON 형태로 출력한 터미널 화면입니다.
Screenshot터미널 화면에는 Text-only 호출과 Vision 입력 호출의 실행 시간이 각각 약 9.38초와 12.49초로 표시되고, 두 번째 호출은 description과 haiku 키를 포함한 JSON 결과를 반환합니다. Vision 호출의 Prompt Tokens는 2,891, Completion Tokens는 521, Total Tokens는 3,412로 나타나며 예상 표준 비용도 함께 표시됩니다. 본문에서 제시한 이미지 입력, 구조화된 JSON 출력, API 실행 결과를 시각적으로 뒷받침하는 자료입니다.
06
벤치마크 비교에서 K3는 Coding과 장기 실행형 Agent 작업에 강점이 있지만 모든 영역에서 최고라고 평가되지는 않습니다. 이미지의 수치 기준으로 DeepSWE는 K3 67.5점, Terminal Bench 2.1은 88.3점, Program Bench는 77.8점, SWE Marathon은 42.0점이며, FrontierSWE에서는 81.2점을 기록합니다. 글은 자체 업무에 맞는 Eval Suite를 실행해야 한다고 권하며, 자체 호스팅에는 최소 64개 Accelerator가 필요하므로 대부분의 사용자는 Kimi App이나 Fireworks API부터 시작하는 편이 현실적이라고 정리합니다.
Kimi K3와 GPT-5.6 Sol, Fable 5, GPT-5.5, Opus-4.8, GLM-5.2의 Coding 벤치마크 점수를 비교한 막대그래프입니다.
Chart그래프는 DeepSWE, FrontierSWE, Kimi Code Bench 2.0, Terminal Bench 2.1, Program Bench, SWE Marathon의 여섯 평가를 두 열로 나눠 비교합니다. Kimi K3는 Terminal Bench 2.1에서 88.3점, Program Bench에서 77.8점, SWE Marathon에서 42.0점을 기록하며, FrontierSWE에서는 81.2점으로 표시됩니다. 하단 주석은 Fable 5 결과에 잠재적 Fallback이 포함되고 GPT-5.6 Sol 결과에 잠재적 Safeguard가 포함된다고 밝히므로 점수 해석 때 평가 조건을 함께 확인해야 합니다.
근거
  • K3는 Coding 및 Agentic 작업에서 일부 Proprietary 모델과 경쟁하며, 특정 Coding 평가에서 앞선다. How K3 Performs Against Other AI Models? 절의 Artificial Intelligence Analysis Index, Front-end coding blind assessment, Moonshot 평가 비교 문단과 벤치마크 이미지가 근거입니다.
  • K3는 프로그래밍과 Long-horizon Agency에 특히 적합하므로 실제 사용 목적에 맞춘 자체 평가가 필요하다. 성능 비교 절 후반의 결론 문단에서 Leaderboard만 의존하지 말고 자체 Eval Suite를 실행하라고 권고합니다.

용어 해설

Mixture-of-Experts
여러 전문가 네트워크 중 일부만 선택해 토큰을 처리하는 Sparse 모델 구조입니다. Kimi K3는 전체 896개 Expert 가운데 토큰당 16개만 활성화해 거대한 총 파라미터 수를 유지하면서 추론 시 실제 계산량을 줄입니다. 이 방식은 모델 규모와 추론 비용 사이의 균형을 맞추는 데 중요합니다.
Linear Attention
입력 길이가 늘어날 때 Attention 계산량이 제곱으로 증가하는 문제를 완화하는 Attention 방식입니다. Kimi Delta Attention은 기존 Quadratic Attention 대신 선형적인 처리 경로를 사용해 1M 토큰 Context Window를 지원하는 기반으로 쓰입니다. 긴 코드와 문서 처리에서 메모리 부담을 낮추는 것이 핵심입니다.
Attention Residuals
표준 Residual Connection을 대신해 여러 층의 Attention 결과를 누적하는 모델 연결 방식입니다. Kimi K3 구조에서는 이전 Block의 요약과 Embedding 같은 Depth Sources를 가중합으로 결합해 다음 Block에 전달합니다. Moonshot AI는 모델이 커질수록 결과의 일관성을 높이는 설계로 설명합니다.
Open-weight 모델(Open-weight Model)
학습된 모델 가중치를 공개해 사용자가 직접 내려받거나 자체 인프라에서 실행할 수 있는 모델입니다. Kimi K3는 2.8T 파라미터와 Text·Vision 입력을 지원하며 Open-weight 형태로 제공됩니다. 다만 자체 실행에는 최소 64개 Accelerator를 갖춘 Supernode가 필요하다고 안내됩니다.
Context Window
모델이 한 번의 요청에서 입력과 출력을 함께 처리할 수 있는 토큰 범위입니다. Kimi K3의 Context Window는 1,048,576 토큰으로, 긴 코드베이스나 대규모 문서와의 작업을 겨냥합니다. 이 규모를 실용적으로 유지하기 위해 Kimi Delta Attention과 Sparse Expert 활성화가 함께 사용됩니다.

기술

  • Kimi K3
  • Moonshot AI
  • Mixture-of-Experts
  • Kimi Delta Attention (KDA)
  • Attention Residuals
  • Kimi App
  • kimi.com
  • Kimi Work
  • Fireworks AI
  • Python
  • requests
  • JSON
  • OpenAI-compatible API
  • Gated Multi-head Latent Attention
  • Kimi Delta Attention

활용 사례

  • 단일 HTML 파일 기반 Typing Speed Test 생성
  • 이미지 설명과 Haiku를 JSON으로 반환하는 Multimodal API 파이프라인
  • 스크린샷 기반 Web UI Margin과 Contrast 점검
  • 긴 코드베이스와 문서를 처리하는 Long-context Coding
  • Coding 및 Agentic Workflow 통합

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 24.수집 2026. 08. 24.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.