2026 年 7 月 16 日,月之暗面(Moonshot AI)發佈了 Kimi K3——一個擁有 2.8 萬億參數的開源大模型。7 月 27 日,完整模型權重正式開源,這是全球首個 3T 級別的開源模型。
Kimi K3 不只是「參數更大」,它在多個基準測試中超越了 GPT-5.6 和 Claude Fable 5,同時 API 呼叫成本僅為 Claude 的 1/3。
本文將手把手教你如何在真實專案中使用 Kimi K3:從 API 註冊、基礎呼叫,到搭建一個完整的 Agent,最後對比三大模型的選型策略。
一、Kimi K3 是什麼?
1.1 2.8 萬億參數的開源巨獸
Kimi K3 的核心資料:
| 指標 | 數值 |
|---|---|
| 總參數量 | 2.8 萬億(2.8T) |
| 上下文視窗 | 100 萬 token |
| 啟用參數 | 每次推理啟用 896 個專家中的 16 個 |
| 架構 | KDA(Kimi Delta Attention) |
| 開源狀態 | 2026-07-27 完整權重開源 |
這意味著什麼?你可以用更低的成本獲得接近甚至超越 GPT-5.6 的效能,而且模型權重完全開源,可以本地部署和微調。
1.2 KDA 架構:如何讓大模型更高效
Kimi K3 採用了全新的 KDA(Kimi Delta Attention) 架構,配合 MoE(Mixture of Experts) 稀疏啟用機制:
- 896 個專家:模型包含 896 個獨立的專家網路
- 稀疏啟用:每次推理只啟用其中 16 個專家
- Attention Residuals:保留關鍵注意力資訊,避免長上下文遺忘
這種設計讓 Kimi K3 在保持 2.8T 總參數的同時,實際推理成本大幅降低。你不需要為所有參數買單,只為實際使用的部分付費。
1.3 核心能力速覽
- 超長上下文:100 萬 token,可以一次性處理整本書或大型程式碼庫
- 原生視覺理解:支援圖片和影片輸入,不只是文字
- Tool Calling:支援自訂工具呼叫,可以搭建 Agent
- 推理強度可調:low / high / max 三檔,按需選擇
- 結構化輸出:支援 JSON Schema 約束,輸出格式可控
- 串流輸出:分離推理和答案增量,實時看到思考過程
1.4 Kimi K3 生態系統:不只是 API
2026 年 8 月,Kimi 圍繞 K3 構建了完整的產品生態,遠不止一個 API:
- Kimi Code:終端和 IDE 中的 AI 程式設計助手,支援 Parallel Agent 和多 Agent 並行開發,直接對標 Cursor 和 Claude Code
- Kimi Work:桌面端 AI 知識工作代理,處理文件、表格、演示文稿,支援 Scheduled Tasks 定時任務
- Kimi Claw:一鍵部署 24/7 執行的 AI Agent(雲端),基於 OpenClaw 開源框架
- Kimi WebBridge:瀏覽器擴充套件,讓 AI Agent 直接操作網頁
這意味著你可以用 Kimi K3 做完整的工作流:從程式碼編寫(Kimi Code)→ 資料分析(Kimi Work)→ 自動化任務(Kimi Claw),全鏈路覆蓋。
二、快速上手:5 分鐘呼叫 Kimi K3 API
2.1 註冊與獲取 API Key
步驟 1:存取 Kimi API 平臺,註冊帳號。
步驟 2:進入 API Keys 管理頁面,建立一個新的 API Key。
步驟 3:充值最低 10 元解鎖 Kimi K3(注意:新使用者贈送的 15 元代金券不可用於 K3,需要真實充值)。
步驟 4:安裝 OpenAI SDK(Kimi K3 相容 OpenAI 格式):
pip install openai
2.2 第一個請求:Python 範例
建立一個 kimi_test.py 檔案:
from openai import OpenAI
import os
# 初始化客戶端
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.cn/v1",
)
# 基礎呼叫
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "用 Python 寫一個快速排序演算法"}
],
)
print(completion.choices[0].message.content)
執行前設定環境變數:
export MOONSHOT_API_KEY="your-api-key-here"
python kimi_test.py
你會看到 Kimi K3 返回的完整快速排序程式碼。
2.3 串流輸出與推理強度配置
Kimi K3 支援 推理強度調節,可以控制模型「思考多久」:
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="max", # low / high / max
stream=True,
messages=[
{"role": "user", "content": "分析這段程式碼的效能瓶頸"}
],
)
for chunk in completion:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
推理強度選擇建議:
low:簡單問答、快速響應(延遲最低)high:一般程式設計任務、文件生成(平衡)max:複雜推理、程式碼審查、架構設計(質量最高)
2.4 視覺理解:圖片和影片輸入
Kimi K3 支援原生視覺理解,可以直接傳入圖片:
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "這張圖片裡有什麼?"},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
],
)
print(completion.choices[0].message.content)
也可以傳入 Base64 編碼的圖片:
import base64
with open("screenshot.png", "rb") as f:
image_base64 = base64.b64encode(f.read()).decode()
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "描述這個 UI 設計"},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{image_base64}"
}
}
]
}
],
)
三、實戰:用 Kimi K3 搭建一個 Agent
Agent 是 Kimi K3 的核心應用場景之一。透過 Tool Calling,你可以讓模型呼叫自訂工具,完成複雜任務。
3.1 Agent 架構設計
我們要搭建一個「行業資訊整理 Agent」,它可以:
- 搜尋指定行業的最新新聞
- 提取關鍵資訊
- 生成結構化報告
工具定義:
search_news(query):搜尋行業新聞extract_key_info(text):提取關鍵資訊save_report(content):儲存報告到檔案
3.2 Tool Calling 實現
Kimi K3 的 Tool Calling 語法與 OpenAI 完全相容:
import json
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.cn/v1",
)
# 定義工具
tools = [
{
"type": "function",
"function": {
"name": "search_news",
"description": "搜尋指定行業的最新新聞",
"parameters": {
"type": "object",
"properties": {
"query": {
"type": "string",
"description": "搜尋關鍵詞,例如 'AI 醫療'"
}
},
"required": ["query"]
}
}
},
{
"type": "function",
"function": {
"name": "save_report",
"description": "儲存報告到檔案",
"parameters": {
"type": "object",
"properties": {
"filename": {
"type": "string",
"description": "檔名,例如 'report.md'"
},
"content": {
"type": "string",
"description": "報告內容"
}
},
"required": ["filename", "content"]
}
}
}
]
# 模擬工具實現
def search_news(query):
# 實際專案中這裡呼叫搜尋 API
return f"關於 {query} 的最新新聞:1. AI 醫療突破... 2. 新藥審批加速..."
def save_report(filename, content):
with open(filename, "w", encoding="utf-8") as f:
f.write(content)
return f"報告已儲存到 {filename}"
# Agent 主迴圈
def run_agent(task):
messages = [
{"role": "system", "content": "你是一個行業資訊整理助手。根據使用者需求,搜尋新聞、提取關鍵資訊、生成報告。"},
{"role": "user", "content": task}
]
while True:
completion = client.chat.completions.create(
model="kimi-k3",
messages=messages,
tools=tools,
reasoning_effort="high",
)
response = completion.choices[0].message
# 如果模型請求呼叫工具
if response.tool_calls:
messages.append(response)
for tool_call in response.tool_calls:
func_name = tool_call.function.name
func_args = json.loads(tool_call.function.arguments)
print(f"🔧 呼叫工具: {func_name}({func_args})")
# 執行工具
if func_name == "search_news":
result = search_news(**func_args)
elif func_name == "save_report":
result = save_report(**func_args)
else:
result = "未知工具"
# 將工具結果返回給模型
messages.append({
"role": "tool",
"tool_call_id": tool_call.id,
"content": result
})
else:
# 模型給出最終回答
print("\n✅ 最終回答:")
print(response.content)
break
# 執行 Agent
run_agent("整理 AI 醫療行業的最新動態,生成一份 Markdown 報告")
3.3 完整程式碼範例:行業資訊整理 Agent
上面的程式碼展示了 Agent 的核心邏輯。實際專案中,你需要:
- 替換
search_news實現:接入真實的搜尋 API(如 SerpAPI、Bing Search) - 新增錯誤處理:工具呼叫可能失敗,需要重試機制
- 限制迴圈次數:避免 Agent 無限呼叫工具
- 日誌記錄:記錄每次工具呼叫的輸入輸出
3.4 除錯與最佳化技巧
問題 1:Agent 陷入死迴圈
- 解決:設定最大迭代次數(例如 5 次)
問題 2:工具呼叫參數錯誤
- 解決:在工具描述中提供更詳細的參數說明和範例
問題 3:響應太慢
- 解決:降低
reasoning_effort到low或high
四、Kimi K3 vs GPT-5.6 vs Claude Fable 5
4.1 效能對比:Benchmark 資料解讀
| Benchmark | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Frontend Code Arena | 1679 | 1650 | 1631 |
| AI Intelligence Index | 57 | 59 | 58 |
| 程式設計能力(綜合) | 開源第一 | 商業第一 | 第二 |
關鍵發現:
- Kimi K3 在前端程式碼生成方面全球第一
- 綜合智慧略低於 GPT-5.6 和 Claude Fable 5,但差距很小
- 在開源模型中,Kimi K3 遙遙領先
4.2 Kimi K3 定價方案完全解讀
API 定價(按 token 計費)
| 型別 | 價格(每百萬 token) | 說明 |
|---|---|---|
| 輸入(快取未命中) | $3.00 | 新上下文 |
| 輸入(快取命中) | $0.30 | 節省 90%,適合重複工作流 |
| 輸出 | $15.00 | 模型生成的內容 |
| 上下文視窗 | 1,048,576 tokens | 約 100 萬 token |
會員計劃(直接使用 K3)
| 等級 | 月付 | 年付(月均) | K3 超長對話 | Agent 併發 | 特色功能 |
|---|---|---|---|---|---|
| Moderato | $19 | $15 | ✗ | 2 | 基礎 Agent |
| Allegretto | $39 | $31 | ✗ | 2 | +Kimi Claw 部署 |
| Allegro | $99 | $79 | ✓ 1M tokens | 4 | +超長對話+Kimi Claw |
| Vivace | $199 | $159 | ✓ 1M tokens | 4 | +最高優先順序+全部功能 |
💡 Allegro 和 Vivace 解鎖 K3 超長對話能力,支援最多 100 萬 token 的上下文。
免費使用 Kimi K3
Kimi 提供免費層級(Adagio 計劃),你可以:
- 在 kimi.com 網頁端免費使用 K3(有次數限制)
- 使用基礎 Agent 功能和 Swarm 多 Agent 協作
- 體驗 Kimi Code、Kimi Work 等全線產品
此外,Kimi K3 完整權重已開源(2026-07-27),你可以在本地 GPU 叢集完全免費部署。
成本計算例項
假設每天處理 100 個請求,每個請求 2000 輸入 token + 500 輸出 token:
- 每日輸入:200,000 token × $3/1M = $0.60
- 每日輸出:50,000 token × $15/1M = $0.75
- 每日總成本:$1.35,每月約 $40
如果啟用上下文快取(相同上下文複用):
- 每日輸入降至:200,000 × $0.30/1M = $0.06
- 每月輸入成本僅 $1.80,節省 90%
三大模型成本對比
| 模型 | 輸入價格/1M token | 輸出價格/1M token | 相對 K3 成本 |
|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | 基準 |
| GPT-5.6 Sol | ~$10.00 | ~$30.00 | ~2x |
| Claude Fable 5 | ~$15.00 | ~$75.00 | ~5x |
結論:Kimi K3 的 API 成本僅為 Claude Fable 5 的 1/5。對於月呼叫量超過 1000 萬 token 的專案,選擇 K3 每月可節省數百到數千元。
4.3 場景選型:什麼時候該用哪個?
選擇 Kimi K3:
- 預算敏感,需要高頻呼叫
- 前端程式碼生成、程式設計輔助
- 需要超長上下文(100 萬 token)
- 希望本地部署或微調
選擇 GPT-5.6:
- 綜合智慧要求最高
- 需要最成熟的生態系統
- 多模態任務(圖片、音訊、影片)
選擇 Claude Fable 5:
- 長文字理解和生成
- 需要最自然的對話風格
- 對安全性要求極高
4.4 遷移成本:從 OpenAI 切換到 Kimi
Kimi K3 完全相容 OpenAI SDK 格式,遷移非常簡單:
# 原 OpenAI 程式碼
from openai import OpenAI
client = OpenAI(api_key="sk-...")
# 切換到 Kimi K3
from openai import OpenAI
client = OpenAI(
api_key="your-moonshot-key",
base_url="https://api.moonshot.cn/v1",
)
只需修改 base_url 和 api_key,其他程式碼無需改動。
4.5 Kimi K3 vs Claude Fable 5:正面交鋒
| 維度 | Kimi K3 | Claude Fable 5 |
|---|---|---|
| 參數量 | 2.8T(開源) | 未公開(閉源) |
| 上下文視窗 | 1M tokens | 200K tokens |
| API 輸入價格 | $3/1M token | ~$15/1M token |
| API 輸出價格 | $15/1M token | ~$75/1M token |
| 快取命中價格 | $0.30/1M | 無公開快取定價 |
| 開源 | ✓ 完整權重 | ✗ 完全閉源 |
| 本地部署 | ✓ 完全支援 | ✗ 不可能 |
| 前端程式碼能力 | 全球第一(1679 分) | 優秀(1631 分) |
| 生態系統 | Kimi Code/Work/Claw | Claude Desktop/MCP |
| 推理強度調節 | ✓ low/high/max | ✓ 類似 |
| Tool Calling | ✓ 完全相容 OpenAI 格式 | ✓ 原生支援 |
為什麼很多人從 Claude 轉向 Kimi K3?
- 成本:K3 的 API 成本僅為 Claude 的 1/5,高頻呼叫差距巨大
- 上下文:K3 支援 1M token(Claude 僅 200K),處理大型程式碼庫和長文件時優勢明顯
- 開源可控:K3 權重完全開源,可以本地部署、微調、資料不出境
- 生態完善:Kimi Code 對標 Claude Code,Kimi Claw 提供 24/7 Agent 執行
Claude 仍然更好的場景:
- 對安全性要求極高的企業場景(Anthropic 的 Constitutional AI)
- 需要最自然的對話風格
- 已深度整合 Claude MCP 生態的專案
五、開源意味著什麼?
5.1 本地部署的可能性
7 月 27 日完整權重開源後,你可以:
- 在本地 GPU 叢集部署 Kimi K3
- 完全離線執行,資料不出境
- 自訂推理最佳化,降低延遲
硬體需求預估:
- 完整模型:需要 8×A100 80GB 或更高
- 量化版本(INT8):4×A100 80GB 可能可行
- 社群量化版本(GGUF):消費級 GPU 可能支援部分功能
5.2 微調與定製化
開源權重意味著你可以:
- 在特定領域資料上微調
- 適配企業內部知識庫
- 最佳化特定任務的效能