2026 年 7 月 16 日,月之暗面(Moonshot AI)发布了 Kimi K3——一个拥有 2.8 万亿参数的开源大模型。7 月 27 日,完整模型权重正式开源,这是全球首个 3T 级别的开源模型。
Kimi K3 不只是「参数更大」,它在多个基准测试中超越了 GPT-5.6 和 Claude Fable 5,同时 API 调用成本仅为 Claude 的 1/3。
本文将手把手教你如何在真实项目中使用 Kimi K3:从 API 注册、基础调用,到搭建一个完整的 Agent,最后对比三大模型的选型策略。
一、Kimi K3 是什么?
1.1 2.8 万亿参数的开源巨兽
Kimi K3 的核心数据:
| 指标 | 数值 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 上下文窗口 | 100 万 token |
| 激活参数 | 每次推理激活 896 个专家中的 16 个 |
| 架构 | KDA(Kimi Delta Attention) |
| 开源状态 | 2026-07-27 完整权重开源 |
这意味着什么?你可以用更低的成本获得接近甚至超越 GPT-5.6 的性能,而且模型权重完全开源,可以本地部署和微调。
1.2 KDA 架构:如何让大模型更高效
Kimi K3 采用了全新的 KDA(Kimi Delta Attention) 架构,配合 MoE(Mixture of Experts) 稀疏激活机制:
- 896 个专家:模型包含 896 个独立的专家网络
- 稀疏激活:每次推理只激活其中 16 个专家
- Attention Residuals:保留关键注意力信息,避免长上下文遗忘
这种设计让 Kimi K3 在保持 2.8T 总参数的同时,实际推理成本大幅降低。你不需要为所有参数买单,只为实际使用的部分付费。
1.3 核心能力速览
- 超长上下文:100 万 token,可以一次性处理整本书或大型代码库
- 原生视觉理解:支持图片和视频输入,不只是文本
- Tool Calling:支持自定义工具调用,可以搭建 Agent
- 推理强度可调:low / high / max 三档,按需选择
- 结构化输出:支持 JSON Schema 约束,输出格式可控
- 流式输出:分离推理和答案增量,实时看到思考过程
二、快速上手:5 分钟调用 Kimi K3 API
2.1 注册与获取 API Key
步骤 1:访问 Kimi API 平台,注册账号。
步骤 2:进入 API Keys 管理页面,创建一个新的 API Key。
步骤 3:充值最低 10 元解锁 Kimi K3(注意:新用户赠送的 15 元代金券不可用于 K3,需要真实充值)。
步骤 4:安装 OpenAI SDK(Kimi K3 兼容 OpenAI 格式):
pip install openai
2.2 第一个请求:Python 示例
创建一个 kimi_test.py 文件:
from openai import OpenAI
import os
# 初始化客户端
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.cn/v1",
)
# 基础调用
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "用 Python 写一个快速排序算法"}
],
)
print(completion.choices[0].message.content)
运行前设置环境变量:
export MOONSHOT_API_KEY="your-api-key-here"
python kimi_test.py
你会看到 Kimi K3 返回的完整快速排序代码。
2.3 流式输出与推理强度配置
Kimi K3 支持 推理强度调节,可以控制模型「思考多久」:
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="max", # low / high / max
stream=True,
messages=[
{"role": "user", "content": "分析这段代码的性能瓶颈"}
],
)
for chunk in completion:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
推理强度选择建议:
low:简单问答、快速响应(延迟最低)high:一般编程任务、文档生成(平衡)max:复杂推理、代码审查、架构设计(质量最高)
2.4 视觉理解:图片和视频输入
Kimi K3 支持原生视觉理解,可以直接传入图片:
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "这张图片里有什么?"},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
],
)
print(completion.choices[0].message.content)
也可以传入 Base64 编码的图片:
import base64
with open("screenshot.png", "rb") as f:
image_base64 = base64.b64encode(f.read()).decode()
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "描述这个 UI 设计"},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{image_base64}"
}
}
]
}
],
)
三、实战:用 Kimi K3 搭建一个 Agent
Agent 是 Kimi K3 的核心应用场景之一。通过 Tool Calling,你可以让模型调用自定义工具,完成复杂任务。
3.1 Agent 架构设计
我们要搭建一个「行业信息整理 Agent」,它可以:
- 搜索指定行业的最新新闻
- 提取关键信息
- 生成结构化报告
工具定义:
search_news(query):搜索行业新闻extract_key_info(text):提取关键信息save_report(content):保存报告到文件
3.2 Tool Calling 实现
Kimi K3 的 Tool Calling 语法与 OpenAI 完全兼容:
import json
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.cn/v1",
)
# 定义工具
tools = [
{
"type": "function",
"function": {
"name": "search_news",
"description": "搜索指定行业的最新新闻",
"parameters": {
"type": "object",
"properties": {
"query": {
"type": "string",
"description": "搜索关键词,例如 'AI 医疗'"
}
},
"required": ["query"]
}
}
},
{
"type": "function",
"function": {
"name": "save_report",
"description": "保存报告到文件",
"parameters": {
"type": "object",
"properties": {
"filename": {
"type": "string",
"description": "文件名,例如 'report.md'"
},
"content": {
"type": "string",
"description": "报告内容"
}
},
"required": ["filename", "content"]
}
}
}
]
# 模拟工具实现
def search_news(query):
# 实际项目中这里调用搜索 API
return f"关于 {query} 的最新新闻:1. AI 医疗突破... 2. 新药审批加速..."
def save_report(filename, content):
with open(filename, "w", encoding="utf-8") as f:
f.write(content)
return f"报告已保存到 {filename}"
# Agent 主循环
def run_agent(task):
messages = [
{"role": "system", "content": "你是一个行业信息整理助手。根据用户需求,搜索新闻、提取关键信息、生成报告。"},
{"role": "user", "content": task}
]
while True:
completion = client.chat.completions.create(
model="kimi-k3",
messages=messages,
tools=tools,
reasoning_effort="high",
)
response = completion.choices[0].message
# 如果模型请求调用工具
if response.tool_calls:
messages.append(response)
for tool_call in response.tool_calls:
func_name = tool_call.function.name
func_args = json.loads(tool_call.function.arguments)
print(f"🔧 调用工具: {func_name}({func_args})")
# 执行工具
if func_name == "search_news":
result = search_news(**func_args)
elif func_name == "save_report":
result = save_report(**func_args)
else:
result = "未知工具"
# 将工具结果返回给模型
messages.append({
"role": "tool",
"tool_call_id": tool_call.id,
"content": result
})
else:
# 模型给出最终回答
print("\n✅ 最终回答:")
print(response.content)
break
# 运行 Agent
run_agent("整理 AI 医疗行业的最新动态,生成一份 Markdown 报告")
3.3 完整代码示例:行业信息整理 Agent
上面的代码展示了 Agent 的核心逻辑。实际项目中,你需要:
- 替换
search_news实现:接入真实的搜索 API(如 SerpAPI、Bing Search) - 添加错误处理:工具调用可能失败,需要重试机制
- 限制循环次数:避免 Agent 无限调用工具
- 日志记录:记录每次工具调用的输入输出
3.4 调试与优化技巧
问题 1:Agent 陷入死循环
- 解决:设置最大迭代次数(例如 5 次)
问题 2:工具调用参数错误
- 解决:在工具描述中提供更详细的参数说明和示例
问题 3:响应太慢
- 解决:降低
reasoning_effort到low或high
四、Kimi K3 vs GPT-5.6 vs Claude Fable 5
4.1 性能对比:Benchmark 数据解读
| Benchmark | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Frontend Code Arena | 1679 | 1650 | 1631 |
| AI Intelligence Index | 57 | 59 | 58 |
| 编程能力(综合) | 开源第一 | 商业第一 | 第二 |
关键发现:
- Kimi K3 在前端代码生成方面全球第一
- 综合智能略低于 GPT-5.6 和 Claude Fable 5,但差距很小
- 在开源模型中,Kimi K3 遥遥领先
4.2 定价对比:成本分析
| 模型 | 输出价格(元/百万 token) | 相对成本 |
|---|---|---|
| Kimi K3 | ~120 | 基准 |
| GPT-5.6 Sol | ~216 | 1.8x |
| Claude Fable 5 | ~360 | 3x |
成本优势:Kimi K3 的 API 调用成本仅为 Claude Fable 5 的 1/3,GPT-5.6 的 1/2。对于高频调用场景,这意味着每月可以节省数千元。
4.3 场景选型:什么时候该用哪个?
选择 Kimi K3:
- 预算敏感,需要高频调用
- 前端代码生成、编程辅助
- 需要超长上下文(100 万 token)
- 希望本地部署或微调
选择 GPT-5.6:
- 综合智能要求最高
- 需要最成熟的生态系统
- 多模态任务(图片、音频、视频)
选择 Claude Fable 5:
- 长文本理解和生成
- 需要最自然的对话风格
- 对安全性要求极高
4.4 迁移成本:从 OpenAI 切换到 Kimi
Kimi K3 完全兼容 OpenAI SDK 格式,迁移非常简单:
# 原 OpenAI 代码
from openai import OpenAI
client = OpenAI(api_key="sk-...")
# 切换到 Kimi K3
from openai import OpenAI
client = OpenAI(
api_key="your-moonshot-key",
base_url="https://api.moonshot.cn/v1",
)
只需修改 base_url 和 api_key,其他代码无需改动。
五、开源意味着什么?
5.1 本地部署的可能性
7 月 27 日完整权重开源后,你可以:
- 在本地 GPU 集群部署 Kimi K3
- 完全离线运行,数据不出境
- 自定义推理优化,降低延迟
硬件需求预估:
- 完整模型:需要 8×A100 80GB 或更高
- 量化版本(INT8):4×A100 80GB 可能可行
- 社区量化版本(GGUF):消费级 GPU 可能支持部分功能
5.2 微调与定制化
开源权重意味着你可以:
- 在特定领域数据上微调
- 适配企业内部知识库
- 优化特定任务的性能
预计未来几周会有社区提供微调教程和工具。
5.3 对 AI 开发生态的影响
Kimi K3 的开源将:
- 降低 AI 应用成本:开发者有更多选择,不再依赖单一供应商
- 加速创新:社区可以基于 Kimi K3 开发新工具和应用
- 推动竞争:其他模型厂商需要降低价格或提升性能
六、常见问题
6.1 Kimi K3 的上下文窗口真的有用吗?
100 万 token 的上下文窗口意味着:
- 可以一次性处理整本书(约 70 万 token)
- 可以分析大型代码库(数十个文件)
- 可以进行长对话而不会遗忘早期内容
实际使用中,建议将关键信息放在上下文的前半部分,因为模型对开头和结尾的信息更敏感。
6.2 开源权重什么时候可以下载?
2026 年 7 月 27 日,完整模型权重已经开源。预计可以在 Hugging Face 或 ModelScope 下载。
6.3 和 Kimi K2 相比有哪些提升?
Kimi K3 相比 K2:
- 参数量从 1T 提升到 2.8T
- 上下文窗口从 128K 提升到 1M
- 新增原生视觉理解
- 推理速度提升 30%
- 工具调用能力大幅增强
参考链接
截至 2026 年 7 月 27 日,Kimi K3 是目前最强的开源大模型之一。如果你正在寻找高性价比的 AI API,或者希望本地部署大模型,Kimi K3 值得一试。
有问题?欢迎在评论区讨论。