4. Kimi K3 在 Artificial Analysis Intelligence Index(人工分析智能指数)中获得了 57 分。整体智能水平与 Claude Opus 4.8 和 GPT-5.5 相当,但仍落后于 Claude Fable 5 和 GPT-5.6 Sol。Moonshot AI 表示,未来计划开源这款 2.8 万亿(2.8T)参数模型的权重,届时它将成为性能最强的开源权重模型(Open Weights Model)。
主要测试结果:
➤ Agent(智能代理)任务表现突出
Kimi K3 在 GDPval v2 基准测试中获得 1668 Elo,相比 K2.6 的 1190 Elo 有大幅提升,超过了:
GLM-5.2(1514)
GPT-5.5(1494)
Claude Opus 4.8(1600)
但仍落后于 Claude Fable 5(1760)。
此外,Kimi K3 在 Artificial Analysis 实现的 AutomationBench-AA(基于 Zapier Agent 工作流评测)中获得 53% 的成绩,排名第一。
---
➤ 在 AA-Briefcase(智能代理知识工作)中排名第二
在 Artificial Analysis 自有的长周期知识工作评测 AA-Briefcase 中,Kimi K3 获得 1547 Elo,比 K2.6 提高 732 分,仅次于 Claude Fable 5。
综合表现十分均衡:
评分质量(Rubric Scoring)
分析能力(Analytical Quality)
都已接近 Claude Fable 5。
不过,在演示文稿(Presentation Quality)方面,GPT-5.6 Sol 仍然领先所有主流模型。
---
➤ 权重发布后有望成为最强开源权重模型
Moonshot AI 尚未公开 Kimi K3 的模型权重,但已表示有计划发布。
一旦开源,Kimi K3 将明显领先当前主要开源权重模型,例如:
GLM-5.2(人工分析智能指数 51 分)
DeepSeek V4 Pro(44 分)
不过,Kimi K3 的模型规模也远大于其他开源模型:
Kimi K3:2.8T 参数
DeepSeek V4 Pro:1.6T 参数
GLM-5.2:7530 亿(753B)参数
Kimi K2/K2.6:1T 参数
---
➤ 单任务成本约 0.94 美元,与 GPT-5.6 Sol 接近
Kimi K3 的平均单任务成本约为 0.94 美元:
GPT-5.6 Sol:1.04 美元
Claude Opus 4.8:1.80 美元
因此:
比 Opus 4.8 便宜约一半;
与 GPT-5.6 Sol 基本相当;
但明显高于开源模型:
GLM-5.2:0.32 美元
DeepSeek V4 Pro:0.04 美元
Moonshot AI 也提高了 K3 的 API 定价:
K3 输出价格:15 美元 / 百万 Token
K2.6 输出价格:4 美元 / 百万 Token
因此,K3 相较 K2 系列涨价明显。
---
➤ 智能提升的同时,Token 使用效率更高
在 Artificial Analysis Intelligence Index 的全部九项测试中:
Kimi K3 共消耗约 1.32 亿输出 Token
K2.6 消耗约 1.66 亿输出 Token
Kimi K3 输出 Token 数量减少约 21%,但整体成绩反而更高,说明模型推理效率得到明显提升。
---
➤ 原生支持多模态
Kimi K3 与 K2.6 一样,原生支持:
文本输入
图片输入
输出仍仅支持文本。
如果未来开放模型权重,它将成为性能最强的支持原生多模态输入的开源权重模型之一。
---
其他模型信息
**上下文窗口(Context Window):**100 万 Token(1M)
**模型规模:**2.8 万亿(2.8T)参数
API 定价:
输入:3 美元 / 百万 Token
输出:15 美元 / 百万 Token
缓存输入(Cached Input):0.30 美元 / 百万 Token(享受 90% 折扣)
模态支持:
输入:文本 + 图片(原生多模态)
输出:仅文本
可用性:
已可通过 Moonshot 官方 API 使用。
模型权重尚未发布,但 Moonshot AI 已表示未来有计划开源。