月之暗面开源的Kimi K2.5模型,标志着AI执行复杂任务方式的革新。其核心突破在于能自主调度上百个智能体并行工作,将端到端任务效率提升最高4.5倍。这一进展为解决企业级长周期、高成本的知识工作流程自动化难题,提供了全新的技术路径和可能性。
智能速览
K2.5能自主调度最多100个子智能体集群,并行执行1500次工具调用。
相较于单智能体模式,K2.5任务执行效率最高提升4.5倍。
在多项Agent、编码及图像理解基准测试中,K2.5得分均位列第一。
模型支持视觉编程,可通过上传录屏直接重建对应网页。
K2.5能端到端处理大规模办公任务,AI办公质量比前代提升近60%。
精华内容
K2.5的突破性能力源于其独特的“智能体集群”架构和大规模多模态训练。它不再是单个执行者,而是一个能自主分工、并行协作的“专业团队”,从根本上提升了处理复杂任务的效能。
智能体集群架构
K2.5通过并行智能体强化学习(PARL)训练,掌握了自主调度智能体集群的能力。该集群可包含最多100个子智能体,并行执行高达1500次工具调用的工作流,全程无需人工预设角色或流程。
这种从“单个专家”到“专业团队”的升级,在Kimi团队内部评估中,能将端到端运行时间缩短80%。在广泛搜索场景中,与单智能体相比,Agent集群可以将达到目标所需的关键步骤减少至原先的1/4到1/5.5,实际运行时间最多可缩减至原先的1/5.5。
视觉编程革新
K2.5在前端开发领域展现了强大潜力,能将简单的对话转化为具备高级审美和动效的完整网页界面。其视觉编程能力得益于大规模视觉-文本联合预训练,学习并融合了约15万亿个混合数据单元。
用户只需上传一个录屏视频,K2.5就能通过图像与视频推理,重建出相应的网页代码,极大地降低了通过视觉表达创意的门槛。此外,它还能通过代码推理解决视觉谜题并标记最短路径。
办公自动化能力
K2.5已熟练掌握Office套件的核心技能,能够端到端处理高密度、大规模的办公任务。它可以解析复杂输入,协调多步骤工具使用,并通过对话生成包含Word、Excel、PPT和PDF在内的专业级成果。
在Kimi团队设计的内部专家生产力基准测试中,K2.5的端到端办公输出质量比K2 Thinking提升了59.3%。它能执行如生成百个镜头的分镜脚本、为技术报告添加行内注释、从数据中提取并处理加密PDF文件等高级任务。
性能与成本优势
基准测试数据显示,K2.5的综合性能表现突出。在Agents方面,HLE-Full、BrowseComp、DeepSearchQA三项测试得分均位列第一;在编码方面,SWE-Bench Verified和SWE-Bench Multilingual两项测试中排名第一;在图像多模态方面,文档理解测试mniDocBench 1.5得分88.8,同样是第一名。
与GPT-5.2(xhigh)相比,K2.5在性能逼近的同时成本更具优势。其API定价为输入每百万Token 4元,缓存输入0.7元,输出每百万Token 21元。
Kimi K2.5的发布不仅是技术的迭代,更是AI应用范式的转变。它通过智能体集群技术,有效解决了长链、复杂任务的自动化难题,为企业级应用落地描绘了新蓝图。未来,这种“一人成军”的AI模式将如何重塑知识工作?