Kimi K2.5 的发布不仅是模型的升级,其“视觉智能代理”和“Agent Swarm”概念更引人关注。通过实际测试,可以发现其在像素级映射和多代理协作上的突破,为开发者提供了新的自动化解决方案视角。
智能速览
Kimi K2.5 的核心是 token 到像素的映射能力。
模型擅长处理 HTML、CSS、Word 等结构化数据。
网页版已集成类似 Claude 的 SKILL 系统。
测试证实 Agent Swarm 是多代理并行处理机制。
其内置 Skill 的复杂度超越 Claude 开源版本。
精华内容
深入测试后发现,Kimi K2.5 的真正亮点并非简单的多模态,而是其底层的运行逻辑与全新的工作流。
像素级映射
Kimi K2.5 的一个关键特性是实现了从 token 到 pixel(像素)的映射。这意味着模型能理解并生成视觉元素,而不仅仅是文本。在测试中,将一个个人博客网站转换为滚动触发的 fancy 风格,模型能够很好地保持原站点的主体框架,并将所有生成好的文档打包供下载,展示了其对前端代码的精准理解和操作能力。
集成SKILL系统
在测试过程中,一个有趣的发现是网页版中出现了 SKILL.md 文件。这表明 Kimi 已将类似 Claude 提出的 SKILL 概念整合进其核心功能。用户可以通过定义的 Skill 让模型执行特定任务,例如网页构建、Word 文档处理等,这极大地扩展了模型的应用场景和自动化能力。
Agent Swarm 实证
通过一次意外观察,验证了 Kimi 官网提到的 Agent Swarm(代理集群)能力。在模型分析个人博客时,网站后台显示有3个“人”同时在访问多个页面。这并非真实用户,而是模型启动了多个代理并行处理任务,可能一个代理分析布局,另一个分析页面内容,展现了其多任务并行处理的高效性。
内置Skill详解
测试进一步发现,不仅可以导出 agent 当前使用的 Skill(如 webapp-building),还能让模型列出所有可用的 Skill,包括针对 Word 和 PDF 的操作。这些 Skill 文档的复杂度和详细程度非常高,考虑了各种 bug 和异常情况,其专业性甚至超过了目前 Claude 开源的 Skill 集合。
Kimi K2.5 的视觉智能与多代理架构,为复杂任务的自动化处理提供了新思路。其内置的 Skill 系统展示了高度的专业性,未来在编程和设计领域的应用潜力值得持续关注。