张大妈

让100个Agent同时给你干活,Kimi K2.5是这么训出来的

源自知乎:PaperAgent

03-05 15:23

Kimi K2.5的技术报告展示了一个重要的技术飞跃。它通过联合训练打通了文本与视觉的壁垒,并创新性地提出了Agent Swarm并行智能体系统,极大地提升了复杂任务的执行效率与准确性,为构建通用智能体提供了新的路径。

让100个Agent同时给你干活,Kimi K2.5是这么训出来的智能速览

  • 联合训练模式比传统的模块嫁接更有效。

  • Zero-Vision SFT技术能仅用文本数据激发视觉推理能力。

  • Agent Swarm系统通过并行执行,将任务效率提升3-4.5倍。

  • 统一的视觉编码器MoonViT-3D简化了图像与视频处理。

  • 模型已实现全自动分析超长视频的能力。

让100个Agent同时给你干活,Kimi K2.5是这么训出来的精华内容

要理解Kimi K2.5的突破,需要深入其技术内核。它并非简单堆砌功能,而是在视觉融合和智能体协作两个核心维度上进行了系统性的创新。

视觉融合新范式

传统方法将视觉模块“嫁接”到预训练好的文本模型上,导致两种模态配合生硬。Kimi K2.5采用Joint Training(联合训练)策略,让文本和视觉从训练初期就共同进化。实验表明,“早期融合+低视觉比例”效果最佳,如同学习一门语言时同步进行听说读写。

更巧妙的是Zero-Vision SFT技术。模型在完成15万亿图文预训练后,仅用文本数据进行指令微调,就能激活视觉推理能力。这使得模型能像调用本能一样,根据语言指令自主启用视觉能力,无需昂贵的视觉示范数据。

Agent Swarm集群

面对复杂任务,传统串行智能体推理时间会线性增长。Kimi K2.5的Agent Swarm系统引入了并行协作机制。系统内设一个“指挥家”(Orchestrator),负责动态拆解任务、创建子智能体并分配工作,各子智能体同时处理不同部分,最后汇总结果。

通过专门设计的并行智能体强化学习奖励机制(PARL Reward),系统学会了高效调度。在深度调研任务中,该系统比单智能体快3到4.5倍,同时准确率从72.7%提升至79.0%,如同多人协作整理书房,效率翻倍。

统一视觉编码器

为处理图像与视频,Kimi K2.5设计了MoonViT-3D视觉编码器。它将连续的4帧视频画面打包成一个“时空块”,用同一个Transformer统一处理,实现了参数共享。这种设计让模型在预训练时同时学习图像和视频,视频理解能力直接继承自图像处理能力,无需额外模块。

配合4倍时序池化技术,在同等上下文窗口下可处理的视频帧数提升4倍,使得自动分析监控回放、直播总结等长视频任务成为可能。

实战能力展现

多项技术融合后,Kimi K2.5展现出惊人的实战能力。技术报告中一个案例是其全自动分析《黑神话:悟空》的完整通关视频,全程无需人工干预。任务涉及24小时内容、32个视频文件及40GB数据,模型不仅理解了视频内容,更是进行了解构、信息重组与知识生成。

这标志着模型已从简单的“理解视频”迈向更高维度的信息处理,展示了其在处理复杂、密集信息场景下的巨大潜力。

Kimi K2.5的实践表明,通向通用智能体的道路有了新的可能。它所展示的深度理解与高效协作能力,正推动人机协作的边界。未来,基于这类模型的应用将如何重塑我们的工作与生活?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章