最新xbench月报显示,Kimi K2.5在多项评测中取得优异成绩,综合性能跻身全球前列。该模型不仅在传统语言理解上表现强劲,更在多模态视觉和智能体任务中展现了国内领先的实力,标志着其向全面通用智能体进化的重要一步。
智能速览
Kimi K2.5在多个xbench榜单中位居国内模型第一。
在ScienceQA评测中平均分达63.2分,BoN(N=5)高达77分。
其DeepSearch与BabyVision得分均超过40分和36分,仅次于国际顶尖模型。
K2.5采用万亿参数MoE架构,支持256k长上下文与原生多模态。
Google Genie 3、Runway GWM等世界模型近期亦有新进展。
精华内容
深入数据背后,Kimi K2.5的跃升不仅体现在分数上,更在于其架构与效率的全面革新,使其在多维度竞争中脱颖而出。
综合性能跃升
根据xbench的最新数据,Kimi K2.5模型性能相较前代有显著提升。在ScienceQA评测中,其平均分达到63.2分,BoN(N=5)方法更是取得77分的高分,总排名位列第四,国内第一。
在DeepSearch能力评测中,K2.5得分超过40分,跻身全球第二,仅次于ChatGPT,成为国内模型中的SOTA。值得注意的是,其完成每道题的推理时间仅需2-3分钟,速度优势明显。
这些分数的增长伴随着推理效率的提升和Token价格的下降,实现了性能与性价比的双重优化。
多模态理解领先
Kimi K2.5在新增的BabyVision多模态视觉理解基准测试中表现突出,获得36.5分,仅次于Gemini 3 Pro,排名全球第二,在国内大模型中位列榜首。
这一成绩验证了其作为原生多模态模型的技术路线。K2.5通过集成的多模态视觉编码器,能够将图像、视频等非文本信号直接转换为模型可理解的向量,实现了跨模态的深度推理。
这标志着模型正从单一的长文本处理能力,向着能够“看”懂世界并执行复杂任务的智能体形态进化。
万亿架构支撑
Kimi K2.5的优异表现背后,是其先进的混合专家(MoE)架构。模型总参数量高达约1万亿,但在实际推理时仅需激活约320亿参数,在保证强大性能的同时,有效控制了计算成本和响应速度。
该模型基于约15万亿混合视觉和文本token进行持续预训练,为其强大的理解和生成能力奠定了坚实基础。同时,它持续支持256k token的超长上下文窗口,能够胜任长文档分析和复杂对话记忆等任务。
世界模型动态
近期,通用世界模型领域亦有诸多新进展。Google DeepMind的Genie 3开放测试,能根据文本或图片描述生成可实时交互的探索环境。
其提出的4D建模框架D4RT,则统一了动态4D重建与追踪,有望成为世界模型的数据引擎。Runway也发布了通用世界模型GWM,探索在机器人训练、实时模拟和交互式虚拟形象等方向的应用。
Kimi K2.5的这次更新,不仅是分数上的超越,更是技术路线的一次成功验证。它展示了从长文本到多模态智能体的清晰进化路径。未来,随着模型能力的持续深化,AI将如何更无缝地融入物理世界与日常工作流,值得持续关注。