月之暗面发布的全新统一模型 Kimi-K2.5,最大的亮点在于新增了视频理解能力。通过一系列实测,它在复现网页动画、Python编程及Agent任务中均展现出第一梯队的实力,为多模态AI的应用提供了新的想象空间。
智能速览
新增视频输入,可理解并复现动态网页内容。
Python编程能力表现出色,能实现滴水不漏的倒水效果。
“大象牙膏”动画效果还原惊艳,短期内难以被超越。
Agent能力测试得分进入第一梯队,长上下文召回稳定。
存在审查过严问题,小说内容创作易出现逻辑错误。
精华内容
这款新模型究竟实力如何?通过视频复现、编程挑战和长时任务跑分,可以一窥其真实能力边界。
视频理解初体验
针对一个包含小行星带背景、鼠标交互与滚动切换的复杂动画网页进行录屏测试。Kimi-K2.5 能够较好地理解和复现其动态效果,整体还原度达到80分。虽然在柔性材料弯曲等细节处理上仍有不足,但其对视频信息的理解和代码生成能力已相当成熟。
编程实力超预期
在编程测试中,该模型表现突出。“大象牙膏”动画效果的还原度极高,展现了强大的物理模拟能力。在经典的Python杯子倒水测试中,它无需斜边辅助就实现了侧面滴水不漏的精确效果,代码逻辑直追Claude-Sonnet。虽然初始版本的粒子碰撞算法性能为O(n²),但在提示下能通过空间网格划分进行优化,显示出良好的代码优化潜力。
长任务处理在线
通过硅基骑手Agent测试,模型在持续40分钟的长时任务中消耗1000万token,最终获得543.94分,稳居第一梯队。长上下文召回率也稳定保持在85%以上,证明了其处理和检索长篇信息的可靠性。不过,目前审查机制较为严格,导致在小说内容创作中,人物关系和情节逻辑方面容易出现误判,官方已介入修复。
Kimi-K2.5凭借强大的视频理解能力和顶级的编程水平,展现了全模态AI的巨大潜力。未来,通过摄像头等工具,AI或能主动监控并辅助人类工作,这为技术落地提供了全新的方向,其发展值得持续关注。
关键评论
网友对Kimi-K2.5的“大象牙膏”动画效果还原度评价极高。
有用户对加入视频实测环节表示肯定,认为内容更直观。
有评论认为Kimi-K2.5的Agent能力非常出色,对其集群表现充满期待。
部分用户实测发现模型在小说创作上存在人物关系混乱等逻辑问题。