近期,开源人工智能代理(Agent)框架DeepSeek Harness发布了备受瞩目的v0.1.0-rc.8版本,这次更新的核心是显著增强了其多模态处理能力,让原先的纯文本模型框架学会了“看图”,在开发者社区引发热烈反响。
本次更新最关键的特性是补齐了多模态输入的短板。具体而言,DeepSeek Harness现在从框架层面原生支持了图片处理。其模型适配器经过配置后可以直接发送包含图片的原生请求,这意味着如果用户接入的是本身就具备视觉能力的多模态模型,Harness能够无缝地将图像数据传递给模型。同时,像`/goal`、`/plan`这样的核心命令也支持图文混合输入,用户可以在设定目标或规划任务时,将文字描述与截图、照片等视觉信息一并提交。此外,`@`菜单也得到增强,可以引用本地文件和历史会话,使得将视觉材料融入现有工作流变得更加便捷。
然而,更有趣的是DeepSeek Harness如何让纯文本模型也具备“视觉”能力。当其所连接的底层模型(如DeepSeek V4)不具备原生视觉能力时,Harness并不会停止工作,而是会启动一套基于工具的“伪视觉”方案。它会调用OCR(光学字符识别)工具提取图片中的文字,通过像素扫描和颜色统计来分析图像的布局、色彩等元信息,最后将这些结构化的文本描述信息整合起来,再交给纯文本模型进行“脑补”和推理。这种“工具层视觉”的实现方式,虽然与原生多模态模型的直接理解有所不同,但对于处理UI截图、流程图、数据图表等结构化图像时非常有效。
值得一提的是,这种通过插件和工具扩展能力的思路,正是DeepSeek Harness“一切皆插件”核心理念的体现。在官方正式支持多模态之前,社区开发者们已经通过`modlens`、`dsh-vision-toolkit`等插件,自发地为Harness实现了类似的图像处理能力。此次官方更新,可以说是将社区的创新思路吸纳并固化为框架的一部分,同时为原生多模态和工具层视觉两种路径提供了更完善的支持。
除了多模态能力的史诗级更新,v0.1.0-rc.8版本还在其他方面进行了重要升级。新版本将Claude Code和Codex这两大主流编程Agent更深度地整合进其子代理体系中,它们可以作为独立的配置文件包(Profile Bundle)按需安装和调用。这使得DeepSeek Harness的角色进一步向一个“总调度层”演进,能够根据任务需求,灵活地编排和调度不同的AI工具人协同工作。
同时,更新也包含了对Windows用户体验的优化,例如支持持久化的PowerShell会话;改进了工具调用效率,如`web_search`支持并发查询;并修复了此前版本中存在的图片尺寸过大或历史图片过多导致请求失败、流式生成中断后上下文丢失等一系列问题。
DeepSeek Harness的这次更新,不仅通过原生支持和工具模拟两种方式,成功为其补齐了关键的多模态能力拼图,还通过深化子代理集成,进一步巩固了其作为开放、可扩展的Agent基础设施的定位。从社区的热烈反响和框架的快速迭代来看,DeepSeek Harness正加速从一个单纯的模型运行环境,演变为一个能够整合、调度多种AI能力和工具的强大平台。