DeepSeek Harness上新多模态,纯文本能看图

2026-08-21 11:01:15 0点赞 1收藏 0评论
DeepSeek Harness上新多模态,纯文本能看图

公测才过去一周,DeepSeek Harness 又推新版本了。v0.1.0-rc.8 上线,这是 8 月 13 日开源公测以来的第一次大更新,一共 14 项调整,重要的是增加了多模态。

新版里 DeepSeek 模型适配器可以配置启用原生图片请求,有视觉能力的模型直接把图片送进上下文;/goal、/plan 这类指令也吃图文混合输入了,输入框的 @ 菜单还能直接拉本地文件和已有会话。以前这套东西主要在文本和代码里打转,现在截图、界面图也能塞进任务里。

有开发者实测下来发现,调的模型本身不支持图像输入时,Harness 不报错撂挑子,反而退到另一条工具链:先 OCR 把文字抠出来,再统计图片里的颜色比例、扫一部分像素行,顺带把尺寸和色彩模式这些元信息也读一遍。一张图会被拆成"文字内容加坐标""背景颜色占比""特定区域像素变化"几组结构化数据,再喂给文本大模型,让它照着 OCR 文本和像素证据去"脑补"整张图大致长啥样。

这套玩法和视觉大模型直接看图不是一回事。PPT 截图、流程图、界面草图这种结构清楚的东西,靠 OCR 和像素特征能拿回不少有效信息;换成真实照片、复杂空间关系,工具链能还原的就有限了。不过从 Agent 框架这层看,它点出了一种可能:视觉能力未必非得长在底座模型上,工具也能分一块"感知"的活。

官方补多模态之前,社区已经攒了一批视觉插件,像 dsh-vision、dsh-vision-toolkit、modlens,思路差不多都是靠 OCR、像素分析或者独立视觉子代理,让纯文本模型间接处理图片。rc.8 上线后,原生多模态模型和这些工具层方案能配合着用,

顺手修掉的还有一批公测暴露的问题:单张大图或者历史会话里图片攒太多导致请求挂掉、流式生成取消后已显示的前缀没带进下一轮、自定义 OpenAI 兼容网关调不通等等。另外 web_search 支持了并发查询、子代理能及时唤醒父任务、本地跑 dsh web 会自动开浏览器,大型历史会话分叉和 SQLite 后端的性能也提了。

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
1
扫一下,分享更方便,购买更轻松