昨夜凌晨,DeepSeek Harness 悄悄推送了 v0.1.0-rc.8,一口气更新了 14 项,排在最前面的是"增强多模态支持"。知乎但今早刷知乎,高赞回答直接给这份热闹泼了冷水,“我还以为 V4F 和 V4P 支持多模态了呢,白高兴一场,继续用 Cursor 和 Codex 去了”,一句话把落差摆在了台面上。知乎落差为什么这么大?因为这个"多模态",和你想象的不是一回事。
先说清楚:这次的多模态,不是模型长了眼睛
DeepSeek 现在的 V4 系列是纯文本模型,API 本身不接受图像数据。rc.8 加上的,是框架层的"看图能力",分两条路。没跟上背景的补一句:Harness 不是模型,而是 DeepSeek 8 月 13 日开源的 Agent 运行时框架——模型负责思考,框架负责读文件、调工具、管上下文这些工程活,是套在模型外面的"工作台"。

一条是原生传图。模型适配器支持开启原生图片请求,/goal、/plan 等命令可以接收图文混合输入,@ 菜单还能引用文件和历史会话。知乎注意前提:你得接一个自己就能看图的底座模型,接 V4 的话,这条路是关着的。
另一条是社区扒出来的"工具层土法视觉":纯文本模型遇到图片时,read_image 工具会先失败,但任务不停——Harness 自动退化到一套工具链,先 OCR 扒文字,再做颜色统计、像素扫描、元信息读取,把这些结构化信息打包交给文本模型,让它"脑补"出图片内容。知乎相当于近视没戴眼镜,靠听描述、摸轮廓、数色块认东西。
实际效果如何?按开发者实测:界面截图、表格、PPT、流程图这类结构规整的图,OCR 准确率相当靠谱,文字坐标、颜色分布基本对得上;但真实照片、复杂空间关系就比较粗糙。知乎像素扫描给不了足够的空间信息。所以别拿它"认照片里有什么",但拿它"读截图里的文字和结构",是真能用。

14 项更新,除了多模态还值得看什么
对照官方 Release 页,这轮更新是四条主线:
Claude Code 和 Codex 被做成 Profile Bundle,按需安装当子代理,Codex 还支持非交互权限模式和多个命名实例——竞对的干活工具,变成了你可以编进自己工作流的零件;
web_search 支持并发查询,Windows PTY 终端终于加了持久 PowerShell 会话(被公测版折磨过的人懂);
大历史会话分叉和 SQLite 读写做了一轮优化,但数据结构不兼容,本地存了大量数据的,升级前先备份;
“DeepSeek Harness” 注册为商标,附带品牌使用规范。开源归开源,牌子攥在自己手里。
背景数据补一句:这个框架 8 月 13 日才以 MIT 协议开源,首日登顶 Hacker News,到 8 月 18 日 GitHub 仓库收藏破 15 万、Fork 过 1.6 万。经济观察报社区还扒出更夸张的细节——从第一条提交到公开只有 64 天,12293 次提交、683 篇设计笔记,连 11 条被否决的方案都摊在仓库里。知乎
社区现在分成三派
野思路派觉得真正值钱的是"一切皆插件"的架构:模型不会看图,工具来凑;能力不够,插件来补,灵活性比单点能力更香。失望派就是开头那条回答:等的是 V4 原生多模态,不是框架层的补丁。
成本派更现实。经济观察报的采访里,一位视频策划用户算过账:涨价后同样的工作,日均成本从 20 元以内涨到近 200 元,而 DSH 反复读写文件和上下文的玩法,Token 消耗比开箱即用的成品高得多,他不愿意叠加使用。经济观察报
一位营销用户体验半天就退出:她要的是开箱即用,不是一切都要手搓的"车间",还担心"部署在本地,会不会有恶意插件读我的文件"。经济观察报小红书上已经铺天盖地是保姆级教程,另一边"是不是过度工程""到底值不值得这么吵"的讨论也在同步进行。热度是真的,分歧也是真的。
想上手的人,实操指南
安装用 `npm install -g @deepseek-ai/dsh@next`,注意 @next 标签——@latest 目前还指向 rc.7,装错了别奇怪怎么没有多模态。知乎
想让纯文本模型读图,装 ModLens 插件:`npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.21.1`,然后在模型选择器里选带 (modlens vision) 后缀的变体,直接粘图。

想逛插件市场,装 dshmarket,社区站点 FindHarness 已经收录了两千多个插件,内容、UI、工具类都有。

三个坑提前说:
SQLite 数据结构不兼容,升级前备份本地数据;
v0.1 就是 v0.1,官方文档用全大写警告破坏性变更,一周三更的节奏下文档必然滞后;
跑起来后本机会生成 UUID 随每次请求发送,遥测开关并不影响它,介意的自己留意。知乎
成本账也算一下:轻度尝鲜用 V4-Flash,输出 2 元/百万 tokens 是地板价。知乎重度跑 V4-Pro 高峰时段,按 27 元/百万 tokens 算——DSH 的 Token 消耗是成品的几倍,这个乘数不能忽略。经济观察报
谁该升级,谁该等
值得试的:已经在调 DeepSeek API 做开发、想搭自己 Agent 工作流的人;想把 Claude Code、Codex 和 DeepSeek 放在一处调度的人;经常要喂截图、界面图给 Agent 的人。
再等等更好的:想要开箱即用、不想折腾插件的(上面那位营销用户就是你的镜像);预算敏感、又主要在高峰时段重度使用的;等的是 V4 自己长眼睛的——这次更新里没有你要等的东西。
继续观察的信号:正式版什么时候稳下来;DeepSeek 会不会在模型层补上原生多模态;插件生态的安全规范怎么立。
最后说一句:这次长眼睛的不是模型,是框架。DeepSeek 押的不是某一个模型或产品,而是 Agent 时代的"调度层"位置——谁先被用顺手,谁就难被搬走。这场赌局成不成立,rc.9 会给出下一个线索。