DeepSeek Harness内测扩围,桌面端Agent进入倒计时:Claude Code续费前先看这三个信号

源自11位全网作者

14:11

8月2日,一条“DeepSeek Harness 开启内部测试”的消息在AI圈传开;8月5日,负责人又在社区发出招募帖,只问一件事:哪些开源项目愿意在Harness发布第一天就接入?等知乎复盘文章看到时,浏览量已经到了17万。知乎如果你现在正付费订阅着Claude Code、Codex,或者用DeepSeek API跑OpenCode,这个“还没发布的产品”值得花3分钟搞清楚:DeepSeek到底想造什么,你手里的续费要不要先等一等?

Harness不是突然冒出来的,线已经埋了半年

5月,一则Agent Harness产品经理的招聘 JD 在业内被转发,团队使命只有一行:Model + Harness = Agent;6月,研发工程师第二个岗位跟上。真正的信号密度出现在7月底:7月31日V4-Flash正式版发布并开源,发布说明里直接写明,所有CodingAgent任务的基准测试都是用尚未发布的内测Harness完成的。微博8月2日内测开启,同时面向开源项目开发者招募封闭测试。把这套节奏放进当月的大模型发布潮里看更清楚:7月一个月,Kimi K3、Qwen3.8-Max、Claude Opus 5等9款旗舰密集上线,而DeepSeek V4正式版当时还排在“未发布”一栏。

DeepSeek Harness内测扩围,桌面端Agent进入倒计时:Claude Code续费前先看这三个信号

Harness是什么?先读JD里的三层信息

第一层是定义。用招聘 JD 的原话说,除模型本身以外的所有工作都属于Harness的范畴——上下文管理、工具循环、权限、验证、模型适配,这些“脚手架”全算Harness。微博第二层是产品形态。同一份 JD 要求产品经理“参与 DeepSeek 桌面端 Agent 产品的全过程”,任职要求里深度使用清单点名Claude Code、Codex、Cursor、OpenCode、GitHub Copilot、Manus——翻译过来,对标的就是你现在在用的这批工具。第三层是边界。模型卡里把Harness称为minimal mode,而社区招募范围对plugin、Skill、MCP、orchestrator、aggregator、UI全部开放,入选作者还能拿到内测资格和API额度。知乎三层信息拼起来,知乎社区的推测是:DeepSeek大概率只守中间层,记忆、人格、行业工具和各种UI交给社区补。

DeepSeek Harness内测扩围,桌面端Agent进入倒计时:Claude Code续费前先看这三个信号

换成架构图就好理解了:本地客户端负责的是“Client Agent”这一层,上接模型,下管工具调用和子Agent;DeepSeek要做的,是把这一层官方化,并且和自己的模型一起调优。

跑分表里藏着两件事:Flash变强了,Harness是放大器

先看成绩。V4-Flash-0731重做后训练之后,TerminalBench 2.1拿到82.7分,在DeepSWE、Cybergym等多个Agent向基准上超过V4-Pro预览版。36氪更关键的是官方表格底部那行小字:V4-Flash的公开Code Agent任务成绩,是用尚未发布的DeepSeek Harness(minimal mode)框架测出来的。也就是说,这一轮名次上浮是“后训练+Harness”的合练成绩。差评君在测评里说得直白:Harness可以说是Agent工具的一种,Codex、OpenClaw都可以算是Harness,而现在DeepSeek要推出自己的Agent工具卷进来了。微博

DeepSeek Harness内测扩围,桌面端Agent进入倒计时:Claude Code续费前先看这三个信号

成本端的差距更直观:一份成本榜里,DeepSeek-V4-Flash复杂负载单任务0.03美元,同维度的ClaudeFable5是3.15美元。微博用量端,Flash也在狂奔:有科技博主称正式版发布后它以单日8万亿Token的吞吐量登顶全球调用榜,而OpenRouter的周榜口径里,DeepSeek-V4-Flash以单周7.22万亿Token登顶,前五名首次全部由中国本土AI产品包揽。微博36氪两个数字统计口径不同,但指向同一件事:Flash现在的调用量已经把DeepSeek的算力吃紧,这也是社区认为“涨价传闻”的背景。大家说的“斩杀线”就是这意思——性能稍强一点的对手,往往要贵出几倍。

续费要不要等?看你是哪一类人

正在付费订阅Claude Code、Copilot的人:别急着退订,也别冲动续长周期。Harness的首版体验、V4 Pro的正式定价都还没落地,等到公测拿自己最常用的任务集跑一轮对比,等两周不吃亏。用API跑OpenCode、Codex的人:关系最大。开源项目作者可以直接报名封闭测试,生态也在跨工具同步,比如已经拿到1.2k Star的skills-hub,想解决的就是同一套Skill在Claude Code、Codex、Cursor、OpenCode之间迁移的问题。知乎切换成本没有想象中大。主要用AI聊天、写东西、查资料的人:不用等。从 JD 和内测信息看,Harness第一波明确冲着 coding 和 Agent 场景去,聊天体验不会被它重构。

发布前,盯三个信号,也记一盆冷水

信号一,首批内测接入名单的构成:Agent框架、跨工具Skill管理类项目多,“轻量中间层”路线就基本坐实;如果大量出现完整UI和桌面工具,那它瞄准的就是更泛的人群。信号二,V4 Pro的发布节奏与正式定价:社区猜测窗口在8月中下旬,Harness加Pro定价的组合,直接决定性价比答案。信号三,真实任务口碑:跑分是跑分,你的任务是你的任务,已经有用户实测觉得V4-Flash-0731指令遵循远弱于Kimi K3,体感差距远超榜单。微博

最后泼一盆冷水。目前大部分信息还停留在爆料和招募层面,官方没放任何产品演示。知乎“deepseek的harness值得期待吗”问题下,高赞回答直接泼冷水:如果是coding Agent那种壳,不值得期待,市面上已经太多这种壳。知乎这句话值得记住:真正值得等的不是“又一个壳”,而是模型厂第一次把自家模型和自家Harness放在一起“共同进化”——如果公测能体验到这种联调,这次等待才算值。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章