DeepSeek开源“马具”Harness,谁掌握执行层谁掌握价值!

2026-08-14 11:59:30 1点赞 1收藏 0评论

一匹好马拉不了车,还得有副马具。DeepSeek今天把“马具”开源了,不是模型,而是让模型真正能干活的“执行层”。

上线几小时GitHub就收获3万Star,有人夸架构强,有人嫌难用,开发者社区评价两极分化。

DeepSeek开源“马具”Harness,谁掌握执行层谁掌握价值!

8月13日,凌晨。

没有发布会、没有倒计时,甚至连更新日志都没来得及写好。DeepSeek的API文档悄悄刷新了。模型版本号变为DeepSeek-V4-Pro-0813,调用名deepseek-v4-pro不变。

同一天晚上,另一条消息从官方公众号发出,DeepSeek Harness的开发者预览版正式公测,MIT协议开源。

有那味儿了。

◆ 111天的等待,0.1分的距离

从4月24日预览版上线,到8月13日正式版转正,整整111天。

深宵灯未灭,一行代码横。
小数点后争长短,谁人识此中。
跑分表上风光好,知是几回更。
五十七倍价差在,谁解此中功。

这期间Kimi K3高调发布抢走了开源头条,V4 Flash正式版在7月31日先行上线,API涨价的预告悬在所有开发者头顶。

所有人都在问同一个问题:Pro的正式版到底什么时候来?

答案是一个凌晨。

架构没变,但能力暴涨。

V4 Pro正式版的模型架构和预览版完全一致,1.6T总参数、49B激活参数的MoE(混合专家模型)结构,支持1M上下文、384K最大输出。变的是后训练,而且变化大到像换了个模型。

最夸张的数字来自Agent相关评测。DeepSWE(软件工程基准)从预览版的12.8飙到62.7,涨了将近5倍。

DeepSeek开源“马具”Harness,谁掌握执行层谁掌握价值!

Cybergym从52.7到83.3,Terminal Bench从72.1到87.9。

翻译一下:这不是“会不会写一段代码”的进步,而是“能不能像工程师一样持续干活”的质变。

0.1分的距离,57倍的价格鸿沟。 Terminal Bench 2.1,一项衡量AI智能体在真实终端环境中完成复杂任务能力的测试,V4 Pro正式版拿到87.9分。

全球第一的Anthropic Fable 5是88.0分,差距只剩0.1。在Cybergym上,V4 Pro以83.3分反超Fable 5的83.1。

潜台词:Fable 5每百万输出Token定价50美元,V4 Pro是6元人民币。0.1分的跑分差距背后,是五十七倍的价格鸿沟。

这个等式,足以让每一个开发者重新审视自己的技术选型。

◇ 涨价:从“地板价”到“峰谷价”

伴随V4 Pro发布,DeepSeek宣布了新的API定价方案。

定价从来非算账,寒潮深处见云晴。
峰时谷底皆成价,要让人心知重轻。

新方案采用峰谷定价机制。

高峰时段(工作日9:00-12:00、14:00-18:00)每百万Token输出价格将达27元,较现行6元上涨约350%。

即便是空闲时段的13.5元,也是现价的2.25倍。新价格8月17日生效。

市场震动是有原因的。

梳理DeepSeek今年的定价时间线:4月V4发布时,V4 Pro API以2.5折优惠上线;5月31日优惠结束后,直接永久降至原价的四分之一,输入3元/百万Token、输出6元/百万Token。

如今这一“地板价”即将成为历史。

但换个角度看,V4 Pro的涨价恰恰证明了一件事:它的能力配得上更高的价格。在Terminal Bench上只差0.1分追平Fable 5,价格却只有对手的六十分之一。

即便涨价后,这依然是一个极具侵略性的定价。

▶ Harness:模型之外的那一层

如果说V4 Pro是“马”,那Harness就是那副“马具”。

好马配好鞍,插件即自由。
不挑君与彼,四档各千秋。

DeepSeek给Harness的定位很清晰:Model + Harness = Agent。模型再强,如果没有一套系统帮它调度上下文、调用工具、管理状态、判断任务边界,它就是一匹在原地打转的好马。

好马没套上缰绳,只会在原地打转。

一切皆插件。 Harness的核心设计原则只有五个字。它基于Cordis插件系统构建,Cordis是一个轻量级插件框架,相当于Harness的“操作系统底座”,模型、工具、技能、会话、沙箱、存储、循环、调度、UI,所有Agent能力均由插件组合而成,可自由替换、灵活重组。

DeepSeek开源“马具”Harness,谁掌握执行层谁掌握价值!

官方文档里有一句很硬的话:这套系统里没有哪块是动不得的。

想扩展,在旁边挂一个新插件就行。

不挑模型。 这套系统不挑模型,Anthropic的、OpenAI的、谷歌的,当然也包括DeepSeek自己的。

甚至本机已经能用的Claude Code、Codex,也能被它调过来干活。

这意味着什么?

意味着开发者可以自由组合,用DeepSeek的模型跑Claude的Harness逻辑,或者反过来。

谁家模型好用就用谁家,谁家执行系统顺手就搭谁家。

四种模式,从轻到重。

Harness预设了四档用法。最轻的一档只给两个基础工具;最全的一档把读文件、写代码、上网搜索、派助手分头干活都配齐了。

中间还有一档专门把慢吞吞的操作打包起来一次跑完;最后一档留给想自己动手改的人。

◆ 开发者狂欢:GitHub史上最快涨星

数据不会骗人。

Harness发布1个半小时,GitHub Star突破2.4万,成为GitHub史上最快涨星项目。

DeepSeek自己此前的纪录是R1突破2万星用了5.7天;之前的最快纪录是xAI的Grok-1,用了约1.2天。截至发稿,Star数已超过3.9万。

消息一出,半小时星数破万。国内外社交媒体上,内测成员纷纷发表“解密感言”。

争论也随之而来。

开发者围绕Harness的争论分成了两派:一派说底层架构强,另一派说难用。

夸的人集中在三点:插件化做到最深处、不挑模型、四种模式覆盖全场景。

质疑的声音同样直接。

有开发者指出,Harness当前的启动方式过于极客,依赖Node.js开发工具链,普通用户几乎无从运行。

DeepSeek开源“马具”Harness,谁掌握执行层谁掌握价值!

内测用户指出Harness已具备“自进化软件”的雏形,Agent可以检查自己的运行时,现场编写并挂载插件,但动态生成的插件仅存在于内存中,重启即消失。

另一位用户的评论更直接:“软件自进化可能是个伪命题,只会带来更大的混乱。

插件要么是一次性用完就扔的,要么就得要设计、验证和维护的,不是现在模型能力可以‘自进化’的。”

◇ 为什么说这是一步大棋

把V4 Pro涨价和Harness开源放在一起看,DeepSeek在下一盘更大的棋。

Harness不是Claude Code的替代品。

市面上最省事的说法是“DeepSeek版Claude Code”,但用完内测版的人普遍认为这个定位不准确。Harness的野心更大,它不是在做一个编程工具,而是在做一个“让任何模型都能变成Agent”的框架。

模型划定上限,Harness决定兑现多少。

有开发者做过一组对照实验:把同一个DeepSeek V4-Flash接入不同的Harness配置,分别完成同一批多步骤任务,完成率和成本差距可达数倍。

同一个模型,换了不同的“马具”,跑出来的结果天差地别。

模型划定能力的上限,Harness决定这份上限最终能兑现多少、要花多少钱兑现。

从“卖模型”到“卖干活的能力”。

DeepSeek内部曾认为,Agent要解决持续学习问题,最终让AI加快AI研发。

顺着这条线看,Harness就不是一个外挂的编程工具,而是模型进入真实研发任务的工作台。

一家靠低价和模型能力立足的公司,如果任务交付、失败反馈和开发者入口长期挂在别人的系统里,即便价格再有优势,却决定不了一个任务究竟烧掉多少Token、要重试几次、什么时候才算真正完成。

Harness,就是DeepSeek把主动权握回自己手里的那一步。

▶ 普通人的视角:跟我有什么关系?

说完了产业层面的事,回到一个更朴素的问题:一个搞AI编程框架的公司开源了一个工具,跟普通人有什么关系?

第一,AI干活的能力在变强。

V4 Pro能在170秒内生成了761行完整HTML代码,打开浏览器就能跑。

这些能力正在以极低的价格,甚至免费(开源),流向市场。

未来你手机里那个“帮我把会议纪要整理成PPT”的AI,背后可能就是DeepSeek这套技术栈在跑。

第二,选择变多了。

Harness不挑模型,意味着开发者可以自由组合最优方案。

这种竞争最终会反映在消费者端,更便宜的API调用、更聪明的AI应用、更快的迭代速度。

第三,但门槛依然存在。

Harness目前仍是开发者的玩具,普通用户想用还得等一等。

就像当年Linux开源时也只有极客在玩,真正改变世界的是后来长出来的那层“给普通人用的壳”。

写在最后

111天的等待,一个凌晨,DeepSeek交出了两张答卷。

一张是V4 Pro,性能追平全球最强,价格只有对手的六十分之一。

另一张是Harness,把模型变成Agent的那副“马具”,以MIT协议开源,交给全世界的开发者去拼、去改、去创造。

麒麟终非池中物,一遇风云便化龙。

正如一位哲人所言:工欲善其事,必先利其器。

DeepSeek用V4 Pro打磨了模型这把“器”,用Harness打磨了让模型干成事的那副“具”。

当模型与框架在同一个生态中彼此咬合,AI干活的能力就不再只停留在跑分表上,它开始真正长出“把事情做成”的牙齿。

这张答卷,有人狂喜,有人质疑,有人还在摸索怎么用。

DeepSeek开源“马具”Harness,谁掌握执行层谁掌握价值!

但有一点是确定的:AI Agent时代的竞争,已经从“谁的模型更强”变成了“谁能让模型真正干成事”。DeepSeek用V4 Pro证明了前者,用Harness押注了后者。

至于这场押注能走多远,GitHub上那3.9万颗星,或许只是一个开始。

代码深夜偷偷跑,涨价通知群里吵。
开源框架满天飞,你用不用自己挑。
0.1分的差多少,57倍的价差巧。
贵不贵心里知道,够不够用你说好。

来聊聊

你觉得AI编程工具是“越贵越好”还是“够用就行”?V4 Pro涨价后你还会继续用吗?欢迎在评论区聊聊。

点个赞、点个小心心,让更多人看到。

【免责声明】: 本文部分配图源自公开渠道或CC0协议素材,仅作行业交流与产业参考使用。如涉侵权,请联系后台处理。本文仅做行业科普与实操分享,不构成任何投资、消费决策建议。文中数据及案例均来自公开信源,仅供参考,具体以实际为准。

#DeepSeek# #AI大模型# #ai智能体# #harness# #V4Pro# #开源软件# #API定价#

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
1
扫一下,分享更方便,购买更轻松