DeepSeek开源Harness,插件化框架爆火

源自360位全网作者

08-19 20:04

内容由AI生成

精选参考来源

1. 【热门AI鉴定】DeepSeek Harness是什么?强在哪里?Harness实测效果如何?一口气搞懂!

2. #DeepSeekHarness发布#DeepSeek正式开源发布智能体框架Harness,提出「Model+Harness=Agent」。如果说大模型是AI的大脑,Harness就是连接现实环境的执行系统,依靠“一切皆插件”架构,自由调度工具、管理长周期任务,补齐智能体落地短板。这次发布标志行业竞争进入新阶段:单纯比拼模型跑分已经过时,落地能力成为新赛道。依托自身大模型极致成本优势,Harness直面Claude Code等产品竞争,降低开发者搭建智能体的门槛。从卖模型算力,到提供完整智能体工程方案,DeepSeek的布局清晰可见。未来AI比拼不再局限推理能力,能否稳定完成端到端复杂任务,才是拉开差距的关键。

3. 【DeepSeek Harness:把AI智能体的“黑盒”彻底拆开】DeepSeek发布了智能体框架DeepSeek Harness(DSH)的开发者预览版。这不仅是一个类似Claude Code的命令行工具,更是一套基于Cordis框架的插件化系统。DSH的核心逻辑是“一切皆插件”,从模型调用、文件编辑到UI界面均可动态加载或卸载,无需重启进程。最受关注的特性是全链路可追溯性,它通过Trajectory视图记录了模型看到的每一行System Prompt、推理过程、工具调用结果以及上下文注入,目前该项目以MIT协议开源。这件事的价值在于打破了硅谷大模型公司对“推理过程”的黑盒封锁。社区评论指出,OpenAI和Anthropic等厂商往往会加密或隐藏Chain of Thought,以防被竞争对手蒸馏,而DeepSeek选择将这些原始轨迹完全暴露给开发者,这对于调试复杂的Agent行为至关重要。此外,DeepSeek V4在训练阶段就针对该框架进行了后训练优化,这意味着官方框架与模型的配合度将远超第三方工具。虽然1.5GB的构建体积被吐槽为典型的现代前端膨胀,但其引入的“可撤销副作用”插件机制,实际上是在用软件工程的严谨性去对冲大模型的随机性。对开发者而言,这不仅是一个新工具,更是一套让AI在确定性环境下工作的实验场。

4. #DeepSeekHarness发布# 今日,DeepSeek正式发布其首款Agent产品——DeepSeek Harness。该产品支持项目管理、长任务协作、多Agent编排、上下文管理,并整合了联网搜索与Skill功能,旨在为大模型提供完整的工程化支撑。DeepSeek内部将Harness定义为“Model+Harness=Agent”,即模型专注思考推理,Harness承担工具调用、任务规划、执行调度等模型外的全部工程化工作。Harness聚焦代码智能体赛道,直接对标OpenAI的Codex与Anthropic的Claude Code,标志着DeepSeek在AI Agent领域的正式落子。

5. 网友把DeepSeek Harness玩成了赛博乐高,我们挑出了最有意思的11个插件

6. #DeepSeekHarness发布#简单来说,如果说大模型是“大脑”,那么 Harness 就是让大脑能够真正动手干活的“执行神经系统。过去的大模型往往“手笨”,能解微积分却不会操作电脑。Harness 补齐了这一短板,它负责调度上下文、工具、任务状态,让 AI 能够自主完成从理解需求到交付代码的完整闭环简单说就是给马装上了缰绳和马鞍,可以充分释放马的性能了

7. #DeepSeekHarness和Codex谁更好用#上周,DeepSeek发布了首款agnet产品DeepSeek Harness,可以管理项目、处理长任务,并支持多Agent协作、上下文管理、联网搜索和Skill等能力,与OpenAI的Codex等产品进入同一赛道。与Codex相比,DeepSeek Harness的优势是成本、国内直连速度、中文生态和插件自由度,但Codex在复杂任务的工程闭环稳定性、多轮Agent连贯性和“开箱即用”的成熟度上领先。本博觉得如果你能够使用Codex,那还是优先使用Codex,特别是复杂任务。当然,如果成本有限的话,可以采用“DeepSeek模型+Codex框架”的混合方案,用DeepSeek承担大部分低成本任务,仅在复杂逻辑或关键节点回退到Codex兜底,这样可以实现成本与性能的平衡。#老张聊科技# #DeepSeekHarness和Codex谁更好用#

8. 上周一,我发了自己做的AIHOT大模型排行榜。有很多朋友感兴趣,在文章下面评论,最高赞的一条,是在问能不能有个分类测评,能够评估不同模型做不同任务的表现。(图1)讲道理,这其实一直是我想做的,也是我觉得特别特别核心的痛点。现在的大模型榜单很多,比如LiveBench、DeepSWE之类的,可以很快知道哪个模型在某一个能力维度上更强,像Coding、数学、浏览器操作等等。但是有一类评测集,其实是最稀缺的。就是模型在真实工作中的实际完成效果。比如金融领域、法律领域、电商领域、生活领域等等等等,就是直接给它一份真实工作,让它自己从头干到尾,最终看工作效果,而这些,我觉得其实才更符合真实用户的日常工作和生活,也对大家更有用。所以,在分类上,我一直想把这些场景给补上,把这个排行榜的维度,变得更加丰富和多维化。于是,这个周末,我几乎把所有的评测集都翻了一遍,不翻不知道,一翻才吓一跳,这块的评测集,真的少的太可怜的,真的可以用寥寥无几来形容。而且绝大多数的模型的跑分,在这些真实场景下任务的成功率,也是真的低的可怜,跟大家在Coding领域的体感完全不一样。我用一个周末我翻到的比较成熟的电商评测的评测集来举例子,正好也是上周开源的,比较新,一些最新的模型也都有。这个评测集叫RealReplicaBench,团队来自阿里国际站,因为他们就是做外贸的,所以内部的数据我觉得还是比较权威的,从这个案例,也可以看看Agent在真实的电商场景下能完成什么样子。Github地址:网页链接(图2)这套评测一共有107个任务,阿里国际站因为直接做了Accio Work这个电商Agent,然后他们就从大概过去160万条完整对话中整理出20万条工作流,再归纳出约2000条商业价值高的,最后按照可复现性和结果可判定性,最终整理出来107个任务。(图3)基本把电商领域涉及到的工作场景都覆盖了,像供应商采购、商品发布、店铺经营、订单对账、国际物流、售后争议等等等等。任务具体内容的分布我让GPT做了张图,方便大家更直观的看一下。(图4)每一个,都是真实世界里面的电商任务。简单看几个例子的案例,大家就知道大概都是什么样的任务了。比如,有一个任务是让模型在店铺上上线一款定制瑜伽垫。(图5)模型拿到的信息有发品计划、三家供应商的报价和一堆实拍图片。然后呢,它要找出计划指定的供应商,填好类目、销售国家、差异定价和描述,再从一堆相机自动编号的照片里挑出正确、清晰的商品图上传。还有一个,是给东莞到达拉斯的消费级电子产品规划运输路线。(图6)在30天的运输时间的限制下,模型需要计算保险、清关、海关担保和平台费,找出总成本最低的路线,再在仿真的货代平台里完成海运段订舱和货件验证。还有处理电商退货争议。(图7)这个任务里面模型需要把订单记录、物流扫描、仓库质检、客户对话、现场照片、平台政策和截止时间全对起来,然后逐单决定接受退货、部分退款、全额退款、向平台申诉,还是继续补充证据。甚至还有跨平台月度对账。(图8)它要把天猫、京东、拼多多三套格式不同的原始订单清洗到一张表里,统一SKU和订单状态,核对发货与结算差异,再算出每个SKU在各个平台的收入、成本、佣金和利润,最后把这些信息按照指定格式进行交付。从这几个例子就能看到,这基本都是现实世界的电商交易的真实任务,商品上架、物流规划,到售后和经营分析,基本全都有,而且讲道理,这些任务看着就是脏活累活,理论上都应该交给Agent干对吧。然后呢,我们来看看,现在在Coding上感觉已经大杀四方,感觉什么都能干出来的这些牛逼模型,在这个真实任务场景上的成功率有多少。(图9)这些模型,是在PI这个开源Harness框架下跑的,所以准确性我觉得没啥问题。百分制下,只有排名第一的Claude Opus 5刚刚过了及格线。107个任务,它完成了65个,通过率60.75%。Qwen 3.8 Max和DeepSeek V4 Pro以49.53%的通过率并列第三。也就是说,现在大部分模型的任务通过率甚至连50%都过不去,107个任务,你让AI去做,有一半是全失败的。这就是现在的模型,在真实世界工作中,非常真实的现状。我也详细看了看他们是怎么去衡量模型到底完没完成,以及给不给分的,看完以后,我感觉比我想象的还要复杂一些。我随机挑一道供应商采购题,来给大家看看评测过程。(图10)比如这个题,任务的主角Dana是一名采购经理。她离开几天后回来,邮箱里已经堆了大约300封邮件。但是呢,她有一个铝合金笔记本支架项目,必须在当天完成推进。模型需要从这些邮件里还原项目相关的需求、最新的规格和数量,从20家供应商里找出真正合格、单件落地成本最低的一家。选好供应商以后,它还需要进行一系列的规范化操作,比如只给最终选中的那封报价打标签,标出3封要求更换收款账户的可疑邮件,保存给供应商的回复草稿,创建启动会议,并交付一份规定格式的JSON总结。这个任务量你想一想都知道有多大,而且这些任务的原始数据也非常乱,充分体现了现在人类的混乱性。比如项目的最终需求零零碎碎的散在10封邮件里面,中途还改过数量,改过要求,改的乱七八糟的。而且供应商也不是只看公司名,因为现实世界中,也经常会有同一家供应商会换着联系人、邮箱、域名和显示名称来发报价,所以题目中,同时还混进了4组名字很像、实际却是不同公司的供应商。模型得综合工厂地址、电话、银行收款人和出口许可证等多个信号交叉核对,才能判断哪些报价来自同一家。说实话,这个过程,看得我都要力竭了,至少我是一丁点都不想干的状态。。。所以我也生了个页面,方便看得更清晰。(图11)Accio Work团队那边,也给模型准备好了Shopify、Gmail、日历、商品发布之类的工具,可以让模型直接用。等模型做完,评测程序会直接检查邮箱、草稿、日历和JSON文件的最终状态。一共有23组、42项结果检查。(图12)像选中的报价有没有加上正确的标签?3封钓鱼邮件有没有全部标记?草稿收件地址和会议日期对不对?JSON里的供应商、价格、数量和淘汰原因能不能全部对上?而模型的得分,要这23组全部通过,才算答对,才能得到这1分,一旦有1个检验出来错误就0分,非常严格。也就是说,没有过程分这个东西,你只有所有检测项全对才有分,因为模型去解决真实的电商问题的时候,这差一步,可能就会让你丢了单子,这才是真实的商业世界。最后的得分就按通过的任务数除以总任务数量107。于是,最终就是上文看到的排行榜,几乎没有及格的。而如果用他们自己的Agent产品Accio的框架跑,通过率会整体高一些,模型通过率50%以上的,从2个增加到了6个,毕竟是专门做电商的框架。而因为是评测集,同时因为也是全自动化,平时大量的任务,其实是人和Agent协同,所以完成率也会实际更高一些。(图13)而如果我们对比一下Coding任务上的跑分,大家就能看出来差距了,我们拿今年5月底发布的DeepSWE举例。这个评测基准包含了113个任务,考的是AI能不能在真实的开源代码仓库里,独立完成一次复杂、跨文件的软件工程改动。(图14)所有模型都用mini-swe-agent框架跑,模型自己去阅读代码仓库、查找问题、修改文件、运行测试,最后提交结果。排在最前面的这几个模型,任务通过率都能到70%以上。(图15)类似的低分情况,也出现在了其他领域的真实任务评测集里。比如上个月底,腾讯混元联合清华大学和东南大学发布的这个E-Bench。(图16)它模拟了3个产品场景,分别是王者荣耀、QQ音乐和腾讯会议。一共设置了323个需要模型真实去操作的任务。比如王者荣耀要整理好友、战队、房间和比赛记录,QQ音乐要搜索歌曲、管理收藏歌单,腾讯会议要筛选参会人员、预定会议等。E-Bench一共测了11个模型。(图17)成绩最好的是Kimi-K3,Avg@3是73.79%。这里简单解释一下Avg@3这个指标,它指的是模型在任务集上独立运行3次,3次得分的平均值。但现实中,我们肯定希望模型不只是做对一次,而是能反复多次完成任务。所以他们还测试了同一道题独立运行3次的情况。表现最好的K33次全部做对只有58.82%。而11个模型在这个稳定性指标上都没过60%。。。还有比如小红书今年先后也发布了两套模型在真实任务上的评测。(图18)比如这个偏生活的VibeLifeBench。这个评测包含200个持续时间数周的生活任务,覆盖了职业、健身、租房、购物和差旅等10个领域。同样还是给大家看看各个模型在榜单上的得分。(图19)榜单上成绩最好的是Claude Opus 5,它的avg@3也依然只有32.5%。就真的更有点惨不忍睹了。。。这3套评测基准的任务、指标等等都不一样,所以不能横向比较,但至少能说明,在它们覆盖领域的真实世界任务上,大模型的表现,确实还有极大进步的空间。所以这个时候,纯靠模型公司我觉得也不行了,需要所有产商一起努力,就像Accio也说,会持续提炼真实的工作任务,然后把这些评测集数据滚动更新然后开放。毕竟这些厂子最重要的目标,是做Agent,是做模型路由,只有模型牛逼了,他们才能实现给自己客户的价值最大化。不过比较可惜的是,就是这些评测集更偏向于研究,更新的不够及时,一些新模型出来可能要很久以后才会更新,所以还没有办法放到AIHOT的排行榜里面。不过我未来可能会把类似于阿里国际站的RealReplicaBench、腾讯的E-Bench、小红书的VibeLifeBench等等的真实世界工作的评测集全都收集起来,然后我自己搭环境,我自己花钱来跑,一发新模型就全部跑一遍,保持更新,再把这些评分放到AIHOT上,方便大家查看,大家可以期待一下~大家如果有类似真实世界工作任务的评测集,也欢迎评论区留言跟我提供。最后,我想说。在AI的世界里,会解题,和会工作,中间确实还隔着一些比较遥远的距离。模型在Coding这个任务上,现在确实做的很好,跑的很快,但是在大量真实工作任务的场景中,还有很大的进步空间。毕竟,那些琐碎、混乱、没有标准答案的东西,才组成了我们每天真正面对的工作。因为,这才是真正的。人类世界。以上,既然看到这里了,如果觉得不错,随手点个赞、评论、转发三连吧,这对我们有特别大的帮助~谢谢你看我的文章,我们,下次再见。#How I AI# #AI创造营##科技先锋官##AI#

9. DeepSeek正式推出其首款Agent产品DeepSeek Harness开发者预览版,并同步在GitHub以MIT协议开源。这不仅是DeepSeek从“模型供应商”向“应用框架层”延伸的标志性动作,更意味着代码智能体(Code Agent)的竞争从单一模型能力比拼,升级为“模型+工程化工作台”的全栈生态角逐 #DeepSeekHarness发布# DeepSeek Harness发布:代码智能体赛道迎来“全栈工作台”范式革命

10. DeepSeek Harness,是今年最有野心的一次Agent开源

11. 准备试一下#DeepSeekHarness发布# ,这是DeepSeek推出的开源智能体(Agent)工程化执行框架,核心公式为 Model + Harness = Agent。核心架构:一切皆插件(Cordis 驱动):底层由 Cordis 框架驱动,所有功能模块(如文件读写、Bash终端、上下文压缩等)均可插拔。开发者无需改动源码,就能自由组合或扩展能力。独特的运行模式:开箱支持多种内置模式,包括默认完整工具的标准模式、通过代码组合多轮调用的 PTC模式(程序化工具调用)、极简测试模式,以及能在内存中试验并创作新模式的创造模式。端到端的环境闭环:不仅处理文本输入,更能直接接管沙箱、执行代码、进行错误重试和自主规划长任务链,直接对标国际主流的AI编程智能体(如Claude Code)。定位区别于传统框架:通用框架(Framework)教你“怎么造Agent”,而Harness负责“在运行时怎么养Agent、怎么调度工具和容错”。

12. #DeepSeekHarness发布# 昨晚DeepSeek干了两件事:开源Agent框架Harness,API闲时半价。开发者圈的评价很直白:"DeepSeek把一切开源,我们不必生活在Anthropic的统治之下了。"也有人说,这是"向Claude Code说再见的那一天"。从"只会聊天的模型"到"能自己干活的智能体",DeepSeek补上了最关键的执行层。V4 Pro正式版+Agent框架+峰谷定价,三连击,招招冲着AI编程入口去的。一句话:国产AI不再只卖"大脑",开始卖"手脚"了!反正现在我的状态栏慢慢进入陪伴AI出内容了

13. #DeepSeekHarness发布#刚看到DeepSeek Harness正式上线,简单说它不是新大模型,而是一套智能体编排框架 。公式Model+Harness=Agent算是把思路摆明白了,专门负责调度工具、管理长任务流程,补齐模型落地实操的短板。对开发人员格外友好,多智能体编排、项目运维全都能覆盖,打通了从生成代码到完整交付的闭环 。看得出DeepSeek不再只埋头做大模型,开始深耕上层智能生态了,很期待后续开发者社区能跑出有意思的应用。

14. #DeepSeekHarness发布#说实话,Harness这次发布,比我想象中有分量多了。你问我Harness到底是个啥?简单粗暴地说,它是让AI真的能“动手干活”的那套系统。以前的大模型,说白了就是个“嘴强王者”。你问它问题,它给你答案,看着挺聪明,但也就到这儿了。但Harness完全不一样。它直接把模型接入了文件系统、终端、网页、代码工具。它能真正读写文件、运行命令、调用外部服务。模型终于不只是“想”,它能“做”了。官方给了个很直白的公式:Model+Harness=Agent。模型是大脑,Harness是身体和工作台。大脑有了,身体也有了,这回是真的能干活了。但我觉得Harness真正厉害的地方,不是它现在有多好用,而是它把“AI Agent到底应该长什么样”这个问题,直接扔回给了开发者社区。模型你可以换,工具你可以换,循环逻辑你可以换,安全策略你可以换,甚至连UI你都能换。这种开放程度,说真的,在目前的Agent框架里,我确实没见过几个。昨晚Harness一开源,Hacker News直接冲上TOP1,到现在已经快40k Star了。GitHub上已经有人在用Harness写自动化脚本、跑测试、做代码审查了,那个速度确实让人有点上头。话说回来,你们试过Harness了吗?这个“一切皆插件”的思路,你们觉得靠不靠谱?评论区聊聊👇

15. Harness和Codex如果只是比“写一个登录页面”,我觉得没什么意思。现在主流AI写这种东西,基本都能整出来。真正有意思的是,把一个乱七八糟的真实项目扔给它。几十个文件、几个模块互相调用,中间还有一堆历史代码,然后告诉它:“这个功能帮我改了,别影响原来的东西,顺便把Bug找一下。”这时候就开始刺激了。AI到底能不能看懂整个项目?改完以后会不会这里好了,那里又崩?跑测试发现问题以后,它会不会自己回头修?所以我觉得Harness和Codex真正的较量,不是在Demo里,而是在这种“脏活累活”里。#DeepSeekHarness和Codex谁更好用#能连续干活不翻车,才算真本事。

16. 刚刚涨完价,Deepseek就把AI Agent的“家底”全掀开了

17. 首发体验 | DeepSeek Harness 来了,它不想做下一个Codex

18. DeepSeek Harness 入选项目疑似曝光,不选万星「花瓶」,死磕 Agent 基建

19. 深度拆解 DeepSeek Harness 架构:AGI 的自进化,终于有了「后悔药」

20. #DeepSeekHarness发布#主打全插件化智能体框架,模型、工具、任务链路全部可自定义。不再只是聊聊天,能跑复杂长流程任务,轻量化部署门槛压得很低。之前国内很多智能体框架看着热闹,实际上手改造处处受限。这次算是交出一份很有竞争力的答卷,国产智能体框架又多一员猛将。

21. 2026年7月中文大模型基准测评结果发布!Qwen3.8、Kimi-K3并列第一,DeepSeek轻量版并列第二

22. 【#代码智能体赛道迎来新玩家##人人都能DIY一个ClaudeCode#】IT时代网8月14日消息,DeepSeek今日正式发布首款Agent产品DeepSeek Harness(简称dsh),并同步开源。DeepSeek定义AGENT = MODEL + HARNESS,即大模型负责思考推理,Harness承担模型外所有工程化工作,包括工具调用、任务规划、执行调度等。与Claude Code类似,都是模型调用工具完成具体任务。其核心理念为“一切皆插件”,模型、工具、技能、会话、沙箱、存储、循环、调度、UI等所有Agent能力均由插件组合而成,可自由替换和灵活重组。目前支持管理项目、长任务协作、多Agent编排、上下文管理以及联网搜索和Skill等功能,聚焦代码智能体赛道,直接对标OpenAI的Codex和Anthropic的Claude Code。用户可通过npx安装并体验本地WebUI操作界面。这一开源免费框架的推出,意味着过去只有大厂和付费用户才能使用的智能体能力,如今向所有开发者及爱好者敞开大门,让每个人都能亲手搭建属于自己的AI助手。#DeepSeekHarness发布#

23. 刚刚,DeepSeek Harness震撼开源:一切皆插件

24. 开源 DeepSeek Harness 开箱即用客户端,还有几个易用插件

25. #DeepSeekHarness发布#终于等到 DeepSeek 首款智能体产品 DeepSeek Harness 正式亮相了。前几日行业里就传出消息,团队新开了官方公众号,不少从业者都还在观望上线时间,没想到节奏紧凑,短短数日就正式推出,这个效率着实让人意外。纵观当下行业态势,2026 年算得上 Harness 工具框架助推 VibeCoding 走向商业化落地的关键年份。目前市场认可度最高的两款标杆产品,就是 OpenAI 的 Codex 以及 Anthropic 的 Claude Code,凭借成熟的代码编写、任务统筹能力,长期稳居 AI 代码智能体第一梯队,也是很多海外开发者日常编程的主力工具。不过在我个人看来,闭源产品终究有着难以规避的局限,适配国内开发环境总会存在隔阂。DeepSeek 此次推出的 v0.1 版本仅仅只是开端,官方并未追求一蹴而就做到完美,核心主打开源开放、模块化可复用的底层架构。愿意把基础设施敞开,邀请全球开发者共同打磨优化,一起挖掘 AI 编程的潜力。和海外封闭生态对比,开源模式更贴合国内开发者的使用习惯,方便大家结合本土开发场景调整优化。不再只局限于大模型参数比拼,转而深耕工程化工作流搭建,这样的发展思路,也会让 AI 代码赛道迎来更多新鲜变数。#热点跨界共创# #deepseekharness发布#

26. DeepSeek V4 Pro发布后一天,官方憋了很久的Agent项目也来了。短时间冲到3.7万GitHub Star,名字却不叫Code,也不叫Build,偏偏叫Harness。因为DeepSeek这次真正想做的,可能根本不是又一个“装好就用”的Agent产品。它的核心Cordis只负责插件的加载、卸载和依赖管理。工具、Skills、沙箱、存储、工作流、子Agent,甚至WebUI,统统都被拆成了可以替换的插件。更特别的是,插件能在Agent运行过程中动态插拔,原有状态还不能崩。于是,一个Agent甚至可以检查自己缺什么,再现场造出新插件装到自己身上。这也解释了它为什么理念惊艳,产品却粗糙得劝退普通人。DeepSeek Harness不是来和Claude Code比谁更顺手的。它想做的,是让开发者一起搭下一代Agent的底座。#DeepSeekHarness发布# #Deepseek# #AI# #科技先锋官# 从0到1带你速通DeepSeek Harness。

27. DeepSeek首款Agent产品,正式亮相!今天DeepSeek发布了DeepSeek Harness。通俗理解,像给大模型配了一个"全能助理"——AI负责思考推理,Harness负责所有工程化落地,比如工具调用、任务规划、执行调度、联网搜索、多Agent协作等。这次Harness重点聚焦"代码智能体"赛道,直接对标OpenAI Codex和Anthropic Claude Code,能帮开发者自动完成代码编写、项目管理、长任务协作等复杂工作。Harness,让AI不仅会想,更能真正"动手"干活。#DeepSeekHarness发布#

28. DeepSeek Harness 到底装不装?看懂 3 件事再决定

29. DeepSeek Harness:想造机器的人,现在可以进场了

30. 已经在开始部署了,DeepSeek Harness很快啊,今晚刚刚发布了。什么叫做harness?就是大模型的调用程序,Open AI的CodeX就是harness,一个厨师需要一个趁手的工具才能发挥最大的能力,模型就是厨师,工具就是harness

31. #DeepSeekHarness发布#它来了它来了,Deepseek首款agent产品上线。前两天就流传了DeepseekHarness团队公众号开启没想到这么快就来了。今年可以说是Harness(工具框架)带动VibeCoding发展比较成功的商业化应用一年,最为出名的两款Harness是OpenAI的Codex和Anthropic的Claude Code。Deepseek官方说了,DeepSeek Harness目前的 v0.1 版本只是一个起点,他们期待与全球开发者一起,在开源、开放、可复用、可组合的基础设施之上,共同探索智能上限。

32. DeepSeek Harness开源,突破4万星/iPhone或全线涨价100美元/ChatGPT大更新,记住你在电脑上干过什么

33. DeepSeek每次都是晚上搞大事~刚发布了Agent产品——Harness,定位是Coding Agent,对标Claude Code。核心逻辑是“Model+Harness=Agent”——模型负责思考,Harness负责干活(调工具、管上下文、执行任务),把模型能力真正落地到编程场景。本来以为是腾讯WorkBuddy类似的通用办公Agent;不过看介绍,Harness的操作界面和主要场景,应该都是给程序员用的专业工具。Coding Agent这赛道已被Claude Code验证,年入25亿美元。DeepSeek成本只有对手1/100,这波性价比拉满。程序员朋友可以关注下了~#DeepSeekHarness发布##DeepSeekHarness##AI#

34. DeepSeek Harness可以理解为国产CodeX Claude Code采用一切皆插件的开放架构非APP形式 而是整了一个开源平台未来各家都可以用#DeepSeekHarness发布# 目前不适合普通用户AI爱好者可以琢磨起来

35. 半小时破万星 DeepSeek用插件重新发明AI编程

36. 硅谷慌了。   DeepSeekHarness这只“黑鲸”正式浮出水面。公众号独立注册、全球内测招募、V4-Flash同步公测,当一家中国AI公司开始自己造“马具”的时候,大洋彼岸的巨头们还坐得住吗?   8月11日,“DeepSeekHarness团队”微信公众号完成注册。Logo是一只黑色鲸鱼,认证主体为北京深度求索公司。账号7月6日注册,次日即完成认证。   Harness到底是什么?绝大多数人压根没搞懂。   DeepSeek内部有一个核心公式:Model+Harness=Agent。模型是大脑,负责推理、理解需求、生成代码。Harness呢?是执行神经系统,负责调度工具、管理任务状态、执行闭环。大白话:模型只会“说”,Harness让AI真正“动手干”。   这玩意儿能干什么?自主读取解析代码仓库、批量修改源码文件、自动化运行单元测试、精准定位漏洞、自主修复bug。从需求对接到代码开发再到测试运维,端到端,全流程。   Harness为什么重要?因为2026年,Harness直接带动了VibeCoding成为“GPT时刻”以来首个成功商业化的杀手级应用。   最知名的两款Harness,OpenAI的Codex和Anthropic的ClaudeCode。ClaudeCode有多猛?Anthropic在2026年2月完成300亿美元G轮融资后透露,ClaudeCode年化收入已经来到25亿美元。东方证券研报显示,2026年全球智能体代码市场规模约80亿美元,CR4高达86%,远期中美总潜在市场合计达4000亿美元。   DeepSeekHarness一上来,就直接对标ClaudeCode。   更狠的是,DeepSeek资深研究员陈德里早就在社交媒体上放了话,“简单来说就是对标ClaudeCode,做DeepSeekCodeHarness”。   8月7日,FloatboatHarness在五项第三方基准上发布完整评测数据。底座用的是DeepSeekV4-Flash,输入$0.14/百万token、输出$0.28,混合价$0.175/M。对面是ClaudeOpus4.8,混合价$10/M,贵57.1倍。   结果呢?$0.175的底座,五项全部超过$10的旗舰。   赢它的不是模型,是Harness。同一个DeepSeek-V4-Flash,跑在官方自己的Harness上和跑在别人家框架上,效果天差地别。Harness做得好,模型能力就能被十倍、百倍地释放。   AnthropicClaudeCode还有一个致命问题,闭源。   上个月,部分AI社区用户发现,当用户指向非官方端点时,ClaudeCode客户端会把代理域名、系统时区等信息隐写回传给Anthropic服务器。工信部网络安全威胁和漏洞信息共享平台已经发布了风险提示。   你的代码库目录结构、系统时区,正在被悄悄传回硅谷。   而DeepSeekHarness团队秉承什么理念?开放。明确组建多个模型接口方向的工程师团队,不限于接入自家模型。模型团队与Harness团队分离,Harness可能独立运作,甚至与其他模型厂商合作。   这场仗打到这个份上,DeepSeek要的已经不是API调用量了。   行业价格战打到什么程度?国产大模型在OpenRouterToken调用量月榜前十中占据七席,DeepSeekV4Flash位列第二。但单纯卖算力的模式,天花板已经到了。   Harness的战略价值在于,从“卖算力”转向“交结果”。客户付费依据从模型调用量变成实际完成的工程任务。价值创造和收益直接挂钩,彻底跳出低价竞争的红海。   硅谷慌的不是DeepSeek又发布了一个模型。   慌的是,一家中国公司开始自己定义“模型之外的一切”。慌的是,当行业竞争从“底层模型比拼”转向“落地能力与工程体系的较量”时,DeepSeek已经悄悄把Harness这条战线铺开了。慌的是,贵57.1倍的对手被打趴下,靠的不是更贵的模型,而是一套更好的Harness。   更慌的是,如果Harness真的开源,行业统一脚手架这个位置,它就有机会先占住。 梁文锋曾经说过,DeepSeek现阶段最重要的是CodingAgent。Harness就是这句话的落地,不是模型,不是论文,是能跑、能干、能交付结果的系统。   硅谷慌了。因为这次浮出水面的,不是又一个大模型参数榜单,而是一整套能让AI真正“干活”的底层系统。黑鲸才刚露头,水面下的动静,才刚刚开始。   信息来源:界面新闻《DeepSeek智能体要来了?公众号已完成注册认证》(2026-08-12)#DeepSeek智能体要来了吗#

37. DeepSeek黑鲸鱼上线:AI编程下半场的门票已经不是模型了

38. DeepSeek Harness 终于来了:你以为是国产Claude Code,他想得更远

39. DeepSeek正式开源Harness:它终于有了自己的Vibe Coding入口

40. 像玩乐高一样拼插件,DeepSeek Harness能带来哪些改变?

41. 连夜实测DeepSeek Harness!梁文锋放出黑色鲸鱼,一切皆插件

42. 天变了。 DeepSeek Harness团队公众号刚刚完成注册,Logo是一只黑色鲸鱼,这是DeepSeek首次为Harness业务线单独设立官方发布阵地。从模型到智能体,DeepSeek这一步,到底要多大? 公众号注册时间是7月6日,7月7日就完成了认证,一个月过去了,账号里一个字没发。但这一个月,外面已经沸腾了。 7月31日,DeepSeek-V4-Flash正式版API悄悄上线公测,什么叫悄悄?没有发布会,没有通稿,就更新了一条API日志,Agent能力暴涨6倍。 在权威的Terminal Bench 2.1测试里,Flash正式版拿了82.7分,把自家V4-Pro预览版的72.1分远远甩开。逼近Opus-4.8的85分。 更狠的是什么?第三方评测机构Artificial Analysis当天就把Flash放上了榜单,智能指数50分。比自家V4-Pro还高6分。一个Flash版,把Pro版反超了。而Flash版的总参数2840亿,激活参数才130亿,一个轻量模型,把旗舰预览版摁在地上摩擦。 最让人细思极恐的是另一件事:模型结构和尺寸跟预览版一模一样,只把后训练重做了一遍。三个月前官方自己承认Flash在复杂Agent任务上跟Pro有差距,三个月后同一个身子把Pro给反超了。后训练的优化空间,远比我们想象的更大。 这帮人到底在憋什么大招? Harness团队负责人叫崔添翼,90后,浙大计算机毕业,大学拿了6枚ACM亚洲金牌。然后在全球顶尖量化机构Jane Street干了9年。2022年联合创办量化交易公司TSY Capital。今年3月加入DeepSeek。 他不是传统AI学术派,他是搞量化交易出身的,玩的是真实系统、低延迟交易、模型输出落到执行层会遇到什么坑。DeepSeek找他来带Harness,说明什么?说明这家公司清楚一件事,光有模型不行,得让模型真的能干活。而让模型干活这件事,需要的是懂真实系统的人,不是只会写论文的人。 现在市面上绝大多数大模型都是“嘴炮型”,你说它懂,它什么都懂;你让它干,它什么都干不了。不会读写本地文件,不会调用第三方工具,代码报错不会自己修。Harness要干的事,就是补齐这些短板。把AI从一个“会聊天”的东西,变成一个“能干活”的东西。 这一步,比大多数人想象的要大得多。 中信证券的研报点得很透:拥有成熟Harness的厂商,同时握着两项稀缺资产,一是从任务入口到结果交付的商业闭环,二是长程任务轨迹和纠错反馈这类高质量数据。这两样东西互为强化,先发者的优势很难被追上。 换句话说,谁先把Harness做出来、跑起来、形成数据飞轮,谁就在下一代AI竞争里卡住了身位。 DeepSeek这次对标的是谁?Claude Code。 Anthropic的Claude Code年化收入已经超过25亿美元,周活用户翻倍增长。OpenAI的Codex周活用户在15天内从300万涨到400万。全球智能体代码市场规模约80亿美元,远期中美总潜在市场合计4000亿美元。这不是小打小闹。 DeepSeek的Harness团队现在什么状态?缺人,非常缺人。崔添翼自己说“我每天都在面试,在各个渠道发布招聘小广告”。目标宏大,工作繁重,人手仍然紧缺。 8月1日他面向全球开启内测用户征集,优先招募有Agent开发实战经验的开发者。结果一条内测帖发出去,评论区秒变“开源Agent路演”,截至8月3日上午,769位报名者、712个开源仓库、合计超过120万Stars。 开发者们排队往里冲。 但也得泼盆冷水。Harness这个东西,DeepSeek自己都还没正式发布,V4-Flash的测试分数是在DeepSeek Harness“极简模式”下跑的,自家框架测自家模型,这分数得打个折。而且官方技术报告也承认,模型在超过128K上下文后性能就开始往下掉。从测试到产品,从内测到大规模商用,中间的坑一个都不会少。 还有一个潜在风险:崔添翼在社交平台上说过,DeepSeek招人需要能用中文工作。这话被外界解读为“不招外国人”。在全球化的AI竞争里,人才池子主动收窄,会不会影响团队的技术视野和工程速度?这事值得盯。 但无论如何,DeepSeek这一步已经迈出来了,从公众号注册到内测招募,从V4-Flash的Agent能力暴涨到Harness框架的首次亮相,这家公司正在做一件很多人想做但没做成的事,让AI真正能干活。#DeepSeek智能体要来了吗##上头条 聊热点#

43. DeepSeek深夜双响炮:API涨价11倍,Harness开源GitHub星数破纪录

44. DeepSeek 又放大招!开源 AI Agent 框架 Harness:一切皆插件

45. DeepSeek发布Harness智能体,从“动口聊天”进化到“动手做事”

46. DeepSeek V4 Pro更新:国产大模型Agent能力迎来新突破

47. GitHub史上最快涨星项目 DeepSeek Harness发布1个多小时破2万星

48. DeepSeek开源智能体框架Harness,补齐Vibe Coding入口

49. 最近 #DeepSeekHarness火了#,我觉得这件事真正值得关注的地方,是DeepSeek终于开始补自己最缺的那一块:Agent产品层。 过去很多人用DeepSeek做Agent,实际上是“DeepSeek模型+别人的壳”。 比如腾讯WorkBuddy,本身就是一个桌面AI Agent,可以调用DeepSeek、混元、Kimi、GLM等不同模型,腾讯官方文档也专门提供了DeepSeek V4 Pro的接入方式。 这个模式当然能用,但问题在于,模型的最大能力未必能发挥出来。 今天的Agent已经不是简单地问模型一个问题、模型回答一句话。上下文怎么管理、什么时候调用工具、任务怎么拆解、失败之后怎么重试、执行结果怎么验证,这些Harness层的设计都会直接影响最终效果。 甚至同一个模型,换一套Harness,Agent表现都可能差很多。 这也是为什么DeepSeek这次自己做Harness值得关注。 这对WorkBuddy反而可能是最大的威胁。 因为今天很多人用WorkBuddy,一个重要原因就是它给DeepSeek这样的模型加上了电脑操作、文件处理、工具调用和Agent执行能力。 可一旦DeepSeek自己的Agent正式出来,并且针对自己的模型做深度适配,用户很自然会问一句:我为什么还要在WorkBuddy里面套一层DeepSeek,而不直接用DeepSeek自己的Agent? 当然,WorkBuddy依然有自己的优势,比如多模型切换、QQ/企微生态以及办公场景整合,这些并不会因为DeepSeek Harness出现就消失。腾讯也把WorkBuddy定位成全场景桌面AI智能体,而不只是DeepSeek客户端。 但长期来看,Agent竞争很可能会从“谁接入的模型更多”,逐渐变成“谁能把一个模型的能力压榨得最彻底”。 如果DeepSeek自己的模型+自己的Harness真的做到1+1>2,那么今天靠“套DeepSeek”获得吸引力的Agent产品,都会面临一个问题: 当原厂开始自己造整车,第三方车厂的日子就没那么舒服了。

50. DeepSeek Harness v0.1发布:具备自进化雏形,GitHub星数超3万

51. 凌晨两点刷到这条,我直接从床上坐起来了。 DeepSeek那只黑鲸,8月11号深夜又搞事了——"DeepSeekHarness团队"的公众号,悄无声息地上线了。 不是新模型。是比新模型更狠的东西。 很多人还没反应过来Harness是啥,但我告诉你:这玩意儿要是做成了,AI圈的游戏规则,今晚就得重写。 说人话。 你现在跟ChatGPT说"帮我修个bug",它回你"好的已修复"——修了吗?如修。 它根本没手没脚,就是个"缸中之脑"。 Harness,就是给这个大脑装上四肢。 业内有个公式:Model + Harness = Agent。 模型负责想,Harness负责干。调工具、跑测试、出错回滚——这些脏活,模型干不了,得靠Harness。 有个特别扎心的数据:同一个Claude模型,用Anthropic自家的Claude Code跑,得分95%;换个简陋配置,直接跌到42%。 同样的脑子,不同的身子,差了一倍多。 所以你看,OpenAI推Codex,Anthropic推Claude Code,Google推Project Mariner。大厂全在抢这个赛道。 DeepSeek这次派谁去打?崔添翼。 浙大计算机出身,华尔街量化巨头Jane Street干了九年,今年3月才加入DeepSeek。5月立项,8月1号在X上发内测招募,面向全球收编"造过Harness"的开发者。 评论区直接炸了。LLaMA-Factory作者、LobeHub团队、elizaOS核心开发者全冒头。有人整理了425条回复,61个人亲手造过轮子——Rust、Go、双Loop、崩溃恢复,各路神仙都想看看DeepSeek的官方轮子长啥样。 更关键的是,DeepSeek-V4-Flash的API文档里已经白纸黑字写了:CodeAgent测试,用的是DeepSeekHarness极简模式(即将发布)。 不是PPT,已经在跑了,就差掀牌。 而且按DeepSeek一贯的尿性,这东西大概率开源。 Claude Code已经占了GitHub公开提交量的4%。这个位子,DeepSeek不可能不抢。如果真有一款国产版Claude Code,月租只要海外的几分之一,还能国内直连、私有化部署——不用翻墙,数据不出本地。 程序员效率翻倍,小公司一个人干一个团队的活,你手机里的APP迭代更快、bug更少。 这才是真正的科技普惠。 所以我想问你:如果真有一款国产AI,能帮你写代码、做表格、改文档,月租一杯奶茶钱——你敢不敢把活儿交给它干? 评论区聊聊,我看看有多少人是真敢的。 #DeepSeek #AI编程 #人工智能 #ClaudeCode #科技圈

52. DeepSeek Harness开源!AI Agent产业迎来新突破

53. DeepSeek Harness是未来软件的基础形态 省流: 1.deepseek模型没有超出预期,但是harness在干大事。 2.传统插件形态的软件,只提供了粗粒度的插拔能力,无法适配未来的软件需求,以及AI自进化的需求。 3.识别出两个问题:时间上的可组合性,即所有插件可做的事情是可撤销的;空间上的可组合性,插件之间可以通信且插拔插件互相不会影响。 4.达成效果,可以在运行过程中,在不影响软件运行的情况下,增加或删除插件。 #deepseek #deepseekharness #dsh #harness #梁文峰

54. 性能评测+上手解读!DeepSeek-V4-Pro开源新王,Agentic coding&推理&长程工具调用全面硬刚Fable 5!

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章