9月30日下午,DeepSeek官网Harness页挂出了桌面安装包:双击装好,登录就送6元赠金,有效期到10月6日。10月2日凌晨,Claude Code v2.1.287悄悄加上Mods——官方第一次允许插件动到"行为和界面"。同期,CodexCloud进灰度:手机上启动编程任务,电脑合盖,云端继续跑。36氪哔哩哔哩知乎

国庆七天,DeepSeek、Anthropic、OpenAI把刀同时伸向同一层——不是模型,是包在模型外面那层执行框架,圈里管它叫Harness(执行挂具)。B站上已经有人给17个框架挨个配了"××主义"阵营,玩成了选边站梗;知乎上的共识则更直接:大多数Agent对比只在比模型,但真正决定任务能不能可靠完成的,是外面那层壳——同一底层模型,换个壳,结果天差地别。知乎
这层壳决定三件事,每件都直接打在你的钱包和交付上。
8月到现在,护城河是一层层被拆掉的
把散在36氪、知乎、B站、微博上的消息拼在同一张时间轴上,才发现这不是国庆突然起的事,而是一场从8月烧起来的层位迁移:
8月15日:DeepSeek Harness开源,被媒体称为"杀死Agent黑箱",公式很简单:Model+Harness=Agent(36氪)
8月21日:OpenAI全面开源Codex Harness,AI编程的护城河被亲手拆开;同一天DeepSeek一周三更,把Claude Code和Codex收编成自己的子代理。36氪
9月3日:颜水成团队发布Scaling Harness Intelligence——首个专为"即时生成Harness"构建的模型(36氪)
9月9日:三项跨框架实测揭开"模型一模一样,Token相差70倍"的成本黑洞。36氪
9月11日:英伟达开源自家Harness SoL-Pi,“AI自己爆改AI”(36氪)
9月20日:YC公开判断:模型定上限,Harness定表现。36氪
9月25日:DeepSeek Harness桌面预览版出现(36氪)
9月30日:v0.2桌面版正式上线,macOS/Windows安装包+6元赠金;同期dsh-libreoffice-kit等办公插件开源。
10月1-2日:Claude Code Mods上线、claude.dev新主页;CodexCloud进入Work/Codex/API;GPT-6.1Sol"紧急扩容"的说法开始流传(标题级证据,细节未采到,存疑)
模型层的性能和定价战打到9月底已经见底,竞争集体落到了框架层。
三项实测:账单的大头从来不只是模型
信息量最大的是9月那组基准测试——同一个模型,只换框架,看成本、通过率和账单怎么变。
第一,"启动税"决定成本基本盘。6月的独立基准用OpenRouter跑12种配置,同一API同一模型,每解决一个任务消耗的Token从约3500个(Aider architect模式)到约29.2万个(OpenClaw)不等,接近两个数量级,而排名在两个毫不相关的模型之间几乎不变。差异来自框架开口前先发送的负担——系统提示词加工具说明:约700个Token对约2.6万个。把启动税乘以对话轮数,能预测单任务Token用量,两组模型的决定系数R²均为0.99。36氪
第二,缓存命中率悄悄改写排行榜。Composio的30个企业工作流实测(DeepSeek V4 Flash、240次运行、129次成功)显示:ClaudeCode的输入Token里只有1.5%是缓存命中,Codex约70%、OMP约57%;而新输入的价格约是缓存输入的5倍。结果就是:ClaudeCode原始Token消耗和对手相当,账单却不是。另一个测试环境里更直观——Codex的计费Token有77%按缓存读取价(约十分之一价格)计,它每任务实付反而低于原始Token只有它一半的ClaudeCode。36氪
第三,同模型下,通过率差20个百分点。Composio八种框架的通过率从OpenCode的46.7%到PiAgent的66.7%;每次成功任务的成本从0.028美元到0.195美元,差7倍。DeepAgents通过率和ClaudeCode持平,成本只有四分之一。36氪

要说明的是,这些实验并非严格单变量——有的配置只跑一遍、Agent自带随机性,作者自己也披露了限制。但三个机制(启动税、缓存路径、轮数)指向同一件事:壳承担着成本与稳定性,模型只提供上限。B站评论区早就用体感摸到了这条曲线:同样喊"一个亿token",有用户日耗七八亿只花30块左右,有人一亿多烧了24块,还有人聊两百多万Token"就不见了8毛钱"。口径各不相同,但跨度本身说明——换框架后的第一件事是量自己的钱,不是看别人的榜。哔哩哔哩
Claude Code作者Boris那边还补了个注脚(经B站转述):每次模型升级,他都要删掉绝大部分Claude Code的系统提示词——脚手架本来就是为弥补模型缺陷搭的,模型变强,脚手架就该拆。框架也是脚手架,这正是"同一任务不同壳"账单能差出几十倍的原因,也是这轮大战真正的技术底色。哔哩哔哩
DeepSeek桌面版:真实增量和口径裂缝
官网双击安装、6元赠金、300token/s左右的生成速度,加上"给一文件夹PDF让它读材料、核数据、出报道大纲和汇报PPT"的实测演示,桌面dsh看起来是"普通人用Agent干活"的转折点。官方发布稿给的口径也够猛:按官方模型API用户统计,约60%的Harness用户使用过第三方插件;下一步建官方插件市场,找不到插件可以让"创作模式"的Harness自己写——APPSO实测约十分钟,一个稿件检查器插件真挂在了界面上。AI写的代码直接改变AI所在的软件,这个事比"一次生成多少行代码"有意思得多。36氪

但知乎有一篇较真的《DeepSeekHarness每周采用观察》(9月30日),拿GitHub REST读数、npm下载API、仓库issue逐条核验,给出的另一组口径和媒体叙事差了不少:
仓库238,700 stars、npm周下载490,627看着都涨,但按日均算环比实质持平(约-0.7%),作者明确提醒:stars与下载只是兴趣/安装代理,不是用户数。知乎
截至该轮观察,没有任何企业或团队级生产部署证据,没有IDE/编辑器一等集成,唯一公开的跨harness实测仍是内容农场口径;
桌面安装包只有mac和Windows,官方README明确Linux不是发布目标,视频区还有人误传"Linux也发布了",被作者纠正。哔哩哔哩
号称"关了App也不注销"的定时任务,实际是会话级能力:提醒到期后作为一条消息回到原会话,不发邮件不做系统推送,会话没恢复就一直overdue待处理。知乎
Windows稳定性问题成簇:ELECTRON_RUN_AS_NODE泄漏到所有子进程、ACL沙箱下子进程静默不执行(0xC0000142弹窗)、装插件要手动重启;
第三方插件目录自报4382个,无独立评测、无安全审计。

两组口径合在一起,判断就客观了:桌面dsh作为"日常轻任务壳+插件玩具",眼下确实是性价比最高的入场券(赠金+模型本身便宜);作为"生产编码主力机",它还没拿出该拿的证据。文档党可以现在动手;拿它写大型仓库前,先自己跑一遍每任务成本。知乎

Mods与CodexCloud:能力边界松动了,账本也变长了
Claude Code的Mods把插件从"加命令加工具"推进到改行为、改界面,内置mod “You should know"专门提醒遗漏点——但只对开启遥测的第一方会话生效。Anthropic工程师Thariq九月底已经放话"Claude.md终将消失,Claude Mods上场”,方向明确。问题在另一边:当界面和行为都能被模组替换,你的Agent在跑谁的逻辑,普通用户更难知道了——这层审计问题官方还没回答。知乎
CodexCloud(电脑休眠、云端任务继续,手机可启动)截至9月30日已进入Work/Codex/API,但数据存储与加密策略、断点续传细节、上线范围与成本模型均未披露。叠加此前社区对第三方编码工具外传仓库的警惕,"框架层权限越来越大、披露却待补"这个错位,是国庆之后最值得盯的一条线。
另一个信号是需求侧:知乎"AI编程几乎无成本产出代码,为什么程序员反而更要加班"的讨论已有10714浏览。微博10月1日流传的工程师自述更直白——大厂里规格文档、代码、测试、PRD、工单、周报全是Claude Code做的,高层反复讲"推代码又不是瓶颈,那我们为什么还这么慢"。框架把"执行"变便宜之后,瓶颈移到了"决定做什么"的人身上——这也是为什么各家抢的不只是工具,而是工作流的入口。知乎微博
接下来两周怎么动:分三口人
尝鲜党/文档办公党:6元赠金10月6日到期,值得现在从官网装一个桌面版,跑通"读文件夹→核数据→出大纲+PPT"这条链路。别急着放重要数据:Windows沙箱权限问题修好之前,把它当玩具层验证,不当存储层。
重度编码用户(ClaudeCode/Codex付费):主力工作区不用为框架大战搬家。先量三个数——每轮开局发送的系统提示词+工具说明体积(启动税)、平均轮数、缓存命中占比,比盯模型榜有用得多。dsh适合当子代理和常规任务的便宜备胎,还不适合当主力。
企业与团队:等两样东西——带日志的第三方跨harness实测和生产部署证据。采购口径直接用"每个验证成功的任务成本",拒绝按原始Token比价的PPT。
观察清单留五个信号:0.2.0正式版是否在10月5日前落地;桌面端真实更新通道与下载入口是否公开;Windows稳定性簇是否被修复;VS Code/JetBrains等编辑器集成何时出现;CodexCloud何时补上数据政策与成本模型。
一句话收束:模型定上限,框架定表现、账单和风险面。框架大战第一个月里,最值钱的增量不是换哪个壳,而是你手里第一次有了可复测的尺子——启动税、缓存占比、每成功任务成本。先拿尺子,再选阵营。