一周18万星的DSH出了官方桌面端,「4B跑Agent」正在评论区翻车:本地模型上岗干活前,先看这张档位表

源自216位全网作者

02:46

这个9月,本地部署圈的考题换了一种问法。以前问的是"我这台机器能不能跑起来",现在问的是"我能不能让它替我干活"。

促使考题换掉的,是过去几天里连着的三件事:9月9日,DeepSeek Harness(社区叫它DSH)放出官方自研桌面端0.1.5-alpha.2;9月10日,0.1.5-rc.1把默认模型切到了刚开源的DeepSeek-V4.1-Flash,顺手改了Session V3和插件API。紧接着,社区的多版本管理器dshvm也上线了,作者发帖时开口就是"我现在所有实例都用它管理"——一个人需要给DSH装版本管理器,本身就是这个生态跑得多快的证据。知乎知乎

从毛坯到上岗工位,只用了四周

8月13日晚9点,官方账号宣布DSH开源:“目前的版本还很不完善,请大家多提提意见”。当晚23点20分,社区桌面端就发出了首个版本,和官方仓库同一天创建。一周过去,GitHub star数"已经点到了18万,比之前最快的龙虾还要快"。微博知乎知乎

但首发状态,用科技号主世超的话说,是个"彻头彻尾的毛坯房":常见客户端没有,命令行界面也没有,只有一个要本地起服务再用浏览器访问的网页端。微博第一批普通用户的反馈拿了424个赞,第一条就是:程序员没问题,普通用户估计都没有nodejs环境,很难跑起来。知乎微博

这四周的更新路径,基本就是把这个门槛一块块填平。0.1.5-rc.1里一个不那么显眼的变化,对干活党反而最关键:开始支持in-history System Prompt更新——更新系统提示词的同时,尽可能保留已有缓存,几十轮上百轮的长会话从此不用每轮重付提示词的钱。知乎

再加上右侧Sidebar/Artifact面板,那篇版本解读的总结很直白:以前DSH是"聊天窗口+Agent工具",现在逐渐变成"聊天窗口+Agent+Workspace+Artifact",方向是Agent IDE。一个要留心的代价:0.1.5同时改了插件API,旧写法要返工——"一切皆插件"的生态有多繁荣,兼容裂口就有多疼。知乎

4B模型能不能跑Agent:演示派和实测派说的不是同一件事

这两天B站"本地部署"标签下最热的吵架,主角是讯飞刚开源不久的Spark-X2.5(1.7B/4B)。9月9日,145万粉的UP主"老麦的工具库"发了实测:把它换进Claude Code,能执行多种Agent任务、断网能跑、一台手机也能跑起来,视频两天多16万播放、3400多人收藏。哔哩哔哩

另一头,评论区的高赞基本是冷水:“4b8b9b这种小模型基本就告别agent了,非常容易逻辑死锁,只能说凭借速度优势去干一些流程短重复度高的流水线任务,相当于ai力工。最起码也要到gemma4 12b这种级别的稠密模型,才能够独立地完成一些任务”。紧跟着还有"当对话小模型,或者翻译小模型我还敢信,让它调工具真不怕它屎循环吗?"(389赞),以及一句实测结论:“目前的4b模型满精度依然无法打半年前的9b模型4位量化。”(322赞)哔哩哔哩

两边其实没吵到同一个点上:演示证明的是"工具调用格式学得会",评论担心的是"长链路会不会死锁",这是两回事。评论区另有一句话只有21个赞,但把问题问到了根上:“实际上Agent的瓶颈根本不在模型智力,而是在执行纪律”。哔哩哔哩

评测的风向也在同期转向:开始"比Harness"而不只是"比模型"。9月3日流传开的Frontier Harness v1.0榜单,把Claude Code、Codex、Pi、Kimi Code和4款DSH变体放上了同一张测试台。微博

榜单给出的数字同样值得截图:一共360个任务、12款harness,整体通过率58.1%;完成率最高的是Codex的66.7%,DSH Creator和Claude Code以63.3%并列其后——但Claude Code单次通过的花费高出5.6倍,同时也是耗时最长的。报告把Claude Code的高花费归因到框架与模型的适配:它依赖Anthropic的显式缓存控制语义,换成暴露隐式前缀缓存的模型平台,原有缓存策略迁移不过来。“工具链选模型、模型配工具链”,第一次成了有数字可查的问题。微博

对手里有卡、盘里有量化模型的本地玩家,公开实测和教程能拼出的档位大致是这样:1.7B到4B(手机、核显、轻薄本),流水线任务是真的能接,长链路别托管;12B到27B(16G显存)是现实干活档,B站8月27日那期教程给的路径就是RTX 5060Ti 16G跑千问3.8-27B,收藏接近600。小红书上自己折腾过一轮的帖子给27B的评价是"先说结论,qwen 3.8 27B 名不虚传,写代码很能打"。但同一个圈子里,那篇83万阅读的回答给的是另一头:“Qwen 3.8完全没有长程任务的能力,这样24h开蹬就是纯纯的给自己找麻烦”,除非是"用更大的模型跑通了场景然后让Qwen单纯的跑跑执行"。两边合起来读才完整:27B档适合执行已经跑通的流程,不适合替你探索新任务。再往上,32G和多卡党可以考虑本地满血V4.1-Flash——那条显存之外的内存账单之前已经有帖子拆过,这里不重复算,这一档对Agent场景真正的红利是长会话不掉速、工具回传装得下。哔哩哔哩小红书知乎

Agent是token吞金兽,这才是本地党该盯它的原因

为什么"干活"这件事让本地部署突然又有搞头?因为Agent烧token的方式和聊天完全不同。一位8月21日晒账单的微博用户,几天DSH-API花掉1727元、35亿token,“我已经快一周没打开CodeX了”。个案不是样本,但方向是真的:Agent一轮任务是几十次工具调用往上下文里回灌,不是"一问一答"。本地跑过27B的都见过那个口径拆分:同一条5090 32G的回答摆得很清楚——部署完开256K上下文,perfilling大约1600tps,decode大约120tps。聊天党晒的是后一个数字,Agent场景吃的是前一个,工具结果回传全是输入。框架侧已经在替你砍长会话成本了,你的prefill短板被Agent任务相对放大的同时,也在被0.1.5那类保缓存更新对冲。微博知乎

顺便把立场摆正。知乎那条221万阅读、45条评论的回答早就总结过:“本地部署不是省钱方案,是可控性方案”。让模型在本地干活,图的是随时在岗、会话不掉、过程不出内网,而不是省额度。企业侧的信号也是这个方向:8月底已有用户把DSH接上全私有化DeepSeek上了生产环境,最早落地的场景朴素得很——替代RPA,自动登录、自动处理、自动把结果传到FTP交给另一个系统。知乎知乎

准备上岗之前,先看完这四颗雷

第一颗,插件不是应用商店。DSH目前仍是开发者预览版本,第三方插件会在用户权限下运行代码,可能接触文件、凭据和网络,装之前至少要看权限、依赖和最近提交。知乎

第二颗,“一切皆插件"意味着能拆自己家:有同事装了个插件,把系统自带的提示词整个卸掉了,直接当场宕机。叠加0.1.5的插件API迁移,旧插件现在是一片"能用但没人维护”。知乎

第三颗,文件删除权限别交给习惯:“连dsv4f都曾经把我库给删了,小模型别不小心全盘清空就谢天谢地”——这条评论只有6个赞,但问类似问题的人最多。哔哩哔哩

第四颗,玄学插件浅尝辄止。社区确实有强制给模型思维链"换起头"来稳定输出的玩法(dsh-anchored-standard、“梁神模式”),但可观察到的现象只有"同一模型、同一API,换个Harness或首轮工具目录,工作状态差很多",原因至今没有官方定论;教程作者自己的评价也实在:“多少还是带点玄学成分,真想稳定提升效果,还是得看官方后面的模型优化才更靠谱”。知乎

还有个半颗雷是心理上的。"为什么DSH不更新了"的问题拿了580赞、32.8万阅读,高赞回答就一句话:“deepseek 已经一小时后没有提交代码了”。热度期按小时更新过后的社区,现在一小时没push就开始焦虑;dshvm这类工具的出现说明新常态已经形成:版本多开,升级节奏自己管。知乎

三类人三种走法

手机或核显的尝鲜党:装个1.7B/4B跑跑转格式、改名的流水线任务,感受"Agent长什么样"就到为止,别托管长任务、别给它碰有删除权限的目录。

16G显存、盘里已经有27B量化版的:现在可以认真试上岗。官方桌面端0.1.5-alpha.2之外,跟进极快的社区桌面端累计安装已到25万次、带故障诊断、Safe Mode和升级保留配置,首次配置选服务商填API Key就行,不用先装Node。接上本地端点,先派"整理文件、写点小代码"级别的活,把工具调用失败率和prefill体感记下来,再决定装不装插件;要装,先装插件市场,再按需补一个sidebar,到此为止。知乎

多卡、跑得起满血模型的:等三样东西——0.1.5正式版、DSH对Qwen这类开源模型adapter的补齐情况、Frontier Harness榜单上DSH的下一轮成绩。执行纪律有没有真提升,正在从口水变成可查的数据。

接下来盯这几个信号:官方桌面端什么时候逃出alpha;插件API迁移会不会让插件市场里一批插件集体失配;第三方模型adapter的更新节奏;以及——那个一小时没提交就会有人发帖问的仓库,什么时候恢复日更。

本地部署的第二阶段已经开场。这次的考题不是"跑不跑得动",而是"干不干得成、死不死循环"。先对号入座,再决定投入。

内容由AI生成

精选参考来源

1. DeepSeekHarness0.1.3→0.1.5这次主要更新了什么?

2. 如何评价deepseek新发布的deepseek-harnessv0.1.0-rc.8版本?

3. DeepSeekHarness已经以MIT协议开源发布。目前的版本还很不完善,请大家多提提意见。网页链接

4. 如何看待DeepSeekHarness官方自研桌面端(0.1.5-alpha.2,09-09)?

5. 从毛坯到精装,DeepSeekHarness的入门教程来了

6. 我只是作为一个“普通用户”的角度去用DeepSeekHarness,一些感受:1.启动方式偏极客,程序员没问题,但是普通用户估计都没有nodejs环境,很难跑起来2.速度飞快,这点特别好3.Thinking部分由于Flash模型速度过快,导致文字闪的厉害,可以做一下节流,攒一批一起显示,配合动效会好一点。...全文

7. 给ClaudeCode换了个4B模型,事情开始不对劲了…

8. Harness的评测榜单FrontierHarnessv1.0测试harness包括:Pi、Exo、ClaudeCode、Codex、DeepSeekHarness(4款)、Hermes、OpenCode、OhMyPi、KimiCode测试模型:KimiK3(选择K3,而不是GPT、Claude,是因为测试者不想偏向Codex和ClaudeCode)任务类型:21项终端基准测试任务和...全文

9. 普通人也能玩本地大模型!千问3.827B+DeepSeekHarness安装教程,照着做就能跑起来

10. 折腾最流行的两个本地部署的小“大模型”

11. 很多人认为本地部署一个大模型,就实现token自由,就可以干活了,真的吗?

12. 本周比较忙,很少发微博,一直在指挥梁圣的DS帮我干活。仅这几天,就给梁圣贡献了1727块钱,用了35亿Token。话说DeepSeekHarness是真的好用,尤其是编程场景,我已经快一周没打开CodeX了。我这样消费下去,DS万亿市值不是梦。。

13. 有必要自己将deepseek部署到本地吗?

14. deepseek-harness的热度这么快过去了吗?

15. DeepSeekHarness有什么好用的插件?

16. 为什么DeepSeekHarness不更新了?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章