今天(8月17日)零点,DeepSeek的峰谷调价正式落地:V4-Pro高峰时段输出价格从每百万tokens 6元提到27元,缓存命中输入涨了11倍。微博每日9:00-12:00、14:00-18:00执行高峰资费,只有闲时还能拿到半价。微博不过这两天本地部署圈里最热的不是吐槽涨价,而是一个刚开源的项目——DeepSeek Harness。按知乎网友8月16日的截图,这个仓库上线三天GitHub star就冲到了12.6万。知乎B站、知乎到处都在讨论同一件事:把Harness接上本地模型,是不是就能"token自由"了?
先给还没跟上节奏的朋友一句话同步:Harness不是新模型,而是DeepSeek官方开源的Agent执行框架。知乎可以理解成Claude Code那套"会自己读文件、跑命令、改代码、迭代调试"的底座,而且"一切皆插件"——模型、工具、界面全都能换。它本身免费,但默认调用DeepSeek官方API。问题就出在这儿:Agent恰好是最费token的用法。聊天是一问一答,Agent干一个任务动辄几十轮,每一轮都要带着完整上下文重新过一遍,一个稍微复杂的编程任务烧掉百万级token很常见。峰谷调价之后,白天高峰跑Agent,成本直接翻倍往上走。所以"Harness+本地模型"这套组合这周突然爆火,逻辑一点都不玄学。

但"免费"这两个字没那么好拿。我把这几天B站实测视频、知乎部署帖和评论区的真实反馈拢在一起,按显存档位捋了一遍,想入坑的先对照看看自己在哪一档。

32GB显存档(RTX 5090单卡,或双5060 Ti 16G)是目前跑Harness+Qwen3.8-27B的舒适区。有B站网友实测双5060 Ti跑Qwen3.8-27B的Q5 NVFP4量化,速度能到40 tokens/s,上下文能开到182K。哔哩哔哩更有意思的是,一位用5090做实测的UP主在评论区承认,自己的5090并没比双卡5060 Ti快多少,还补了一句"现在配电脑太亏了,双卡5060性价比高太多"。
24GB显存档(3090、4090这类)是"Agent能干活"的入门线:Q4量化能把27B完整塞进显存,还能留出32K上下文的空间。知乎这也是社区公认性价比最稳的一档。
16GB显存档最普遍,也最尴尬。Qwen3.8-27B的Q4_K_M量化文件约17GB,16G显存装不下,一部分权重落到内存里,速度直接跳水。哔哩哔哩有5060 16G用户实测只有5 tokens/s,也有5080用户报10 tokens/s。评论区的解法是换架构:上26B-A4B这类激活参数只有4B的MoE模型,Q2量化下上下文能拉到80K,Agent勉强能用。

8GB及以下就不用考虑了。有人拿4G显存的小模型接Harness拍了个视频,那是验证流程的玩法,不是干活的玩法。
还有一笔隐形账:内存。Qwen3.8-27B用了混合注意力架构,KV cache算是同级别里省的了——按FP16算每个token约64KiB,32K上下文大约占2GB显存,比很多人想象的友好。知乎但一位32GB内存的UP主仍说"能明显感觉到上下文瓶颈"。再看眼今年的内存价格,SK集团掌门人都在警告2027年是存储芯片供应缺口最大的一年。知乎如果你的本地Agent方案需要新购内存,这笔钱务必算进总账。
坑也替你拢了四个,都是社区这几天真实踩出来的。
第一个,“完全离线"目前并不完全。有网友实测,不配DeepSeek API Key、只接本地模型时,调用Harness自带的web_search插件照样提示缺"DEEPSEEK_API_KEY”。哔哩哔哩联网搜索这类能力现阶段还是绑官方API的。冲着"拔网线也能用"去的朋友,心理预期要改成"本地模型为主、部分服务仍走官方"。
第二个,本地模型能干活,但和跑分是两回事。Qwen3.8-27B的Agent跑分确实猛,官方模型卡上QwenSWEBench从上一代27B的49.3涨到79.0。知乎可那是高精度版本的成绩。低比特量化之后代码能力还剩几成,目前没人敢打包票;而且Qwen"思考偏多"的毛病在Agent场景里会被放大,评论区有人直言"思考太耗时间了"。社区里也有清醒派:一条高赞方向的评论说,本地部署目前更适合破限写作、剧本分镜这类场景,“正规干活根本不行”。哔哩哔哩马上被另一条怼回来:"这跑分有Opus 4.6水平,可以干活。"两边都还没被说服,这就是现阶段的真实状态。

第三个,别把token省在错误的地方。一位社区用户的经验很值得抄:给项目维护一个AGENT.md文件记录核心规则和架构,让Agent每轮先读它。哔哩哔哩任务拆成最小模块、分批次多轮对话。这样每轮上下文都短,质量更稳,token省一大截——Harness自己也内置了上下文压缩能力。这套方法在云端省的是钱,在本地省的是电和时间。
第四个,安装这关比想象中折腾。Harness对Node版本要求很新,一部分核心依赖要求Node 22及以上,系统里Node太老的话,装到一半postinstall脚本就会直接崩溃,解法是把新版Node加进PATH最前面再重装。知乎Windows用户还要留意启动脚本:社区实测里有案例启动时找不到pnpm相关的命令,最后是重写启动脚本、理顺PATH才把服务跑起来。知乎遇到"命令找不到"这类报错,先查环境变量,别急着怀疑项目本身。

那么到底值不值得上?我的判断分三档:
手里已经有24GB及以上显存的,这个周末就值得折腾。Harness+Qwen3.8-27B Q4是目前被验证最多的组合,重复性的编程、文档、脚本任务丢给本地跑,电费几乎可以忽略。
16GB显存的,别硬上27B Q4。要么走MoE模型的路线先过渡,要么把能挪的批量任务挪到DeepSeek闲时跑——闲时价格是高峰的一半,这本身就是官方给你的"错峰省钱"方案。
想为这事专门装新机的,先等等。显卡价格今年涨了一轮,内存还在高位,那位5090 UP主都说现在装机亏。除非你有数据不能出本地的硬需求,否则拿新硬件去换"token自由",这笔账现在怎么算都不划算。
最后留几个值得持续盯的信号:智谱GLM-5.3已经发布,并宣布两周内开源,743B参数主打编程,开源版本能不能落到本地,要看最终放出的规格。36氪Qwen3.8-27B的MTP多token预测加速正在被llama.cpp等引擎吸收,本地速度还有提升空间;Harness本体还是0.1.0-rc.6的开发者预览版,本地模型工具链补得很快。这件事几乎一周一变,想参与的,先用手里现有的卡试起来,别急着掏钱。