这周本地部署圈的话题只有一个:dsh。
8月13日晚,DeepSeek把自家Agent框架DeepSeekHarness(社区简称dsh)以MIT协议开源。微博按知乎网友的说法,开源不到48小时GitHub星标破10万,创了史上最快涨星纪录。知乎一周内又从公测迭代到rc.8,8月21日再放出v0.1.1。知乎
但很多人装完才发现问题:官方默认流程走的是DeepSeek API——对,就是刚涨价的那个。于是教程区最高赞的画风是这样的:“有谁和我一样是看到DeepSeek涨价后来看本地部署的”。哔哩哔哩那么真正实际的问题来了:我家里跑着的Qwen3.8-27B,能不能接进dsh?怎么接?接上之后真能干活吗?我把B站、知乎、微博、小红书这两周的实测和讨论翻了一遍,整理如下。
先说清楚:dsh对本地党意味着什么
一句话:Codex、Claude Code这类产品的"大脑"是焊死的,dsh的"大脑"是插槽。
"一切皆插件"的意思是:模型、工具箱、系统提示词、沙箱、甚至Agent执行循环和整个UI,全是可替换的插件。官方用67个插件搭出4种Agent模式,底层是一个叫Cordis的插件管理框架。哔哩哔哩这个设计对本地部署人群是实打实的利好——它是目前头部Agent框架里,少数能把大脑整个换成本地模型的。

当然硬币另一面,首次上手的人吐槽也很直接:“太毛坯房了”“HTML预览窗口都没有”“还不如WorkBuddy舒服”。知乎这个后面说。
3条接入路线,本质是同一件事
先说破窗户纸:dsh走OpenAI兼容接口接模型,所以只要你能把本地推理暴露成一个本地API,就能接。社区现在主流三条路。
路线一:Ollama,最省心。按教程的说法配置就两步,如果尚未安装DeepSeek Harness,Ollama会自动安装并连接模型。知乎联网搜索也是内置的,模型需要即时信息时自动处理,不用配MCP。缺点是显存管理比较粗、极限性能上限低,适合"先跑起来再说"的人。
路线二:LM Studio,教程最全。B站播放4万+、收藏1700+的那条5090实战教程走的就是这条路:LM Studio部署模型、打通本地API、完整配置Harness,全程GUI。哔哩哔哩适合不想碰命令行、又想明确知道自己加载了哪个量化版的人。
路线三:llama.cpp(llama-server),上限最高。双卡、魔改卡、MTP提速这类极限玩法基本都在这条路上。有个很能说明问题的实测:双2080Ti(16G×2)跑Q4_K_XL量化,只有约15 tok/s,但博主用它在dsh里做完了3个Three.js游戏。哔哩哔哩缺点是参数自己配、分支自己编。
按配置给个粗建议:16G单卡入门,Ollama+IQ3量化,评论区有直接给16G单卡点名Qwen3.8-27B-AD-IQ3_S.gguf的。哔哩哔哩24G,Q4量化+Ollama或LM Studio都行;32G以上或双卡,直接llama.cpp吃满性能。

接上之后真能干活吗?实测汇总
先泼冷水,再给惊喜。
冷水:Agent推理比聊天慢,这是预期内的。有5060Ti单卡用户反馈,IQ3量化下普通对话约25 tok/s,进了dsh高强度推理只剩20 tok/s。哔哩哔哩多步工具调用、反复读写上下文,本地模型跑Agent天然比纯聊天费。拿聊天速度估Agent体验,会失望。

再看社区攒出来的一组参考速度(Q4档量化,均为网友自测):
5090约157 tok/s,3090约53 tok/s。哔哩哔哩
4090(24G):开DSFlash2加速,速度翻倍,Q4能到80 tok/s这档。哔哩哔哩
5060Ti 16G双卡(Q5):约40 tok/s。
Mac M3 Ultra:Q4约30+ tok/s,FP8反而只有20左右。哔哩哔哩
惊喜:一个反直觉的实测。有博主用同一个提示词、同一个dsh框架,让本地4bit的Qwen3.8-27B和云端DeepSeek V4 Flash各做3个Three.js游戏,结论是本地略胜。哔哩哔哩弹球打砖块这种高复杂度的,本地一次跑通、25项自动化测试全过,云端版本反而有"砖块撞了不消除"的bug。当然,单一场景、单一博主的样本,别当成全面结论——但它至少说明:27B的Q4在结构化任务上不是玩具。
争议也要摆上桌。评论区有人说"这个跑分有opus4.6水平,甚至可以拿来干活"。哔哩哔哩另一半则坚持本地模型干正经生产活还差得远。我的判断:代码、文档、流程化任务,27B Q4已经够用;但长链条、重规划的复杂Agent任务,本地和顶级闭源还有明显差距,这个差距不是一句"真香"能抹平的。
两个几乎必踩的坑
坑一:读图。“搞了一晚上,结果这个模型版本不能读图”——这是教程评论区的高频惨叫。哔哩哔哩原因是Qwen3.8-27B读图需要额外下载视觉投影仪文件(mmproj-Qwen3.8-27B-F16.gguf),它独立于量化文件,很多人只下了模型本体。
解法有三条:把mmproj一起配上(llama.cpp、Ollama都支持);或者用dsh的工具链降级方案——纯文本模型读图失败时,会自动退化到OCR+颜色统计+像素扫描的工具链来"脑补"图片。知乎PPT截图、流程图这类规整图片效果不错,真实照片打折扣。再或者学有人专门挂个本地小视觉模型给dsh当眼睛,不过也有人算账:为一个偶尔的读图需求把大模型长期挂在显存里,不如按张计费的云端API,一张几厘钱。哔哩哔哩
坑二:毛坯房门槛。插件市场目前号称已有8000多个,正在填补开箱体验的缺口。不想折腾命令行的,第三方桌面封装版已经有人做了,主要解决"想体验Harness但不想先装Node.js"的问题。知乎愿意折腾的,记住两个起点:先装dsh-plugin-store——它是"装插件的插件",装完设置里就有插件商店;技能(skill)可以直接复用Claude Code那套,丢进~/.agents/skills/就能被识别。知乎但注意它不支持递归发现,藏进二级子目录就找不到了。

最后说一笔吵得最凶的账
没有显卡的人动过这个念头:租云端显卡部署、再调API回来用,会不会比直接充DeepSeek便宜?毕竟有人算过,5090租一小时才3块钱。评论区的两条反驳都很到位:“你要租就租80G以上显存的卡,可以跑全量27B”;“3块钱1小时,一天用5小时就是15块,30天450,有这钱买啥订阅不行”。哔哩哔哩补一句我的判断:租卡只适合短窗口高强度使用——比如集中赶一两周的项目。长期使用,要么一次到位买卡,要么老老实实用API,租是最贵的中间态。
现在该不该上车
现在就接:显存24G以上、Qwen3.8-27B已经跑起来的,任务以代码、文档、流程化Agent为主,且已经受够了按token计费。
再等等:16G及以下(先用IQ3试水别重投入)、重度读图需求(rc版多模态还在快速迭代)、完全不想碰环境的(等正式版和成熟的桌面封装)。
值得持续盯的信号:v0.1.1之后正式版的节奏、插件生态里能不能沉淀出真正高频的工具、以及Qwen3.8后续版本对思考长度的控制。
dsh这波真正的意义,不在于它现在多好用,而在于"Agent的大脑第一次可以随便换"。对本地部署党来说,这才是等了很久的东西。