八月这波本地部署潮比往年来得猛。8月17日零点,DeepSeek新价格正式生效,高峰时段被吐槽"根本用不起"。知乎
同一周,阿里开源了Qwen3.8-27B。知乎社区魔改的GGUF版本也几乎同步冒了出来。量化版本怎么选,前面已经有文章掰扯透了——翻过"劝退区"的评论就知道,相当一部分骂"没用"的,其实是量化版本选错了。这篇往后再走一步:模型装好、加载成功之后,如果你还是觉得它比演示视频里笨一截,先别急着换模型,更别急着卸载。"能跑"和"好用"之间隔着一排开关,大多数人一个都没碰过。
梳理了知乎几篇实测、B站一条91条评论的视频评论区,还有Simon Willison的测试记录,浓缩成下面7个开关,按收益从大到小排。
开关一:思考强度,收益最大的一个开关
Qwen3.8-27B装好后最容易踩的第一个坑,是它的默认值:Qwen的文档写得很清楚,这个模型默认使用xhigh推理强度。知乎Simon Willison让它画一只骑自行车的鹈鹕(SVG),足足跑了21分钟:光推理就用掉22,276个token,最后又输出3,223个token。Simon Willison博客

随后关掉推理,用同一条提示词再跑一次,输出3,715个token,只用了137秒,两分多钟。知乎

21分钟对2分钟,这不是快慢问题,是能不能用的问题。而且这种"过度思考"极难甩掉,B站评论区有人想动态开关"雷霆大思考",写进设置里都不起作用。哔哩哔哩
但也不能一刀切全关。Willison还测了视觉边界框标注任务:关掉推理后,模型写的工具几乎能跑,却没能一次成功。Simon Willison博客速度换来的,是推理类任务的出错率。
有没有中间档?有一组探索性测试可以参考:hankin用15道题做配对(GSM8K、GPQA、AIME各5道,每题分别跑xhigh和medium),Medium的成本不到xhigh一半,准确率反而更高。样本很小,作者自己强调结论不该推广,但方向与社区直觉一致——过度思考会在简单问题上钻牛角尖,把成本和时延都烧掉。知乎
按场景给个粗建议:
闲聊、简单问答:直接关思考或开low,速度立竿见影;
写文案、写代码:medium起步,不满意再往上加;
Agent类多步任务:开,但盯着它有没有"想太多"——一步该过的卡好几分钟,就是信号。
开关二:上下文长度,显存爆炸的第一嫌疑人
Unsloth官方的建议是从32K起步,逐级往上加:第一次统一从32K开始,模型、速度和内存都正常了,再往64K、128K加。知乎上下文不是免费的,KV缓存随上下文长度线性膨胀,吃的全是显存。
B站评论区有人给了实测上限:5060 Ti 16G在Windows下,系统显示占掉一部分显存后,上下文实际依然是64-72k的上限。哔哩哔哩16G卡在Windows下爆显存,很多时候不是模型问题,是物理上限。
上下文长度还决定你等第一句话要多久。预填充速度大概在1000 tokens/秒的量级,一次塞64K上下文,首字等接近一分钟很正常;而前缀缓存的收益被严重低估——同一份长文档反复提问,首token时间从22.4秒降到0.56秒。长系统提示词、重复会话的场景,这个一定要开。知乎

另外给"256K上下文"的营销数字泼盆冷水:Q4量化下,长上下文的误差会累积,评论区的态度很直接——都Q4了,就不要纠结能不能极限卡到256K上下文。哔哩哔哩日常32-64K,够用。
开关三:KV缓存量化,评论区吵得最凶的一个
这个开关是评论区的交火最前线。一边原话很直接:“q4kv严重降智”。哔哩哔哩
另一边给出了完全相反的结论:“3090跑q4量化下的256k上下文还是很轻松的,kvcache可以q4量化”。哔哩哔哩
两边可能都没说谎——他们说的不是同一张卡、同一个编译版本、同一种任务。KV量化在有的配置下质量损失明显,有的配置下几乎无感,编译版本差异还会进一步放大分歧。
建议很简单:显存够用就别开,把智力稳稳拿在手里;显存紧张非开不可,拿你自己真实跑的任务做A/B,别拿别人的结论当自己的依据。
开关四:引擎,换个引擎等于换半张卡
知乎一位Intel核显玩家的踩坑记录很说明问题:同一个Gemma 4B级小模型,Ollama跑约11.5 tokens/秒,换llama.cpp的Vulkan后端约22 tokens/秒,速度能差2倍——而他只是换了个引擎。知乎

N卡用户也别觉得跟自己没关系。B站评论区有人发现,LM Studio跑16G显存、Q4量化、64K上下文只有12 tokens/秒,跟帖里马上有人支招:换Unsloth Desktop会快一些。哔哩哔哩
按场景粗排一下:
Windows + N卡,图省事:LM Studio、Unsloth Desktop都行,想榨性能就两个都测;
核显、A卡:优先llama.cpp的Vulkan后端;
要对外提供服务、多人共用:上vLLM。
开关五:MTP版,不是所有人都快
带MTP(多token预测/投机解码)的社区魔改GGUF版本最近很热。评论区有人日用IQ3_XXS版平均47 tokens/秒,换到IQ4-XS-MTP魔改版后涨到平均53 tokens/秒。哔哩哔哩3090上跑MTP版,普通聊天提示词下约133 tokens/秒。知乎
但核显不吃这套。Intel核显实测,26B模型不开MTP是25.8 tokens/秒,开了反而掉到20.8 tokens/秒,本想提速,实测反而拖慢。知乎另外MTP版文件更大、更占显存。这个开关属于独显显存宽裕的人,核显用户直接跳过。
开关六:采样参数,先按官方推荐来
temperature、top_p、top_k这组参数不用自己发明。Qwen3.8给了官方推荐值,非思考模式的推荐参数是 temperature=0.7、top_p=0.80、top_k=20、presence_penalty=1.5,先照官方跑,其他开关都查完还有问题再动它。知乎参数带来的"随机感"和配置带来的"笨"是两回事,混在一起排查,只会越查越乱。
开关七:Windows杂项,小但要命
两个Windows特供坑:
一是桌面吃显存。Windows桌面本身占显存,16G卡上这几百兆就是生死线。对策:降分辨率、关掉吃硬件加速的后台应用,或者干脆上Linux/WSL。
二是长推理被系统强行打断。Windows下N卡驱动有TDR机制,单次计算太久会被判定卡死、强制复位,长上下文预填充很容易触发。解法是注册表两项:TdrDelay=30 + TdrLevel=0,改完重启生效。知乎不熟悉注册表的先备份。
调优顺序,以及谁根本不用调
最后给个调优顺序,按收益排的:思考强度 → 上下文长度 → 引擎 → KV缓存/MTP → 采样参数。每动一项,拿自己的任务测一轮前后差异——别人的实测是路标,不是你的答案,这篇也一样。

也有一类人完全不用焦虑:只是偶尔问问题、整理文档、又不碰隐私数据,那DeepSeek们涨价后的非峰时价格依然很低,涨价后一年多花的钱,可能不够一张3090的一半。知乎本地部署真正的甜区是三件事:重活、私事、自动化。
再留两个观察信号:Qwen3.8-27B的社区魔改GGUF版本几乎周更,Bucoid、jpetrina、QQZ2026几个作者的版本清单就在评论区挂着,现在跑出来的速度纪录,过两周可能就被改写,别急着下结论。哔哩哔哩
GLM-5.3 Flash也在八月底开源了,但321B的体量,消费级显卡基本无缘,不用等它。哔哩哔哩
本地模型感觉笨,多数时候不是模型的问题。开关就在那里,一个一个查。