这周的开源圈,焦虑的是会员党
这周开源模型圈像过年。8 月 14 日阿里开源 Qwen3.8-27B,发布 48 小时冲上 Hugging Face 趋势榜第一,LM Studio 上线 38 分钟下载破万,Ollama 单渠道 5 天 36 万下载。知乎同一周,DeepSeek-V4-Flash 也顶着 MIT 协议来了,主打 1M 上下文和近乎地板价的推理成本。知乎
热闹背后是一笔很现实的账。大厂的 token 额度在缩水,钱没少花,用的人反而越来越焦虑。知乎于是所有人的问题都变成了同一个:这个免费的 27B,到底能不能让我把手里每月一两百块的 AI 会员退掉?

先把这模型是什么说清楚。Qwen3.8-27B 是 270 亿参数的原生多模态稠密模型,支持 262K 原生上下文,通过 YaRN 技术可以外推到 1M。知乎它由更大的旗舰 Qwen3.8-Max 蒸馏而来,把软件工程、Computer Use、长周期办公 Agent 能力压进了单张消费级显卡可以部署的尺寸,海外社区给它的称号相当直白——“本地版 Opus 4.6”。知乎
官方跑分先打对折,第三方榜单才说实话
官方成绩单确实吓人。SWE-bench Pro 61.7,旁边摆的参照物是 Claude Opus 4.6 Max 的 53.4,Terminal Bench 73.0,LiveCodeBench 90.3,官方口径整体能力超过自家上一代付费模型 Qwen3.7-Plus。知乎

但这分数怎么听,得先讲清楚。截至 2026 年 8 月中旬,没有任何独立实验室复现过官方那张表的质量分数;而且官方表用的是定制 harness,在自己精修过的题目集上重跑自家模型,引用的却是对方标准题目集上的分数——这不是同一把尺。知乎把官方表放大看,形状也很清楚:agentic coding 和视觉操作赢了,terminal 自主性、repo 级推理、深度知识是输的。

第三方尺子更接近真实水位。Artificial Analysis 给出 Intelligence Index 52,追平 GPT-5.6 Luna 满血档,Agentic Index 51,超过 Claude Opus 4.8,但离榜首还有看得见的距离。知乎目前唯一设计严谨的公开同题对照里,上一代 27B 的本地量化版对上 Claude Opus 4.7:本地模型纯计算反而更快,但覆盖率差得多,需要人推 7 次,Claude 只要 1 次。知乎注意测的是 3.6 的量化版,3.8 的最大改进恰恰在自主性,但"要不要人一直盯着"这个差距,今天还抹不平。
结论不复杂:日常编程和 agent 任务,它跟云端旗舰的差距已经小到要刻意分辨才感觉得出来;真正复杂的长推理任务,差距还在。
你的电脑跑得动吗,先看显存档位
最现实的问题:你的机器跑得动吗?先记一条硬规则——这是稠密模型,每生成一个 token,全部 270 亿参数都要参与计算,所以整个模型必须全部放进显存,少一层都不行,往内存 offload 一层,生成速度直接砍掉六成。知乎
16GB 卡上 4-bit 的权重根本塞不下,只能上 3-bit。5070 Ti 16GB 的实测说得直白:在这张卡上,量化不是"3-bit 还是 4-bit"的取舍,而是"3-bit 还是没有"。知乎

按显存档位对号入座,社区这一周的实测锚点大概是这个样子。8GB 显存基本出局,评论区最常见的一句话是"8g显存只能默默看着"。哔哩哔哩16GB 卡跑 3-bit(约 17GB 文件)能干活,5070 Ti 实测聊天 80 tok/s、agent 任务能到 113 tok/s。
24GB 档(3090/4090)舒服很多,有人双 3090 张量并行跑 Q8,128K 上下文开 MTP,40+ t/s。哔哩哔哩32GB 往上可以开始考虑无量化,评论区有人说本地两张 5090 就能部署无量化版本,“看测评的话,综合能力也能和第一梯队的大模型比划一下”。哔哩哔哩
Mac 党单独说。速度锚点:M4 Max 跑 MLX 4bit 大约 23 tok/s,M5 Max 优化过的 4bit 加 MTP 能到 50-60 tok/s,RTX 5090 开 MTP 甚至能冲到 90-120 tok/s,入门档 Mac 聊天够用,跑长任务会嫌慢。知乎16GB 统一内存的 Mac 就比较勉强,有用户直言"我的Mac仅仅只有16g的运行内存,想流畅运行难度太大"。小红书
还有两个容易被忽略的变量。一个是 MTP:模型内置多 token 预测,开与不开速度差接近一倍,所以看到别人晒速度,先问一句开没开。另一个是门槛还在继续降,这周已经有人用 7599 元的整机跑到 40 t/s,还特意强调无需 Linux。哔哩哔哩
早期用户踩过的坑,比跑分值钱
第一周最集中的吐槽不是质量,是过度思考。这模型默认最高推理档 xhigh,Simon Willison 让它画一只骑自行车的鹈鹕,花了 21 分钟、22,276 个推理 token,才产出 3,223 token 的正式输出。Simon Willison 个人博客他对这个默认档位毫不客气,直言这是个荒唐的默认值,尤其不适合消费级硬件。知乎

那这张图值得等 21 分钟吗?Simon 的答案是绝对不值。Simon Willison 个人博客把推理关掉,速度快了近 9 倍,但车架形状变差、脚没踩踏板、没握车把,质量肉眼可见地下降。知乎所以正确姿势不是二选一:简单任务关推理,复杂任务开推理但盯紧时间。

第二个坑是 token 消耗。同一类任务,它的平均消耗几乎是上一代 3.6 的三倍,有个任务想了 7 分多钟、烧了三万一千多个 token,3.6 一分半钟七千多个就交卷,已经有人实测完默默换回了 3.6。知乎本地跑烧的是自家的电不心疼,打算走 API 按量计费的,这笔账必须先算。
第三个坑是知识截止。问它训练数据到什么时候,它自己答 2026 年,一追问 2024 年之后的具体事就露馅。知乎有人拿冷门知识当试纸,结论是 gemma 4 31b 确定能过的题,qwen3.8 27b 是过不了的。知乎需要"最近发生了什么"的问题,别指望它。
第四个坑藏在长任务里。agent 每干一轮活,都要把前面的上下文从头重读一遍,上下文堆到几万字之后,每一轮开工前的等待会明显变长,这时候瓶颈是内存带宽,不是 tok/s。知乎
该不该退会员:先算账,再分流
回到开头的问题。我的答案是:先别退,但可以开始分流。这一周最客观的实测结论只有八个字——建议是分流,不是取代:如果你的活儿是规格明确、有测试可以验收的 coding 任务,这套组合现在就能进生产流程;如果是需求模糊、需要判断力、要跑三小时不看的长任务,跟 Claude 的差距依然真实,而且不只是分数差距,是"要不要人一直盯着"的差距。知乎
账是这么算的。云端会员每月固定支出,额度还在缩水;Qwen3.8-27B 本身免费,成本全在硬件上——已经有 16GB 以上显卡的人,边际成本约等于电费。没硬件、活儿也不重的,先别急着买卡,今年多了一条低价 API 的路:MIT 协议的 DeepSeek-V4-Flash,百万 token 输入 0.03 美元,比 Claude 便宜 100 倍。知乎本地模型扛高频轻任务,低价 API 兜底,云端会员只留给最难的活,两条腿走路比一刀切退订稳。
还有一个视角值得听:别再只盯着 AI 订阅费,真正该算的是它能不能放大你的时间和产出。哔哩哔哩会员费买来的是真实产出就不贵,免费模型让你盯三小时也不便宜。
对号入座:手里已有 16GB 以上显存、主要活儿是写代码、跑脚本、处理文档,且能接受偶尔盯一眼的,现在就可以把一部分工作流搬过来。8GB 显存的、只有 16GB 统一内存的 Mac 用户、天天需要长程深度推理的、以及要为一台新机器花一万多才能"省下会员费"的,都建议再等等。
今天替代不了生产主力,但里程碑到了
最后给判断。Qwen3.8-27B 现在还替代不了生产主力,真正做项目,深度用户还是会打开云端,但在 token 越来越不够用的时代,本地模型第一次摸到了"能用"的门槛。知乎它的定位也被说得相当准:不是最强的开源模型,而是能塞进一张卡的最强模型。知乎
接下来值得盯三个信号。一是第三方复现能不能追上官方口径,接下来几周独立榜单与官方分的差距怎么变,决定这波热度里有多少是真的;二是 MTP 和量化生态的成熟度,16GB 卡还能不能再榨出速度,决定多少人真的上得起车;三是硬件价格,24GB 二手卡和大显存国产卡什么时候到甜点价,"退会员"这笔账就什么时候翻过来。
今天别退会员,但今天可以开始,把一部分活儿搬回家。