昨晚刷小红书,刷到一条帖子叫"Qwen 3.8 27B 成为新的斩杀线",评论区两百多个赞、一百多条讨论。小红书差不多同一时间,有开发者发现,DeepSeek 官方价格页悄悄变成了两套价:V4 Flash 和 V4 Pro 都分出了峰时、谷时,谷时直接半价。知乎两件事单独看都是新闻,放在一起,就成了一个落在账单上的问题:当一个 27B 开源小模型的能力已经追到你正在付费的 API 旗舰,而 API 还开始分时段涨价,这云,还值不值得继续充?
今天把这笔账算清楚。先说结论:斩杀线是真的,但它不斩所有人;弃云之前,你得先看清三件事。
一、先看这个"只差 1 分"到底是什么
这周全网在传的数字是这个:Qwen3.8-27B 在 Artificial Analysis 智能指数上拿到 52 分,站上了第二梯队的守门位置,离参数量大约 60 倍于它的 DeepSeek V4 Pro 只差 1 分,把 V4 Flash、GLM 这一档甩在身后或打平。微博微博有微博博主忍不住吐槽:都到这个份上了,阿里在该 PR 的时候反而没声音。

但玩跑分的人都知道,综合分这东西,最诚实,也最骗人。
把这几天的第三方实测和架构拆解翻了一遍,这个模型的能力分布其实很不均匀:
强的地方是真强。 一个 27B,编码和 Agent 能力已经摸到旗舰区间——多方转述的官方口径里,它的代码 Agent 登顶了 SWE-bench Pro。哔哩哔哩有第三方架构分析视频实测后说,它在 Agent 任务上能压 Claude Opus 一头。哔哩哔哩B 站、小红书的实测里,夸得最多的也是前端生成、交互网页这类活。
弱的地方是真弱。 硬推理(HLE)离旗舰还差着 9 分。哔哩哔哩微博有用户实测直接吐槽创意写作"又拉完了";官方版的拒答也偏厚,想要它放开写点东西,经常碰壁。
它还爱"想太多"。 模型卡默认打开思考模式,小红书那条"Qwen3.8 想了 18 分钟,一个字没写"不是段子,是真事。小红书第三方基准审计也指出,官方自测数据和第三方验证之间存在差异。哔哩哔哩
所以这 1 分的含义是:如果你的 token 主要花在代码、Agent、工具调用和自动化流水线上,这 1 分约等于平手,斩杀线成立;如果你靠硬推理、创意写作、文案吃饭,这 1 分就是天堑,弃云等于自斩。
二、峰谷定价:先做那件零成本的事
很多人对"DeepSeek 涨价"的第一反应是换平台。但这次价格页真正想说的是:同一个请求,换个时间跑,价格能差一倍。
具体数字摆出来(缓存未命中价,美元/百万 token):V4 Flash 输入谷时 0.22、峰时 0.44,输出谷时 0.66、峰时 1.32;V4 Pro 输入谷时 0.66、峰时 1.32,输出谷时 1.98、峰时 3.96。峰时按 UTC 01:00—04:00、06:00—10:00 算,换算成北京时间就是 09:00—12:00 和 14:00—18:00——正好压在打工人白天最忙的两段。知乎

所以第一步不是弃云,是给任务分类:
第一,把任务分成"能等"和"不能等"。在线问答、实时 Agent 没法动,但批处理、离线评测、向量重建、日报生成、夜间回归这些,挪到谷时就是单价打五折;
第二,缓存键要稳定。失败重试别让同一批输入换个格式重算一遍,不然谷时省的钱会从缓存未命中的口子全漏回去;
第三,别把请求全堆到谷时。便宜时段堆出一座请求山,首 token 延迟和失败率会另外开一张账单。
这一步不用买卡、不用改架构,今晚就能做。做完你会知道自己手上有多少任务是"能等"的——这个比例,决定你后面走哪条路。
三、弃云的三条路,按姿势选
如果"能等"的比例很高,月 token 量又大,就该认真算自建这笔账了。Qwen3.8-27B 开源才四天,社区的实测数据已经码得很齐:
8GB 显存笔记本:能跑,思考、工具调用、视觉全可用,但 0.26 token/s,属于为爱发电。哔哩哔哩
魔改 2080Ti 22G:跑 IQ4_NL 量化,39.5 token/s,入门续杯档。
3090 24G:社区 vLLM 方案把两块嵌入矩阵量化成 int8,抠回 2.6GB 显存,并为单人和并发准备了两套启动方案。知乎实测单用户开 MTP 推测解码 82 token/s,64 路并发持续 417 token/s,分界点大约在 8 路并发。
5090 32G:量化后模型约 20GB,显存装下还有富余,速度起飞。小红书但注意,双路高精度 Q8 进程会卡死,只能退回 Q4。
RTX Pro 6000 这类专业卡:Q8_K_XL 跑出 45 token/s,显存占用 45G,想跑满 256K 上下文要 70G 左右。
对应三条路:
路线 A:留在云里,吃峰谷价。 适合在线实时任务占大头、月账单还没到肉疼的人。峰谷定价本身就是官方给的折扣,先把零成本的那部分吃掉再说。
路线 B:自建。 适合离线可延迟任务占大头、月 token 开销高、手里有卡或者不介意收二手卡的人。但要算总账:一次性硬件投入 + 电费 + 折腾的维护成本,对比每月账单。两个提醒:27B 开源之后,"显卡又要涨价了"已经不是玩笑话;也有人实测,花一天下载,结果比预期慢 8 倍。小红书买硬件之前,先租一天云卡把自己的业务跑一遍,是最便宜的试错。
路线 C:租算力或走聚合平台。 适合想要 token 自由、但不想养硬件的人。AutoDL 上租 5090 部署 27B 已经有现成实测案例。哔哩哔哩还有 OrcaRouter-Lite 这类开源路由项目可以免费在线试这个模型。哔哩哔哩先免费试,确认能力覆盖自己的场景,再决定掏不掏钱。
四、冷水也备好了
别把 26 万上下文当承诺。 模型卡写着 262K 原生上下文,但 3090 方案默认只建议开 150K——接近 19.5 万的实际上限时,一条超长请求就能吃掉整个缓存池;10 万 token 输入的预填充,首 token 还要等上约两分钟。
"想太多"有开关。 模型卡提供按请求关闭思考、控制历史思考保留的参数,简单任务记得关,省时间也省 token;低思考模式的社区配置已经有人整理好了。
无审查版要谨慎。 社区里 abliterated(剥离拒答)版本火得很。哔哩哔哩本地玩玩可以,别接进商用和对外的生产环境——这是合规红线,不是技术问题。
综合分不信就测子项。 AA 智能指数覆盖不了你的场景,就拿自己的真实 prompt 集先跑一轮。别人的斩杀线,可能是你的坑。
五、值得继续盯的信号
会不会有更多厂商跟进峰谷定价——如果变成行业惯例,"按时间调度任务"就是所有 API 用户的必修课。
27B 的衍生生态:开源两天下载破百万,社区贡献的量化版本超过 500 个。36氪Qwen 系衍生模型在 HuggingFace 上超过 15.1 万个、是 Meta 全家的两倍多。生态在跑,部署门槛每周都在降。
同一周 GLM5.3 的榜分涨了 21 分。哔哩哔哩斩杀线不会停在原地,真正该攥在手里的,是"先给任务分类、再决定钱花在哪"的方法。

最后一句话:模型的斩杀线斩在参数表上,你账单的斩杀线在自己的任务清单里。先把任务分成"能等"和"不能等",再决定走哪条路,比盯任何跑分都实在。