最近刷 OpenRouter、OpenCode 的人,应该都见过那个叫 OxAlpha 的匿名模型:8月20日悄没声上线,没署名没官宣,调用全免费,结果不到一天就同时登顶两个平台的调用榜,顺手终结了 DeepSeek 在 OpenCode 上连续 56 天的霸榜。36氪中文社区借着档期电影《牛来》,给它起了个外号叫"牛来",全网猜了六天它爹妈是谁。微博
8月26日晚上谜底揭晓:智谱认领,真身是 GLM-5.3-Flash,当晚直接开源,MIT 协议。微博哔哩哔哩吃瓜到此结束,但对我们这些自己掏 token 钱跑 Coding Agent 的人来说,真正的事现在才开始——这头"牛"的定价是照着大动脉砍的,而限时半价 9月9日 24 点截止,满打满算只剩 9 天。迁不迁、怎么迁、什么时候迁,得先算明白账。
这头"牛"到底什么水平
先把硬参数摆出来:320B 总参数,每个 token 只激活 18B(5.6%),线性+稀疏混合注意力,100 万 token 上下文,GLM-5 系列第一个原生多模态(文本、图片、视频输入)。36氪匿名期间单日处理量峰值一度到数十万亿 token 级别,流量全部由 10 万张国产芯片承载。微博

性能口径上有几个可以参考的点:Artificial Analysis Intelligence Index 给了 57 分,高于 DeepSeek V4 Pro 正式版的 53 分。36氪智谱官方说部分口径可以对标 Claude Opus 4.8,而价格只有 Opus 4.8 的约 1/40(36氪报道口径)。微博Together AI 那份基于约 900 次 DeepSWE rollout 的报告更直接:GLM-5.3-Flash 的 pass@1 是 63.4%,完整版 GLM-5.3 是 69.0%,差 5.6 个百分点,但单次 rollout 成本 0.24 美元对 3.99 美元,差了约 16 倍。知乎

社区实测这两天已经刷屏。B站几条 2 万以上播放的实测视频,前端项目完成度、自主纠错能力普遍给出好评。哔哩哔哩"新晋性价比之王"的说法也不少。哔哩哔哩知乎有人让 Flash 和完整版写同一组 JavaScript 模块,各跑 9 次真实调用,Flash 账单只有完整版的约 1/12,严格交付通过率反而 8 比 9 领先。知乎
但有两句话必须说在前面。第一,目前传播的这些高分,相当一部分是厂商口径和社区宣称,系统性第三方验证还没跟上,建议先当"待复核"处理。第二,同一批实测也暴露了两个短板:Flash 单次响应约 28 秒,比完整版慢约 1.9 倍;输出容易夹带解释性文字,在人看没问题,在自动化流水线里会破坏"输出契约"——这也是它严格测试里仅有的几次失败的真正原因。知乎
这笔账,得把"缓存命中"算进去
价格先列清楚(每百万 token,人民币):
模型 | 输入(未命中缓存) | 输出 | 缓存命中输入 | 备注 |
|---|---|---|---|---|
GLM-5.3-Flash | 0.8 元 | 2.8 元 | 0.23 元 | 半价期至9月9日:0.4 / 1.4 / 0.115 元 |
DeepSeek V4 Flash | 峰谷计价 | 峰时较原价涨4.71倍 | 峰时0.1元 / 谷时0.05元 | 8月17日执行新定价 |
Qwen3.8-Flash | 0.8 元 | 2.7 元 | 官方未重点披露 | 8月27日阿里云再下调 |

看着是不是 GLM 全面比 DeepSeek 便宜?坑就在这张表的第三列。
GLM-5.3-Flash 的标准缓存命中价 0.23 元,比 DeepSeek 峰时 0.1 元贵 1.3 倍,是谷时 0.05 元的 4.6 倍——哪怕半价期,0.115 元也比 DeepSeek 峰时贵。36氪而 Coding Agent 恰恰是缓存命中率最高的场景:同一套系统提示词、工具定义、代码历史被反复塞进上下文,一个任务里九成以上的输入 token 往往都是缓存命中。
36氪算过一笔很典型的账:一个累计输入 50 万 token、99% 命中缓存、输出 1 万 token 的任务,半价结束后用 GLM-5.3-Flash 大约 0.146 元;用 DeepSeek V4 Flash,谷时约 0.077 元、峰时约 0.155 元。36氪也就是说,同一个任务,谷时跑,GLM 比 DeepSeek 贵约九成;只有峰时跑才便宜,而且不到 6%。已经有开发者实测后反馈:综合用下来比 DeepSeek 谷时贵,只比峰时便宜。
再补两个容易被忽略的点:有用户观察到 Flash 生成 token 偏多,单价低不等于总账单同比例下降;它的强项在编程和 Agent 任务,知识问答相对偏弱,别指望一个模型全包。微博
三类人,三种动作
被 DeepSeek 峰时价格挤到的人,值得迁。 你主要在工作日白天跑任务,8月17日那波峰谷定价对你伤害最大。36氪现在半价窗口是真优惠,先把模型接上,用自己真实任务测一周,同时记下账单里缓存命中的占比,9月10日恢复原价后自然知道去留。
谷时夜跑党,不用急着迁。 你的账单大头是缓存命中,而 GLM 恢复原价后的缓存价对你不划算,大概率比现在贵。可以等两个信号再回头看:智谱会不会在半价结束后跟进调整缓存价,以及 Qwen3.8-Flash 后续补齐缓存命中价格后的对比。
准备进智谱生态的会员型用户,先看前科再掏钱。 今年7月智谱会员刚大幅涨价(Max 月卡从 469 元涨到 1078 元),8月又有一批接 Claude Code 的用户因为多设备、IP 异常被封号,客服口径是"以实际情况为准",有用户投诉到 12315 也没能解封。36氪如果你要迁,优先 API 按量付费而不是会员套餐,一账号一设备,别拼单、别用中转站共享额度——这次"牛来"的 API 价格够便宜,没必要再为套餐赌一把。
接入方式和测试建议
渠道都现成:智谱开放平台 API 直接可用,火山方舟 8月31 日也已上架,OpenRouter 和 OpenCode 都能调(注意匿名期免费额度已结束,现在是正常计费)。微博Claude Code、Codex 用户改 base URL 和模型名,或者走 FreeClaudeCode 这类开源代理层切换,不用换掉原来的工作流。
测试方法给一个具体版本:挑你自己项目里最常用的 3 个小任务(真实模块,不是算法题),各跑 3 次,只记三个数——账单、耗时、交付通过率。前面那个知乎实验有个重要提醒:Flash 的"失败"里有相当一部分是输出格式问题,加一步代码块提取就能从 8/9 拉到 9/9。所以测出失败先别急着下"不行"的结论,分清楚是格式契约问题还是能力问题,前者改流水线就能解决,后者才需要换模型。
接下来值得盯什么
一是 9月10日恢复原价后的第一周:会不会重演 DeepSeek 涨价后用量腰斩的剧本,智谱会不会续优惠。36氪
二是 Flash 三国杀的后手:同夜发布的 Qwen3.8-Flash(125B 总参、6B 激活,现价 0.8/2.7 元)、8月28日开源的腾讯混元 Hy4 Preview、还在内测的 Google Gemini 3.8 Flash,9 月这个价位段大概率还有新变量。微博知乎
三是成绩复核:AA 和 DeepSWE 的分数有没有更多独立验证;上线头两天社区反馈过性能波动,智谱 8月29日 做了修复,后续版本更新后留意会不会反复。哔哩哔哩

四是智谱自己:市值从 6 月高点已经跌掉约一半,会员定价争议还没散,"便宜大碗"这条能走多远,值得持续观察而不是无脑冲。36氪
一句话收尾:GLM-5.3-Flash 是真好,半价窗口也是真的,但"便宜"是有条件的——你任务的缓存命中率,决定你站在账单的哪一边。剩下 9 天,能测的赶紧测;测的时候把缓存命中的数字记下来,9月10日那天,你就知道自己该留还是该走了。