昨晚国产大模型圈集体熬了个夜,而且不是一家。
8月26日晚上,智谱把一个悬念了一周的答案正式揭晓:在 OpenCode、OpenRouter 上匿名霸榜的那个"Ox Alpha"——中文社区按读音给它起的外号叫"牛来"(Ox 是牛,Alpha 读起来像"来")——就是 GLM-5.3-Flash,当天发布、当天开源。知乎同一晚,阿里也发布并开源了 Qwen3.8-Flash,首发接入千问办公。36氪
两家同夜开源两款 Flash 模型,定价都奔着"便宜"去,这个时间点不是巧合。背景是:八月中旬 DeepSeek 改了峰谷计价,一批中转套餐和订阅用户的账单跟着上涨。知乎这一波,明摆着是冲着接住迁移用户来的。
先说"牛来"到底什么来头。简单讲:320B 总参数、18B 激活的 MoE 架构,GLM-5 系列第一个原生多模态模型(能看图、看屏幕),上下文 100 万+,算力全部跑在国产芯片集群上。36氪它从 8 月 20 日起以 Ox Alpha 的匿名身份在平台上免费开放测试。小红书七天窗口(截至 8 月 25 日)处理了约 23.2 万亿 token,是第二名 DeepSeek-V4-Flash 的两倍多;OpenCode 那边另一个口径是六天约 42 万亿。知乎没预热没投放,全靠开发者真刀真枪跑出来的热度。顺便澄清一句:最近还有一部出圈的 AI 动画电影也叫《牛来》,那是另一回事,模型这个外号纯粹来自 Ox Alpha 的读音。

阿里这边,Qwen3.8-Flash 走的是极致效率路线:125B 主模型加 51B 的 N-gram Embedding,推理时每 token 只激活 6B,官方说训练成本压到上一代 Qwen3.7-Plus 的九分之一。微博API 定价输入 1 元/百万 token、输出 3 元/百万 token,同样是发布即开源。36氪
智谱官方的口径是:GLM-5.3-Flash 全面超越参数量高出一倍的 GLM-5.2,定价只有后者的十分之一;部分能力对齐 Claude Opus 4.8,价格只有其四十分之一。知乎
注意,这两个"分数"是这次发布里最容易被误解的地方,先把三个误会说清楚。
误会一:"1/40 的价格"不是单价除以 40
智谱说的"只有 Claude Opus 4.8 的 1/40",指的是完成同一任务的综合成本,不是拿 token 单价直接除 40。知乎单价摆出来,差距没那么大——各家现行公开定价(元/百万 token):
GLM-5.3-Flash 标准价:缓存命中输入 0.23 / 未命中 0.8 / 输出 2.8
GLM-5.3-Flash 限时 5 折:0.115 / 0.4 / 1.4
Qwen3.8-Flash:输入 1 / 输出 3(未单列缓存价)
DeepSeek 高峰:命中 0.10 / 未命中 3.0 / 输出 9.0
DeepSeek 空闲:命中 0.05 / 未命中 1.5 / 输出 4.5
看出门道了吗?DeepSeek 的缓存命中输入其实比 GLM 还便宜,它贵在未命中和输出;GLM 则是全天一个价,不分峰谷。
误会二:决定账单的不是换哪家模型,是命中率和时段
有知乎开发者拿自己 DeepSeek 的真实调用算了一笔账:低缓存命中率(约 76%)+高峰时段,规模放大到 1 亿 token,DeepSeek 要 328 元,GLM 5 折只要 54 元;但如果是高命中率(约 96%)+空闲时段,GLM 标准价(42.4 元)和 DeepSeek 空闲价(40.1 元)几乎打平。知乎
他的原话很直白:GLM 标准价并不比 DeepSeek 便宜多少,真正拉开差距的是限时 5 折;对账单影响最大的,是缓存命中率和调用时段,不是换哪家的模型。
真实用户的体感也在降温。一条 146 赞的知乎回答直言,体感和 v4f(DeepSeek-V4-Flash)差不多,价格优势没有到斩杀的地步,吐字速度还慢不少。知乎小红书上还有一条吐槽很扎眼:全网免费的时候一点不卡随便用,进入收费环节开始服务繁忙。小红书免费转收费的拥堵期,本身就是迁移要算进去的变量。当然也有觉得真香的:有人实测几小时,“充了 10 块钱都没花完”。小红书

误会三:Flash 不等于 GLM-5.3,别下错了
这条专门说给本地部署党:现在能下载的 GLM-5.3-Flash 是多模态低成本版;真正的文本旗舰 GLM-5.3,权重要到明天(8 月 28 日)上午 10 点才开放——ModelScope 预发布页写的是 2026-08-28T02:00 UTC,换算北京时间就是早 10 点,Hugging Face 上 zai-org/GLM-5.3 也挂着 Upcoming。知乎两个名字只差一个后缀,但一个主打多模态,一个主打复杂代码工程和长程 Agent 任务。把 Flash 当旗舰下回来,官方基准分数复现不出来,时间全花在显存和部署脚本上。
顺带给明天的开源泼半盆冷水:GLM-5.3 官方成绩单里,六项基准拿了两项全场最高,但也有没登顶的——DeepSWE 66.9 低于 Kimi K3 的 67.5,HLE w/ Tools 也低于两款闭源对手。知乎厂商口径是厂商口径,权重开放后能独立复跑才算数。

四条路线,先对号入座再动手
第一条,纯体验党。智谱放了一批 GLM Coding Plan 7 天体验卡,面向从未订阅过套餐的用户,每张 2000 积分,接下来一周每天限量 10000 张,零成本。知乎注意它是编程套餐,得配 Cline、OpenCode 这类编码工具用;不碰编码工具的话,这波可以先围观。
第二条,编码订阅党。有知乎用户按积分规则算过:智谱 Lite 套餐 118 元/月,对比 OpenCode 的 Go 套餐约 68 元(10 美元,首次半价已结束),月度可用调用量大致相当;错峰用得多选智谱更划算(非高峰积分按 50% 抵扣,高峰是工作日 14 点到 18 点),白天高峰重度用则 Go 套餐更稳。知乎这是用户估算,积分规则复杂,下单前以官方口径为准。
第三条,按量 API 党。缓存命中率不高、或者必须白天高峰用的,限时 5 折窗口确实值得抓;但"限时"两个字意味着随时可能收,这个月大模型定价变动有多频繁,大家都见识过了,别按 5 折价去做长期预算。
第四条,本地部署党。别急着下 Flash,等明早 10 点的 GLM-5.3 权重,先检查交付是否齐整(权重、许可证、模型卡、推理配置),再跑自己的任务。已有 Mac 用户实测 ox-alpha,文件大小约 90GB 量级,想本地跑 Flash 的可以照这个准备硬盘。小红书
最后三件事,值得留个心眼。一,23.2 万亿、42 万亿、"每天烧 100 万亿"这些数字口径不一,还有平台把匿名期两个不同统计混着吹,别全当真。二,千问的 1 元/3 元和 GLM 的 5 折,都是当下时点价——DeepSeek 涨价已经证明,这个行业的定价是按周变的。三,想拿开源模型商用,先看许可证,今年开源模型的商业条款整体在收紧。
接下来值得盯三个信号:5 折窗口什么时候结束;明早 10 点 GLM-5.3 权重是否按时到、交付是否完整;DeepSeek 会不会跟进动作。这三件事落地,"Flash 大战"到底是不是真划算,自然有答案。