昨晚,AI 编程圈有点热闹。
晚上十点半前后,智谱正式揭晓:匿名霸榜 OpenRouter 一整周、被全网猜身份的 Ox Alpha,就是 GLM-5.3-Flash,随即发布并 MIT 协议开源。知乎几乎同一时间,阿里放出了 Qwen3.8-Flash。而 OpenRouter 周消耗榜上被"牛来"追着打的那个榜二,正是刚结束 56 天统治的 DeepSeek V4 Flash。
三款带"Flash"后缀的模型,挤进同一个时间窗口。这不是巧合——这轮价格战已经不是打"便宜聊天"的市场,而是瞄准了最烧钱的场景:Agent 编程。

先把三张牌摆上桌
GLM-5.3-Flash:总参数 320B,每 token 只激活 18B,1M 上下文,原生多模态,MIT 协议开源。这是 GLM-5 系第一个原生多模态的型号——意味着 GLM 用户终于能用自家模型干截图写代码这类活了。智谱给的定位很激进:AA(Artificial Analysis)综合智能指数 57 分,与 Claude Opus 4.8 持平。微博按官方口径,它的定价是 GLM-5.3 的 1/10,限时折扣内 1/20,只有 Opus 4.8 的 1/40。哔哩哔哩具体价格分两个口径。
价格:Z.ai 国际站输入 $0.15、输出 $0.50 每百万 token,缓存命中 $0.03。微博国内 BigModel 牌价输入 ¥0.8、输出 ¥2.8,限时五折后是 ¥0.4 / ¥1.4,缓存命中 ¥0.115。哔哩哔哩

Qwen3.8-Flash:多模态 MoE,主模型参数 125B,另有 51B N-gram Embedding,每 token 激活只有 6B——三家里激活参数最小,训练成本相比 Qwen3.7-Plus 骤降近 90%。微博牌价输入 ¥1、输出 ¥3 每百万 token,另有一个更高规格的 Qwen3.8-Flash-Next 版本。
DeepSeek V4 Flash:霸榜最久的一个。有 UP 主整理了三家的国内 API 牌价:空闲时段输入 ¥1.5、输出 ¥4.5,高峰翻倍,但缓存命中输入只要 ¥0.05。哔哩哔哩缓存这一项,比上面两家便宜一个量级。
三家的牌价看起来都省钱。但这轮 Flash 战的第一个教训恰恰是:牌价只是入场券。
牌价和真实成本之间的三个差异
第一个差异:缓存——命中率与保存期。
Agent 工作流里成本大头不是新输入,而是反复命中的前缀缓存。GLM 的缓存牌价最低(折后 ¥0.115),但智谱官方视频下一条高赞评论直接点破:编程的成本大头是缓存,而且 GLM 的命中率还更低,同样的任务 DeepSeek 能用 98%,GLM 只有 95% 不到。哔哩哔哩跟帖里有人把账算得更细:DS 的缓存能保存几个小时到一天,睡一觉起来继续命中——真正便宜的不止是单价。这是用户单方面的实测,不能当严格结论,但它指向一个事实:缓存牌价 × 命中率 × 保存期,三者相乘才是真实成本。只盯单价那一栏,会被骗。
第二个差异:输出冗长度。
Agent 时代,输出 token 才是烧钱主力。知乎有答主提醒:GLM-5.3-Flash 的输出看起来非常冗长,实际使用成本会比预想的高。知乎官方视频评论区也有人直接贴出账单:直连 API、命中率 99%,十分钟烧掉三块钱。哔哩哔哩通义那边则有一位 UP 主实测称 Qwen3.8-Flash 比 GLM-5.3-Flash 更便宜也更快,但该视频样本不大且标注为 AI 生成,仅供参考。
第三个差异:高峰时段。
DS 有高峰时段翻倍的机制;GLM Coding Plan 则是非高峰调用只消耗一半积分,周末全天算非高峰。知乎如果你习惯夜里挂机跑长任务,这个差异比任何单价差异都大。
跑分覆盖不了你的场景
官方跑分方面,CodeBench 全面超过 GLM-5.2、追平 Opus 4.8。微博第三方评测 DeepSWE v1.1 的编程 Agent 实测里,匿名期的 Ox Alpha Pass@1 拿到 80%,比现款旗舰 GLM-5.3 的 66.9%、Claude Fable 5 的 65%、GPT-5.6 Sol 的 52% 都高出一截。知乎

匿名那一周,OpenRouter 单周消耗 23.2 万亿 token:榜二 DeepSeek V4 Flash 只有 11.6T,Ox Alpha 是它的整整两倍;GPT-5.6 Luna 不到五分之一。知乎顺带一提,匿名期 OpenCode 和 OpenRouter 上的免费测试请求流量,全部由国产芯片提供算力支持。微博OpenCode 上的更替更直接:ox-alpha 以 44T 登顶,曾经的霸主 deepseek-v4-flash 周环比暴跌 76%,DeepSeek 连续 56 天的霸榜纪录就此终结;平台数据还显示,OpenCode 全平台 96% 的输入 token 走缓存,Ox Alpha 自身缓存命中率 93%,在所有样本量足够的模型里,GLM-5.3 的用户留存率高达 79.1%,全平台第一。

但真实用户这两天摸出来的手感更具体:
有编程区 UP 主实测后的整体感受是:以 18B 激活规模来看已经不错,后端表现扎实,前端和深度推理差点意思。哔哩哔哩
有开发者踩了时区坑:已经告知要用服务器的 UTC 时区,模型却按 Mac 的北京时间改代码,差点出事故。哔哩哔哩
有人专门拿它写小游戏,修了一轮鼠标还是无法控制瞄准,最后的结论是可能不太适合做游戏。哔哩哔哩
也有拿"牛来"干活几天的媒体行业用户说,自己更喜欢 flash 多一些,没觉得比 5.3 差。
把这些拼起来,图景是:GLM-5.3-Flash 的上限有跑分和近 70 万亿 token 的真实流量验证,但体验下限取决于你的场景。通义用 6B 激活换极致速度和低成本,适合高频短任务;DeepSeek 则靠缓存机制和长上下文口碑,仍牢牢占住已有工作流的用户——评论区甚至有人替它站台:要是真到了长上下文难 agent 的用途,还得是你 DS 叔叔。哔哩哔哩
按场景的选择建议
主力场景是 Coding Agent(ZCode、Claude Code、OpenCode 等)且多模态需求多:GLM-5.3-Flash 目前是最完整的选择。Coding Plan 有 Lite/Pro/Max 三档,其中 Lite 档周额度大概 1.4 亿 token,价格还是比较贵。知乎非高峰半价、周末全天非高峰。唯一要盯的是输出冗长,prompt 里限好字数、配合缓存用。
高频短任务、批处理、对速度和成本都敏感:Qwen3.8-Flash 值得试。6B 激活,响应延迟有优势,¥1/¥3 的价格没有折扣套路。
已有 DS 工作流、长上下文缓存命中需求大:不急着迁。DS V4 Flash 的缓存保存期是真实优势,避开高峰时段涨价即可。需要视觉能力的话,注意 DS 的视觉版本还带着 -Exp 后缀,而 GLM-5.3-Flash 和 Qwen3.8-Flash 都已是原生多模态。
想先白嫖试水:OpenRouter / OpenCode 仍有试用渠道,但匿名期就有用户登录两天被限流,连 GitHub 账号都被封,而理由只是同时开了两个项目。哔哩哔哩别把工作流押在免费通道上。
值得继续盯的信号
GLM-5.3-Flash 限时五折的截止时间官方没有明说。国内站 ¥0.4/¥1.4 是促销价,到期前是迁移试跑的最佳窗口;
GLM-5.3 旗舰会不会跟着开源权重——社区期待很久了,开源之后本地部署的故事会完全改写;
DS V4 Flash 的 Vision 版本何时去掉 -Exp 转正;
Qwen3.8-Flash-Next 会不会放出完整跑分和开源权重;
MiniMax 还没出 Flash 牌,评论区追问它在哪发财,得到的回复是"和 Seedance 对线去了"。哔哩哔哩价格战里消费者不用急站队。
最后说一句。这轮 Flash 战真正让"前沿智能"变成了日用消费品,但记住:牌价只是入场券,真实成本藏在缓存命中率、输出冗长度和高峰时段里。好消息是三家都足够便宜,试跑一周的成本可能不如一杯咖啡。先试,再迁——这才是这轮价格战的正确节奏。