牛来掉马甲的故事已经刷屏,但对真正准备上车的人来说,问题在另一处:一个号称跑分对标 Opus 4.8、价格却只有零头的模型,真能当成便宜版 Opus 直接换进工作流吗?上线两天,社区攒下的实测样本已经够回答这个问题。答案不是斩杀爽文,而是一份分工表——有些活儿它干得比想象中扎实,有些活儿交出去,就是给自己埋雷。
8 月 26 日晚,智谱正式认领了匿名霸榜 OpenRouter 一周的 Ox Alpha,定名 GLM-5.3-Flash。这个没名字、没白皮书、没定价的匿名模型 8 月 20 日悄悄上线,6 天处理 42 万亿 Tokens,把 DeepSeek 都挤了下去,一度用量超它两倍。小红书揭晓当晚直接开源:320B 总参数只激活 18B,原生多模态,100 万 Token 上下文,MIT 许可证,标准 API 价每百万 Token 输入 0.15 美元、输出 0.50 美元,首发期还打五折。微博

纸面简历确实够硬。一篇流传很广的知乎选型文判断,两款新开源模型都达到了对标海外旗舰的水平,GLM-5.3-Flash 对上的正是 Opus 4.8。知乎也有人保持清醒:编程和 Agent 能力是否真接近 Claude Opus 4.8,智谱自测先当参考,等更多第三方实测再下结论。微博第一批上车的用户,果然把话题从跑分聊向了“到底能干什么活”。

三种可以放心交的活
第一,后端代码和测试类任务。这是实测口碑最集中的方向,有 UP 主跑完整套实测后的整体感受是:以 18B 激活规模来看已经不错,尤其后端表现比较扎实。哔哩哔哩注意,这类结论不是来自跑分表,而是真仓库、真测试用例跑出来的。
第二,多模态文书活。GLM 系列过去被社区调侃是“瞎子”,这次原生多模态总算补上了。一位开发者把模型接进自己的翻译工具试跑 20 页,OCR 加摘要提取加翻译,只花了 0.15 元,速度快,翻译质量感觉和 DeepSeek-V4-Flash 差不多。微博按首发半价算,截图转代码、文档阅读这类流程可以压到极低成本跑。
第三,峰时备胎。知乎那篇算账长文给过一个很直白的太长不读版:在编程任务中,不论何时,谷时 DS 仍然更具性价比,GLM 半价期间适合做 DS 峰时的替代。知乎所以不必急着整个工作流迁移,先在 DeepSeek 又贵又堵的时段拿它顶上,跑顺了再说。
三种千万别交的活
第一,时区、编码这类工程约定。一位开发者踩了个差点出事故的坑:提示词里已经写明要用服务器的 UTC 时区,模型却把代码按他 Mac 的北京时间改造了一遍。哔哩哔哩这类 bug 本地测试能过、上线才炸,时区、编码、命名这类硬约定,人必须逐行复查。
第二,前端细活和深度推理。前面那条实测的后半句同样值得记住:以 18B 激活规模来看已经不错,但前端和深度推理差点意思。多模态的优势是它终于能“看见”你的界面截图,可看得见和做得细是两回事——原型级页面没问题,像素级还原别指望。
第三,可玩的小游戏。有实测让它做恐怖版植物大战僵尸,修了一轮鼠标还是无法控制瞄准,博主直言可能 GLM5.3flash 不太适合做游戏。哔哩哔哩样本只有一个,不能推广,但指望“一句话出游戏直接上线”的人,它大概率不是圆梦的那款。
两个认知差,比分工表更重要
第一个认知差:跑分里的“便宜”,和你生产环境的“便宜”不是一个环境。Artificial Analysis 的测试里没有真实项目的缓存命中,模型的低价在那里会被放大;反过来,在 AA 的测评数据里,GLM-5.3-Flash 每任务的 Token 消耗,在 GLM-5.3、DSFlash、DSPro 三款里恰恰是最高的。知乎所以别拿牌价直接估成本:国内牌价每百万 token 输入 0.8 元、输出 2.8 元,限时五折降到 0.4 元、1.4 元,命中缓存 0.115 元。哔哩哔哩真实成本要按自己任务的缓存命中率和输出长度算一遍。
第二个认知差:“斩杀 DeepSeek”只成立一半。那篇算账文自己提醒:不要被官网价格迷惑,GLM 5.3 Flash 能否斩杀 DeepSeek V4 Flash,还得看缓存命中怎么样。知乎按文中的公式推,两周后回归原价,它只适合在峰时顶替 DSPro,两者更像峰谷互补,而不是谁替代谁。

不写代码也能上车
牛来已经上了智谱清言,不写代码的人也有入口:网页版的免费对话默认是快速,需要耗费积分的 AgentMore 对话则默认是极致。小红书想零成本体验多模态对话和文档处理,这是目前最快的路。
三个值得盯的下一步
第一,明早(8 月 28 日)十点,纯文本旗舰 GLM-5.3 开放权重,最容易踩的坑是把已经能下载的 Flash 当成它:两个名字只差一个后缀,前者是纯文本旗舰,后者是原生多模态、低成本的独立产品线。知乎两者压根不是量化版或轻量后缀的关系,下错模型最直接的后果,是官方分数复现不出来,时间全耗在显存和部署脚本上。

第二,五折窗口只有发布后两周。想迁移任务的,这个窗口值得拿真实任务跑一轮,测出自己的缓存命中率和真实成本数据,两周后回归原价,留不留就看这份数据。
第三,匿名测试期间,这个模型的所有推理流量都跑在国产 AI 芯片上。微博国产算力第一次大规模承接这种级别的真实流量,长期稳定性本身就值得持续观察。
一句话收尾:GLM-5.3-Flash 不是便宜版 Opus,而是一个分工明确的专才。简历是真的,第一批用户踩的坑也是真的。趁五折窗口还没关,把它能干的活交出去,把它干不了的活留给别的模型——这头牛,是真能干活的。