「牛来」掉马第5天:我把 GLM-5.3-Flash 的七个数字对了一遍账,免费期结束,先把欢呼收一收

源自17位全网作者

04:27

8月20日,OpenRouter 上冒出来一个匿名模型,只挂了一句"一家暂时保持匿名的第三方提供商"。微博 开发者们很快给它起了个中文名:牛来(OxAlpha,Ox 是牛,Alpha 是 α)。六天之后,智谱亲自认领:GLM-5.3-Flash,320B 总参数、激活 18B 的 MoE,GLM-5 系列第一个原生多模态,当晚开源权重。知乎 再往后几天,免费 3 亿 Token 的周末福利发放、回收,限时半价还挂着。

谜面揭完,剧情对看过热闹的人来说已经结束了。但对每天真的在 OpenRouter、Claude Code、ZCode 里轮模型干活的人来说,事情才刚开始:模型要不要换、什么时候换、换错了亏多少钱。我把这五天全网流传的七个关键数字逐个对了一遍账,哪些是实的,哪些得打折,哪些干脆是两笔账被说成了一笔。

第一个数字:一周 70 万亿 Token——这是两笔账被加成了一笔

掉马当天,中文媒体最爱用的数字是"一周 70 万亿 Token"。但账其实来自两个口径:OpenRouter 截至 8 月 25 日的七天窗口显示,Ox Alpha 处理了约 23.2 万亿 token,是第二名 DeepSeek-V4-Flash 约 11.6 万亿的两倍多;OpenCode 同期披露六天累计约 42 万亿 token。知乎 两个平台、两个时间窗,媒体顺手一加,就成了 70 万亿。

这不是造假,但混用口径会把结论带偏。真正值得记的反而是另一件事:牛来上线即登顶,创下双平台调用量新高,把 DeepSeek 在 OpenCode 上长达 56 天的垄断终结了。知乎 一个匿名模型能在"白嫖党"用脚投票的平台登顶六天,说明它的规格确实掐中了当下最饥渴的需求:104.86 万 token 上下文、单次最多输出 13.1 万、能读文本图片和视频,全是奔着长周期 Agent 和视觉 coding 去的。微博

第二个、第三个数字:AA 指数 57 分与"1/40 价格"——分是真的,除法不是你想的那个除法

Artificial Analysis 智能指数上,GLM-5.3-Flash 拿了 57 分,与 Claude Opus 4.8 同分。知乎 官方口径说价格是后者的约 1/40,但注意这个除法的口径:智谱说的是"完成同一任务的综合成本",不是 token 单价除以 40,别拿它直接比单价或写进采购 PPT。知乎

「牛来」掉马第5天:我把 GLM-5.3-Flash 的七个数字对了一遍账,免费期结束,先把欢呼收一收

同分不等于同手感。AA 那张帕累托图(上图)里 GLM 标在 $0.045/57pts 的位置确实漂亮,但跑分和日常写代码之间,还隔着一个巨大的变量——这个放到第六段算。

第四个数字:“惊艳"还是"复古”——两个阵营都没说谎

社区评价这两天的分裂程度,比模型本身有意思。一派是白嫖期的高赞:ox-alpha 断档领先,白嫖的这几天我真的是嗨到不行。知乎 另一派是认领后的实测:使用下来 GLM5.3Flash 是真的傻,代码一遍过概率很低,复古感很重,完全没有 GLM-5.2 发布时那种惊艳的感觉。知乎 甚至掉马前的匿名期,就已经有人晒出它在 OpenRouter 上"无限循环都搞出来了"的翻车截图。微博

「牛来」掉马第5天:我把 GLM-5.3-Flash 的七个数字对了一遍账,免费期结束,先把欢呼收一收

两派吵的不是同一个东西。我梳理下来至少三个错位。一是场景错位:它的成绩在"几十分钟长跑不掉线的托付式 Agent 任务",翻车点集中在"简单代码一遍过"和幻觉,恰好是 Vibe Coder 们最日常的体感项。二是名字效应:中文社区流传最广的一句话是"蒙上名字,大家才肯投它第一",匿名期用户没有品牌预期,认领后智谱历史上"高峰期不稳定"的旧账立刻被翻出来对照——白嫖 3 亿 token 周末的实测里,10 点之后就出现了"重新连接中… 6/10"。知乎 三是评测错位:AA 榜单显得 GLM 便宜,是测试环境命中率偏低造成的数学必然。知乎

结论先放这:把它当"长会话、多模态、敢托付"的选手,它是这代 Flash 里最能打的;把它当"随手改两行"的快枪手,你会失望。

第五个数字:16 小时 Blender 厨房——最该被记住的不是演示,是闭环

官方 demo 里最扎眼的一条:在没有任何外部素材的前提下,模型自主运行 16 小时,在 Blender 里搭建了一套约 400 平米的主厨自宅加测试厨房,几何、材质、光照、空间一致性全靠模型自己规划。知乎 第三方实测则更日常:只丢一张 Riso 印刷风明信片当参考图、加一句话,模型就生成了一整套海边展览网页,票价弹窗、艺术家墙、配色和质感还原得像模像样。知乎

「牛来」掉马第5天:我把 GLM-5.3-Flash 的七个数字对了一遍账,免费期结束,先把欢呼收一收

「牛来」掉马第5天:我把 GLM-5.3-Flash 的七个数字对了一遍账,免费期结束,先把欢呼收一收

「牛来」掉马第5天:我把 GLM-5.3-Flash 的七个数字对了一遍账,免费期结束,先把欢呼收一收

16 小时是厂商自测,当不得独立复现过的真数据;真正的增量是"原生多模态进代码闭环"这件事:模型能看见自己渲染出来的界面,再对照视觉预期自我修正。前端、游戏、3D 这类"错只有看到才知道错"的任务,第一次在一个 Flash 价位上可以自动迭代。而 DeepSeek 的 V4 多模态版本,直到 8 月 31 日才正式开源。微博 这是 GLM-5.3-Flash 目前唯一没有同价对手的能力项。

第六个数字:账单临界点——决定你钱包的从来不是品牌

直接上 8 月 27 日的公开定价(元/百万 token):GLM 标准价输入命中 0.23、未命中 0.8、输出 2.8,限时 5 折后是 0.115/0.4/1.4;DeepSeek-V4-Flash 高峰 0.10/3.0/9.0,谷时 0.05/1.5/4.5。知乎

「牛来」掉马第5天:我把 GLM-5.3-Flash 的七个数字对了一遍账,免费期结束,先把欢呼收一收

有人拿真实账单套过两种负载:高命中率下 GLM 标准价和 DS 空闲价几乎贴着,一亿 token 是 42.4 对 40.1 元;低命中率撞上 DS 高峰,DS 成本直接爆炸,1 亿 token 328 元对 GLM 5 折的 54 元。知乎 也有人把临界条件推了个遍:在编程任务中,不论何时谷时的 DS 仍然更具性价比,GLM 半价期间适合做 DS 峰时的替代,原价之后则只适合作为 DS-Pro 峰时的平替。知乎

一句话版:高命中率的谷时党,别为了换而换;峰时段、长会话、命中率一般的 Agent 任务,5 折期内 GLM 是真香。至于榜单上的比价结论,别外推到你自己的 IDE。

第七个数字:10 万张国产卡——实锤和水分都要分开称

这次发布真正比模型本身大的,是算力叙事。能确认的第一层:公测一周所有线上流量跑在国产芯片集群上,社区流传的规模口径是"超 10 万张国产芯片组建的生产级推理集群,普通使用者几乎感知不到算力底座的变化"。微博 能确认的第二层是工程数据:智谱在 SGLang 基础上构建专用推理引擎、自研高带宽互联组网,官方称对比同硬件初始基线端到端性能提升 3 倍,硬件效率和单 token 成本达到与主流英伟达 GPU 持平。知乎 注意这仍是厂商自报口径,第三方尚未独立复现。能确认的第三层是开发生态:FlagOS 社区在发布当天完成平头哥、英伟达、摩尔线程、华为昇腾、海光、沐曦、清微智能、昆仑芯、曦望共 9 家 AI 芯片的 Day0 适配、精度对齐与部署验证。知乎

要打折的:1GW 国产算力中心目前只是社区引用的传闻;"XX 倍领先英伟达"式的标题全部超出证据;以及官方自己承认的短板——KV 缓存开销仍略高于 Kimi-K3 和 DeepSeek-V4-Flash,官方明确这是下一步优化方向。知乎 1M 上下文在国产芯片的内存容量和带宽上依然吃力,这是没解决的问题,不是已经解决的成绩。

对你有什么用?三层:供给端,免费 3 亿 token 周末能扛住洪峰没有崩盘,说明智谱对这波流量的冗余是真金白银堆出来的;采购端,"全栈国产"第一次有了前沿模型级别的公开工程数据,政企私有化的选筹逻辑会变;个人端,权重开源加多芯片镜像,意味着你手里的国产卡或旧 N 卡,第一次有了一套官方级开箱方案,不用等社区手搓。

对不同人的行动卡

  • 谷时码字、vibe coding、命中率常年 90% 往上:主力留 DeepSeek-V4-Flash,GLM 只在你撞峰或要跑长任务时接管。

  • 重度 Agent / 自动化管线:值得现在迁移测试,5 折还没到期,先拿非关键任务压一周,重点盯"重新连接"频率而不是跑分。

  • 要做前端、游戏、视觉闭环:没得选,这就是当前 Flash 价位唯一选项;GLM Coding Plan 每天限量发放 10000 张体验卡,比抢 lite 套餐划算。知乎

  • 本地和私有化部署党:zai-org/GLM-5.3-Flash 权重已开源,但 320B 的 BF16 不是家用机的事;国产芯片用户直接取 FlagOS 开箱镜像,别自己啃迁移。

  • 在等 DeepSeek 出招的:V4 多模态已挂上 HuggingFace,MIT 协议,Flash 战场的下一轮贴身肉搏大概率在九月中——在那之前签任何年付套餐都不如按月。

三个继续观察的信号:5 折会不会转正(决定生态位存亡)、KV 缓存优化什么时候落地(决定 1M 上下文的真实成本)、智谱 lite 套餐一周 3 亿的上限松不松(决定它是不是只想做营销)。

欢呼声先收一收,计算器拿稳。牛来确实来了,但它是来了你的工作流里干活的那头牛——能不能套上犁,得看你自己的田。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章