智谱“牛来”揭晓:1/40 的价格追平 Opus 4.8?先算清这笔账再换

源自147位全网作者

14:14

这周 AI 编码圈最热闹的是一场悬疑剧:一个叫 OxAlpha 的匿名模型突然出现在 OpenRouter 上,不问出处、不报家门,上来就冲榜一,全网都在猜它是谁。有人拿分词器指纹反查,有人盯着 API 报错路径做鉴定,中文社区干脆叫它"牛来"。微博8 月 26 日晚,据彭博社报道,智谱确认 OxAlpha 就是其 GLM 系列新一代模型,并计划当晚开放权重。微博谜底揭开:它就是智谱当晚上线并开源的 GLM-5.3-Flash(320B-A18B),GLM-5 系列的首个原生多模态模型。IT之家

七天 23.2 万亿 token,这数据是怎么来的

智谱官方承认,这次匿名公测是有意为之,目的就是在正式发布前收集真实开发者的大规模反馈。智谱结果玩脱了——一周时间,OxAlpha 在 OpenRouter 上烧掉 23.2 万亿 token,断层第一,是榜二 DeepSeek V4 Flash(11.6T)的整整两倍,GPT-5.6 Luna 只有 4.16T。知乎

在 OpenCode 上,它的累计消耗超过 40 万亿(43T~44T),直接把 DeepSeek 连续 56 天的霸榜纪录终结了。知乎

智谱“牛来”揭晓:1/40 的价格追平 Opus 4.8?先算清这笔账再换

值得注意的是,这波流量不是"白嫖党"堆出来的。OpenRouter 的历史纪录被拉到此前单期最好成绩的约 2.6 倍,而且免费期结束后,大量用户转头去 OpenCode 继续付费使用——在 OpenCode 全平台样本量足够的模型里,智谱上一代 GLM-5.3 的次日留存率就有 79.1%,全平台第一。知乎换句话说,用脚投票的人里,大部分是真干活的人。

这是个什么模型

简单说:它不是旗舰缩水版,而是重新设计的新基座。总参数 320B,但每个 token 只激活 18B,激活参数和层数比上一代几乎减半,配合 30T token 的多模态语料训练。智谱架构上它是首个采用稀疏注意力加线性注意力混合架构的开源前沿模型,主打压低长上下文成本,官方给的数据是注意力计算量和 KV 缓存比 GLM-5.3 分别低 3.01 倍和 4.44 倍。

它是 MIT 协议开源,上下文 100 万 token,最大输出 128K,权重已经放上 Hugging Face。微博还有个容易被忽略的点:公测期间的全部请求流量都跑在国产芯片集群上,智谱自己也承认瓶颈在内存容量和带宽,撑 1M 上下文"很有挑战"。智谱这对在意服务稳定性的用户是个持续观察项。

能力到底行不行

官方口径很猛:在 Artificial Analysis 综合智能指数(AA Index)上拿 57 分,与 Claude Opus 4.8 打平。智谱在官方公布的基准图里,DeepSWE v1.1(真实软件工程任务)它拿 63.4 分,超过 Opus 4.8 的 58.0;Terminal Bench 2.1 则是 84.3 对 85.0,小负。科技锐评

智谱“牛来”揭晓:1/40 的价格追平 Opus 4.8?先算清这笔账再换

这里要拆一个流传很广的数字:社区里说 OxAlpha 的 DeepSWE 有 80%,这是博主综合智谱官方文档与海外媒体报道汇总的口径,和官方基准图里的 63.4 不是一回事,对比时别混用。知乎另外官方自建的 Z.ai Code Bench 称编程表现与 Opus 4.8 相当,自建基准参考就好,别当成第三方结论。

多模态是这次的隐藏看点:它是"视觉编码"路线,能看着渲染结果改代码。官方演示里让它不用任何外部素材、自主运行 16 个小时,在 Blender 里搭了一套约 400 平方米的主厨自宅加测试厨房。智谱

重点来了:这笔账怎么算

价格是真便宜。BigModel 开放平台标价:输入 0.8 元、输出 2.8 元(每百万 token),缓存命中 0.23 元;限时五折后是 0.4 元、1.4 元、0.115 元。知乎国际站 Z.ai 口径是输入 $0.15、输出 $0.50、缓存 $0.03。微博官方给的对比锚点很直白:定价为 GLM-5.3 的 1/10,限时折扣内是 1/20,是 Opus 4.8 的 1/40。智谱

智谱“牛来”揭晓:1/40 的价格追平 Opus 4.8?先算清这笔账再换

但编码 Agent 的真实账单不是拿牌价乘一乘就完事,有两个关键变量。先说缓存:Agent 工作流里约 96% 的输入是可缓存命中的重复前缀,按折后 0.115 元的缓存价算,实际输入成本会比牌价低一个数量级。知乎

再说输出量:有博主按公开牌价做了一张对比表,GLM-5.3-Flash 折后的输出单价只有 Claude Fable 5 的 1/253——数字极端,但方向没错,输出 token 才是 Agent 烧钱大头。知乎

冷水也得泼:换之前要知道的三件事

第一件,输出冗长会吃掉价格优势。知乎上有实测用户直接提醒,这个模型的实际使用成本会比预想的高。知乎UP 主 Icyの狼 用同一批任务做了真金白银的对比,结论是 Qwen3.8-Flash 比 GLM-5.3-Flash 便宜 2.78 倍、快 1.96 倍——牌价更便宜的模型,真干起活来反而更贵,这就是冗长的代价。哔哩哔哩所以它真正的对手不是 Opus,而是同价位的 Qwen3.8-Flash 和 DeepSeek-V4-Flash。

第二件,包月订阅没有看上去那么管够。GLM Coding Plan 分 Lite、Pro、Max 三档,折后最低档每天只要几块钱。知乎但 Lite 档每周额度约 1.4 亿 token,有重度用户直接吐槽不够用、价格还是比较贵。知乎

倒是藏了个小设计:非高峰时段调用只消耗一半积分,周末全天算非高峰,白天搬砖、夜里跑长任务能把一份钱当两份花。知乎

第三件,能力有偏科。社区反馈里后端、测试、重构这类任务口碑好,但游戏开发、3D 类任务目前缺少稳定验证,别拿自己的主线项目裸切。

谁适合换,谁应该等

按现在手里的证据,我的建议分四种情况。一直用旗舰模型、每月 token 账单肉疼的:值得把例行任务迁一部分过来试,折后价确实给了"敞开了跑"的空间,官方每天还限量发一万张体验卡,可以零成本先摸。智谱已经在用 Qwen3.8-Flash 这类低价模型的:别急着换,牌价便宜不等于实付便宜,先用你自己的真实任务跑几轮、按实际消耗算账再说。用 OpenCode、Claude Code 接 API 的:接入很轻,Coding Plan 和第三方工具链都已经支持,有用户已经在客户端里手工把模型加上了。微博纯观望的:不用焦虑,限时五折没有公布截止时间,真正的窗口是"折扣期内验证值不值"。

智谱“牛来”揭晓:1/40 的价格追平 Opus 4.8?先算清这笔账再换

接下来值得盯的三个信号

一是限时五折什么时候结束、会不会续,这直接决定"1/40 价格"这个故事能讲多久;二是官方会不会针对输出冗长做优化,这是它和同价位对手之间最大的变量;三是国产芯片集群在高峰期的排队和稳定性表现,1M 上下文的内存瓶颈官方自己点了名,后续长任务实测会给出答案。跑分可以刷,账单不会说谎——这轮值不值得换,让你的真实任务先跑一周再说。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章