一、谜底揭晓:牛来就是智谱,权重当晚就开源
8月20号深夜,OpenRouter上悄悄冒出一个叫Ox Alpha的匿名模型。没品牌、没官宣,上线12小时,它冲到了OpenRouter调用量榜首。知乎六天后谜底揭晓:智谱正式发布并认领了它,定名GLM-5.3-Flash,确认后当晚开放模型权重。微博
规格值得划重点:Ox Alpha的正式名字是GLM-5.3-Flash,也是GLM系列首个原生多模态模型,支持1M上下文,重点强化Coding和Agent能力,上线即以MIT协议开源。微博它是320B-A18B的MoE架构,总参数与GLM-4.5相当,但激活参数只有18B、层数45层,几乎减半,用稀疏注意力加线性注意力的混合架构把长上下文的服务成本压下来。微博
智谱当晚同步放出了六项基准的官方成绩:Terminal Bench 2.1拿到84.3,DeepSWE v1.1为63.4,GDPVal-AA v2为1773,在对标Claude Opus 4.8、GPT-5.6 Terra、Gemini 3.7 Flash的六项测试里多项领先。

二、跑分要打折看:80%是10道题的成绩
牛来匿名期刷屏的那个"80%通过率",来源是这样的:有人拿了十个真实的软件工程任务去考它,让模型自己读代码仓库、找bug、改完再跑测试,结果Ox Alpha通过了八个,通过率八成。知乎拿10道题的通过率当模型整体实力,就像用一次摸底考当高考分。
全量数据是另一回事:独立研究者Ben Davis随后跑了全量113题测试,Ox Alpha的成绩落在63%附近,和GPT-5.6 Sol基本打平,并没有拉开差距。知乎智谱官方给出的DeepSWE v1.1完整成绩也是63.4%,两边能对上;部分社区复测图里还出现过58%附近的更低读数。Artificial Analysis在8月26日更新的智能指数里,把GLM-5.3-Flash按折后价格计,给出57分,正好卡在成本-智能帕累托前沿的拐点上——这个位置的含义是"性价比突出",而不是"智能登顶"。
海外的兴奋情绪也在降温:Abacus.AI CEO Bindu Reddy公开说测试表现低于预期,沃顿商学院教授Ethan Mollick的评价是「惊艳程度一般」。知乎国内开发者刘聪的实测则给出了另一面:ox除了视觉之外,coding能力也不错,实现卡丁车小游戏,登录系统、排名、多场地、多车型选择,直接就好了。知乎

所以正确的打开方式是:把80%的传闻按58%~63%来看。它大概率是目前最强的开源Agent模型之一,但不是神话。
三、免费窗口:用量爆炸,白嫖要讲姿势
牛来这波热度,一半来自实力,一半来自"免费"。OpenCode官方确认,Ox Alpha在平台上免费使用一周,窗口期内用量直接爆炸:它一夜之间冲到调用榜第一,还终结了DeepSeek在OpenCode连续56天的霸榜纪录。微博连正在收购OpenRouter的Stripe CEO帕特里克·科里森都亲自上手测了一圈,然后在X上留下一句「非常令人印象深刻」。知乎

流量数据能说明这轮白嫖有多猛:光OpenRouter前6个完整自然日,就跑出23.2万亿Token,ox-alpha以23.2T排在用量榜第一,是第二名的2.3倍。小红书截至8月24日,仅Hermes、Claude Code等前五大调用入口,对Ox Alpha的累计调用就突破了4万亿token,OpenRouter全站日使用量达到DeepSeek的两倍以上。知乎
对准备上手的用户,三条白嫖纪律:
不传敏感数据。 免费通道本质是匿名测试通道,数据处理没有商用级承诺,代码仓库和商业文档别直接喂进去。
不建长期依赖。 免费窗口一关,端点随时可能变价、限流或下线,把生产流程挂在上面等于裸奔。
存好自己的配置。 趁窗口把prompt、工作流配置和测试记录保存下来,窗口关了还能带着结论迁移。
另外留一个时间锚点:智谱今年1月8日在港股上市,下周一(8月31日)将发布2026年中期财报。知乎定价和商业化节奏大概率在那前后明朗,免费窗口还剩几天,该测的抓紧测。
四、OpenRouter成了大厂匿名试验场:本周还有两场戏
把视角拉远一点,牛来不是孤例:此前已有Pony Alpha(智谱)、Hunter Alpha(小米)、Elephant Alpha(蚂蚁)和Owl Alpha(美团)等多款国产匿名模型上线。小红书匿名上线、全网免费、全网猜身份、白嫖真实压测数据、官宣认领——这套打法已经标准化了,OpenRouter实质上成了大厂的匿名试验场。

本周还有两个值得盯的节点。一是Anthropic的Opus 5.1:预测网站也显示,Anthropic有74%的概率在两周内发布其下一代旗舰模型(极有可能是Mythos或Fable 5.1)。微博另有消息人士爆料本周就会正式发布。二是Claude Fable 5.1已在灰度:Fable 5.1已开启灰度测试,部分Claude用户已悄悄用上,参照Fable 5当初的发布节奏(先抽5%用户测试,当天全量推送),业内推测Fable 5.1的全量发布已近在眼前,大概率8月底前上线,且定价不会上涨,仍延续每百万输入token 10美元、输出50美元的现价。微博如果Opus 5.1真的本周落地,那就是"开源性价比之王"和"闭源旗舰"同周对撞,Agent用户正好拿自己的任务集当裁判。
五、三类用户,三种操作
现在就想用的Agent/编程党: 趁免费窗口,用你自己的2~3个真实任务集跑通它,重点记录任务完成率和token消耗,和你现在的主力模型对比。窗口关闭后按折后定价重算一遍成本,再决定要不要长期切换——别拿别人的跑分替自己做决定。
开源自部署党: MIT协议、权重已放,这是你的主场。先确认集群能不能装下320B总参(18B激活是利好),重点验证混合注意力架构在你自己的长上下文负载下的成本表现,官方口径是注意力计算量比GLM-5.3降低3.01倍、KV缓存降低4.44倍,这是它相对上一代最大的变量。
观望吃瓜党: 不用急。牛来这波最大的价值是验证了"开源Agent模型能打",等三件事落地再看:Opus 5.1官宣后的实测对比、智谱8月31日前后的定价和财报口径、以及更多独立复测把DeepSWE全量成绩钉在58%还是63%。
继续观察的信号清单:①本周内Opus 5.1是否官宣,以及它与GLM-5.3-Flash的同题实测;②免费窗口关闭后OpenCode/OpenRouter的正式定价;③国产芯片集群的实际推理成本披露;④下一个匿名马甲什么时候出现——按现在的节奏,不会太久。