追国产大模型的朋友,这周有个不太正常的剧情。
8月20日深夜,一个没有厂牌的模型悄悄上了 OpenRouter——全球最大的大模型 API 聚合平台,代号 Ox Alpha,模型 ID 是 stealth/ox-alpha。Ox 是"牛"的意思,赶上国内社区正迷电影《牛来》的梗,大家干脆叫它"牛来模型"。
四天过去,这头"牛"闹出的动静是:
上线 12 小时内就冲到 OpenRouter 调用量榜首、刷新平台单日用量纪录,还在 OpenCode 上终结了 DeepSeek 连续 56 天的霸榜。微博
截至今天,前五大调用应用(HermesAgent、Claude Code 等)对它的累计调用已超过 4 万亿 token。微博
Stripe CEO Patrick Collison 亲自上手后评价"非常令人印象深刻",谷歌 Gemini 和 SpaceX 的官方账号也跑到评论区互动——注意,Stripe 正在收购 OpenRouter。知乎
最魔幻的是:没有一家厂商认领它。于是全网开始"猜爹",而线索的方向出奇一致——智谱。
今天把三件事说清楚:证据链有多硬、能力有多少水分、免费窗口关闭前怎么正确上车。
先看规格:为什么全网愿意上钩
OpenRouter 官方页面公开的信息:
上下文窗口 1,048,576 token(约 100 万),最大输出 131,072 token,一次能塞下整个大型代码仓库。36氪
支持文本、图像、视频多模态输入,工具调用与强制推理全开,预览期完全免费。36氪
官方定位是"为编码、长周期智能体任务和生产负载设计的推理模型";OpenCode 同步接入,据称准备了每天 100 万亿 token 的容量。

百万上下文 + 多模态 + 全免费,这三个词放在一起,足够让全球开发者集体"先上车再说"。
证据链:为什么"大概率是智谱"
这次社区不是靠感觉猜,是在做数字 DNA 鉴定:分词器、视频编码行为、API 报错格式,都成了比对对象。知乎目前能查到的证据整理如下:
证据 | 内容 | 强度 |
|---|---|---|
分词器指纹 | 25 组测试提示词,Ox Alpha 的 token 计数与 GLM-5.3 只差一个固定 +75 的封装偏移,说明共用同一套词表 | 很强 |
视频编码行为 | 4 段受控视频测试,token 预算、帧采样、缩放机制与 GLM-5V-Turbo 逐项吻合 | 很强 |
API 报错格式 | 有开发者用自有密钥抓到报错信息,与智谱服务高度一致,社区贴出了对照截图 | 较强 |
音频行为 | 拒绝音频输入,与 GLM-5V 行为一致;而小米 MiMo v2.5 支持音频,这条同时压低了小米的嫌疑 | 较强 |
解码速度 | 与 GLM-5V-Turbo 相差约 6%,同一量级 | 中等 |
先例 | 今年 2 月 OpenRouter 的匿名模型 Pony Alpha,事后被证实就是 GLM-5 的早期测试版 | 较强 |
主导这轮鉴定的独立研究者、AI 编程框架作者 Ben Davis 给出的结论是:99% 确定这是智谱 GLM-5.x 系列的下一代,可能是多模态旗舰 GLM-5.3V,甚至可能是更新的 GLM-5.5;另一份独立分析给出 90% 的置信度。36氪知乎
还有一条更直接的:社区流传的测试截图里,Ox Alpha 在对话中自称是"由 Z.ai 训练的 GLM 模型"。

国内社区的猜测则进一步收敛到了具体版本,目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。36氪

顺手排除一下其他候选人:
小米:CFO 林世伟 8 月 18 日刚透露新一代 MiMo 在训练,本来是头号嫌疑,但音频能力对不上
DeepSeek:分词器和发布方式都对不上,最早被排除。知乎
OpenAI、Anthropic、谷歌:都是闭源路线,没有匿名发布的动机,基本排除
严谨起见,也列两个竞争说法:DeepMind 研究员 Evan Otero 说过一句意味深长的"如果 Ox Alpha 就是我们一路遇到的朋友呢",被社区解读为暗示 Gemini 3.5 Pro;Wccftech 也提到分词器证据还可能指向微软 MAI 家族。知乎但这两条路目前的证据量,都不及"智谱说"。
先泼冷水:能力本身有争议
刷屏的"80% 通过率",值得多看一眼:
出处是 Ben Davis 从 DeepSWE 基准里抽的 10 个真实软件工程任务,Ox Alpha 做对 8 个,对照组是 Claude Fable 5(65%)、GLM-5.3(62%)、Grok 4.6(62%)、GPT-5.6 Sol(52%)。36氪
但另一组开发者在不同子集上复测,只得到约 63%;Abacus.AI CEO Bindu Reddy 公开说测试表现低于预期,沃顿商学院教授 Ethan Mollick 的评价是"惊艳程度一般"。知乎
DeepSWE 官方排行榜还没收录它,各家测试口径也不统一,"碾压 GPT-5.6"这个说法暂时立不住
社区负面反馈包括:有时"推理几分钟不动手"、复杂后端项目挣扎、从零构建不稳定、散文写作平淡
所以准确的定位是:一款在部分编码与 Agent 任务上非常亮眼、规格激进、但评测结果分歧很大的匿名模型。是真旗舰,还是针对速度和成本优化的中型模型,现在下结论都早。
比"是谁家的"更有意思的是:这是套路
大模型圈最近流行"挂马甲"测试,Ox Alpha 不是 OpenRouter 上的第一个"隐身模型"。36氪在它之前已经有 4 个,清一色最后都被中国团队认领——Pony Alpha 被证实是智谱 GLM-5,Hunter Alpha 被证实是小米 MiMo-V2-Pro。知乎套路已经标准化:匿名上线 → 全面免费 → 全网猜爹 → 白嫖真实压测数据和口碑 → 官宣认领。对厂商来说这笔账很划算:每天 100 万亿 token 的容量,相当于全球开发者免费帮你做压测,比任何内部测试都狠;"猜爹"话题自带传播;匿名状态下测出的高分,也比顶着品牌光环发布更有说服力。
从智谱的角度看,动机更充分。上周 GLM-5.3 的资本市场反响偏冷——港股单日跌超 13%,卖方观点是"只是 5.2 的迭代版,不是市场期待的大参数旗舰",API 定价又被指比 DeepSeek V4 Pro 贵 2.2 倍。微博这个节骨眼上,把真正的下一代旗舰先匿名放到海外、让成绩先说话,是比开发布会更稳的打法。(注:以上是基于公开信息的推断,智谱官方至今没有确认任何事。)
实用部分:怎么薅,以及谁别薅
先说结论:值得试,但有明确的时效和边界。
入口:
OpenRouter 搜模型 ID:stealth/ox-alpha,输入输出都是 0,免费窗口到 8 月 27 日。知乎
OpenCode 已接入,免费开放一周,速率限制较宽松、使用额度接近不限量。36氪

适合三类人:
想体验"百万上下文代码 Agent"成色的——把中型仓库整个丢进去让它读代码、改 bug,平时按量计费不便宜,现在零成本
有长文档、视频理解需求的——视频输入是这代的亮点之一
等"下一代 GLM"亮相的智谱生态用户——先自己上手试,比等官宣快
也明确说三个别碰:
别接生产环境:模型方没认领,明天要是下线,没人给你 SLA
别喂敏感数据:OpenRouter 官方口径是提示词由匿名供应商保留、不用于训练,但保留的数据最终拿去干什么,外界并不清楚
别指望"一夜替代 Claude Code":负面反馈显示它在复杂项目上并不稳
顺带一提,智谱自己最近也在猛发福利:自家编程工具 ZCode 给新用户送 1 亿 GLM-5.3 token 的活动,这周末已经是第二轮。小红书如果 Ox Alpha 真是它家的下一代旗舰,这波"免费组合拳"明显是在为新发布铺垫。
接下来盯三个信号
认领时间:参考 Pony Alpha 的先例,匿名期一般一周左右,这周留意智谱官方动静
官方榜单:等 DeepSWE、Artificial Analysis 这些榜单收录,看口径和社区复测的 80%、63% 哪个对得上——这决定成色能不能定论
接入与定价:是否同步接入智谱清言、ZCode 和 Coding Plan,API 定价多少——真旗舰如果继续走 GLM-5.3 的高价路线,对普通开发者的意义就要打折;如果低价走量,才值得迁移工作流。别忘了 GLM-5.3 的开源权重本身就推迟了两周,这次"匿名先行"也可能牵动后面的发布节奏
三个信号落地之前,"值不值得切换"先不聊。眼下这个免费窗口,先上车再说。
评论区聊聊:你押"牛来"是智谱家的吗?