一个没有署名、没有技术报告、价格栏写着两个零的模型,四天时间把 OpenRouter 顶到了榜一。
它叫 Ox Alpha。Ox 是英文里的"牛",赶上国产动画《牛来》的梗正在全网发酵,国内开发者干脆叫它"牛来大模型"。8月20日,它以匿名身份出现在 OpenRouter。量子位截至8月24日,仅 HermesAgent、Claude Code 等前五大应用对它的累计调用就超过了4万亿 Token,刷新了平台单日模型用量纪录。微博顺手还终结了 DeepSeek 在 OpenCode 连续56天的霸榜。微博没有任何厂商认领。于是全网开始了一场大型"数字 DNA 鉴定"——目前证据链指向最明确的,是智谱。
四条硬证据,都指向同一个方向
社区鉴定已经扒到工程细节层面,我把各方测试按证据强度排了个序。

证据一:Tokenizer 指纹(强)。 Tokenizer 负责把输入切成模型能处理的 token,不同模型家族的词表和切分逻辑不同,面对刻意设计的文本会留下稳定的"指纹"。测试者拿同一段混合中英文、代码和 emoji 的文本做对比:GLM-5.3 和 GLM-5.2 都算出 68 个 token,Ox Alpha 显示 143 个——多出来的 75 个,恰好可以由模型外部附加的一段隐藏 System Prompt 解释。量子位另有测试者用 25 组不同 Prompt 验证,观察到同样的固定偏移关系。
证据二:视频 token 预算(强)。 文本习惯可以靠蒸馏或后训练模仿,但视频进入模型前的工程设计很难伪装。有研究者制作了 4 段受控测试视频分别喂给 Ox Alpha 和几款多模态模型,发现它和 GLM-5V-Turbo 在多项特征上高度相似:帧率变化时采样策略基本不受影响、视频时长增加时 token 消耗约以每秒 147 个的速度增长、每帧分辨率变化对应的缩放方式逐项对得上。量子位而对照组里的 MiMo、Qwen、GLM-4.6V 都呈现不同特征。
证据三:API 报错指纹(中)。 有人故意传入异常参数,捕捉到"[1210] The temperature parameter is illegal"这类错误信息,错误码风格、参数限制和中英文混排的返回方式,与智谱相关服务相似度较高。
证据四:先例(背景分)。 今年2月,OpenRouter 上过另一款匿名模型 Pony Alpha,大家围着猜了半天,最后揭晓——就是 GLM-5 的早期测试版。Pony 是马,Ox 是牛,网友调侃智谱这是"牛马组合"。此外社区还捕捉到过疑似"trained by Z.ai"的推理输出残留,不过这条主要来自截图和二手转述,证据等级明显低于前三条,当彩蛋看就行。
8月24日又出现一个新信号:有用户发现,GLM-5.3 和 Ox Alpha 在同一时间出现性能下降。微博同一厂商的不同服务抢算力,是很多老用户熟悉的剧情。这条还不能算实锤,但方向上又加了一分。

谷歌是讨论度第二的候选,但证据明显偏弱。目前主要靠 DeepMind 研究员 Evan Otero 在讨论区那句"如果 Ox Alpha 就是我们一路遇到的朋友呢"式的含糊发言,加上 Gemini 3.5 Pro 跳票很久迟迟不发的联想。量子位谷歌这边抢认领的架势已经被全网调侃了一轮,但没有任何公开证据支撑"谷歌说"。
模型本身牛不牛?评测分歧极大
抛开身份谜团,Ox Alpha 的规格确实激进:约 104.86 万 token 上下文、单次最高 13.1 万输出、支持文本图片视频输入,瞄准的就是代码、长周期 Agent 和复杂推理。量子位
实测口碑两极分化。一项包含 10 个真实软件工程任务的社区测试里,Ox Alpha 完成 8 个(80%),同组的 Fable 5 为 65%、GLM-5.3 为 62%、GPT-5.6 Sol 为 52%。36氪但这只是小样本社区测试,不是官方 Benchmark。Stripe CEO Patrick Collison 亲自上手后评价"It’s very impressive";另一边,Abacus.AI CEO Bindu Reddy 测试后认为表现低于预期。量子位沃顿教授 Ethan Mollick 也表示惊艳程度一般,还有开发者发现它在低推理强度任务下表现平平、视觉任务弱于 Gemini 系列。

比较准确的一句话描述:一款在某些代码和 Agent 任务上极亮眼、同时评测分歧极大的匿名模型。拿它当免费的高阶编程副手没问题,当成全面替代现有主力模型,证据还不够。
免费窗口怎么上车
先说清楚:这波免费是限时策略,官方口径的窗口约一周,随时可能关闭。36氪目前两条路:
路线一:OpenRouter 直接调。 模型条目是 stealth/ox-alpha。36氪输入输出价格都是零,需要一个 OpenRouter API Key,适合已经有自己工作流、想把它塞进现有 Agent 链路的开发者。注意社区反馈高峰期调用延时偏高,不适合卡时间的任务。
路线二:OpenCode。 Ox Alpha 已上线 OpenCode 和 OpenCode Go,免费期间几乎不限量,且不计入用户原有的 Go 额度。OpenCode Go 订阅月费 10 美元(当前结算页首期折合约 35 元),额度受 5 小时 12 美元、每周 30 美元、每月 60 美元的平台计量上限约束。知乎注意这是订阅内额度,不是额外扣费。模型池里同时有 GLM-5.3、Kimi K3、DeepSeek V4 系列,适合想一个入口切多家模型的人。

三个提醒,都是真金白银或者数据安全的坑:
第一,匿名模型没有服务承诺。免费窗口的稳定性、响应速度都不保证,别把它放进有 deadline 的生产链路,拿它跑测试、跑副业项目、跑积压的长任务最合适。
第二,注意输入内容。厂商身份未官宣意味着数据处理方不透明,涉密代码、敏感业务数据不要往里喂,这条对任何免费模型都成立,但对匿名模型尤其重要。
第三,别急着按传言改订阅。如果鉴定属实,它大概率是智谱下一代模型的公开测试——等官宣再决定要不要升级手里的 GLM Coding Plan,现在换订阅没有意义。
接下来盯三个信号
一是 GLM-5.3 的开源权重。8月14日发布后,权重按官方安排推迟了约两周,窗口指向 8 月 28 日前后。36氪如果 Ox Alpha 真是智谱的,权重开放前后大概率会有身份揭晓或产品联动。
二是官方认领。按 OpenRouter 最近几次匿名模型(Pony Alpha、Hunter Alpha)的剧情,匿名期结束后总得有厂商出来"牵牛回家",通常伴随正式版本发布和商业化定价,那才是决定要不要付费上车的真正节点。
三是智谱自己的处境。过去两个月智谱股价跌超六成,市值从高点蒸发超过 8000 亿港元。36氪唐杰公开反思过技术路线。如果这头牛真是智谱的,它就不只是一次测试,更是一次必须兑现的能力证明——这也是为什么这次社区鉴定格外起劲的原因。
对普通开发者来说,眼下最划算的姿势就一句话:免费窗口期拿真实任务压测一轮,记录它在你的场景里值多少分,然后等权重开放那天看答案。