这两天如果你在用 Claude Code、Codex 这类工具干活,又没听说过「Ox Alpha」,那信息流是有点落后了。
8月20日夜里,OpenRouter 上悄悄冒出来一个匿名模型,模型ID是 stealth/ox-alpha。知乎没有发布会,没有技术报告,参数、架构、团队全部保密,但配置直接拉满:100万 token 上下文、支持文本/图片/视频输入、主打编程和长程 Agent 任务,关键是——完全免费。第二天 OpenRouter 用一个忍者表情正式吆喝了它,OpenCode 同步上架,其联合创始人 Dax 公开喊话开发者们猜猜这是啥模型。36氪
社区给它起了个很贴切的中文名:牛来(Ox=牛)。我扒了一圈知乎、36氪、B站、小红书和海外 X/Reddit 的讨论,这篇把三件事说清楚:实锤有哪些、猜测分几派、剩下这几天怎么安全地把羊毛薅到手。
一、先说确定的部分
确定的东西不多,但都很硬(来自 OpenRouter / OpenCode 公开页面):

模型ID:OpenRouter 上是 stealth/ox-alpha;OpenCode 界面里显示「Ox Alpha Free」
定位:高效编程、长时间 Agent 任务、真实生产场景;文本+图像+视频输入,文本输出
上下文 100万 token,最大输出 13万 token
支持工具调用、tool_choice、JSON 结构化输出;不支持严格的 JSON Schema 约束(这条后面要考)
实测中位首 token 延迟约 1.95 秒,输出速度约 49 token/s,近几日可用率接近 100%(样本期很短,随时可能变)
输入输出价格都是 0,免费窗口一周,预计 8月27日 前后结束
OpenCode 宣称为此准备了每天 100万亿 token 的容量——这不是小规模内测,是明牌压测

要注意:OpenRouter 官方没有公布任何 SWE-bench、Terminal-Bench 成绩。36氪「frontier model」只是宣传语,它到底是不是第一梯队,目前没有官方证据。
二、实锤盘点:为什么越来越多人认定是智谱?
独立研究者 Ben Davis 8月21日发布了一份技术取证报告,说自己「99%确定」ox-alpha 属于智谱 GLM-5.x 系列。知乎他的证据全是技术指纹,分量不轻:
视频编码器对上了:4 组受控视频里,ox-alpha 的 video token 消耗与 GLM-5V-Turbo 完全一致——帧采样与帧率无关、约每秒 147 token 的时长缩放、逐帧分辨率缩放,三项特征同时命中。MiMo v2.5、Qwen 3.8 Max、GLM-4.6V 全都不符。
分词器对上了:25 个提示词测试,token 计数与 GLM-5.3 完全吻合,只差固定的 +75 token「隐藏封装」,基本等于共用同一套词表。B站还有用户独立复测,确认了「锅内倒入植物油烧热」这种 GLM 分词器的经典特征。
音频拒绝行为一致:ox-alpha 拒绝音频输入,和 GLM-5V 一致;而小米 MiMo v2.5 是支持音频的,这条顺手就把小米候选削弱了一分。
输出风格:每千字符约 1.3 个 emoji,接近 GLM/Qwen 系;Claude、GPT-5.6、Grok 在同环境下接近于零。
能力方面:DeepSWE 的 10 个确定性任务,ox-alpha 通过 8 个、Pass@1 80%(对比:Fable 5 为 65%,GLM-5.3 和 Grok 4.6 各 62%,GPT-5.6-sol 52%);51469 项回归测试全部通过;一次 69 次工具调用的 Agent 任务,全程只出 1 次错、没有重试循环。知乎
但丑话要说在前面:这组跑分有坑。对比模型普遍跑了 4 次,ox-alpha 样本量很小、测试口径不完全一致,不能据此得出「已经打败 Fable 5」的结论。B站评论区就有人直接表示不买账,说 Fable 5 出来半年了至今还是无人超越。哔哩哔哩Davis 自己的判断是:ox-alpha 明显强于 GLM-5.3,更像下一代检查点,解码速度与 744B 总参/40B 激活的 GLM-5V-Turbo 只差约 6%,推测是相近规模的 MoE。知乎不过小红书也有人自称「实锤」它是 GLM-5.3-Flash——智谱派内部,其实还分小派系。
三、4个猜测派系,谁有反证?
除了智谱,市面上还流传着这么几个候选:
小米 MiMo V3:Reddit/X 上出现频率最高的答案。逻辑链:8月18日小米 CFO 在财报电话会透露新一代 MiMo 正在训练。今年3月的隐身模型 Hunter Alpha 就是同款操作,后来被小米认领为 MiMo-V2-Pro 早期内测版,同样百万上下文、同样主打 Agent,上线后很快破 1万亿 token 调用。36氪但反证也很直接。B站用户做了对照测试,塞了一大堆敏感词成功调用了,一点也不像小米。哔哩哔哩小米系模型在敏感词管控上向来以严格出名。
腾讯混元 HY4:理由是「能撑住这种规模免费调用的厂商没几个」,腾讯有算力。目前零技术证据,纯排除法反推。
DeepSeek V4 Pro 视觉版:小红书有这个猜法,说牛来应该就是长了眼睛的 v4 pro。但 Davis 报告直接排除了这种可能,DeepSeek 此前没有发布视频能力,分词器也对不上。知乎
模型自报家门派:有人问它身份,它自称 Gemini。但让模型自报家门不算证据——stealth 模型的回答受系统提示和训练数据影响,问谁都可能说自己是别家的。
真正有意思的,是社区总结出来的一条规律:今年的 OpenRouter 隐身模型,是个「动物园」。年初 Pony Alpha(马)→ 后来被确认与 GLM-5 相关;3月 Hunter Alpha → 小米认领;6月 Owl Alpha(猫头鹰)→ 美团认领为 LongCat-2.0;现在 8月中旬,Ox Alpha(牛)登场。看懂这个规律,很多神秘感就消失了:这不是悬疑剧,而是国产大模型「隐身发布」的标准流程——先匿名公测,让真实开发者拿真实项目压测,跑一周、烧掉海量 token,再带着反馈正式亮相。表现好,揭晓身份再传播一轮;表现不好,低调收场,品牌无损。
四、怎么白嫖:2条实测可用的路,和2个真实的坑
窗口就一周(预计 8月27日 前后关闭,以平台页面为准),想上手的看这里。以下两条路都有社区实测:
路线1:OpenRouter。 注册、拿 API key,模型名填 `stealth/ox-alpha`,免费模型不需要绑卡,接到任何支持自定义 API 的 Harness 里就能跑。
路线2:OpenCode(以及 DSH 这类想接 OpenCode API 的工具)。 有人已经替你踩过坑了:
OpenCode 界面里它叫「Ox Alpha Free」,但 API 里真正的模型ID是 `x-preview-f-free`。有兄弟照着显示名接,401 报错,换了 3 个 key 才发现是 ID 写错了。小红书
端点走 `/zen`,不是 `/zen/go`。
实测吐字 40~50 token/s,高峰期会掉——用原话说,「全世界都在站起来蹬」,挤的时候别抱太高期待。

拿它干什么? 社区已经跑出真实案例:
长程 Agent 任务:有人接 OpenRouter API 跑一个重构任务,一个小时没中断,后台一看烧了 1900万 token。小红书这正是官方介绍里反复强调的 sustained agentic work;
大仓库阅读:100万上下文能一口吞下中等规模代码库。OpenCode 以往的限免模型都是 256K,这次是第一次给到 1M;
多模态输入:丢截图、丢视频让它复刻前端,已经有不少成品晒单。
3条别碰的线:
别上生产。身份未确认、稳定性无承诺、随时可能下架,拿它当生产依赖等于裸奔;
别喂涉密代码。这本质是一场公开压测,你的任务就是别人的测试数据;
别依赖严格结构化输出。不支持严格 JSON Schema,流水线靠这个吃饭的请绕行。
五、这波羊毛值多少?算笔账
拿同一平台上的参照价说话:同样百万级上下文的 Gemini 3.7 Flash,每百万 token 输入 $0.375、输出 $1.875;GPT-5.6 Sol Pro 则是输入 $2.5、输出 $15。36氪Ox Alpha:0。

以前面那个「一小时 1900万 token」的重构任务为例,哪怕全部按 Sol Pro 的输入价算,也要接近 50 美元(约 350 元人民币)——真实产出场景里只会更贵,因为输出单价是输入的 6 倍。对一个重度 Agent 用户来说,这一周免费窗口,差不多是一张价值几百上千美元的「旗舰模型体验卡」。模型圈卷成这样,该薅就薅,不丢人。
六、接下来值得盯的3个信号
智谱认不认领。 先例摆着(Pony、Hunter、Owl 都从隐身走到了官宣)。知乎智谱一旦被证实,这大概率是传闻中的下一代旗舰(社区普遍猜 GLM-5.5)的发布预演——参考它 8月14日刚发了纯文本版 GLM-5.3;
免费窗口的确切截止时间。 目前口径是一周、预计 8月27日 前后,以平台页面为准,想薅的别拖到最后一晚;
认领之后的定价。 身份揭晓只是上半场,定价才决定值不值得把工作流迁过去。参考参照物:GLM-5.3 上线时的 API 定价策略,社区是拿着放大镜看的。
最后说句感受:Ox Alpha 这波,可能是「大模型发布方式换代」最生动的一次样本——没有发布会,模型先进开发者的终端干一周活,再带着真实反馈亮相。对我们这些用 AI 编程干活的人来说,这意味着:以后「限免窗口」会成为抢先体验新旗舰的常态。与其围观猜谜,不如把窗口期利用起来——反正这一周,最贵的东西免费。