当前位置:
AIGC文章详情

Ox Alpha白嫖窗口只有一周:4个实锤、4个猜测派系、2条接入路、3条别碰的线

源自15位全网作者

07:14

这两天如果你在用 Claude Code、Codex 这类工具干活,又没听说过「Ox Alpha」,那信息流是有点落后了。

8月20日夜里,OpenRouter 上悄悄冒出来一个匿名模型,模型ID是 stealth/ox-alpha。知乎没有发布会,没有技术报告,参数、架构、团队全部保密,但配置直接拉满:100万 token 上下文、支持文本/图片/视频输入、主打编程和长程 Agent 任务,关键是——完全免费。第二天 OpenRouter 用一个忍者表情正式吆喝了它,OpenCode 同步上架,其联合创始人 Dax 公开喊话开发者们猜猜这是啥模型。36氪

社区给它起了个很贴切的中文名:牛来(Ox=牛)。我扒了一圈知乎、36氪、B站、小红书和海外 X/Reddit 的讨论,这篇把三件事说清楚:实锤有哪些、猜测分几派、剩下这几天怎么安全地把羊毛薅到手。

一、先说确定的部分

确定的东西不多,但都很硬(来自 OpenRouter / OpenCode 公开页面):

Ox Alpha白嫖窗口只有一周:4个实锤、4个猜测派系、2条接入路、3条别碰的线

  • 模型ID:OpenRouter 上是 stealth/ox-alpha;OpenCode 界面里显示「Ox Alpha Free」

  • 定位:高效编程、长时间 Agent 任务、真实生产场景;文本+图像+视频输入,文本输出

  • 上下文 100万 token,最大输出 13万 token

  • 支持工具调用、tool_choice、JSON 结构化输出;不支持严格的 JSON Schema 约束(这条后面要考)

  • 实测中位首 token 延迟约 1.95 秒,输出速度约 49 token/s,近几日可用率接近 100%(样本期很短,随时可能变)

  • 输入输出价格都是 0,免费窗口一周,预计 8月27日 前后结束

  • OpenCode 宣称为此准备了每天 100万亿 token 的容量——这不是小规模内测,是明牌压测

Ox Alpha白嫖窗口只有一周:4个实锤、4个猜测派系、2条接入路、3条别碰的线

要注意:OpenRouter 官方没有公布任何 SWE-bench、Terminal-Bench 成绩。36氪「frontier model」只是宣传语,它到底是不是第一梯队,目前没有官方证据。

二、实锤盘点:为什么越来越多人认定是智谱?

独立研究者 Ben Davis 8月21日发布了一份技术取证报告,说自己「99%确定」ox-alpha 属于智谱 GLM-5.x 系列。知乎他的证据全是技术指纹,分量不轻:

  1. 视频编码器对上了:4 组受控视频里,ox-alpha 的 video token 消耗与 GLM-5V-Turbo 完全一致——帧采样与帧率无关、约每秒 147 token 的时长缩放、逐帧分辨率缩放,三项特征同时命中。MiMo v2.5、Qwen 3.8 Max、GLM-4.6V 全都不符。

  2. 分词器对上了:25 个提示词测试,token 计数与 GLM-5.3 完全吻合,只差固定的 +75 token「隐藏封装」,基本等于共用同一套词表。B站还有用户独立复测,确认了「锅内倒入植物油烧热」这种 GLM 分词器的经典特征。

  3. 音频拒绝行为一致:ox-alpha 拒绝音频输入,和 GLM-5V 一致;而小米 MiMo v2.5 是支持音频的,这条顺手就把小米候选削弱了一分。

  4. 输出风格:每千字符约 1.3 个 emoji,接近 GLM/Qwen 系;Claude、GPT-5.6、Grok 在同环境下接近于零。

能力方面:DeepSWE 的 10 个确定性任务,ox-alpha 通过 8 个、Pass@1 80%(对比:Fable 5 为 65%,GLM-5.3 和 Grok 4.6 各 62%,GPT-5.6-sol 52%);51469 项回归测试全部通过;一次 69 次工具调用的 Agent 任务,全程只出 1 次错、没有重试循环。知乎

但丑话要说在前面:这组跑分有坑。对比模型普遍跑了 4 次,ox-alpha 样本量很小、测试口径不完全一致,不能据此得出「已经打败 Fable 5」的结论。B站评论区就有人直接表示不买账,说 Fable 5 出来半年了至今还是无人超越。哔哩哔哩Davis 自己的判断是:ox-alpha 明显强于 GLM-5.3,更像下一代检查点,解码速度与 744B 总参/40B 激活的 GLM-5V-Turbo 只差约 6%,推测是相近规模的 MoE。知乎不过小红书也有人自称「实锤」它是 GLM-5.3-Flash——智谱派内部,其实还分小派系。

三、4个猜测派系,谁有反证?

除了智谱,市面上还流传着这么几个候选:

  • 小米 MiMo V3:Reddit/X 上出现频率最高的答案。逻辑链:8月18日小米 CFO 在财报电话会透露新一代 MiMo 正在训练。今年3月的隐身模型 Hunter Alpha 就是同款操作,后来被小米认领为 MiMo-V2-Pro 早期内测版,同样百万上下文、同样主打 Agent,上线后很快破 1万亿 token 调用。36氪但反证也很直接。B站用户做了对照测试,塞了一大堆敏感词成功调用了,一点也不像小米。哔哩哔哩小米系模型在敏感词管控上向来以严格出名。

  • 腾讯混元 HY4:理由是「能撑住这种规模免费调用的厂商没几个」,腾讯有算力。目前零技术证据,纯排除法反推。

  • DeepSeek V4 Pro 视觉版:小红书有这个猜法,说牛来应该就是长了眼睛的 v4 pro。但 Davis 报告直接排除了这种可能,DeepSeek 此前没有发布视频能力,分词器也对不上。知乎

  • 模型自报家门派:有人问它身份,它自称 Gemini。但让模型自报家门不算证据——stealth 模型的回答受系统提示和训练数据影响,问谁都可能说自己是别家的。

真正有意思的,是社区总结出来的一条规律:今年的 OpenRouter 隐身模型,是个「动物园」。年初 Pony Alpha(马)→ 后来被确认与 GLM-5 相关;3月 Hunter Alpha → 小米认领;6月 Owl Alpha(猫头鹰)→ 美团认领为 LongCat-2.0;现在 8月中旬,Ox Alpha(牛)登场。看懂这个规律,很多神秘感就消失了:这不是悬疑剧,而是国产大模型「隐身发布」的标准流程——先匿名公测,让真实开发者拿真实项目压测,跑一周、烧掉海量 token,再带着反馈正式亮相。表现好,揭晓身份再传播一轮;表现不好,低调收场,品牌无损。

四、怎么白嫖:2条实测可用的路,和2个真实的坑

窗口就一周(预计 8月27日 前后关闭,以平台页面为准),想上手的看这里。以下两条路都有社区实测:

路线1:OpenRouter。 注册、拿 API key,模型名填 `stealth/ox-alpha`,免费模型不需要绑卡,接到任何支持自定义 API 的 Harness 里就能跑。

路线2:OpenCode(以及 DSH 这类想接 OpenCode API 的工具)。 有人已经替你踩过坑了:

  • OpenCode 界面里它叫「Ox Alpha Free」,但 API 里真正的模型ID是 `x-preview-f-free`。有兄弟照着显示名接,401 报错,换了 3 个 key 才发现是 ID 写错了。小红书

  • 端点走 `/zen`,不是 `/zen/go`。

  • 实测吐字 40~50 token/s,高峰期会掉——用原话说,「全世界都在站起来蹬」,挤的时候别抱太高期待。

Ox Alpha白嫖窗口只有一周:4个实锤、4个猜测派系、2条接入路、3条别碰的线

拿它干什么? 社区已经跑出真实案例:

  • 长程 Agent 任务:有人接 OpenRouter API 跑一个重构任务,一个小时没中断,后台一看烧了 1900万 token。小红书这正是官方介绍里反复强调的 sustained agentic work;

  • 大仓库阅读:100万上下文能一口吞下中等规模代码库。OpenCode 以往的限免模型都是 256K,这次是第一次给到 1M;

  • 多模态输入:丢截图、丢视频让它复刻前端,已经有不少成品晒单。

3条别碰的线:

  1. 别上生产。身份未确认、稳定性无承诺、随时可能下架,拿它当生产依赖等于裸奔;

  2. 别喂涉密代码。这本质是一场公开压测,你的任务就是别人的测试数据;

  3. 别依赖严格结构化输出。不支持严格 JSON Schema,流水线靠这个吃饭的请绕行。

五、这波羊毛值多少?算笔账

拿同一平台上的参照价说话:同样百万级上下文的 Gemini 3.7 Flash,每百万 token 输入 $0.375、输出 $1.875;GPT-5.6 Sol Pro 则是输入 $2.5、输出 $15。36氪Ox Alpha:0

Ox Alpha白嫖窗口只有一周:4个实锤、4个猜测派系、2条接入路、3条别碰的线

以前面那个「一小时 1900万 token」的重构任务为例,哪怕全部按 Sol Pro 的输入价算,也要接近 50 美元(约 350 元人民币)——真实产出场景里只会更贵,因为输出单价是输入的 6 倍。对一个重度 Agent 用户来说,这一周免费窗口,差不多是一张价值几百上千美元的「旗舰模型体验卡」。模型圈卷成这样,该薅就薅,不丢人。

六、接下来值得盯的3个信号

  1. 智谱认不认领。 先例摆着(Pony、Hunter、Owl 都从隐身走到了官宣)。知乎智谱一旦被证实,这大概率是传闻中的下一代旗舰(社区普遍猜 GLM-5.5)的发布预演——参考它 8月14日刚发了纯文本版 GLM-5.3;

  2. 免费窗口的确切截止时间。 目前口径是一周、预计 8月27日 前后,以平台页面为准,想薅的别拖到最后一晚;

  3. 认领之后的定价。 身份揭晓只是上半场,定价才决定值不值得把工作流迁过去。参考参照物:GLM-5.3 上线时的 API 定价策略,社区是拿着放大镜看的。

最后说句感受:Ox Alpha 这波,可能是「大模型发布方式换代」最生动的一次样本——没有发布会,模型先进开发者的终端干一周活,再带着真实反馈亮相。对我们这些用 AI 编程干活的人来说,这意味着:以后「限免窗口」会成为抢先体验新旗舰的常态。与其围观猜谜,不如把窗口期利用起来——反正这一周,最贵的东西免费。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章