当前位置:
AIGC文章详情

“牛来”爆火,谷歌抢着认领:Ox Alpha是不是Gemini?先看证据链再激动

源自48位全网作者

04:22

这两天,AI圈在给一头牛做亲子鉴定。

8月20日前后,一个叫Ox Alpha的匿名模型突然出现在OpenRouter上。Ox就是"牛",赶上电影《牛来》的梗正在全网火,国内网友干脆给它起了个更接地气的名字——「牛来」大模型。搜狐科技规格激进得离谱:104.86万token上下文、单次13万token输出、支持文本图片视频多模态,专门瞄准代码、长周期Agent和复杂推理。微博

更让人心动的是,这头牛暂时不要钱:OxAlpha目前在OpenRouter上的输入和输出价格均为零。36氪OpenCode里也有限时免费的ox-alpha-free入口,文档写明零数据留存、不用你的数据训练模型。知乎

免费、匿名、规格拉满,三重Buff叠满,硅谷大佬们都坐不住了,排队亲自上手测。Stripe的CEO Patrick Collison试完只留下四个字「相当惊艳」,Hermes Agent的创始人更是说它超过了自家所有内部评估标准。新智元

但实测跑分非常分裂。有独立测试跑出编程任务80%的通过率,超过Claude Fable的65%和GPT-5.6 Sol的52%。微博细看那是从DeepSWE里抽10项任务完成了8项,连结果出处自己都承认,10项任务的样本很小。搜狐科技DeepSWE的一作Wenqi Huang把它拉去跑仓库级修bug测试,准确率直冲63%,只比Grok 4.6差一点。新智元

“牛来”爆火,谷歌抢着认领:Ox Alpha是不是Gemini?先看证据链再激动

可也有人不买账:Abacus.AI的CEO Bindu Reddy公开说他们测下来只达到较早一代模型水平,沃顿教授Ethan Mollick也说"惊艳程度一般"。微博后来又有人拿更大的DeepSWE子集跑了一遍,完整跑分约58.4%,贴着Opus 4.8、持平DeepSeek V4 Pro——之前刷屏的80%,大概率是小样本噪声。小红书跑分分裂对匿名模型来说不算意外,没人知道它是谁、为谁优化过,测试集各测各的。真正的看点是那场「亲子鉴定」侦探游戏——目前证据链的方向,其实已经比较清楚了。

证据一:服务器自己开了口

最开始大家只能靠指纹猜。有人拿25组不同Prompt做对比测试,发现Ox Alpha和GLM-5.3的token计数呈现高度一致的固定偏移关系——多出来的那75个token,恰好能被一段隐藏System Prompt解释。视频编码方式也被扒出来和智谱的多模态方案高度相似。甚至API的报错信息格式,都有人找到了和智谱服务端的对应关系。微博tokenizer就像模型的基因序列,是最难造假的一层,所以社区一度猜智谱的占绝大多数。

紧接着有人玩得更狠:直接给服务器发了一个格式错误的请求,它抛出的Java堆栈跟踪里,明晃晃带着内部类名,对应智谱官方文档里的/api/paas/v4/chat/completions路由,这不是指纹猜测,而是服务器的自证。小红书还有用户进一步试探,怀疑它的内部代号是GLM-5.3-t——一个Flash级的小模型。小红书而且智谱有先例可循:此前曾用Pony Alpha匿名测试GLM-5,属于相同操作。搜狐科技

“牛来”爆火,谷歌抢着认领:Ox Alpha是不是Gemini?先看证据链再激动

证据二:谷歌的暗示,含金量不高

谷歌这边倒是相当积极。DeepMind研究员Evan Otero先单发了一个词,Gemini,过一会儿又补了一句「万一Ox Alpha就是我们一路遇到的朋友呢」,同在DeepMind的Vamsi Batchu也跟了一句「谷歌回来了,相信流程」——阴阳怪气全开,就是没一个人把话说死。新智元知乎上也出现了相关热门提问,讨论怎么看有猜测认为谷歌的人集体暗示Ox Alpha模型是Gemini。知乎至于其他嫌疑人——Cursor拿开源模型自己训了一版再套个牛头、小米、腾讯之类——就当听个乐子。

谷歌蹭这波热度,暴露了什么

这波认领的效果,堪称翻车。外网高赞评论直接封神:GLM等于Google Language Model,一句话把「指纹指向GLM」这事怼回了谷歌脸上。新智元

但一直关注Gemini的人,能从这波操作里读出点真东西:Gemini的旗舰位置,空得太久了。

看谷歌这半年的节奏:Flash系列在疯狂迭代,距离 3.6 Flash 发布才过了三周,Google 就端出了 Gemini 3.7 Flash,核心是把Flash系列往编程、Agent两个方向猛推。知乎8 月 15 日,Gemini 官方账号宣布,Gemini 3.7 Flash 已开始向 Gemini 聊天中的 Google AI Pro 和 Ultra 用户开放。知乎定价上,3.7 Flash和涨价后的DeepSeek V4 Pro高峰期价格差不太多,官方对比表里Input 0.75美元、Output 3.75美元每百万token。微博

“牛来”爆火,谷歌抢着认领:Ox Alpha是不是Gemini?先看证据链再激动

可用户最关心的那个塔尖呢?3.5 Pro至今几个月了都还没发布,版本号直接跳过到3.7了。微博播客主播Theo Jaffee有句话说得最狠:这不可能是Flash模型,如果这真是个Flash,那美国就完蛋了。新智元现在结合网上流传的「疑似GLM-5.3-t、Flash级小模型」的说法品一品:如果一个Flash级的模型匿名出来就能贴着旗舰的分数跑,这句话打的不只是美国的脸,也正好戳在只能拿Flash出来应战的谷歌身上。而据新智元报道,Gemini联合负责人Noam Shazeer去了OpenAI、拿诺贝尔化学奖的John Jumper去了Anthropic,留在公司里的员工也在公开抱怨「我们落后了」——旗舰空窗加人心浮动,大概才是谷歌急着下场认牛的真正原因。

Gemini用户现在该怎么办

三个判断,仅供参考。

第一,先别急着把Ox Alpha当成下一代Gemini。硬证据链指向智谱的方向更扎实,谷歌只给了暗示没给实锤。按OpenRouter近几次Alpha模型的惯例,匿名期结束之后总得有人出来"牵牛回家",谜底不会太远。微博在官宣之前,所有「内部消息」都建议打对折看。

第二,不管它是谁家的,这波羊毛都值得薅。价格是零、承诺零数据留存,窗口也有限——按新智元的说法,这次免费开放只有一周。新智元平时写代码、跑Agent的,可以丢给它几个可验证、可回滚的小任务:解释一个小仓库、补一组测试、重构一段独立函数,看diff和任务完成度说话,别急着信排行榜。知乎已经有开发者趁着限免让它搓出「吹牛测肺活量」「鹈鹕骑车」这种小游戏,完成度确实能看。敏感代码照旧按自己的安全规矩来,免费期限和使用限制随时可能调整。

“牛来”爆火,谷歌抢着认领:Ox Alpha是不是Gemini?先看证据链再激动

第三,Gemini用户真正该盯的,是牛背后的两件事。一是Gemini 3.5 Pro到底什么时候发——这次风波把旗舰空窗的尴尬摆上了台面,它直接决定你手里的Gemini订阅还值不值得续;二是Flash系列的价格和速度走势,3.7 Flash已经把价格打到每百万token 0.75/3.75美元,后面和国产模型的价格战还有得看。顺带一提,谷歌开学季官宣美国学生可以免费领一年Google AI Pro(原价19.99美元/月,还附送5TB Drive网盘),国内用户大多用不上,看个热闹就好。知乎

牛早晚会被牵回家。但不管最后姓什么,这头匿名牛已经证明了一件事:模型能力趋同的年代,tokenizer是指纹,报错信息是身份证,厂商藏不住任何痕迹,能藏的只有发布时间。三个信号会继续盯:Ox Alpha匿名期揭晓、Gemini 3.5 Pro官宣、Flash线的下一次调价,有进展随时更新。

内容由AI生成

精选参考来源

1. 【#新模型OxAlpha引大规模身份猜测#,#神秘牛来大模型OxAlpha火了#】近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter……

2. 赛博茶馆:全网都在给一个“匿名大模型”做亲子鉴定,它叫Ox Alpha……

3. 神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米

4. OpenCode 新上的 Ox Alpha Free 和 DeepSeek V4 Flash 多模态,值得试吗?

5. AI圈因为一头来历不明的牛,又炸了!Ox Alpha免费开放一周,硅谷大佬排队亲测……

6. 神秘AI模型OxAlpha火爆外网:上下文窗口104万token,独立测试编程任务通过率80%

7. 大家传疯了的那个 Ox Alpha,实测真相出来了

8. 突发新闻:隐形型号 Ox Alpha 是Z.ai

9. 怎么看有猜测认为谷歌的人集体暗示 Ox Alpha 模型是 Gemini ?

10. Gemini 3.7 Flash,三周就更新,这次动的不是版本号

11. 谷歌发布 Gemini 3 Flash,相比上一代 2.5 Flash 有哪些提升?使用体验如何?

12. Gemini 3.7 Flash发布了,价格和涨价后的DeepSeek V4 Pro高峰期差不太多

13. 谷歌这操作有点看不懂,曾经的三巨头现在只剩俩了,3.5pro至今几个月了都还没发布

14. 谷歌羊毛又来了!Gemini Pro 免费一年,还送 5TB 网盘

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章