当前位置:
AIGC文章详情

全网都在猜“牛来”OxAlpha的身份:指向智谱的证据有多硬,8月27日前要不要薅

源自32位全网作者

08:29

这两天大模型圈最热闹的事,不是哪家发了新模型,而是一场全民猜谜。

8月20日,模型路由平台OpenRouter上悄无声息地多了一个匿名模型,ID叫OxAlpha。DeepTech深科技没有厂商署名,没有模型卡,连句正经介绍都没有。但参数一扒出来,整个开发者社区都不困了:100万token上下文、原生多模态(文字、图片、视频都能输入)、单次最多输出13.1万token、支持工具调用、零数据保留,而且——完全免费。机器之心

全网都在猜“牛来”OxAlpha的身份:指向智谱的证据有多硬,8月27日前要不要薅

Ox是"牛"的意思,国内网友很快给它起了个接地气的名字:“牛来”。知乎到了今天,#新模型OxAlpha引大规模身份猜测#已经冲上了微博热搜,知乎上相关问题挂了一排。新浪知乎

对关注智谱GLM的朋友来说,这件事值得停下来看的点只有一个:种种线索都指向智谱的下一代模型。那么证据到底硬不硬?免费的羊毛该怎么薅?现在订阅了GLM的人要不要动?今天把这几件事一次说清楚。

证据链分三档,别把猜测当实锤

社区扒身份的速度很快,但信息质量参差不齐。我把目前流传的证据按可信度分成三档,看完你就知道哪些能信、哪些还得再等等。

第一档:可复现的技术指纹,可信度最高。

有技术博客做了三组交叉验证,每一组都是别人可以照着复现的:

一是视频编码器指纹。研究者用四段不同帧率、时长、分辨率的视频喂给OxAlpha,发现它消耗的视觉token和智谱的GLM-5V-Turbo完全一致,而MiMo、Qwen、GLM-4.6V的结果都明显不同。视频编码方案这种东西近似于"指纹",撞车的概率极低,这是目前最硬的一条证据。DeepTech深科技

全网都在猜“牛来”OxAlpha的身份:指向智谱的证据有多硬,8月27日前要不要薅

二是文本分词器。有人用25组完全不同的提示词对比token数量,OxAlpha和GLM-5.3的计数始终只差固定的75个token——这点固定差值大概率来自系统模板,说明两者底层用的是同一套Tokenizer。机器之心

三是行为特征。OxAlpha会拒绝处理音频输入,和GLM-5V的路由方式一致;回答风格、Agent执行步数、推理接口的形态也都贴着GLM。DeepTech深科技

全网都在猜“牛来”OxAlpha的身份:指向智谱的证据有多硬,8月27日前要不要薅

第二档:单来源线索,方向一致但还没人复核。

有开发者发现,OxAlpha报错时会返回1210状态码,据称这是智谱API独有的错误码——如果属实,基本等于把身份证拍在桌上了。知乎但这条信息目前只见于个别文章,还没看到第二个人独立验证,先记下来等复核。

另外,最早跑测试的开发者Ben Davis公开表态"99%确定这就是GLM-5.x"。老手的直觉有参考价值,但直觉毕竟不是证据。DeepTech深科技

第三档:前科推断,算旁证。

智谱之前就用过同样的玩法:代号Pony Alpha匿名上OpenRouter测试,后来被证实就是GLM-5系列。这次换成Ox,"牛马成群"的代号风格一脉相承,很难说是巧合。机器之心

反证也查了: 另一个被点名的嫌疑人是小米——MiMo-V2-Pro发布前就顶着Hunter Alpha的代号匿名测过。但视频编码器指纹那组实验基本排除了MiMo和Qwen。DeepTech深科技

不过必须说清楚一件事:截至目前,OpenRouter和智谱官方都没有任何回应。所有结论都还是社区推理,准确的表述应该是"大概率是智谱系的模型,但具体是哪款,悬而未决"。谁要是现在就把"牛来=GLM-5.5"当事实转发,那是替厂商官宣了。新浪

全网都在猜“牛来”OxAlpha的身份:指向智谱的证据有多硬,8月27日前要不要薅

具体是哪款模型?目前谁也说不准

“是智谱的"置信度不低,但"是哪一款”,社区现在分成几派:

一说是GLM-5.3的多模态版本机器之心GLM-5.3本体8月14日发布,是纯文本模型,OxAlpha原生支持图片、视频输入,恰好补上这个空档,节奏上完全合理。爱范儿B站已经有UP主直接押注"牛来就是GLM-5.3-Vision"。

一说是Flash类的轻量版本。新浪科技的深度报道结尾就留了这个口子:如果牛来真是一款Flash模型,代码能力已经逼近头部,那完整版还得了?新浪

还有更激进的猜测直接指向下一代旗舰,认为这是智谱在免费放样下一代模型。知乎目前没有任何一方的猜测拿到决定性证据,这部分当谈资看就好,别当结论。

能力到底多强?两个"打架"的数字

社区实测已经跑起来了,但数据有点"打架",正好拿来说明怎么看这类早期测试:

开发者Ben Davis从DeepSWE(专测真实软件工程能力的基准,要求模型读仓库、定位问题、改代码、跑测试、看报错再修)里抽了10项任务,OxAlpha完成了8项,通过率80%;对比成绩是Fable 5 Max 65%、GLM-5.3 Max 62%、Grok 4.6 xhigh 62%、GPT-5.6 Sol Max 52%。DeepTech深科技

但随后另一位开发者在另一组DeepSWE子集上测,结果只有63%左右。机器之心

同一家模型,80%和63%并不矛盾:10个任务的样本太小,两次测试的任务范围和运行配置也不完全一样。目前唯一站得住的结论是:牛来的长程编码能力已经逼近当前头部模型,但精确排名没人给得出来。看到拿这两个数字断言"牛来已经碾压全场"的,直接划走。

全网都在猜“牛来”OxAlpha的身份:指向智谱的证据有多硬,8月27日前要不要薅

免费窗口怎么薅:渠道、期限、避坑

接下来是值友最关心的部分——这羊毛具体怎么薅。

窗口期: 多方信息显示免费期大约持续到8月27日,满打满算还剩四天。DeepTech深科技官方号称免费期间每天能处理100万亿token,数字当宣传语看就好,但对个人开发者来说约等于不限量。知乎

渠道一:OpenRouter。 模型列表里直接找OxAlpha,免费调用,适合已经习惯用OpenRouter做模型路由的人。

渠道二:OpenCode Go。 10美元/月的套餐里直接送了一个OxAlphaFree(模型ID:opencode-go/ox-alpha-free),切换即用,不用额外配置。本来就订了OpenCode Go的人,等于白捡一个顶级模型。知乎

渠道三: 社区反馈agibar等平台也能免费用,渠道还在陆续增加,可以多留意。

三个避坑提醒,认真看:

  1. 它是匿名测试模型,随时可能抽风、改参数、直接下架。拿来体验、跑demo、测自己的任务类型都可以,生产环境的刚需任务别碰知乎

  2. "零数据保留"是卖点,但也意味着没有任何服务保障。它哪天消失,你连个说理的地方都没有。

  3. 免费不等于随便。公司代码、敏感数据别往任何匿名测试模型里扔——数据出了自己的环境就是出了环境,协议写得再好听也是对方一句话的事。

已经在用GLM的人,要不要动?

按身份拆开说:

已经订了GLM Coding Plan的: 不用急着做任何事。GLM-5.3是8月14日发布的新旗舰,API在19日才刚开放,能力档完全够用。IT之家就算牛来真是智谱的,从匿名测试到正式发布、再进订阅套餐,中间还有距离。现在该干嘛干嘛。

正打算买订阅或充API的: 建议盯住8月27日到28日这两个节点。27日免费窗口关闭,28日——按照智谱官方公布的日程——GLM-5.3的模型权重将正式开源。爱范儿权重开源之后,第三方部署的价格大概率还有一轮变化,届时再拿API定价(参考上一代官方标准价:输入8元/输出28元每百万token,5.3的API预计沿用同价)和订阅成本重新比一次账,比现在仓促下单稳。知乎

纯粹想薅羊毛的: 就这四天,100万上下文加多模态的头部模型免费用,这种窗口一年碰不上几回,值得抽半天试试。

接下来值得盯的三个信号

最后给一份观察清单,这事后面大概率还有剧情:

  1. 智谱或OpenRouter的官方回应。 一旦官宣,身份悬念当场终结;参考Pony Alpha的先例,智谱认账只是时间问题。

  2. 8月27日之后的状态。 窗口到期后如果还能调用,说明免费期延长;如果直接下架,那离正式发布通常就不远了。

  3. 8月28日权重开源当天。 如果智谱在开源GLM-5.3权重的同时端出一个新模型,牛来的身份不证自明。

官宣之前,社区已经有人替它"宣判"了:X上有一条帖子直接断言"Ox Alpha就是智谱即将推出的GLM 5.3 Flash",浏览量超过44万。这类断言越多,官方回应就越值钱。

全网都在猜“牛来”OxAlpha的身份:指向智谱的证据有多硬,8月27日前要不要薅

顺带一提,Code Arena上同期还冒出了另一个匿名模型korrine,被猜是Kimi K3.1、Qwen或者MiMo V3,说什么的都有。机器之心8月的大模型圈已经变成了大型猜谜现场——对值友来说,这种匿名测试期恰恰是低成本试错的好时候:不用花钱,就能提前摸到下一代模型的脾气。

一句话总结:身份大概率是智谱系,但具体哪款还没实锤;羊毛值得薅,生产别碰;要花钱的,等27、28日两个节点过了再决定。

内容由AI生成

精选参考来源

1. 神秘“牛来大模型”火爆外网,部分测试超过 Fable、GPT-5.6

2. 神秘「牛来」大模型刷屏,限时免费

3. 月10美元套餐白送神秘新模型:疑是国产GLM-5.5

4. 白嫖一周!有个叫牛来的大模型

5. 【#新模型OxAlpha引大规模身份猜测#,#神秘牛来大模型OxAlpha火了#】近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就是「牛」的意思,国内网友很快给它起了一个更接地气的名字:「牛来」大模型。根据 OpenRouter 披露的信息,Ox Alpha 拥有 100 万 token 上下文,支持文本、图片和视频输入,可以调用工具,目前完全免费。上线后不久,开发者就把它接入编码 Agent,扔进真实代码仓库进行测试。初步测试结果显示,这款来历不明的「牛来」大模型,能力已逼近当前顶级代码模型。与此同时,有网友爆料,一款名为 korrine 的匿名模型正在 Code Arena 上进行测试。有人猜它是 Kimi K3.1,也有人将其指向 Qwen 和 MiMo,说啥的都有。8 月的大模型圈,突然变成了一场大型猜谜游戏。「牛来」大模型表现抢眼Ox Alpha 真正引发关注,靠的是代码能力。开发者 Ben Davis 从 DeepSWE 中抽取 10 项任务进行测试,Ox Alpha 完成了其中 8 项,通过率达到 80%。其公布的对比结果中,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。DeepSWE 考察真实软件工程能力。模型需要阅读代码仓库,定位问题,修改代码,运行测试,再根据报错继续修复。相比单轮编程题,它更接近编码 Agent 的实际工作。不过,10 项任务的样本很小。随后,其他开发者在另一组 DeepSWE 子集上测试,给出的结果约为 63%。两次测试的任务范围和运行配置并不完全相同,暂时无法据此确定 Ox Alpha 的准确排名。不过这些结果初步显示,这款匿名模型已经表现出很强的长程编码潜力,能力逼近当前头部模型。「牛来」大模型到底是谁家的?「牛来」大模型的身份,目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。有人还专门写了个博客进行分析:1. 最强证据来自视频编码器。四段不同帧率、时长和分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致。MiMo、Qwen 和 GLM-4.6V 都呈现出明显不同的结果。2. 文本 tokenizer 也高度吻合。研究者测试了 25 组提示词,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。3. 其他特征也指向智谱。Ox Alpha 拒绝处理音频,与 GLM-5V 的路由方式相同;回答风格、Agent 执行步数和推理接口也很接近 GLM。智谱此前还曾用 Pony Alpha 匿名测试 GLM-5,具备相同操作先例。还有网友从对话中寻到蛛丝马迹。Ben Davis 认为 99% 确定这就是 GLM-5.x。这些线索提高了 GLM 说的可信度,但还不足以完成身份确认。截至目前,OpenRouter、智谱都没有公开回应。korrine 身份更扑朔迷离「牛来」大模型的身份还扑朔迷离,Code Arena 又出现了一个名为 korrine 的匿名模型。最初,不少人猜测它是 Kimi K3.1,原因是 Kimi K3 发布前,曾被认为以 kivine 的代号接受测试。kivine 与 korrine 结构相近,因此引发了联想。不过,最早传播消息的爆料者随后补充称,此前获知的 Moonshot 新模型可能对应另一个代号 adamant-ananke。korrine 也可能来自 Qwen 等其他中国团队。评论区中,还有人将它指向 MiMo V3。大模型厂商为什么喜欢「挂马甲」?匿名测试正在成为大模型正式发布前的重要环节。在 Arena 中隐藏厂商和型号,可以尽量削弱品牌带来的先入为主。用户看不到模型身份,只能根据实际输出进行选择,最终积累的对战结果,也更接近真实用户体验。OpenRouter 提供的是另一类测试环境。开发者会把模型接入各种编码 Agent,让它进入真实仓库,连续调用工具,处理长达数小时的软件工程任务。上下文能否保持稳定,工具调用是否可靠,模型会不会在长程任务中循环或跑偏,都能在高强度使用中迅速暴露。对模型厂商来说,这相当于一次公开压力测试。团队可以提前观察失败案例,验证推理服务的承载能力,也能在正式发布前积累真实口碑。此外,「猜模型」现在也越来越成为一种营销手段了,身份悬念确实可以拉长讨论周期。最后回到模型本身。如果 Ox Alpha 真是一款 Flash 模型,其代码能力已经逼近头部水平,那么资源投入更高、能力更完整的完整版,又会把上限推到哪里呢?(新浪)

6. 神秘「牛来」大模型引发热议,谷歌、SpaceX 都来「蹭」,这意味着什么?

7. 【智谱 GLM-5.3 模型 API 上线,权重下周五开源】智谱 AI 今日宣布,其最新模型 GLM-5.3 API 正式开放。该模型在编码、安全等任务上表现出色,以更低的成本达到了与 GPT-5.6 等顶尖模型同级的智能水平,并已接入 ZCode 等平台。模型权重将于下周开源。#智谱##GLM-5.3#

8. 【#智谱发布GLM5.3#:综合编程与智能体能力指标逼近 Fable 5】就在刚刚,智谱正式发布 GLM-5.3 大模型,重点提升了编程与网络安全防御能力,并宣布将于两周内完成安全加固后开源模型权重。据官方数据披露,GLM-5.3 在未改变原有基座模型的前提下,依托后训练 Scaling 机制实现了核心性能的升级。在编程表现方面,该模型在 Terminal-Bench 3.0 测试中得分由 4.6 提升至 28.3,在 Z.ai Code Bench 端到端高档位测试中准确率达 31.4%(超越 Claude Opus 4.8 最高档位的 29.5%),综合编程与智能体能力指标逼近 Claude Fable 5 水平。在网络安全任务链中,GLM-5.3 在 CyberGym 白盒审查测试中取得 84.5% 的成绩,持平行业闭源模型 Mythos 5。智谱官方表示,旗下编程工具 ZCode 与效率工具 AutoClaw 已于即日上线,并将向开发者开放 GLM Coding Plan 订阅及多平台抢先体验。

9. 如何评价 GLM-5.3 ?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章