这两天大模型圈最热闹的事,不是哪家发了新模型,而是一场全民猜谜。
8月20日,模型路由平台OpenRouter上悄无声息地多了一个匿名模型,ID叫OxAlpha。DeepTech深科技没有厂商署名,没有模型卡,连句正经介绍都没有。但参数一扒出来,整个开发者社区都不困了:100万token上下文、原生多模态(文字、图片、视频都能输入)、单次最多输出13.1万token、支持工具调用、零数据保留,而且——完全免费。机器之心

Ox是"牛"的意思,国内网友很快给它起了个接地气的名字:“牛来”。知乎到了今天,#新模型OxAlpha引大规模身份猜测#已经冲上了微博热搜,知乎上相关问题挂了一排。新浪知乎
对关注智谱GLM的朋友来说,这件事值得停下来看的点只有一个:种种线索都指向智谱的下一代模型。那么证据到底硬不硬?免费的羊毛该怎么薅?现在订阅了GLM的人要不要动?今天把这几件事一次说清楚。
证据链分三档,别把猜测当实锤
社区扒身份的速度很快,但信息质量参差不齐。我把目前流传的证据按可信度分成三档,看完你就知道哪些能信、哪些还得再等等。
第一档:可复现的技术指纹,可信度最高。
有技术博客做了三组交叉验证,每一组都是别人可以照着复现的:
一是视频编码器指纹。研究者用四段不同帧率、时长、分辨率的视频喂给OxAlpha,发现它消耗的视觉token和智谱的GLM-5V-Turbo完全一致,而MiMo、Qwen、GLM-4.6V的结果都明显不同。视频编码方案这种东西近似于"指纹",撞车的概率极低,这是目前最硬的一条证据。DeepTech深科技

二是文本分词器。有人用25组完全不同的提示词对比token数量,OxAlpha和GLM-5.3的计数始终只差固定的75个token——这点固定差值大概率来自系统模板,说明两者底层用的是同一套Tokenizer。机器之心
三是行为特征。OxAlpha会拒绝处理音频输入,和GLM-5V的路由方式一致;回答风格、Agent执行步数、推理接口的形态也都贴着GLM。DeepTech深科技

第二档:单来源线索,方向一致但还没人复核。
有开发者发现,OxAlpha报错时会返回1210状态码,据称这是智谱API独有的错误码——如果属实,基本等于把身份证拍在桌上了。知乎但这条信息目前只见于个别文章,还没看到第二个人独立验证,先记下来等复核。
另外,最早跑测试的开发者Ben Davis公开表态"99%确定这就是GLM-5.x"。老手的直觉有参考价值,但直觉毕竟不是证据。DeepTech深科技
第三档:前科推断,算旁证。
智谱之前就用过同样的玩法:代号Pony Alpha匿名上OpenRouter测试,后来被证实就是GLM-5系列。这次换成Ox,"牛马成群"的代号风格一脉相承,很难说是巧合。机器之心
反证也查了: 另一个被点名的嫌疑人是小米——MiMo-V2-Pro发布前就顶着Hunter Alpha的代号匿名测过。但视频编码器指纹那组实验基本排除了MiMo和Qwen。DeepTech深科技
不过必须说清楚一件事:截至目前,OpenRouter和智谱官方都没有任何回应。所有结论都还是社区推理,准确的表述应该是"大概率是智谱系的模型,但具体是哪款,悬而未决"。谁要是现在就把"牛来=GLM-5.5"当事实转发,那是替厂商官宣了。新浪

具体是哪款模型?目前谁也说不准
“是智谱的"置信度不低,但"是哪一款”,社区现在分成几派:
一说是GLM-5.3的多模态版本。机器之心GLM-5.3本体8月14日发布,是纯文本模型,OxAlpha原生支持图片、视频输入,恰好补上这个空档,节奏上完全合理。爱范儿B站已经有UP主直接押注"牛来就是GLM-5.3-Vision"。
一说是Flash类的轻量版本。新浪科技的深度报道结尾就留了这个口子:如果牛来真是一款Flash模型,代码能力已经逼近头部,那完整版还得了?新浪
还有更激进的猜测直接指向下一代旗舰,认为这是智谱在免费放样下一代模型。知乎目前没有任何一方的猜测拿到决定性证据,这部分当谈资看就好,别当结论。
能力到底多强?两个"打架"的数字
社区实测已经跑起来了,但数据有点"打架",正好拿来说明怎么看这类早期测试:
开发者Ben Davis从DeepSWE(专测真实软件工程能力的基准,要求模型读仓库、定位问题、改代码、跑测试、看报错再修)里抽了10项任务,OxAlpha完成了8项,通过率80%;对比成绩是Fable 5 Max 65%、GLM-5.3 Max 62%、Grok 4.6 xhigh 62%、GPT-5.6 Sol Max 52%。DeepTech深科技
但随后另一位开发者在另一组DeepSWE子集上测,结果只有63%左右。机器之心
同一家模型,80%和63%并不矛盾:10个任务的样本太小,两次测试的任务范围和运行配置也不完全一样。目前唯一站得住的结论是:牛来的长程编码能力已经逼近当前头部模型,但精确排名没人给得出来。看到拿这两个数字断言"牛来已经碾压全场"的,直接划走。

免费窗口怎么薅:渠道、期限、避坑
接下来是值友最关心的部分——这羊毛具体怎么薅。
窗口期: 多方信息显示免费期大约持续到8月27日,满打满算还剩四天。DeepTech深科技官方号称免费期间每天能处理100万亿token,数字当宣传语看就好,但对个人开发者来说约等于不限量。知乎
渠道一:OpenRouter。 模型列表里直接找OxAlpha,免费调用,适合已经习惯用OpenRouter做模型路由的人。
渠道二:OpenCode Go。 10美元/月的套餐里直接送了一个OxAlphaFree(模型ID:opencode-go/ox-alpha-free),切换即用,不用额外配置。本来就订了OpenCode Go的人,等于白捡一个顶级模型。知乎
渠道三: 社区反馈agibar等平台也能免费用,渠道还在陆续增加,可以多留意。
三个避坑提醒,认真看:
它是匿名测试模型,随时可能抽风、改参数、直接下架。拿来体验、跑demo、测自己的任务类型都可以,生产环境的刚需任务别碰。知乎
"零数据保留"是卖点,但也意味着没有任何服务保障。它哪天消失,你连个说理的地方都没有。
免费不等于随便。公司代码、敏感数据别往任何匿名测试模型里扔——数据出了自己的环境就是出了环境,协议写得再好听也是对方一句话的事。
已经在用GLM的人,要不要动?
按身份拆开说:
已经订了GLM Coding Plan的: 不用急着做任何事。GLM-5.3是8月14日发布的新旗舰,API在19日才刚开放,能力档完全够用。IT之家就算牛来真是智谱的,从匿名测试到正式发布、再进订阅套餐,中间还有距离。现在该干嘛干嘛。
正打算买订阅或充API的: 建议盯住8月27日到28日这两个节点。27日免费窗口关闭,28日——按照智谱官方公布的日程——GLM-5.3的模型权重将正式开源。爱范儿权重开源之后,第三方部署的价格大概率还有一轮变化,届时再拿API定价(参考上一代官方标准价:输入8元/输出28元每百万token,5.3的API预计沿用同价)和订阅成本重新比一次账,比现在仓促下单稳。知乎
纯粹想薅羊毛的: 就这四天,100万上下文加多模态的头部模型免费用,这种窗口一年碰不上几回,值得抽半天试试。
接下来值得盯的三个信号
最后给一份观察清单,这事后面大概率还有剧情:
智谱或OpenRouter的官方回应。 一旦官宣,身份悬念当场终结;参考Pony Alpha的先例,智谱认账只是时间问题。
8月27日之后的状态。 窗口到期后如果还能调用,说明免费期延长;如果直接下架,那离正式发布通常就不远了。
8月28日权重开源当天。 如果智谱在开源GLM-5.3权重的同时端出一个新模型,牛来的身份不证自明。
官宣之前,社区已经有人替它"宣判"了:X上有一条帖子直接断言"Ox Alpha就是智谱即将推出的GLM 5.3 Flash",浏览量超过44万。这类断言越多,官方回应就越值钱。

顺带一提,Code Arena上同期还冒出了另一个匿名模型korrine,被猜是Kimi K3.1、Qwen或者MiMo V3,说什么的都有。机器之心8月的大模型圈已经变成了大型猜谜现场——对值友来说,这种匿名测试期恰恰是低成本试错的好时候:不用花钱,就能提前摸到下一代模型的脾气。
一句话总结:身份大概率是智谱系,但具体哪款还没实锤;羊毛值得薅,生产别碰;要花钱的,等27、28日两个节点过了再决定。