这周的大模型圈,主角是一头没有名字的"牛"。
8月20日,一个叫OxAlpha的匿名模型突然出现在OpenRouter上。36氪Ox是"牛"的意思,国内网友很快给它起了个吉利的名字:“牛来”。先说清楚,它不是最近刷屏的那部同名动画电影——这个没有票房,但有104.86万token的上下文。
而且是免费的。新智元OpenCode还直接把它接进了自家平台,社区传言"几乎不限量",免费窗口大约一周。微博配上单次13万token输出、文本/图片/视频多模态输入、支持工具调用、专攻代码和长程Agent这套规格,开发者圈一下就炸了:有来测跑分的,有来猜身世的,更多的是来薅羊毛的。

跑分打架,信哪边都只能信一半
"牛来"刷屏,主要靠一组跑分:开发者Ben Davis从DeepSWE里抽了10项任务,OxAlpha完成了8项,通过率80%。36氪他给出的对比里,Fable 5 Max是65%,GLM-5.3 Max是62%,GPT-5.6 Sol Max只有52%。微博

数字看着很炸裂。但很快,另一位开发者在不同DeepSWE子集上测出的结果只有63%左右。36氪Abacus.AI的CEO Bindu Reddy公开说,他们测下来只达到较早一代模型的水平;沃顿教授Ethan Mollick也评价"惊艳程度一般"。微博从80%到63%,差得不算冤枉。DeepSWE考的是真实软件工程能力:读代码仓库、定位问题、改代码、跑测试、再根据报错继续修,这种长程任务本来就波动大,10道题的样本,抽得好一点或差一点,结果就是十几个百分点的差距。两次测试的任务、配置还不完全一样,严格说根本没法互相对比。
所以结论可以收着点说:OxAlpha的长程编码能力摸到了一线水准的边,但离"碾压旗舰"还差得远。对一个免费模型来说,"值得测一测"本身已经是足够的理由。
全网在做亲子鉴定,证据链指向智谱
让这头牛出圈的第二件事,是没人知道它是谁家的。官方一个字不说,社区只好自己做"数字DNA鉴定":
有人拿25组提示词对比OxAlpha和GLM-5.3的token计数,发现永远固定差75个token,很可能就是一段隐藏系统提示词——tokenizer就像模型的基因序列,很难造假;四段不同帧率、分辨率的视频,OxAlpha消耗的视觉token和智谱GLM-5V-Turbo完全一致;连API报错信息的格式,都被扒出和智谱服务端有对应关系。微博再加上智谱有前科——当年GLM-5发布前,就是挂着PonyAlpha的名字匿名测试的。36氪开发者Ben Davis直接说"99%确定是GLM-5.x系列"。

也有猜谷歌的:一位DeepMind研究员近期发言暧昧,而Gemini 3.5 Pro确实迟迟没露面。微博还有更野的说法,是Cursor拿智谱开源模型自己训了一版,套了个牛头。截至目前,OpenRouter和智谱都没有回应。
其实它是官方试水还是事件营销,对用户没那么重要。重要的是这套"匿名挂马甲+免费开放"的玩法正在变成模型厂商的标准动作:用免费换真实流量压测,用匿名换无偏评测,用揭晓换一波传播。PonyAlpha之后有OxAlpha,后面大概率还排着队。
免费期怎么薅,以及三个坑
如果你平时在用Claude Code、Codex、OpenCode这类编程Agent,这个羊毛值得薅。
上手路径两条:一是在OpenRouter上直接选用OxAlpha;二是OpenCode里输入/models,选择Ox Alpha Free(Zen接口里对应x-preview-f-free)。按OpenCode Zen文档的说法,这个模型零数据留存,也不会拿你的数据做训练。知乎

但别把匿名模型当正式员工。有实测过的知乎用户说得挺对:拿它做可验证、可回滚的任务——解释一个小仓库、补测试、重构一段独立函数、和你常用的模型同题对比,好不好看diff、看测试结果说话。知乎刚被这轮API调价刺到的朋友,也可以把它当一段时间的免费备胎。
三个坑先摆在这:
免费期随时可能结束。目前说法是一周左右,参数和限制随时可能调整。今天薅可以,别把工作流搭在它身上;
别喂敏感代码。就算承诺零留存,提供方毕竟不明,按你自己的安全规范处理;
关键任务不要押上去。匿名模型没有SLA,出了问题没处说理;哪天官方揭晓它只是个"Flash"或者实验版,能力再波动一次也别意外。
至于完全不写代码的朋友,不用焦虑。这头牛卷的是编程Agent的底层,离你日常的问答、写文档还有一层距离,瓜可以看,但不必逼自己记模型ID。
接下来,比揭晓谜底更值得盯的
两个信号值得留意。第一,按OpenRouter此前几次匿名Alpha模型的惯例,匿名期结束总要有人出来"牵牛回家"官宣认领。如果真是智谱GLM-5.x,正式版会不会保留同样激进的规格、国内会不会同步上线,才是真正影响钱包的信息。第二,8月的猜谜不止这一头:CodeArena上还有一款叫korrine的匿名模型,被猜是Kimi K3.1。36氪LMArena上也冒出了代号adamant-ananke的匿名灰测,预测市场里有88%的押注认为下一款K系模型会在9月底前发布。哔哩哔哩灰测一个接一个地冒,这波"马甲潮"短期不会停。
错过这次免费窗口也不用太可惜。匿名模型时代,免费窗口只会越来越多。真正值钱的能力,是看清跑分打架时信哪边、免费羊毛里哪些值得真接进工作流。