这两天,大模型圈被一头"无主的牛"搅翻了天。
8月20日深夜,一款没有厂商名、没有模型卡的匿名模型悄悄出现在模型聚合平台OpenRouter上,ID叫OxAlpha。量子位Ox就是"牛",正好赶上抽象电影《牛来》的梗火遍全网,国内网友顺手给它起了个外号——「牛来」大模型。
免费、超过100万token上下文、能看图看视频、主打编程和长周期Agent,就这几个标签,足够让开发者圈炸锅。三天之内:DeepSWE基准的一作亲自拉它跑测试,Stripe的CEO上手试完留下四个单词,DeepMind的研究员下场疯狂暗示,全网都在问同一个问题——这头牛,到底是谁家的?
先给没耐心的朋友一个结论速览:
它是什么:一款瞄准编程/Agent场景的匿名模型,目前完全免费。按上线一周的口径,免费窗口大约8月27日前后关闭。DeepTech深科技
它是谁家的:官方至今没有认领。但社区扒出的三条可复现的硬证据,全部指向智谱GLM系;谷歌方面试图"认领",反而被全网群嘲。
值不值得试:跑编码Agent、吃长上下文的用户,值得冲;要放敏感代码的,先别碰;纯看热闹的,等身份揭晓再吃瓜不迟。
最大的坑:目前的高分全是小样本社区测试,正反评价分歧极大,没有任何官方基准背书。
一、这头牛什么规格
把OpenRouter和OpenCode公开的信息捋一遍,这头牛的纸面参数相当激进:
上下文:约104.86万token,单次最大输出13.1万token。新智元
输入:文本、图片、视频都支持;音频会被明确拒绝——这一点后来也成了查身份的线索之一
能力:工具调用、强制推理模式,定位就是编码、长周期Agent和复杂推理
渠道:OpenRouter可直接调API;OpenCode Go几乎不限量免费,还不扣用户原有额度。量子位
数据:OpenCode公开的使用数据显示,上线几天累计用量已到2500亿token级别,约8500名独立用户、超过11万次完成会话;平台方还给出了"零数据保留"的承诺

这套规格明显是为Agent场景调过的。100万上下文是什么概念?一个中型代码仓库、几百页文档、一长串Agent运行记录,可以一次性全塞进去。有开发者把它接进Codex之后,团队直接改了工作习惯——以前要精挑细选哪些文件值得喂给模型,现在整个仓库一股脑丢进去。搁以前按量计费这么用,账单能看哭;现在免费,这就是白嫖党唯一的机会窗口。
二、身份悬疑:三条硬证据和一堆传闻
「牛来」到底是谁家的?社区这几天干的事,堪称给模型做了一套"数字DNA鉴定"。证据分三档,含金量差别很大。
第一档:可复现的技术指纹。
第一条是分词器指纹。不同模型家族的切词逻辑不同,面对同一段刻意设计的文本,token数量会留下稳定的"指纹"。有测试者用25组不同的prompt逐一比对,OxAlpha和GLM-5.3的token计数每一组都差固定的75个——刚好可以用一段外挂的隐藏System Prompt解释。新智元流传最广的一组测试里,同一段中英文混合代码的文本,GLM-5.2和GLM-5.3都算出68个token,只有OxAlpha显示143个。量子位
第二条是视频编码指纹。文本回答习惯可以靠蒸馏和后训练模仿,但视频进入模型前的编码管线是工程设计,很难装。有研究者做了4段控制变量的测试视频,分别喂给OxAlpha和几款多模态模型比对token预算:OxAlpha和GLM-5V-Turbo在帧率采样策略、每秒约147个token的时长增长、分辨率缩放方式上逐项对上;而同场对比的MiMo、Qwen、GLM-4.6V,特征完全不同。DeepTech深科技
第三条是API服务层的痕迹。有人故意传入异常参数,捕捉到"[1210] The temperature parameter is illegal"这类报错,错误码风格、参数限制、中英文混排的返回方式,都被认为和智谱现有服务高度相似。量子位

第二档:低可靠度的"彩蛋"。 有用户声称在推理输出里捕捉到过"trained by Z.ai"的残留字样,但目前只有社区截图和二手转述,证据等级明显低一档,当彩蛋看就好。量子位

第三档:没有证据的联想。 谷歌派的主要依据是产品画像(超长上下文、原生视频输入、Agent导向,像Gemini),加上DeepMind研究员Evan Otero发帖只写了一个词"Gemini",又补了句"万一OxAlpha就是我们一路遇到的朋友呢"。量子位同事Vamsi Batchu跟帖"谷歌回来了,相信流程"。全程阴阳怪气,没一个人把话说死。结果可想而知——被全网笑惨。高赞评论堪称封神:“GLM = Google Language Model”。新智元还有更抽象的猜法:MiMo-V3、Grok 4.7,以及"Cursor拿开源GLM自己训了一遍然后套了个牛头"(纯玩梗)。
智谱说之所以是最大热门,还有个关键背景:它有前科。今年2月,OpenRouter上线过另一款匿名模型PonyAlpha,全网猜了六天,最后揭晓就是智谱GLM-5的早期测试版。DeepTech深科技同一套操作,同一个平台,这次要是还是智谱,"一牛一马"就算凑齐了。
三、80%通过率?先看这份分歧表
能力这边,网上的数据分成两派,分歧大到离谱。
看好派的数据:
开发者Ben Davis从DeepSWE抽了10项真实软件工程任务,OxAlpha完成8项,通过率80%;他公布的同任务对比:Fable 5为65%,GLM-5.3为62%,Grok 4.6为62%,GPT-5.6 Sol为52%。DeepTech深科技他的定性评价是:大致在GPT-5.6 Sol medium那一档,长周期任务和subagent都接得住。
DeepSWE一作Wenqi Huang亲自拉它跑了自家测试:准确率63%,在闭源模型里仅略低于Grok 4.6。新智元
B站UP主的全维度实测:SWE-bench Mini 50题答对48题(96%)
Stripe CEO Patrick Collison试完评价"It’s very impressive"。量子位;Hermes Agent创始人说它超过了团队所有内部评估标准

唱衰派的数据:
Abacus.AI CEO Bindu Reddy公开表示,他们的测试显示OxAlpha低于预期,一些指标只达到较早一代模型的水平。量子位
沃顿商学院教授Ethan Mollick:惊艳程度一般。
有开发者拿私有基准测试发现:它在低推理强度下表现一般;视觉任务明显弱于Gemini系列
国内几位实测UP主的共同发现:强约束指令(比如"用6到9句话收尾")偶尔收不住尾,关键产出需要人工复核
我的判断:所有高分都是10题级别的小样本社区测试,不是官方基准,任务集和配置也各不相同,80%和63%都对,只是没法互相推导。眼下对OxAlpha最准确的描述是——某些代码和Agent任务表现极亮眼、规格极激进,同时评测分歧极大。喊"新王登基"和喊"不过如此"的,都跑在了证据前面。
四、值不值得试,分人
用Codex、Claude Code、OpenCode、DeepSeek Harness这类编码Agent的:值得冲。注册OpenRouter拿个key就能接,免费窗口里把平时舍不得喂的大仓库、长任务全跑一遍。如果最后揭晓真是GLM的Flash档,收费后的定价大概率可以参考GLM系API,窗口期正好用来评估"以后要不要迁"。
日常聊天、写文案为主的:不用急。这头牛是冲着Agent场景调的,聊天体验未必比你手边的国产助手强,指令遵循的小毛病也被实测抓到了。
所有人都要注意的一条:"零数据保留"目前只是承诺,匿名模型背后是谁都没揭晓,追责主体不明。涉密仓库、客户数据、没开源的内部代码,先别往里丢。等身份揭晓、条款落地再说。
时间节点再划一次:8月20日上线,免费一周,预计8月27日前后窗口关闭,目前没有官方延期公告。DeepTech深科技新智元
五、谈资增量:厂商为什么爱"挂马甲"发模型
这件事里比模型本身更值得看懂的,是"匿名测试"这套玩法。厂商图三样东西:
盲测去品牌偏见。竞技场上藏掉厂商和型号,用户只能凭实际输出投票,积累的数据更接近真实体验,而不是品牌滤镜。
免费的公开压力测试。开发者拿着真实仓库、连续几小时的Agent任务来压,上下文稳不稳、工具调用靠不可靠、长任务会不会跑偏循环、推理服务扛不扛得住,全都在正式发布前暴露出来,提前修。机器之心
悬念就是营销。身份猜谜本身会拉长讨论周期——这一波连谷歌都下场蹭热度,OpenRouter和背后的厂商一分钱推广费没花,赚足了全网曝光。DeepTech深科技

对普通用户也有个实用提醒:以后再看到"匿名模型碾压某某旗舰"的爆款,先问两句——样本多少题?谁测的?样本越小,越要让子弹飞一会儿。
六、接下来盯这几个信号
OpenRouter或智谱官方认领:按PonyAlpha的先例,上线六天就揭晓了。这头牛8月21日前后全面上线,答案可能就在这几天。
korrine的身份:CodeArena上还有一款匿名模型korrine在被围观,有人猜Kimi K3.1,也有人指向Qwen或MiMo。机器之心8月的大模型圈,已经变成大型猜谜现场。
如果真是GLM-5.3的Flash或多模态版:智谱正式发布的节奏和定价,会直接决定这头牛"免费期结束后还值不值得跟"。
牛来都来了,牵牛回家的人应该也不远了。