当前位置:
AIGC文章详情

「牛来」大模型刷屏:三条硬证据指向智谱,谷歌下场蹭热度被群嘲——免费窗口薅之前,先看这份评测分歧表

源自23位全网作者

02:00

这两天,大模型圈被一头"无主的牛"搅翻了天。

8月20日深夜,一款没有厂商名、没有模型卡的匿名模型悄悄出现在模型聚合平台OpenRouter上,ID叫OxAlpha。量子位Ox就是"牛",正好赶上抽象电影《牛来》的梗火遍全网,国内网友顺手给它起了个外号——「牛来」大模型。

免费、超过100万token上下文、能看图看视频、主打编程和长周期Agent,就这几个标签,足够让开发者圈炸锅。三天之内:DeepSWE基准的一作亲自拉它跑测试,Stripe的CEO上手试完留下四个单词,DeepMind的研究员下场疯狂暗示,全网都在问同一个问题——这头牛,到底是谁家的?

先给没耐心的朋友一个结论速览:

  • 它是什么:一款瞄准编程/Agent场景的匿名模型,目前完全免费。按上线一周的口径,免费窗口大约8月27日前后关闭。DeepTech深科技

  • 它是谁家的:官方至今没有认领。但社区扒出的三条可复现的硬证据,全部指向智谱GLM系;谷歌方面试图"认领",反而被全网群嘲。

  • 值不值得试:跑编码Agent、吃长上下文的用户,值得冲;要放敏感代码的,先别碰;纯看热闹的,等身份揭晓再吃瓜不迟。

  • 最大的坑:目前的高分全是小样本社区测试,正反评价分歧极大,没有任何官方基准背书。

一、这头牛什么规格

把OpenRouter和OpenCode公开的信息捋一遍,这头牛的纸面参数相当激进:

  • 上下文:约104.86万token,单次最大输出13.1万token。新智元

  • 输入:文本、图片、视频都支持;音频会被明确拒绝——这一点后来也成了查身份的线索之一

  • 能力:工具调用、强制推理模式,定位就是编码、长周期Agent和复杂推理

  • 渠道:OpenRouter可直接调API;OpenCode Go几乎不限量免费,还不扣用户原有额度。量子位

  • 数据:OpenCode公开的使用数据显示,上线几天累计用量已到2500亿token级别,约8500名独立用户、超过11万次完成会话;平台方还给出了"零数据保留"的承诺

「牛来」大模型刷屏:三条硬证据指向智谱,谷歌下场蹭热度被群嘲——免费窗口薅之前,先看这份评测分歧表

这套规格明显是为Agent场景调过的。100万上下文是什么概念?一个中型代码仓库、几百页文档、一长串Agent运行记录,可以一次性全塞进去。有开发者把它接进Codex之后,团队直接改了工作习惯——以前要精挑细选哪些文件值得喂给模型,现在整个仓库一股脑丢进去。搁以前按量计费这么用,账单能看哭;现在免费,这就是白嫖党唯一的机会窗口。

二、身份悬疑:三条硬证据和一堆传闻

「牛来」到底是谁家的?社区这几天干的事,堪称给模型做了一套"数字DNA鉴定"。证据分三档,含金量差别很大。

第一档:可复现的技术指纹。

  • 第一条是分词器指纹。不同模型家族的切词逻辑不同,面对同一段刻意设计的文本,token数量会留下稳定的"指纹"。有测试者用25组不同的prompt逐一比对,OxAlpha和GLM-5.3的token计数每一组都差固定的75个——刚好可以用一段外挂的隐藏System Prompt解释。新智元流传最广的一组测试里,同一段中英文混合代码的文本,GLM-5.2和GLM-5.3都算出68个token,只有OxAlpha显示143个。量子位

  • 第二条是视频编码指纹。文本回答习惯可以靠蒸馏和后训练模仿,但视频进入模型前的编码管线是工程设计,很难装。有研究者做了4段控制变量的测试视频,分别喂给OxAlpha和几款多模态模型比对token预算:OxAlpha和GLM-5V-Turbo在帧率采样策略、每秒约147个token的时长增长、分辨率缩放方式上逐项对上;而同场对比的MiMo、Qwen、GLM-4.6V,特征完全不同。DeepTech深科技

  • 第三条是API服务层的痕迹。有人故意传入异常参数,捕捉到"[1210] The temperature parameter is illegal"这类报错,错误码风格、参数限制、中英文混排的返回方式,都被认为和智谱现有服务高度相似。量子位

「牛来」大模型刷屏:三条硬证据指向智谱,谷歌下场蹭热度被群嘲——免费窗口薅之前,先看这份评测分歧表

第二档:低可靠度的"彩蛋"。 有用户声称在推理输出里捕捉到过"trained by Z.ai"的残留字样,但目前只有社区截图和二手转述,证据等级明显低一档,当彩蛋看就好。量子位

「牛来」大模型刷屏:三条硬证据指向智谱,谷歌下场蹭热度被群嘲——免费窗口薅之前,先看这份评测分歧表

第三档:没有证据的联想。 谷歌派的主要依据是产品画像(超长上下文、原生视频输入、Agent导向,像Gemini),加上DeepMind研究员Evan Otero发帖只写了一个词"Gemini",又补了句"万一OxAlpha就是我们一路遇到的朋友呢"。量子位同事Vamsi Batchu跟帖"谷歌回来了,相信流程"。全程阴阳怪气,没一个人把话说死。结果可想而知——被全网笑惨。高赞评论堪称封神:“GLM = Google Language Model”。新智元还有更抽象的猜法:MiMo-V3、Grok 4.7,以及"Cursor拿开源GLM自己训了一遍然后套了个牛头"(纯玩梗)。

智谱说之所以是最大热门,还有个关键背景:它有前科。今年2月,OpenRouter上线过另一款匿名模型PonyAlpha,全网猜了六天,最后揭晓就是智谱GLM-5的早期测试版。DeepTech深科技同一套操作,同一个平台,这次要是还是智谱,"一牛一马"就算凑齐了。

三、80%通过率?先看这份分歧表

能力这边,网上的数据分成两派,分歧大到离谱。

看好派的数据:

  • 开发者Ben Davis从DeepSWE抽了10项真实软件工程任务,OxAlpha完成8项,通过率80%;他公布的同任务对比:Fable 5为65%,GLM-5.3为62%,Grok 4.6为62%,GPT-5.6 Sol为52%。DeepTech深科技他的定性评价是:大致在GPT-5.6 Sol medium那一档,长周期任务和subagent都接得住。

  • DeepSWE一作Wenqi Huang亲自拉它跑了自家测试:准确率63%,在闭源模型里仅略低于Grok 4.6。新智元

  • B站UP主的全维度实测:SWE-bench Mini 50题答对48题(96%)

  • Stripe CEO Patrick Collison试完评价"It’s very impressive"。量子位;Hermes Agent创始人说它超过了团队所有内部评估标准

「牛来」大模型刷屏:三条硬证据指向智谱,谷歌下场蹭热度被群嘲——免费窗口薅之前,先看这份评测分歧表

唱衰派的数据:

  • Abacus.AI CEO Bindu Reddy公开表示,他们的测试显示OxAlpha低于预期,一些指标只达到较早一代模型的水平。量子位

  • 沃顿商学院教授Ethan Mollick:惊艳程度一般。

  • 有开发者拿私有基准测试发现:它在低推理强度下表现一般;视觉任务明显弱于Gemini系列

  • 国内几位实测UP主的共同发现:强约束指令(比如"用6到9句话收尾")偶尔收不住尾,关键产出需要人工复核

我的判断:所有高分都是10题级别的小样本社区测试,不是官方基准,任务集和配置也各不相同,80%和63%都对,只是没法互相推导。眼下对OxAlpha最准确的描述是——某些代码和Agent任务表现极亮眼、规格极激进,同时评测分歧极大。喊"新王登基"和喊"不过如此"的,都跑在了证据前面。

四、值不值得试,分人

  • 用Codex、Claude Code、OpenCode、DeepSeek Harness这类编码Agent的:值得冲。注册OpenRouter拿个key就能接,免费窗口里把平时舍不得喂的大仓库、长任务全跑一遍。如果最后揭晓真是GLM的Flash档,收费后的定价大概率可以参考GLM系API,窗口期正好用来评估"以后要不要迁"。

  • 日常聊天、写文案为主的:不用急。这头牛是冲着Agent场景调的,聊天体验未必比你手边的国产助手强,指令遵循的小毛病也被实测抓到了。

  • 所有人都要注意的一条:"零数据保留"目前只是承诺,匿名模型背后是谁都没揭晓,追责主体不明。涉密仓库、客户数据、没开源的内部代码,先别往里丢。等身份揭晓、条款落地再说。

时间节点再划一次:8月20日上线,免费一周,预计8月27日前后窗口关闭,目前没有官方延期公告。DeepTech深科技新智元

五、谈资增量:厂商为什么爱"挂马甲"发模型

这件事里比模型本身更值得看懂的,是"匿名测试"这套玩法。厂商图三样东西:

  1. 盲测去品牌偏见。竞技场上藏掉厂商和型号,用户只能凭实际输出投票,积累的数据更接近真实体验,而不是品牌滤镜。

  2. 免费的公开压力测试。开发者拿着真实仓库、连续几小时的Agent任务来压,上下文稳不稳、工具调用靠不可靠、长任务会不会跑偏循环、推理服务扛不扛得住,全都在正式发布前暴露出来,提前修。机器之心

  3. 悬念就是营销。身份猜谜本身会拉长讨论周期——这一波连谷歌都下场蹭热度,OpenRouter和背后的厂商一分钱推广费没花,赚足了全网曝光。DeepTech深科技

「牛来」大模型刷屏:三条硬证据指向智谱,谷歌下场蹭热度被群嘲——免费窗口薅之前,先看这份评测分歧表

对普通用户也有个实用提醒:以后再看到"匿名模型碾压某某旗舰"的爆款,先问两句——样本多少题?谁测的?样本越小,越要让子弹飞一会儿。

六、接下来盯这几个信号

  • OpenRouter或智谱官方认领:按PonyAlpha的先例,上线六天就揭晓了。这头牛8月21日前后全面上线,答案可能就在这几天。

  • korrine的身份:CodeArena上还有一款匿名模型korrine在被围观,有人猜Kimi K3.1,也有人指向Qwen或MiMo。机器之心8月的大模型圈,已经变成大型猜谜现场。

  • 如果真是GLM-5.3的Flash或多模态版:智谱正式发布的节奏和定价,会直接决定这头牛"免费期结束后还值不值得跟"。

牛来都来了,牵牛回家的人应该也不远了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章