8月20日凌晨,OpenRouter没开发布会,只丢出一个忍者表情,上架了一个来路不明的模型:stealth/ox-alpha。没有参数表,没有技术报告,没有厂商署名,只有一句话介绍——面向高效编程、长周期Agent任务和生产环境的前沿模型。然后,它免费。
社区当晚就炸了。因为电影《牛来》正在热映,Ox(牛)这个代号被直接玩成了梗,"牛来大模型"成了它的民间艺名。而更让开发者坐不住的是,开源编程工具OpenCode紧接着宣布:这个模型限时免费一周,100万token上下文随便用。知乎
一个来路不明、还倒贴钱请你用的"顶级模型",到底什么来头?这两天的全网侦查,基本已经有答案了。
先说它是什么。OpenRouter页面给出的信息很短,但每一条都对着Coding Agent的痛点:100万token上下文、最大约12.8万token输出,支持文本、图片、视频输入,输出暂时只有文本。36氪官方定位写得很直白:长周期软件工程、复杂推理、多模态Agent工作流,还支持工具调用和JSON结构化输出。翻译成人话:这不是陪你聊天的模型,是准备塞进终端里连续干几个小时活的执行模型。

再说大家最关心的问题:它到底是谁。
目前社区出现过四个嫌疑人:小米MiMo V3、腾讯混元HY4、Google Gemini,以及智谱GLM系。小米CFO刚在财报会上透露,新一代MiMo模型正在训练,时间点确实接近。36氪但这些猜测都停留在"时间点接近""定位重合"的推理层面,而智谱这条线,是被开发者用三项指纹测试直接按住的。
第一项指纹:API报错。有用户故意传了非法参数,模型接口返回"[1210] The temperature parameter is illegal",中英文混排的报错文案——这个1210错误码加中文提示,是智谱开放平台API的标志性特征。知乎OpenAI系报错是纯英文JSON,DeepSeek是另一套错误码体系,都对不上。
第二项指纹:分词器。分词器相当于大模型的DNA,同一段中英混排加代码加emoji的对抗性文本,GLM-5.3和GLM-5.2都切出68个token,而ox-alpha切出143个。差的75个是什么?是OpenCode套在请求外面的一层隐藏system prompt,用来让模型自称"ox-alpha"。68加75等于143,严丝合缝。知乎更有意思的是每次请求都固定有64个token的缓存命中——正是那层永远不变的伪装外壳。伪装身份的枷锁,反而成了验明正身的铁证。

第三项指纹:直接问它本人。它当然守口如瓶,自称"由一家未公开的组织开发"。但有独立研究者做了50组对抗性文本的分词对比,ox-alpha与GLM-5.3全部匹配,而Gemini、DeepSeek、Kimi的匹配度只有18%到22%。知乎还有用户在它的思考过程输出里,捕捉到过"trained by Z.ai"的字样残留。
到这里,答案基本浮出水面:这大概率是智谱还没正式发布的下一代GLM多模态基座,规格比刚上线的GLM-5.3更高,正借着OpenRouter和OpenCode的真实开发者流量做匿名压测。这套玩法业内有先例:今年3月匿名上线的Hunter Alpha,后来被小米认领是MiMo-V2-Pro。36氪更早的Pony Alpha,认领后就是GLM-5。按惯例,免费期结束或正式发布时,官方会出面认领。知乎
那它到底强不强?这里要说句公道话。X上有用户拿10个具体编程任务做过一轮对比,Ox Alpha通过率80%,比第二名Fable 5(65%)高了15个百分点,GLM-5.3是62%,GPT-5.6 Sol只有52%。36氪但必须泼盆冷水:样本只有10个任务,各家测试口径也不完全一致,这能说明它"有前沿水平",不足以盖章"吊打一切"。

国内已经有人把它接进真实项目了。B站有UP主拿它和日常主力mimo-v2.5对比:免费模型的编码质量甚至更细,90万token的超长上下文还能精准召回前面的细节,但300秒超时、OCR偶发错字这两个毛病也在。哔哩哔哩结论可以概括成一句:白嫖是真香,但它现在还是个灰度测试品,不是稳定生产力。
理解了"它是谁",再看"为什么匿名",这事就更有意思了。匿名测试(stealth release)正在变成一种新的发布机制:模型先摘掉名牌进平台,开发者在不知道品牌的情况下真实使用,厂商拿到比排行榜干净得多的反馈;测得好,揭晓身份时再收割一轮传播,测不好就低调撤下。
而对智谱来说,这一步棋的分量格外重。过去两个月,这家"全球大模型第一股"股价从2980港元的历史高点跌去超过66%,市值蒸发超过8000亿港元。36氪
竞争的伤口还是新的:7月,Kimi K3以开源模型登顶编程榜单,智谱在随后两个交易日合计跌掉3000多亿港元。36氪
8月19日,联合创始人唐杰发长文反思"万亿参数这一轮,是整个领域一起走了一段弯路",同日凌晨上线的GLM-5.3参数没加,靠约一个月的长程任务后训练把内部编程基准拉高约50%,被视作智谱的翻身仗。36氪这个节骨眼上,把一个更强的新基座摘掉名牌丢进真实流量里检验,而不是直接召开发布会喊口号,反而是一种更务实的自信。顺带一提,同期Stripe官宣以约75亿至80亿美元收购OpenRouter,这个"模型试炼场"本身,刚刚成了巨头抢着要的资产。知乎

最后说结论:值得试,但要按正确姿势上车。
适合现在冲的:正在用OpenCode、Claude Code这类工具,想低成本体验下一代国产旗舰编程水平的开发者,以及纯好奇想参与一次"全网猜模型"现场的人。免费窗口就一周,参照先例,窗口结束往往就是官宣之时。
上车前四个提醒:
第一,数据口径要看清。OpenRouter页面的说法是"提示词和补全由提供方保留但不用于训练",OpenCode的说法是"零数据保留",两边表述并不一致。知乎公司项目、核心代码,别往免费通道里塞。
第二,别指望它一直在。灰度模型随时可能下线或改为收费,把它当一周的尝鲜窗口,不要把它写进你的长期工作流。
第三,长任务要有备选。300秒超时和图片识别偶发错字是已被实测确认的短板,关键任务留个备胎模型。
第四,认准官方入口。"牛来"火了之后已经出现各种蹭热度的第三方站点,API key和项目代码只给OpenRouter、OpenCode这种你认识的正主。
接下来最值得盯的信号只有一个:官方认领。按Hunter Alpha和Pony Alpha的先例,认领那天大概率就是新GLM的发布会。在那之前,能用一周免费的"未发布旗舰"给自己干活,这波白嫖,值。