8月20日,一个没有厂牌的AI模型空降OpenRouter,代号Ox Alpha。官方只给了一句话:面向编码、长任务智能体和生产环境的前沿模型。知乎因为Ox是“牛”的意思,国内网友直接给它起了个中文名:牛来。
这个模型拥有约105万Token上下文窗口,支持文本、图像和视频多模态输入,面向代码生成与长周期Agent任务,预览阶段完全免费。微博免费额度每天高达100万亿token,OpenCode直接接入。接下来几天的剧情,连小说都不敢这么写:上线首日即终结DeepSeek连续56天霸榜纪录,刷新OpenRouter单日模型调用量历史。微博截至8月24日,仅Hermes Agent、Claude Code等前五大应用的累计调用就已超过4万亿token。微博
一、实力到底什么水平:先别急着封神,看数据
社区这几天最热的讨论,就是“牛来”到底多能打。目前流传最广的几个数字:其编程与Agent能力惊艳硅谷,在DeepSWE测试中子集得分达80%(全集约63%),大幅超越Claude Fable 5(65%)和GPT-5.6 Sol(52%)。微博规格也给得很足:1M上下文、全模态输入、限免一周,编码与Agent能力进入第一梯队。知乎
社区实测也相当密集。B站、知乎、小红书上,已经有人拿它一句话生成完整的3D交互游戏、高颜值前端网站,还自带自动Debug。

也有人给它出迷宫这类视觉题,实测反馈空间逻辑和推理也比较好,走迷宫、时钟、时空推理都正确。小红书

还有开发者拿它和同期上线的DeepSeek V4 Flash Vision做同题对比,结论很直接:Ox Alpha各方面均强于DeepSeek-V4-Flash-Vision-Exp。小红书

不过实测者也提醒,纯模型测试的效果,要比接入Agent系统差,把它接进工具链里用才更能发挥。小红书
当然也有冷静的反证。有安全研究员拿它做渗透测试演练,结论是作为免费模型来说,在长程任务和复杂信息中无法持续发挥高水准。哔哩哔哩一份高考式评测里,OxAlpha仅用约4万token上下文,拿了接近600分,被标注极度不稳定。哔哩哔哩
一句话总结:编程能力是真的第一梯队,但别神化。比跑分更重要的是——它现在免费。
二、全网“猜爹”:证据链已经基本收敛
如果说跑分还有口径争议,那社区这几天的“溯源侦探游戏”就精彩多了。目前主流判断已经收敛到智谱GLM。先是分词器指纹:有研究者跑了25个不同prompt的tokenizer指纹,结果和GLM-5.3完全吻合,只有一个固定+75 token的系统提示偏移。知乎再是视频编码指纹:四个控制视频的token消耗,和智谱自家GLM-5V-Turbo的视频编码器逐token一致,社区并非空口猜测。知乎
8月23日,社区用自有API key抓到了更直接的证据——它返回的报错信息与智谱系模型完全一致。哔哩哔哩两次独立测试、多条线索交叉,测试者给出的置信度大约90%,但至今没有任何一方认领。知乎
这套玩法其实不新鲜。小米的两款隐身模型Hunter Alpha和Healer Alpha,当初就是先匿名上架,免费收一圈真实流量,等热度攒够了再揭晓,品牌顺势立住。知乎智谱此前也曾以匿名方式测试过GLM-5,此番操作如出一辙。微博
还有知情人士表态,这肯定是一个中国模型,并且下周就发布。微博如果“牛来”真是智谱,那现在发生的一切,等于Claude Code、Hermes这些重型Agent在免费替它跑上线前的压力测试。当然,也还有少数声音在猜谷歌Gemini或小米MiMo-V3,但目前证据都薄。
三、免费窗口进入倒计时,想上车的看这里
按“8月20日上线、限免一周”推算,窗口大约在8月27日前后关闭,具体以各平台页面为准。目前Ox Alpha依然保持着零费用、无限量的开放策略,但免费窗口期已进入最后的倒计时阶段。小红书
公开可接的通道主要是这些:OpenCode用户输入 /models,选择界面中的 Ox Alpha Free 就行。知乎OpenRouter走API直连,通过 stealth/ox-alpha 节点,能够有效保障连接的高效与稳定性。小红书
Cline、Hermes、Venice等通道也被社区陆续打通,其中Hermes走的是Nous提供的专属通道,经多方实测稳定性和响应速度都很高。小红书
拿它干什么最合适?社区跑出来的共识很一致:优先跑可验证、可回滚的任务——解释一个小仓库、补测试、重构一段独立函数,或者拿一道你熟悉的题和常用旗舰模型同题对抗,直接看diff、测试结果和任务完成度。知乎这比看任何排行榜都靠谱。
四、避坑清单:冲之前,这三件事先想清楚
第一,数据隐私要打个问号。OpenCode在Zen文档中明确写了,Ox Alpha Free限时免费,提供方执行零数据留存,也不会用你的数据训练模型。知乎但提供方本身是匿名的,数据最终去向没人能打包票。敏感代码、公司代码、带个人信息的内容,该按自己的安全规范处理就按规范处理,别因为零成本就把边界忘了。
第二,别把它押进生产环境。提供方和完整规格都没公开,免费期之后的价格、额度、是否续期全是未知数,匿名模型的数据去向也不明确。哔哩哔哩
第三,跑分不等于好用。80%是子集成绩,高考式评测里它又明显不稳定。免费的意义恰恰在于:你有机会用自己的真实任务去验证,而不是替别人的跑分买单。
五、这件事真正值得盯的,不只是“它是谁”
“牛来”这轮操作说明,大模型营销正在进入“匿名→猜测→传播→认领”的标准化阶段:算力匿名化供给成熟了,编码成了AI第一变现通道,匿名发布才有底气这么玩。知乎模型只会越来越多、越来越杂,独立评测和溯源的能力,反而越来越值钱。
接下来值得盯的三个信号:智谱(或其他厂商)是否正式认领;免费期结束后的定价和额度;GLM-5.3系列会不会顺势发布。
对咱们普通开发者,答案其实很简单:趁免费,拿这张“体验券”在自己的工作流里跑几道熟悉的题,看看工具调用、改代码、长任务稳定性到底什么水平。等身份揭晓后再看定价,决定值不值得长期用——这波不亏。