过去这一周,全球程序员都在玩一场大型"寻亲"游戏。
8月20日,OpenRouter 这个全球最大的模型聚合平台上,悄悄多了一个连名字都没有的条目,代号 OxAlpha。没有公司、没有参数、没有定价,价格栏就俩字:免费。上海证券报因为 Ox 在英文里是"牛",又正好撞上动画电影《牛来》刷屏,中文社区干脆叫它"牛来大模型"。
就是这头"牛",上线首日就冲上调用量榜首,刷新平台单日纪录,还顺手终结了 DeepSeek 在 OpenCode 连续 56 天的霸榜。全网都在问:这到底是谁家的?
8月26日,谜底揭晓——是智谱。正式型号 GLM-5.3-Flash,GLM-5 系列第一个原生多模态模型,当天发布、当天开源。按智谱自己的体感评测,它的编程表现已经能和 Claude Opus 4.8 掰手腕,价格却只有对方的四十分之一。智东西几乎同一晚,阿里千问也开源了 Qwen3.8-Flash-Next。一夜之间,两个国产顶流把"开源"这个动作卷到了新高度。

先看个大背景:这不是偶然
单看一家公司发新模型,你可能觉得就是常规操作。但把镜头拉远,会发现这事有个更大的注脚。
据 OpenRouter 数据,上周(8月17日到23日)全球 AI 大模型总调用量达到 93.4 万亿 Token,环比增长 24%,首次突破 90 万亿,连续第三周创历史新高。观点网其中,中国大模型周调用量 40.48 万亿 Token,而美国只有 9.66 万亿——中国模型已经连续 17 周稳居全球第一,调用量差不多是美国的 4 倍。东方财富"牛来"的爆火,正是这股大潮里最显眼的一朵浪花。而且,它根本不是第一次。
假面舞会:国产模型的"匿名出海"族谱
OxAlpha 其实是 OpenRouter 上出现的第五款匿名模型(Stealth Model)。把前四款的"揭面"过程排一排,会发现一个相当一致的事实:它们全部来自中国团队。上海证券报
今年 2 月,PonyAlpha(小马),首日调用 400 亿 Token,5 天后确认是智谱 GLM-5
3 月 11 日,HunterAlpha,万亿参数、百万上下文,最后被小米认领,对应 MiMo-V2-Pro
4 月,ElephantAlpha(大象),约两周后蚂蚁集团 Inclusion AI 现身
4 月底,OwlAlpha(猫头鹰),拖到 6 月 30 日才确认是美团 LongCat-2.0
8 月 20 日,OxAlpha(牛来),6 天后揭晓,智谱 GLM-5.3-Flash
为什么国产厂商都爱"匿名出海"?说白了是笔稳赚不赔的买卖。匿名能摘掉品牌滤镜,开发者不知道是谁家的,只能凭真本事打分,反馈反而更真实;这等于一次免费的大规模压力测试,把模型丢进真实代码仓库和智能体框架里被反复调用,比任何自跑榜单都更能暴露问题;而且进可攻退可守——表现好就在热度顶点摘面具收割掌声,不行就悄悄收场,不伤品牌。有网友的吐槽很传神:上次代号是"马",这次是"牛",“无论从生肖分类还是’牛马’的隐喻看,都很合理”。
冷静一下:它到底有多强
现在说用户最关心的:这模型真有那么神?先给刷屏最狠的那个数字泼盆冷水。
网上疯传的"牛来吊打一众旗舰",出自独立研究员 Ben Davis 的一个小样本测试——他从 DeepSWE 基准里抽了 10 道真实任务,OxAlpha 过了 8 道,通过率 80%,确实比 Claude Fable 5、GPT-5.6 Sol 都高。但随后,DeepSWE 的一作 Wenqi Huang 用完整的 113 项官方测试重新跑了一遍,OxAlpha 的通过率回落到 63% 上下,在顶级闭源模型里大概只比 Grok 4.6 稍逊一筹。东方财富

从 80% 到 63%,这就是"精选 10 题"和"完整 113 题"的差距。牛来不弱——能以开源身份和顶级闭源掰手腕已经很难得——但"吊打"这个说法,水分不小。
还有一个容易被误读的数字:OpenCode 宣称给它准备了"每天 100 万亿 Token 的调用容量"。听着像算力奇迹,其实这是理论服务容量,不是实际调用量。腾讯科技而且编程智能体会反复读取同一份代码库,缓存复用会让平台记录的 Token 数远高于真实新增计算量。所以看到"几十万亿 Token",别直接当成算力神话。
真实用下来:三个要留意的坑
综合这一周真实用过的人的反馈,问题集中在三处:
慢。有知乎用户实测,GLM-5.3-Flash 大约 40 token/秒,而 Gemini Flash 3.7 约 400、DeepSeek Flash 约 120。对要盯着输出等结果的编程场景,这个速度差距很影响体验。
输出冗长。不少人反映它回答啰嗦,而按 Token 计费,实际成本会比标价高。智谱编程套餐 lite 档每周约 1.4 亿 Token 额度,价格并不算便宜。
别指望"无脑编程"。有 B 站 UP 主实测,它处理 web 后端时,明明已经告知要用服务器 UTC 时区,还是按本地时区写代码;免费期用的人太多,输出还经常被截断,要手动续。
分人建议:到底要不要切
那这波到底值不值得跟?分人看:
如果你在用 Claude Code、Codex 这类编程工具:值得试。GLM-5.3-Flash 和 Qwen3.8-Flash-Next 都兼容 OpenAI 与 Anthropic 的接口协议,可以直接切过去。尤其千问这次开源的 Qwen3.8-Flash-Next(125B 参数、6B 激活、最高 100 万上下文),API 定价每百万 Token 输入 1 元、输出 3 元,比 DeepSeek-V4-Flash 空闲时段还便宜三成。智东西拿便宜模型跑高频、粗加工的活,把贵模型留给关键收尾,是当下性价比最高的组合。
如果你是日常聊天、轻办公用户:先别急着折腾,趁免费期体验一下多模态就好。GLM-5.3-Flash 是 GLM 系列第一个原生多模态,看图、看视频、看图表,免费期里用最划算。
如果你是评估 API 的企业或开发者:值得纳入选型池,但务必实测速度和冗长度。18B 激活、原生多模态、100 万上下文,还全程跑在国产芯片集群上(据称约 10 万张国产卡),这层供应链意义,比单纯的性能更值得关注。
如果你在观望:至少记住这个信号——大模型竞争的主战场,正在从"谁更聪明"转向"谁能把高频使用做得足够便宜"。MiniMax 的 ARR 从 2 月的 1.5 亿美元冲到 8 月的 8 亿美元,半年翻了约 5.3 倍,7 月 Token 消耗更是 1 月的 20 倍,几乎全靠智能体拉动。36氪这个趋势会持续影响你手里每一个 AI 工具的价格和能力。

接下来值得盯的三个信号
"牛来"的免费测试期在 8 月 27 日前后结束。免费期一过,这些开发者还会不会留下来,决定了这场匿名发布到底只是流量,还是真入口。
千问说,这次开源的 Qwen3.8-Flash-Next 只是基于 Qwen4 架构的"先导预览版",先放出来让社区检验,完整的 Qwen4 家族还在后面。
另一条容易被忽略的新闻:已经有公司开始限制员工使用 AI 的频率,控制对 Anthropic 和 OpenAI 的支出;Gartner 甚至预测,到 2028 年,AI 编程成本可能超过开发者的平均工资。每日经济新闻当使用量爆发,成本就成了新的标尺——而这,恰恰是这波国产开源降价潮最大的意义。