神秘模型 Ox Alpha 身份揭晓:智谱 GLM-5.3-Flash,当场开源
8 月 26 日,智谱 Z.ai 官方确认:过去一周刷屏的匿名模型 Ox Alpha,就是 GLM 系列全新迭代 GLM-5.3-Flash,并当场宣布开源权重。这场持续 6 天的「AI 侦探游戏」,以中国团队的又一次「匿名逆袭」告终。

匿名「牛」如何屠榜
8 月 20 日晚,全球最大 AI 模型聚合平台 OpenRouter 的目录里悄悄多了一条:stealth/ox-alpha。没有公司名、没有参数、没有定价——价格栏就俩字:免费。官方只给了一句介绍:面向编码、长周期智能体任务的前沿模型。
Ox 在英文里是「牛」,网友直接给它起了外号「牛来大模型」。上线 12 小时就刷屏:终结了 DeepSeek 在 OpenCode 连续 56 天的霸榜纪录,首日冲上平台第一,刷新 OpenRouter 单日模型用量历史纪录。到 8 月 26 日身份揭晓时,这个匿名模型在 6 天里累计消耗了约 42 万亿 token,26.8 万名开发者用过它。Stripe CEO Patrick Collison 亲自测试后在 X 上评价「非常令人印象深刻」。
独立研究员 Ben Davis 从软件工程基准 DeepSWE 里抽了 10 项真实任务测试:Ox Alpha 完成 8 项,通过率 80%。同一组任务里,Claude Fable 5 是 65%,GLM-5.3 和 Grok 4.6 都是 62%,GPT-5.6 Sol 只有 52%。虽然是样本量不大的测试,但已经说明它摸到了头部代码模型的门槛。
五重技术指纹锁定智谱
比性能更热闹的是身世之谜。候选名单一度跨度极大:智谱 GLM、谷歌 Gemini、小米 MiMo,甚至 SpaceX/Cursor 的 Composer3。但随着证据浮现,几乎所有线索都指向智谱。
Atomstorm.ai 创始人 lizikk_zhu 梳理了五条技术证据:把同一段视频喂给 Ox Alpha 和智谱 GLM-5V-Turbo,两者消耗的 token 数逐一吻合——帧采样策略、时长缩放、分辨率缩放三个独立设计特征全对得上;文本 tokenizer 特征一致;独特的错误码 [1210] 相同;后端报错信息是中文且风格一致;特定问题的回复口径高度吻合。另一位软件架构师通过 API 对比了 95 组语言、代码与特殊字符的 token,全部与智谱 GLM-5 的词汇表完全吻合。
它到底是谁:320B-A18B,MIT 开源
官方口径如下:GLM-5.3-Flash 是 320B 总参数、18B 激活参数的 MoE 架构模型,原生多模态,支持 1M token 上下文,采用 MIT 许可证在 Hugging Face 开放权重,而且推理集群完全跑在国产 AI 芯片上。
架构上它用的是稀疏注意力与线性注意力混合设计,配合 mHC 机制,基于 30T token 的多模态语料预训练。官方称相比 GLM-5.3,注意力计算量降低约 3 倍,KV cache 大小降低约 4.44 倍——1M 长上下文场景下这是省算力的关键。服务端基于 SGLang 做了专用推理引擎,配合量化、缓存压缩等策略,官方称单 token 成本已接近主流 NVIDIA GPU。
Benchmark 方面(均为官方自测):Terminal Bench 2.1 拿到 84.3,DeepSWE v1.1 从 GLM-5.2 的 46.2 涨到 63.4,AutomationBench 从 26.2 涨到 48.8。在自家 Z.ai Code Bench 上,最高 effort 下得分 29.0,接近 Claude Opus 4.8 的 29.5。注意这些都是 Z.ai 自有测试,不是独立第三方基准。
定价打进极低区间
官方标准 API 定价:输入 0.15 美元/百万 token、输出 0.50 美元、缓存输入 0.03 美元——约合人民币输入 1 元多、输出 3.6 元、缓存 2 毛钱,官方称价格约为 GLM-5.2 的十分之一。第三方渠道更激进:OpenRouter 上架价输入 0.075 美元、输出 0.25 美元,直接低于 DeepSeek V4 Flash。
实测口碑:当 reviewer 用,别当 typer 用
开发者反馈高度分层。强项在长程任务编排、系统规划、代码审查和后端排错——有人让它跑一个 Java 到 C# 的迁移任务,连续工作约 50 小时,结果比试过的其他模型都好。短板同样清晰:直接写实现代码容易幻觉,处理 TypeScript 这类强类型语言经常要 15 到 25 次报错重试才能过编译,前端审美平庸,还容易「过度自主」——没被要求就擅自改配置文件。
名字里的 Flash 体现在成本和高吞吐:单用户单流速度约 12 token/s 偏慢(服务端高并发批处理换总吞吐),但长任务上下文膨胀很慢,数小时运行饱和度能压在 20% 以下。
匿名不是第一次,这次从「裸考」到开源
Ox Alpha 是 OpenRouter 上第五款匿名模型。前四款全是中国团队:2 月的 Pony Alpha(智谱 GLM-5)、3 月的 Hunter Alpha(小米 MiMo-V2-Pro)、4 月的 Elephant Alpha(蚂蚁)、6 月底才揭面的 Owl Alpha(美团 LongCat-2.0)。智谱在 GLM-5 技术报告里把这种玩法叫「盲测实验」——隐去品牌,让模型靠能力接受真实开发者社区的检验,匿名能减少品牌偏见,也能在正式发布前收集真实反馈。
Ox Alpha 的特别之处在于终局:身份确认当天直接开源权重。Unsloth 已宣布正在制作 GGUF 版本,本地跑的门槛会进一步降低。从匿名测试到开源共建,长程 Agent 模型的竞争,正在从昂贵的闭源黑盒,转向高性价比、可控、能落地的开源基础设施——而这头「牛」,全程跑在国产 AI 芯片上。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

张大妈
校验提示文案
张大妈
校验提示文案