这周AI圈最大的悬案,昨晚破案了。
过去一周在OpenRouter和OpenCode上匿名霸榜、把DeepSeek在OpenCode上连续56天的垄断直接终结的「神秘模型」OxAlpha,中文社区都叫它「牛来」——官方认领了:就是智谱正式发布并开源的GLM-5.3-Flash。知乎

如果你这周刷过AI编程相关的社区,大概率见过这场大型猜谜:有人猜小米MiMo V3,有人猜腾讯混元,还有人押Gemini。36氪结果谁也没猜到,是智谱玩了手「匿名上线、免费公测、靠实力说话」。
但对咱们真正拿AI写代码的人来说,身份揭晓只是瓜,真正要紧的是后面两件事:这模型到底能不能进你的工作流?以及,付费姿势选错,成本能差出十倍。
先说清楚,这头「牛」是什么
GLM-5.3-Flash的账面参数,几个关键点:
320B总参数、激活约18B的MoE架构,不是GLM-5.3的蒸馏缩水版,是重新预训练的新基座;
GLM-5系列首个原生多模态:文本、图片、视频都能输入,官方演示里它自主跑了16小时,在Blender里零素材搭出一套约400平米的场景;
100万token上下文,最大输出13万token;
MIT协议开源,权重直接挂在HuggingFace上;
Artificial Analysis智能指数57分,和Claude Opus 4.8打平,而API价格只有Opus 4.8的1/40。微博知乎知乎

还有一个容易被忽略的点:这次公测的全部流量,跑在国产芯片集群上,智谱说端到端服务性能比同硬件初始基线提了3倍,单token成本做到了和主流英伟达GPU持平。知乎对模型本身不重要,但它意味着这条路以后会越来越卷。
跑分追平,不等于你的场景追平
官方口径说完,该看社区实测了。这两天B站、知乎已经有不少人拿真项目蹬过,结论明显分成两半:
强的地方:后端和测试类任务口碑最好。有X用户做了10个任务的对照测试,OxAlpha通过8个,对比组里Fable 5是65%、GLM-5.3是62%、GPT-5.6 Sol是52%。36氪当然这是个人小样本,看个方向就行。
弱的地方:有UP主实测发现它做游戏类任务(比如复刻小游戏)效果一般;还有人碰到web后端时区的坑——明确说了用服务器UTC,它还是会写错。哔哩哔哩哔哩哔哩知乎上另一个高赞提醒更实际:它的输出非常冗长,实际消耗的token会比预想的多,算成本的时候要把这个膨胀系数算进去。知乎这几个坑都不致命,但都属于不提前知道就会踩的那种。
还有个细节值得记住:之前匿名期就有人测过它的推理档位,max档会出现明显「过度思考」——推理字段飙到几万字符、单次生成拖到几分钟,但画面质量的提升很有限。36氪用它跑agent任务,默认档位的选择会直接影响你的账单。

一句话总结:它是一个为「持续agent工作」设计的模型,后端、测试、长任务是对口菜;前端视觉效果、游戏开发,目前还不是它的舒适区。
三笔账:现在切,怎么切才不亏
第一笔,价格账。
GLM-5.3-Flash的API定价是每百万token输入0.15美元、输出0.5美元、缓存读取0.03美元。微博国内价格输入0.8元、输出2.8元,而智谱自己上一代GLM-5.3是输入8元、输出28元——直接砍到1/10,限时两周内再打5折,变成0.4元/1.4元,也就是5.3的1/20。知乎放到同场对比里:阿里Qwen3.8-Flash是1元/3元,DeepSeek V4 Flash和它贴身肉搏,GPT-5.6 Sol Pro则是2.5美元/15美元的量级。哔哩哔哩这是第一次有「智能指数对标顶级旗舰」的模型,把价格打到这个水位。

第二笔,姿势账。
这笔账社区已经吵起来了,而且结论反直觉:折扣期内,直接走官方API,别急着买Coding Plan。
知乎44万浏览的问题下,最高赞的提醒就是这个:两周折扣期内,5.3 Flash的API价格只有GLM-5.3的二十分之一,按量付费比套餐划算。知乎而Coding Plan目前的实测口径还很混乱——有人说lite档周额度约3亿token、性价比已经超DeepSeek API,也有人说只有1.4亿、价格偏贵。知乎知乎额度口径没统一之前,先按量付费跑两周,把自己的真实用量摸出来,再决定买哪一档,比看任何宣传都靠谱。
GLM Coding Plan现在每天限量发1万张体验卡,想白嫖体验的可以去蹲;OpenCodeGo、Tabbit这些第三方也已经第一时间接入,OpenCode用户基本零成本尝鲜。知乎哔哩哔哩想本地跑的,KTransformers当天就做了适配——320B的MoE激活只有18B,本地部署的门槛比看上去低。知乎
第三笔,切换账。
什么人适合现在就切?预算敏感的高频用户,主力任务是后端、测试、脚本和长上下文agent的,折扣期按量付费试两周,几乎没有试错成本。
什么人建议等一等?生产环境里跑稳定性的,等折扣期结束后的价格和服务表现再定;主要做前端视觉、游戏开发的,社区实测它还不是最优选;还有已经在Claude Code/Codex订阅里跑得很顺的,没必要为了省钱硬切——模型切换的隐性成本(提示词习惯、agent调教、稳定性重测)也是钱。
这件事真正值得记住的
比单个模型更值得关注的,是这套打法本身。今年3月小米的HunterAlpha就用「匿名上OpenRouter免费测」的方式试过水,这次智谱把规模做到了双平台调用量新高。36氪哔哩哔哩匿名公测正在变成国产模型出海的新标配:避开品牌偏见,顺便让全球开发者拿真实项目帮你做压力测试——那套「免费额度+百万上下文」吸引来的,可都是真刀真枪跑仓库、跑测试的人。
对AI编程用户,接下来三个观察信号:两周折扣结束后价格停在哪、Coding Plan额度口径会不会统一、以及官方承认的KV缓存偏高问题(目前比Kimi-K3、DeepSeek-V4-Flash略高)什么时候优化。知乎这三个答案出来,「要不要把它当主力」才算真正有解。
前沿智能和前沿价格正在解耦。以前「用最好的模型」和「省着用」是同一件事的两面,现在至少在这两周里,你可以两个都要。