GLM-5.3-Flash发布,多模态终于来了
不久前,在OpenCode和OpenRouter上进行了出现了一个名为Ox-Alpha(中文社区称作牛来)的模型,并迅速成为当周最受欢迎的模型。而就在近日,智谱AI出面认领了这个中文名为“牛来”的模型,就是其最新发布的GLM-5.3-Flash。值得注意的是,GLM-5.3-Flash是GLM-5系列的首个原生多模态模型。
重新定义模型“斩杀线”
Ox-Alpha上线首日即冲至OpenRouter榜首,并刷新单日tokens用量历史纪录,相较OpenRouter平台之前最大tokens量提升4倍。
能力强只是GLM-5.3-Flash最不值得一提的一个环节,GLM-5.3-Flash带来的惊喜之一就是将模型的价格“打下来”。原先,大模型有着参数越大、能力越强、价格越贵的定律,OpenAI的GPT-4系列、Anthropic的Claude Opus系列,无不遵循这一定律。就连智谱自己的GLM-5.3,上半年提价后输出价格也达到了28元。
GLM-5.3-Flash的出现,打破了这条曲线。GLM-5.3 Flash的Artificial Analysis Intelligence分数为57分,超过了上一代旗舰模型GLM-5.2,也高于DeepSeek旗舰模型V4 Pro正式版的53分。在Artificial Analysis Intelligence Index的公开榜单上,GLM-5.3-Flash的57分“远高于同类模型的中间值(18分)”。
而就是这种比肩主流闭源模型的能力,其价格主流模型的四十分之一。官方数据显示,GLM-5.3-Flash每百万Token输入0.8元、输出2.8元、缓存命中价格0.23元。横向对比调价后的DeepSeek V4 Flash——其谷时价格分别为输入1.5元、输出4.5元。综合输入和输出成本,GLM-5.3-Flash在绝大多数常规调用场景下比DeepSeek V4 Flash更便宜。
而对比Claude Opus 4.8,差距更加悬殊。按当时汇率折算,Opus 4.8每百万Token输入约35元、输出约175元。GLM-5.3-Flash的价格仅为对方的四十分之一左右。
“同样智力,1/40价格,前沿智能,第一次不需要省着用。”智谱在发布公告中这样写道。
8月,DeepSeek V4 Flash已经完成了一轮提价。涨价说明市场有强劲需求——也说明“便宜”这件事,在商业上不可持续太久。而智谱在GLM-5.3-Flash上选择的路径恰恰相反:用更低的成本结构,支撑更低的价格,同时不牺牲模型能力。这不再是一个单纯的市场营销动作,而是一次工程能力的验证。
多模态终于来了
此前,智谱首席科学家唐杰在社交平台上发起全球意见征集,为GLM-5.3收集功能建议,浏览量超过40万。评论区被一个词刷屏了:视觉。
GLM-5.3-Flash是GLM-5系列的首个原生多模态模型。视觉编码(Visual Coding)并不只是处理图像,它拓展编程所能触及的边界。对于前端开发、游戏开发、3D仿真等任务而言,最终产物包括用户能够感知的界面、交互或虚拟世界,视觉能力被原生集成进模型中,使其能够自主判断何时需要“观察”,并利用视觉反馈来指导下一步行动。
GLM-5.3-Flash的多模态能力,最直接的落点是Coding。
传统编程模型的工作方式是:你给它需求,它输出代码,然后你拿去跑、去看效果、发现问题、再把问题喂回给它。这是一个“人”在闭环里当裁判的流程。GLM-5.3-Flash把裁判也交给了模型自己——视觉能力被原生融入Coding循环,使模型能够主动观察界面、渲染结果与交互反馈,并据此持续测试和改进。
这意味着什么?模型写完前端代码,可以自己“看”一下渲染出来的页面长什么样;做完一个游戏功能,可以自己“玩”一下看看有没有bug;搭完一个3D场景,可以自己“转”一圈检查各个视角是否协调。
智谱针对视觉编码开发了专门的数据合成流水线,重点训练模型的自我视觉判断与测试时改进能力。最终生成的轨迹要求模型与环境交互、检视自身输出,并进行迭代式改进。这不再是“生成代码”的单向输出,而是一个“生成-观察-修正”的闭环。
智谱官方展示:GLM-5.3-Flash在Blender中自主运行了16个小时,没有任何外部素材,从零搭建了一套约400平方米的专业主厨自宅与测试厨房。
这个任务远不止“写代码”那么简单。在Blender中构建一个连贯的3D场景,需要把几何、材质、光照与空间等知识转化为一个在不同视角下都保持一致的3D结构。模型需要判断什么时候该“看一眼”渲染结果,再用看到的结果决定下一步该做什么。它要自己决定墙怎么砌、光怎么打、厨房动线怎么规划——然后看到效果,再调整,再看到效果,再调整。16个小时,一个模型在虚拟世界里当了一次建筑师兼室内设计师兼施工队。
另一个官方展示的案例是复刻游戏《泰拉瑞亚》。从图像到可运行工程,从两小时电影到8分钟成片,这些实测合集展示的,是一个不仅能写代码、还能“看懂”自己写了什么的模型。
跑在国产卡上
GLM-5.3-Flash最不寻常的地方,或许不在模型本身,而在它跑在什么上面。
过去一周,智谱首次尝试用一个大规目国产芯片集群,直接承载来自全球开发者的真实线上负载。据了解,官方没有确认具体供应商,也没有公布具体芯片数量,但据某些媒体报道,其调用超过10万张国产芯片,算力供应商或来自华为、摩尔线程与海光,有知情人士透露,训练或由海光DCU等国产芯片支持。
但可以确认的是:Ox-Alpha在OpenCode和OpenRouter上的所有请求流量,全部由国产芯片提供算力支持。这是一次真实的、持续的压力测试——不是在实验室里跑几个峰值数据,而是让全球开发者用脚投票。用户不知道模型背后是谁、用的是什么芯片,只根据速度、稳定性和效果决定是否继续调用。
结果,Ox-Alpha成了当周最受欢迎的两个平台上的调用冠军。
国产芯片跑前沿大模型,这件事本身就很有挑战性。单张国产芯片当前面对的主要瓶颈是内存容量和带宽,而GLM-5.3-Flash又原生支持最长1M上下文,对显存和通信提出了更高要求。
智谱的解法是在SGLang基础上构建专用推理引擎,并做了一系列激进的内存优化。包括节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化以及Layer Split等技术。核心思路是“以算力换带宽、以通信换显存”——用国产芯片相对充裕的算力,去弥补内存上的短板。
在集群层面,智谱采用了Encode-Prefill-Decode(EPD)分离式架构。多模态编码、Prompt预填充和逐Token解码被拆分为三个可以独立调度和扩缩容的工作池,让不同阶段按照各自的算力特征运行。
这套方案的效果是:与同一批硬件上的初始基线相比,端到端服务性能提升了3倍。智谱称,最终硬件效率和单Token成本已经达到与主流英伟达GPU相当的水平。
这里需要做一个重要区分。所谓“1/40”,并不是说国产芯片的硬件推理成本只有海外GPU的1/40。目前并没有公开数据支持这样的比较。更准确的理解是:一款全部由国产芯片集群承载的前沿模型服务,把面向用户的价格压到了Claude Opus 4.8的大约1/40。
但这已经足够说明问题。国产芯片不仅可以跑前沿大模型,而且可以在大规模真实流量下跑得稳定、跑得经济。
更值得关注的是智谱形成的一个正向循环。整个推理引擎的构建工作,由GLM-5.3驱动的infra agent大大加速——它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈。“模型优化系统,系统承载模型”,这句话不再是一个愿景,而是已经跑通的现实。
过去一年,中国大模型公司一直在做两件事:把模型能力往前推,把推理成本往下压。GLM-5.3-Flash在这两个方向上都迈出了一步——用更少的参数激活、更低的计算量、更高效的注意力机制,实现了与Claude Opus 4.8持平的综合智能评分;然后用国产芯片集群承接大规模真实流量,把价格压到了对方的四十分之一。
这不再是一个“追赶”的故事。当一款开源、原生多模态、全部跑在国产芯片上的模型,在第三方综合评测中与全球最受欢迎的闭源旗舰得分持平,而价格只有对方的四十分之一——行业竞争的规则,正在被重新书写。
GLM-5.3-Flash的模型权重已通过MIT许可证在Hugging Face等平台开源,API同步开放。任何人都可以下载、使用、二次开发。(本文首发于钛媒体APP,文|Leo张ToB杂谈,作者|张申宇,编辑丨盖虹达)
作者:Leo张ToB杂谈
