近日,智谱AI正式发布并开源了GLM-5.3-Flash模型,其前身是在开发者社区引起广泛关注的匿名模型“Ox-Alpha”(或称“牛来”)。该模型在匿名测试期间,凭借出色的表现迅速在OpenCode和OpenRouter等平台上登顶调用量榜首,引发了业内的广泛讨论。此次正式发布,揭示了其在性能、技术、成本和战略布局上的诸多看点。

在性能和功能上,GLM-5.3-Flash展现了强劲的实力。作为一个拥有320B总参数、18B激活参数的MoE架构模型,其综合能力全面超越了前代GLM-5.2。根据Artificial Analysis的评测,该模型获得了57分的综合智能指数,与Anthropic广受欢迎的Claude Opus 4.8持平,进入全球前沿模型行列。在编程和Agent能力方面,它同样表现出色,自研的Z.ai Code Bench评测显示其编程表现与Claude Opus 4.8相当。

更重要的是,GLM-5.3-Flash是GLM-5系列首个原生多模态模型,能够处理文本、图像和视频等多种输入,并支持长达100万token的上下文窗口。这一特性使其不再局限于纯文本交互,而是能将视觉能力无缝集成到任务流程中。例如,在代码开发等场景下,模型可以主动观察和理解界面截图、渲染结果等视觉反馈,并根据观察进行自我修正和迭代,实现了“边做、边看、边检查”的闭环工作流,这标志着模型从“回答问题”向“完成任务”的定位转变。除了编程,它还能胜任生成PPT、研报、财报和法律文书等复杂工作。
为了在实现高性能的同时控制成本,GLM-5.3-Flash在模型架构上进行了重要创新。它首次在开源前沿模型中采用了稀疏注意力与线性注意力的混合架构。其中,线性注意力用于捕捉局部依赖,而稀疏注意力则通过一个轻量级索引器高效处理全局上下文。结合IndexPool等技术,该架构大幅降低了模型在处理长上下文时的计算量和KV Cache(键值缓存),使其相比GLM-5.3,注意力计算量降低了约3倍,KV Cache缩小了约4.4倍。这种高效的设计是其实现极低服务成本的关键。
再次,该模型最引人注目的特点之一是其极具颠覆性的定价策略。GLM-5.3-Flash的官方API定价仅为GLM-5.3的1/10,在限时折扣期间更是低至1/20,与性能对标的Claude Opus 4.8相比,价格仅为其1/40。这一“价格屠夫”级别的定价,旨在将过去因成本高昂而使用受限的多模态、Coding和Agent等前沿能力,推广到高频调用的日常工作流中,让开发者和企业能够“不用小心翼翼省着调用”,极大地降低了前沿AI技术的应用门槛。

此次发布在战略层面也释放了重要信号。其一,匿名测试期间承载了巨量调用请求的算力,全部由国产AI芯片提供支持。这不仅是对国产芯片算力承载能力的一次大规模实战验证,也表明智谱在算力基础设施上实现了巨大突破,为模型的低成本稳定运行提供了保障。其二,智谱采取了“先匿名测试、后正式发布”的策略,直接通过产品实力在社区建立口碑,再公开身份承接热度,展现了其对产品能力的自信。同时,模型以MIT许可证进行开源,并得到了vLLM等主流推理框架的即时支持,有助于构建和繁荣开发者生态。
当然,也有观点指出,目前极具吸引力的低价是限时折扣,模型在复杂真实业务场景下的长期稳定性、以及折扣结束后的实际成本,仍有待广大开发者在实践中进一步检验。但GLM-5.3-Flash的发布,凭借其强大的原生多模态能力、创新的高效架构、极具竞争力的价格以及对国产算力的成功应用,为AI行业的发展带来了新的可能性和思考。