智谱半年营收9.54亿增长400%,下一代大模型主打首日满规模调用

源自335位全网作者

12:08

精选参考来源

1
英伟达最不愿看到的一幕已然出现:一家中国企业,把超10万张国产芯片组建起生产级大模型推理集群,普通使用者几乎完全感知不到算力底座的变化。智谱GLM‑5.3‑Flash,代号“牛来”正式上线,全部线上流量都由十万张以上国产芯片承接,短短5天就处理50万亿token,刷新海外平台流量纪录。尽管单张国产芯片在内存、带宽层面存在先天短板,但整套集群实现端到端性能三倍提升,单token成本已经可以和英伟达站到同一水平线。能够达成这样的效果,依靠的是稀疏‑线性混合注意力架构、基于SGLang深度改造的自研推理引擎、EPD分离调度方案,搭配W8A8与FP8混合量化技术,把每一张国产芯片的硬件潜力压榨到极致。这绝非仅供演示的Demo项目,而是实打实承接真实业务流量,国产算力由此完成从“能够跑通模型”到“敢于扛住大规模生产负载”的关键拐点。(注:华为昇腾、摩尔线程、海光为媒体报道提及的潜在芯片供应商,智谱官方并未对此予以确认)
2
#牛来大模型6天用掉数十万亿词元##牛来大模型来自北京# 8月26日晚,智谱上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型,已面向全球开源。同日,此前在OpenRouter(全球头部大模型聚合平台)、OpenCode(开源AI编程助手平台)上匿名爆火的模型Ox-Alpha,也被证实来自这家总部位于北京的大模型公司。前沿智能不需要省着用,成了智谱此次发布模型的一大亮点,GLM-5.3-Flash定价约相当于海外知名模型Opus 4.8的40分之一。智谱团队表示,这主要源于GLM-5.3-Flash同时实现的多项架构升级,通过采用稀疏注意力与线性注意力混合架构,技术团队实现了保持精准长上下文能力的同时,大幅降低长上下文服务成本。智谱透露,为收集广大用户的广泛、专业反馈,在正式发布GLM-5.3-Flash前,团队以匿名模型Ox-Alpha在OpenCode和OpenRouter上进行了大规模测试。Ox意为“牛”,恰逢电影《牛来》走红,Ox Alpha也被中文开发者们称作“牛来大模型”。上线后,Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。公开信息显示,从8月20日匿名上线,到8月26日期间的六天,Ox Alpha已经让全球开发者用掉了数十万亿Token(词元)。值得注意的是,这些请求流量全部由国产芯片提供算力支持。智谱表示,这是其首次在大规模流量中尝试用国产芯片集群提供服务,这些芯片均通过自研高带宽互联网络连接。(来源:福布斯中文网)北京日报的微博视频
全部
来源
内容由AI生成

精选参考来源

1. 英伟达最不愿看到的一幕已然出现:一家中国企业,把超10万张国产芯片组建起生产级大模型推理集群,普通使用者几乎完全感知不到算力底座的变化。智谱GLM‑5.3‑Flash,代号“牛来”正式上线,全部线上流量都由十万张以上国产芯片承接,短短5天就处理50万亿token,刷新海外平台流量纪录。尽管单张国产芯片在内存、带宽层面存在先天短板,但整套集群实现端到端性能三倍提升,单token成本已经可以和英伟达站到同一水平线。能够达成这样的效果,依靠的是稀疏‑线性混合注意力架构、基于SGLang深度改造的自研推理引擎、EPD分离调度方案,搭配W8A8与FP8混合量化技术,把每一张国产芯片的硬件潜力压榨到极致。这绝非仅供演示的Demo项目,而是实打实承接真实业务流量,国产算力由此完成从“能够跑通模型”到“敢于扛住大规模生产负载”的关键拐点。(注:华为昇腾、摩尔线程、海光为媒体报道提及的潜在芯片供应商,智谱官方并未对此予以确认)

2. #牛来大模型6天用掉数十万亿词元##牛来大模型来自北京# 8月26日晚,智谱上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型,已面向全球开源。同日,此前在OpenRouter(全球头部大模型聚合平台)、OpenCode(开源AI编程助手平台)上匿名爆火的模型Ox-Alpha,也被证实来自这家总部位于北京的大模型公司。前沿智能不需要省着用,成了智谱此次发布模型的一大亮点,GLM-5.3-Flash定价约相当于海外知名模型Opus 4.8的40分之一。智谱团队表示,这主要源于GLM-5.3-Flash同时实现的多项架构升级,通过采用稀疏注意力与线性注意力混合架构,技术团队实现了保持精准长上下文能力的同时,大幅降低长上下文服务成本。智谱透露,为收集广大用户的广泛、专业反馈,在正式发布GLM-5.3-Flash前,团队以匿名模型Ox-Alpha在OpenCode和OpenRouter上进行了大规模测试。Ox意为“牛”,恰逢电影《牛来》走红,Ox Alpha也被中文开发者们称作“牛来大模型”。上线后,Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。公开信息显示,从8月20日匿名上线,到8月26日期间的六天,Ox Alpha已经让全球开发者用掉了数十万亿Token(词元)。值得注意的是,这些请求流量全部由国产芯片提供算力支持。智谱表示,这是其首次在大规模流量中尝试用国产芯片集群提供服务,这些芯片均通过自研高带宽互联网络连接。(来源:福布斯中文网)北京日报的微博视频

3. #牛来模型确认为智谱GLM系列#牛来模型今天终于实锤身份了,就是智谱GLM系列的新一代产品,今晚就会正式开放模型权重。当初藏着名字悄悄上线,没几天就直接冲到海外平台使用榜第一,调用量比DeepSeek高出两倍还多,闷声秀了波硬实力,这波操作属实会玩。目前还能免费用一周,后续收费标准还没公布。国内大模型现在卷得越来越有看头,先匿名测口碑再官宣,等正式放开之后,实际体验应该差不了。

4. 这一次,智谱用GLM-5.3-Flash实现了真正的智能平权。

5. 牛来大模型来自中国!国产芯片大突破

6. 牛来大模型被认领是国产牛,打穿了Deepseek的价格线

7. AI模型「牛来」真身揭盅,智谱指全用国产芯片部署

8. 智谱认领“牛来”模型,跑在10万张国产芯片上

9. 智谱揭晓”牛来”:Ox Alpha 真的就是 GLM-5.3 Flash,10 万国产芯片跑通 8 天大戏

10. 匿名模型Ox Alpha确认来自智谱,GLM-5.3-Flash正式开源!

11. 智谱 GLM-5.3-Flash上线 商汤大装置提供国产算力支持

12. 智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

13. 智谱新模型“牛来”跑在10万国产卡上,SemiAnalaysis评价“英伟达护城河再受考验”

14. 智谱认领“牛来模型”,背后由10万张国产芯片支撑

15. 10万张国产卡撑起智谱新模型线上流量

16. 3200亿参数只激活180亿,智谱新模型用十分之一成本追平Opus

17. 智谱开源GLM-5.3-Flash,“牛来”模型身份揭晓

18. 商汤大装置支撑智谱GLM‑5.3‑Flash上线的战略价值

19. 牛来大模型来自中国!国产芯片大突破

20. 10万张国产芯片支撑,智谱认领匿名Ox-Alpha模型并开源

21. 晚点独家丨智谱推出对标 DeepSeek 轻量旗舰模型,由 10 万国产卡支持

22. 匿名登顶全球!智谱“牛来”模型出圈,国产AI靠实力改写竞争规则 2026年AI圈最精彩的一次“盲测逆袭”落下帷幕。8月26日,智谱正式确认,近期在海外爆火、霸榜全球的神秘AI模型Ox Alpha,正是自家GLM系列全新迭代版本,国内开发者亲切称之为“牛来”。一场不带品牌、纯靠硬实力的匿名测试,让国产大模型站上全球舞台C位。 此次“牛来”出圈极具戏剧性。该模型以上周末匿名形式登陆全球AI聚合平台OpenRouter,无官宣、无预热、无品牌背书,却迅速登顶平台热度榜首,用户使用量远超DeepSeek,达到其两倍之多,创下该平台史上最大规模单次模型发布纪录。就连正在收购OpenRouter的Stripe CEO也公开称赞,此次秘密发布成果令人惊艳。 褪去神秘外衣,“牛来”的硬核实力是出圈核心。作为主打编程与智能体任务的新一代推理模型,它全面支持文本、图像、视频多模态输入,适配当下主流AI自动化、智能开发、多场景内容创作需求。更关键的是,智谱官宣将正式开放模型权重,让全球开发者可基于该模型二次开发、微调迭代,彻底激活开源生态活力。 这波操作彻底改写了全球AI竞争逻辑。过往海外顶尖模型凭借品牌与生态优势垄断市场,而智谱走出了“实力先行、口碑后置”的新路径:以免费高性能打破高价壁垒,用开源姿态拥抱全球开发者,凭借极致性价比与顶尖性能,对标海外顶级模型,打破国外技术垄断。 从技术跟跑到匿名领跑,智谱“牛来”模型的海外突围,印证了国产大模型已迈入技术自主、生态开放、体验领先的全新阶段。在全球AI竞赛白热化的当下,不靠宣传靠硬实力、不靠溢价靠普惠,正是中国AI产业崛起的核心底气。

23. 千问、智谱同日开源新模型,国产 Flash 模型开始拼效率和价格! - 哔哩哔哩

24. 神秘“牛来”模型登顶全球榜首,中国AI再创历史。

25. 千问成本降九成智谱一折,但MiniMax冲3万亿,大模型真转向性价比

26. 智谱AI董事长刘德兵:用十万张国产卡,跑出一家大模型第一股丨「商业人物档案」

27. “牛来”模型被智谱认领!价格大跳水,10万张国产芯片承载

28. 智谱上线并开源GLM-5.3-Flash,系此前Ox-Alpha(中文社区称作牛来)模型

29. 智谱启用数张国产芯片后,“牛来”背后的算力浮出水面 8月26日智谱确认“牛来”就是GLM-5.3 Flash,但有个细节值得注意,智谱强调这个模型“完全运行在国产AI芯片上”。国产芯片的大规模推理集群,这规模在国内大模型公司里是头一遭。 咱们把时间线拉出来看:7月21日,智谱被曝已建成1GW国产AI算力中心,启用多块国产算力芯片。这才过了一个月,规模直接翻倍。而且《晚点》提到,这是专门用于GLM-5.3 Flash“推理服务”的,训练和推理分开算,意味着总盘子可能更大。 那么这些卡到底是谁的?华为、摩尔线程、海光三家都有可能,但逐个排除就有意思了,我个人觉得还是海光的可能性大一些。 华为昇腾虽然有大规模集群的能力,但问题是,它更适合训练而不是推理。摩尔线程主要适配的是GLM-4.6,和GLM-5系列的深度合作记录基本空白。 海光就不一样了。GLM-5和GLM-5.2两次Day-0适配都是海光抢的首发。更重要的是,郑州那个大规模集群里,海光已经实际跑起来了,不是PPT。 所以大概率是海光DCU撑起了,至少是其中的主力。智谱不说是谁,但线索已经够多了。 #智谱# #海光信息# #海光DCU#

30. 智谱Ox Alpha揭面,阿里同夜开源,中国开源AI竞争逻辑如何变化?

31. 智谱新模型GLM-5.3-Flash,把Agent的调用成本打下来了

32. 智谱新模型全跑在国产芯上,明天股价爆拉?

33. 海外神秘大模型“牛来”,原来是智谱的!

34. 智谱认领Ox Alpha,是智谱新推出的GLM-5.3-Flash,此前该模型匿名放到OpenCode、OpenRouter免费使用测试,结果成为最受欢迎的模型之一,评测性能接近Opus 4.8。 GLM-5.3-Flash有320B总参数,但采用MoE架构,支持多模态和100万上下文。 其实Flash是GLM 5.3的便宜版本,价格便宜,性能强,类似于deepseek v4 flash一样。

35. 智谱GLM-5.3逆天升级,海光DCU神速适配,“国产大模型+国产算力”又亮组合拳! 今天必须吹爆一波!智谱刚刚甩出GLM-5.3这个开源核弹,最牛的地方在于,所有性能提升都来自后训练阶段,基座模型结构和参数量一点没动,全靠强化学习把潜力全挖出来了!   海光DCU立马就跟上Day 0适配,而且是深度协同智谱团队,利用自研的DTK DAS软件栈,把底层算子、硬件加速全都优化到极致,做到了模型发布即生产级可用!低延迟、高吞吐,开发者拿过来就能部署,企业用户即取即用,一点不耽误事!   软件生态这一块,海光信息做得是真省心。DTK全面兼容CUDA,你以前用别的产品怎么写的代码,拿过来改几行就能跑,几乎不用重新学。2000多个算子、100多种AI工具直接集成,开箱即用,迁移成本约等于零! 适配范围也很广,400多款主流大模型全部Day 0首发适配,DeepSeek、Qwen、智谱这些头部模型发布当天就能用。更牛的是落地,从科研院所到石油勘探,从天文FAST数据处理到医疗AI,全国30多个项目都在跑,盘子越做越大了。不得不说,国产算力不是花架子,是真在干活! #海光信息##海光DCU##智谱GLM-5.3#

36. GLM-5.3 深度评测:不换基座涨 50%,智谱这步棋到底值不值?

37. 智谱“认领”神秘AI模型Ox Alpha“牛来”,使用量已达DeepSeek两倍以上

38. Ox Alpha揭晓:智谱开源GLM-5.3-Flash,跑在国产芯片上

39. 匿名屠榜7天,智谱昨晚摊牌:这一枪,打在了所有高价大模型的头上!

40. 智谱AI推出GLM-5.3-Flash模型

41. “牛来”!智谱“认领”神秘AI模型Ox Alpha 使用量已达DeepSeek两倍以上

42. 大模型比拼换赛道,海光DCUDay0适配抢占先机 智谱GLM-5.3换了一条升级路线。不改动基座模型,靠后训练强化学习挖掘现有模型潜力,把代码生成、网络安全任务能力做到跃升。这个信号也告诉整个行业,大模型的竞争重心,已经从堆规模转向深挖模型智能上限。 模型能力升级,对于算力平台的要求自然水涨船高。复杂Agent任务、长代码工程调度,都需要算力底座有更强的算子适配能力和稳定的并发吞吐性能。就在GLM-5.3发布的第一时间,海光DCU就完成了Day0适配。 什么是真正的Day0适配?经过生产级验证,企业拿到模型就可以直接部署上线使用。海光技术团队深度协同智谱,依托自研AI软件栈,针对性优化底层加速逻辑,让GLM-5.3在DCU之上跑出优秀性能。 一路走来,从多款主流开源大模型首发适配,到累计400+大模型调优落地案例,海光DCU已经打磨出一套成熟高效的适配闭环。模型发布极速适配算力部署行业落地,这条链路越跑越顺畅。 国产AI生态想要突围,算力和算法必须同频迭代。模型厂商往前冲锋,算力平台做好后盾,二者双向赋能,国产大模型才能真正从开源社区走向千行百业的实际应用。 #智谱GLM-5.3##DCU##海光信息#

43. 智谱推出轻量旗舰模型,由10万张国产卡支持

44. 智谱开源 GLM-5.3-Flash:用 1/40 的成本,把前沿多模态大模型拉进普惠区间

45. 智谱确认Ox Alpha为新一代GLM模型,使用量已达DeepSeek两倍

46. 智谱刚发模型海光就同步跟上,这Day 0适配成标配了 智谱发布GLM-5.3,开发者群里讨论的都是代码能力和安全评测的涨点。而让我这种搞部署的人多看了两眼的,是海光DCU又是同一时间宣布Day 0适配完成。 智谱发模型、海光跟进适配,这事儿已经第四次了。GLM-5.3这次最大的卖点不是参数堆料,是后训练Scaling,基座没变,全靠强化学习和训练框架把潜力榨出来。也就是说模型推理时的计算模式和资源调度跟以前不一样了。你算子库没跟上,或者显存管理没优化,就算能跑起来,吞吐和延迟也难看。 海光能卡在这个节点上做到生产级验证,说明DTK那套软件栈确实在持续迭代,不是只做个兼容就完事了。现在国产卡单卡算力不是最大瓶颈,生态和适配速度才是。 从开发者角度看,模型发布即用,不用自己折腾编译、调参、踩坑,省下来的时间就是实打实的成本。国产算力如果能一直保持这种跟进节奏,以后选型的时候,考虑的就真不只是性价比了,而是“谁更能让我省心”。 #国产芯片# #海光信息# #智谱#

47. 前几天在社区里风头无两的神秘大模型“Ox Alpha”(牛来大模型),底牌终于被掀开了——它竟然就是智谱的 GLM-5.3-Flash! 看完这套刚刚曝出来的架构解构图,我只能感叹:现在的国产大模型,已经把“架构创新”和“极致算力压榨”玩到了化境。 这哪里是一套普通的升级方案,分明是一场大模型工程界的“超级大缝合”! 这里面藏着的工程智慧极其硬核: 第一,堪称艺术级的 3:1 超级混合注意力机制。 它没有死板地沿用全注意力,而是大胆组装了 34 层 Kimi 的 KDA(线性注意力)加 11 层 DeepSeek 的 MLA/DSA(隐空间/稀疏注意力)。 这套组合拳打下来,上下文 KV Cache 占用直接被砍掉了 4.4 倍,计算量骤降 3 倍!在大文本推理时,简直就像开了加速挂。 第二,残差网络彻底变天。 它放弃了传统单条残差叠加的旧路线,直接采用了 DeepSeek 风格的 mHC(流形约束超连接),拉出了 4 条并行残差流。 这意味着信息在神经网络深层流动时不再拥挤堵塞,深层训练和推理的表达能力上限被大幅拉高。 第三,极度“抠搜”却又极度高效的 MoE 骨架。 总参数量虽然高达 320B,但通过 288 个专家和动态路由,每个 Token 激活的参数竟然只有 18B,激活率低至 5.6%。 相比于前代 744B 的体量,这种精瘦身材不仅没让智商打折,反而让算力利用率达到了惊人的地步。 这背后的行业信号太强烈了:大模型竞赛的下半场,已经从“拼卡多、比谁烧钱狠”的蛮力时代,彻底转向了“架构级极致算力缝合”的工程艺术。 智谱把 Kimi 的长文本基因、DeepSeek 的计算降维打击以及自家的 MoE 骨架拿进摇摇杯里调了一杯极品鸡尾酒,硬是在国产 AI 芯片上跑出了每天 100 万亿 Token 的吞吐量,性价比直接拉满。 甚至看到“18B 动态激活”时,我的第一反应是:这难道不是给我咬牙入手高配 Mac Studio M5 Ultra 找的绝佳理由吗? 把这种级别的模型跑在本地,真机体验简直不敢想。 当顶级 Lab 们不再固步自封,开始毫不避讳地融合彼此最顶级的架构创新时,最压力山大的恐怕不再是国产芯片的算力瓶颈,而是那些还在用旧架构硬扛 Scaling Law 的硅谷巨头们了。

48. 速度拉满!GLM-5.3刚发布,海光DCU直接拿下Day0适配 智谱最新旗舰开源大模型GLM-5.3正式亮相,一出场就刷新了大家对于开源模型编程能力的认知。而让人惊喜的是,海光信息同步交出了Day0极速适配的答卷。 这次GLM-5.3的升级路线非常有意思,没有盲目堆参数量,基座架构完全不变,依靠后训练Scaling深挖模型本身潜力,硬生生把代码、网络安全两大板块的能力抬上了一个新台阶。它已经能够独立走完发现问题、分析验证、落地执行的完整工作链路,更适配Agent复杂工程任务。 前沿模型跑得快,背后离不开算力平台紧跟脚步。依靠DTK、DAS自研AI软件栈,海光DCU完成底层算子深度优化,保障大模型高吞吐、低延迟稳定运行。 回看过去一系列适配成果,海光DCU已形成成熟的生态打法,目前已经完成400余款主流大模型的首发适配。国产大模型迭代越来越快,如果算力跟不上节奏,再好的模型也只能停留在实验室。 算力和模型双向奔赴,才是国产AI产业最健康的发展路线。期待后续看到GLM-5.3在金融、政企、工业等更多行业场景开花结果。 #智谱GLM##国产DCU##海光信息#

49. Ox Alpha 被指为智谱 GLM-5.3-Flash 限

50. 做过AI私有化部署的都懂:智谱+海光这波,真的戳中甲方痛点了 在行业里工作这些年,看见智谱GLM-5.3发布当天海光DCU就完成生产级适配,第一反应是终于不用再踩“适配等待”的老坑了。之前推进过两波大模型私有化项目,模型选型定了,硬件采购到位了,光底层适配、性能调优就要耗大半个月,中间还要踩各种算子不兼容、吞吐不达标的坑,业务部门天天催进度,我们夹在中间两头难。 尤其是有信创硬性要求的场景,前两年全栈国产方案的成熟度一直不够,要么模型能力跟不上业务复杂度,要么算力平台适配慢半拍,想同步上新模型总要拖周期。这次完全不一样,模型正式发布当天,算力适配、吞吐延迟优化、生产环境验证全流程都走完了,拿过来就能直接搭测试环境,一周内就能跑业务试点。 其实,甲方要的从来不是参数榜单有多好看,而是能不能快速落地、能不能稳定运行、能不能过合规要求。智谱和海光这种前置深度协同,等于把最耗时间的适配环节提前做完了,企业不用再为基础适配买单,能把精力和预算真正放在挖掘业务价值上。 #AI私有化部署# #企业AI落地# #海光DCU# #智谱GLM-5.3#

51. 千问智谱连夜开源,都比DeepSeek便宜,国产大模型价格猛卷

52. 大模型更新这么疯,海光DCU居然还跟得这么紧? 说实话,现在做AI芯片适配,多少有点追着高铁跑的感觉。 模型更新越来越快,技术路线也一天一个样。前面还在研究长上下文,转头又是MoE、代码模型和Agent;推理框架、算子组合、部署方式也跟着不停变化。偶尔追上一款不算稀奇,难的是连续几年都不掉队。 这次GLM-5.3刚开源,海光DCU的Day0适配已经同步完成。关键是它并非第一次这么快。 GLM-5.3这轮升级也挺有意思,参数量和基座架构基本没动,主要靠后训练把代码、网络安全和Agent能力继续往上提。模型能够自己找问题、操作终端、修改代码,再根据结果做验证。任务跑法变了,底层适配自然也不能照搬旧版本。 海光还能在首日接住,说明此前积累的东西已经开始管用了。过去在GLM系列以及其他主流模型上磨过的算子、框架和部署经验,可以直接复用,不需要每次从零搭环境。 目前海光DCU适配和联合调优的主流模型已经超过400款。这个数字最让我有感觉的,不是“大”,而是它代表海光至少已经跟着模型行业转了400多次弯。 大模型继续狂奔,国产算力没有站在后面等路线稳定,而是贴着它一起跑。节奏能咬到这个程度,确实不容易。 #GLM53##海光DCU##Day0##开源模型#

53. 8月27 AI早报!阿里发布 Qwen3.8‑Flash!智谱认领牛来模型!

54. 智谱 GLM-5.3 权重开源24h倒计时,Gemini 新模型登顶全球,阿里 Qoder 全民化:AI 卷疯了! | 8月28日 AI日报

55. 夯爆了!全面超越Deepseek!智谱新模型性能实测! 虽然这几个项目都有些小毛病,但是为了公平起见我没有多轮修改,综合来看智谱的功能完成度,项目理解能力以及自主纠错的能力都是显著更强的,并且能够在官方harness中实现很多视觉能力的闭环,都是我观测到的,综合评价给到夯。#大模型 #AI #人工智能 #智谱 #deepseek

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章