智谱天猫开店卖Token,API打骨折但包月Pro套餐涨了3.6倍

源自196位全网作者

09-02 22:19

精选参考来源

1
#牛来大模型6天用掉数十万亿词元##牛来大模型来自北京# 8月26日晚,智谱上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型,已面向全球开源。同日,此前在OpenRouter(全球头部大模型聚合平台)、OpenCode(开源AI编程助手平台)上匿名爆火的模型Ox-Alpha,也被证实来自这家总部位于北京的大模型公司。前沿智能不需要省着用,成了智谱此次发布模型的一大亮点,GLM-5.3-Flash定价约相当于海外知名模型Opus 4.8的40分之一。智谱团队表示,这主要源于GLM-5.3-Flash同时实现的多项架构升级,通过采用稀疏注意力与线性注意力混合架构,技术团队实现了保持精准长上下文能力的同时,大幅降低长上下文服务成本。智谱透露,为收集广大用户的广泛、专业反馈,在正式发布GLM-5.3-Flash前,团队以匿名模型Ox-Alpha在OpenCode和OpenRouter上进行了大规模测试。Ox意为“牛”,恰逢电影《牛来》走红,Ox Alpha也被中文开发者们称作“牛来大模型”。上线后,Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。公开信息显示,从8月20日匿名上线,到8月26日期间的六天,Ox Alpha已经让全球开发者用掉了数十万亿Token(词元)。值得注意的是,这些请求流量全部由国产芯片提供算力支持。智谱表示,这是其首次在大规模流量中尝试用国产芯片集群提供服务,这些芯片均通过自研高带宽互联网络连接。(来源:福布斯中文网)北京日报的微博视频
2
#Easy同学正在独立开发#智谱 Z.ai 今天正式发布 **GLM-5.3-Flash**,这是此前以 Ox Alpha 代号预览的模型,官方确认它完全运行在中国 AI 芯片上。GLM-5.3-Flash 是 **320B-A18B** 的 MoE 架构模型,以 MIT 许可证开源,原生多模态,支持 100 万 token 上下文窗口。权重已上线 Hugging Face,API 同步开放,官方还推出了对应的 Coding Plan 和 ZCode 产品。官方在评论区公布了 API 定价,按每 100 万 token 计算:**输入 $0.15,输出 $0.50,缓存命中的输入 $0.03**。对比 DeepSeek 当前的 V4-Flash 定价,GLM-5.3-Flash 的未缓存输入与输出定价均低于 DeepSeek V4-Flash 的低谷价,但缓存命中输入($0.03)高于 DeepSeek 的 $0.007-$0.014。性能方面,在 Z.ai 自家的 Code Bench 评测中,GLM-5.3-Flash 在各级 effort 设置下均优于 GLM-5.2,官方称与 Claude Opus 4.8 表现相当。发布配图对比了 GPT-5.6 Terra、Gemini 3.7 Flash、DeepSeek-V4-Vision-Exp 等多个模型的基准成绩,GLM-5.3-Flash 在 GDPVal-AA 指标上领先。博客:网页链接(由 流苏ªⁱ 撰写)#GLM-5.3-Flash##智谱AI##DeepSeek##开源模型#
全部
来源
内容由AI生成

精选参考来源

1. #牛来大模型6天用掉数十万亿词元##牛来大模型来自北京# 8月26日晚,智谱上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型,已面向全球开源。同日,此前在OpenRouter(全球头部大模型聚合平台)、OpenCode(开源AI编程助手平台)上匿名爆火的模型Ox-Alpha,也被证实来自这家总部位于北京的大模型公司。前沿智能不需要省着用,成了智谱此次发布模型的一大亮点,GLM-5.3-Flash定价约相当于海外知名模型Opus 4.8的40分之一。智谱团队表示,这主要源于GLM-5.3-Flash同时实现的多项架构升级,通过采用稀疏注意力与线性注意力混合架构,技术团队实现了保持精准长上下文能力的同时,大幅降低长上下文服务成本。智谱透露,为收集广大用户的广泛、专业反馈,在正式发布GLM-5.3-Flash前,团队以匿名模型Ox-Alpha在OpenCode和OpenRouter上进行了大规模测试。Ox意为“牛”,恰逢电影《牛来》走红,Ox Alpha也被中文开发者们称作“牛来大模型”。上线后,Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。公开信息显示,从8月20日匿名上线,到8月26日期间的六天,Ox Alpha已经让全球开发者用掉了数十万亿Token(词元)。值得注意的是,这些请求流量全部由国产芯片提供算力支持。智谱表示,这是其首次在大规模流量中尝试用国产芯片集群提供服务,这些芯片均通过自研高带宽互联网络连接。(来源:福布斯中文网)北京日报的微博视频

2. #Easy同学正在独立开发#智谱 Z.ai 今天正式发布 **GLM-5.3-Flash**,这是此前以 Ox Alpha 代号预览的模型,官方确认它完全运行在中国 AI 芯片上。GLM-5.3-Flash 是 **320B-A18B** 的 MoE 架构模型,以 MIT 许可证开源,原生多模态,支持 100 万 token 上下文窗口。权重已上线 Hugging Face,API 同步开放,官方还推出了对应的 Coding Plan 和 ZCode 产品。官方在评论区公布了 API 定价,按每 100 万 token 计算:**输入 $0.15,输出 $0.50,缓存命中的输入 $0.03**。对比 DeepSeek 当前的 V4-Flash 定价,GLM-5.3-Flash 的未缓存输入与输出定价均低于 DeepSeek V4-Flash 的低谷价,但缓存命中输入($0.03)高于 DeepSeek 的 $0.007-$0.014。性能方面,在 Z.ai 自家的 Code Bench 评测中,GLM-5.3-Flash 在各级 effort 设置下均优于 GLM-5.2,官方称与 Claude Opus 4.8 表现相当。发布配图对比了 GPT-5.6 Terra、Gemini 3.7 Flash、DeepSeek-V4-Vision-Exp 等多个模型的基准成绩,GLM-5.3-Flash 在 GDPVal-AA 指标上领先。博客:网页链接(由 流苏ªⁱ 撰写)#GLM-5.3-Flash##智谱AI##DeepSeek##开源模型#

3. #牛来模型确认为智谱GLM系列#牛来模型今天终于实锤身份了,就是智谱GLM系列的新一代产品,今晚就会正式开放模型权重。当初藏着名字悄悄上线,没几天就直接冲到海外平台使用榜第一,调用量比DeepSeek高出两倍还多,闷声秀了波硬实力,这波操作属实会玩。目前还能免费用一周,后续收费标准还没公布。国内大模型现在卷得越来越有看头,先匿名测口碑再官宣,等正式放开之后,实际体验应该差不了。

4. 英伟达最不愿看到的一幕已然出现:一家中国企业,把超10万张国产芯片组建起生产级大模型推理集群,普通使用者几乎完全感知不到算力底座的变化。智谱GLM‑5.3‑Flash,代号“牛来”正式上线,全部线上流量都由十万张以上国产芯片承接,短短5天就处理50万亿token,刷新海外平台流量纪录。尽管单张国产芯片在内存、带宽层面存在先天短板,但整套集群实现端到端性能三倍提升,单token成本已经可以和英伟达站到同一水平线。能够达成这样的效果,依靠的是稀疏‑线性混合注意力架构、基于SGLang深度改造的自研推理引擎、EPD分离调度方案,搭配W8A8与FP8混合量化技术,把每一张国产芯片的硬件潜力压榨到极致。这绝非仅供演示的Demo项目,而是实打实承接真实业务流量,国产算力由此完成从“能够跑通模型”到“敢于扛住大规模生产负载”的关键拐点。(注:华为昇腾、摩尔线程、海光为媒体报道提及的潜在芯片供应商,智谱官方并未对此予以确认)

5. 这一次,智谱用GLM-5.3-Flash实现了真正的智能平权。

6. 智谱昨晚开源了 GLM-5.3-Flash,中文社区管它叫「牛来」,就是之前匿名的 Ox Alpha。320B 总参数、18B 激活,AA 指数 57分,跟 Claude Opus 4.8 打平,定价是后者的 1/40。智谱 7 月 ARR 已经到 10 亿美金,DeepSeek 前 7 个月收入是去年全年的 10 倍,MiniMax 半年报 ARR 破 8 亿——国产模型厂商的军备竞赛已经从"比谁参数大"进入"比谁便宜还能打"的阶段。不过有意思的是,我发现网易 LobsterAI 是全网最快上线牛来模型的。昨晚智谱刚开源,10 分钟之后他就上线了。不用更新客户端、也不用去官网申请 key,打开LobsterAI 就能直接用。对普通用户来说非常方便!以前一个新模型出来,蹲 API 的开发者才能第一波用上。现在普通人打开 Agent 就能用上当天发布的前沿模型,办公 Agent 厂商们卷的速度利好新模型的普及。而且在 Agent 上,各种模型的价格非常透明。模型厂商都在打价格战,但是输入输出的定价其实普通职场人看不懂,也很难第一时间评估模型的性价比。我看 LobsterAI 上有每个模型的积分倍率,单价和用量摆得明明白白。#LobsterAI# #AI办公# #智谱# #GLM# #办公Agent# #大模型# #牛来#

7. #牛来模型确认为智谱GLM系列#前几天,网上突然冒出来一个神秘的“隐身模型”:Ox Alpha(stealth/ox-alpha),引发了大量网友的关注。Ox Alpha的中文名“牛来”,它是一个匿名上线的“隐身模型”,主打 Coding + Agent + 多模态,目前免费开放,当时网上最热门的猜测是:智谱的 GLM。随着8月26日智谱官宣,匿名模型Ox Alpha(牛来模型)属于GLM系列新一代产品,这款模型此前低调登陆OpenRouter,凭借强悍的编码与智能体能力快速登顶平台榜首,调用量直接超过DeepSeek两倍。它支持文本、图像、视频多模态输入,面向编程开发场景,目前还能免费试用一周。从全网匿名盲测登顶,到官方正式认领,国产大模型用硬实力在全球开发者社区站稳脚跟,太牛了!

8. #智谱发布GLM5.3Flash#智谱GLM‑5.3‑Flash正式对外发布,就是之前在外网悄悄测试一周、引发全网猜测的匿名模型Ox Alpha,也就是大家口中的“牛来”,官宣当晚直接开放模型权重。 采用320B‑A18B的MoE架构,MIT协议开源。总参数规模和GLM‑4.5差不多,但实际激活参数、模型层数几乎砍半。作为GLM‑5系列第一款原生多模态模型,文本、图片、视频输入都可以支持,还给到100万token超大上下文。 混合稀疏与线性注意力架构,重点压低长文本处理的服务成本。先匿名跑真实环境压测,再正式开源,这种发布方式,也给行业提供了不一样的产品验证思路。

9. DeepSeek涨价丢掉的市场,或许海光帮智谱抢回来了 8月DeepSeek刚涨完价,智谱的“牛来”就来了,定价只有DeepSeek V4 Flash的一半。这价格战打得太明显了。 那么问题来了,智谱凭什么能把价格压到这么低?GLM-5.3 Flash输入0.8元、输出2.8元,只有旗舰版GLM-5

10. “牛来”居然真是智谱。GLM-5.3-Flash昨晚正式开源,320B总参数只激活18B,原生多模态、100万Token上下文,MIT许可证。标准API价每百万Token输入0.15美元、输出0.50美元,首发期还打五折。我觉得它先藏起身份,让全球开发者用一周再揭晓,比开发布会念跑分更有说服力。匿名测试的所有流量还全跑在国产AI芯片上,这条挺重要。至于编程和Agent能力是否真接近Claude Opus 4.8,智谱自测先当参考,等更多第三方实测再下结论。#智谱发布GLM5.3Flash# 科技小参谋的微博视频

11. 「牛来」实锤智谱GLM-5.3-Flash:10万张国产芯片扛62万亿Token

12. 智谱开源GLM-5.3:1/10价格,1亿token花3块

13. 如何看待智谱 GLM-5.3-Flash 把前沿模型价格打到 Opus 4.8 的 1/40?

14. DeepSeek涨价后的那个周末,智谱用一头「牛」接走了10万亿Token

15. 智谱认领“牛来模型”,背后由10万张国产芯片支撑

16. 重磅!智谱一句话炸穿全场:GLM-5.3 Flash推理全切国产卡,供应商华为海光摩尔线程? 8月26日,智谱发布GLM-5.3 Flash——320B总参/18B激活MoE,原生多模态,AA智能指数57分持平Claude Opus 4.8,定价仅GLM-5.3的1/10!但最炸的不是模型本身,是官方那句:推理服务跑在超过10万张国产芯片集群上,供应商或来自华为昇腾、摩尔线程、海光。 过去,行业里国产卡适配大模型多是截图式Demo!智谱这次是真把生产流量切上去了——自研高带宽互联+SGLang改专用推理引擎+EPD分离架构,端到端吞吐较同硬件基线提升3倍,单Token成本追平主流英伟达GPU。模型侧也配合到位:稀疏+线性注意力混合,KV Cache压到GLM-5.3的1/4.44,1M上下文能跑;价格输入0.8元/百万Token、输出2.8元,比DS V4 Flash谷时还低,前两周再半价。 智谱不是适配了国产卡,而是把10万张昇腾/海光/摩尔线程塞进生产级推理集群,用320B模型真刀真枪接用户调用——国产算力从能跑到敢扛生产的拐点,被GLM-5.3 Flash踩实了。

17. DeepSeek提价九天后,智谱用十分之一的价格杀进来

18. 智谱牛来模型价格仅1/40,能力追平顶级,将如何改写AI定价规则?

19. 智谱GLM-5.3-Flash的发布,为国内AI大模型的价格战翻开了极具戏剧性的新篇章。如果说此前Claude Opus 4.8等顶级旗舰是收费高昂的“哈佛教授”,DeepSeek V4系列则是凭借峰谷定价和缓存机制精打细算的“高性价比讲师”,那么智谱GLM-5.3-Flash就像一位带着“国产算力”底牌入局的技术过硬的年轻讲师,不仅将常规输入输出价格压至0.8元/百万Token和2.8元/百万Token,更在限时半价期间打出了0.4元和1.4元的“地板价”,以仅为Opus 4.8约四十分之一的价格,实现了与之持平的57分智能水平。 这种极致的成本控制并非单纯的商业补贴,而是源于架构创新与底层算力的双重突破:一方面,模型采用3200亿参数但仅激活180亿的“选择性激活”机制,大幅降低了计算能耗;另一方面,智谱调动超10万张国产AI芯片集群,通过专用推理引擎和量化技术,硬生生在国产硬件上跑出了媲美主流英伟达GPU的性价比。 这一举措直接对DeepSeek构成了降维打击,在常规调用和标准缓存场景下,GLM-5.3-Flash展现出压倒性的价格优势,迫使开发者重新评估成本结构。然而,DeepSeek并未失去还手之力,其极致的缓存命中定价(谷时仅需0.05元/百万Token)在高度重复上下文的Agent任务中依然是“省钱利器”。输入越便宜、缓存命中价越低(DeepSeek 谷时 0.05 元),越适合高频调用。 GLM≈高性价比快餐,DeepSeek≈中档餐厅(有峰谷价差),GPT≈高档餐厅,Claude≈米其林三星。 这场交锋标志着国内AI市场的竞争逻辑正在发生深刻转变:从早期简单粗暴的“拼低价”,全面升级为涵盖架构设计、国产算力适配、峰谷调度与缓存优化的“拼综合价值”。对于开发者而言,这无疑是最好的时代,因为极致的性价比选择正变得前所未有地丰富。

20. 国产大模型推理成本1元/百万Token,小团队为何首选智谱?

21. qwen3.8 flash和glm5.3 flash发布之后,deepseek v4 flash不香了,智力和价格都被碾压。昨天用了一个下午qwen3.8 flash,token plan变得非常耐用!阿里巴巴和智谱开始卷价格。昨天早上看到阿里的定价是输入1元/M,输出3元/M,到了下午变成了0.8/M和2.7/M。智谱原价0.8/M,2.8/M,现在打5折。什么token plan,coding plan都不用考虑了,直接API充值。最令人费解的是智谱的flash支持视觉,而旗舰不支持。所以现在国产模型只需要kimi k3搭配一个最便宜的flash模型就足够应对各种场景了。

22. 智谱开源GLM-5.3-Flash:AA得分57分比肩Opus 4.8,定价为其1/40

23. 匿名爆火模型“牛来”被智谱认领,价格大跳水 #匿名爆火模型牛来被智谱认领 #牛来模型被智谱认领 智谱8月26日深夜上线并开源GLM-5.3-Flash模型。该模型此前已在OpenRouter、OpenCode上匿名爆火、被网友戏称为“牛来”模型。值得一提的是,该模型对比智谱上一代模型价格直线下降,同时其在指数测评上分数与Anthropic的Claude Opus 4.8相等,但定价仅为Opus 4.8的1/40。#牛来模型价格比上一代大跳水 智谱方面还透露,GLM-5.3-Flash全部线上流量均由10万张国产芯片承载,这也是国产算力芯片首次大规模集体“出海”。

24. 火了6天的神秘大模型“牛来”,身份终于揭晓!原来来自北京智谱。此前“牛来”匿名上线后迅速爆火,6天让全球开发者用掉数十万亿Token,价格约为海外知名模型Opus 4.8的1/40。此次智谱还首次用国产芯片集群提供大规模算力支持。#智谱 #牛来大模型 #GLM5 #国产大模型 #热点解读看财经

25. 如何评价智谱开源的 GLM-5.3-Flash?

26. 算力突围EP.01|智谱深夜放大招,新GLM震惊世界 8月26日晚,智谱发布 GLM-5.3-Flash:320B总参/18B激活的原生多模态MoE, 线上推理全部跑在超10万张国产芯片上,定价约为 Claude Opus 4.8 的 1/40。 而就在五天前,DeepSeek 刚上线 V4 系列首个视觉模型。两个国产多模态,撞档了。

27. 海外爆火中国AI大模型“牛来” #智谱AI#Ox Alpha#牛来#国产算力 智谱AI公布海外匿名爆火模型Ox Alpha,国内外号“牛来”,实为GLM‑5.3‑Flash并开源。 总参数量3200亿,激活180亿,支持百万token上下文,定价降至前代十分之一。 全部线上推理流量由10万片国产AI芯片承载,验证大模型+国产算力整套国产化能力。

28. 智谱用匿名Ox-Alpha每天处理100万亿Token,如何完成公开测试?

2
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章