智谱半年营收9.54亿增长400%,下一代大模型主打首日满规模调用
源自335位全网作者
12:08
精选参考来源
1
英伟达最不愿看到的一幕已然出现:一家中国企业,把超10万张国产芯片组建起生产级大模型推理集群,普通使用者几乎完全感知不到算力底座的变化。智谱GLM‑5.3‑Flash,代号“牛来”正式上线,全部线上流量都由十万张以上国产芯片承接,短短5天就处理50万亿token,刷新海外平台流量纪录。尽管单张国产芯片在内存、带宽层面存在先天短板,但整套集群实现端到端性能三倍提升,单token成本已经可以和英伟达站到同一水平线。能够达成这样的效果,依靠的是稀疏‑线性混合注意力架构、基于SGLang深度改造的自研推理引擎、EPD分离调度方案,搭配W8A8与FP8混合量化技术,把每一张国产芯片的硬件潜力压榨到极致。这绝非仅供演示的Demo项目,而是实打实承接真实业务流量,国产算力由此完成从“能够跑通模型”到“敢于扛住大规模生产负载”的关键拐点。(注:华为昇腾、摩尔线程、海光为媒体报道提及的潜在芯片供应商,智谱官方并未对此予以确认)
2
#牛来大模型6天用掉数十万亿词元##牛来大模型来自北京# 8月26日晚,智谱上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型,已面向全球开源。同日,此前在OpenRouter(全球头部大模型聚合平台)、OpenCode(开源AI编程助手平台)上匿名爆火的模型Ox-Alpha,也被证实来自这家总部位于北京的大模型公司。前沿智能不需要省着用,成了智谱此次发布模型的一大亮点,GLM-5.3-Flash定价约相当于海外知名模型Opus 4.8的40分之一。智谱团队表示,这主要源于GLM-5.3-Flash同时实现的多项架构升级,通过采用稀疏注意力与线性注意力混合架构,技术团队实现了保持精准长上下文能力的同时,大幅降低长上下文服务成本。智谱透露,为收集广大用户的广泛、专业反馈,在正式发布GLM-5.3-Flash前,团队以匿名模型Ox-Alpha在OpenCode和OpenRouter上进行了大规模测试。Ox意为“牛”,恰逢电影《牛来》走红,Ox Alpha也被中文开发者们称作“牛来大模型”。上线后,Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。公开信息显示,从8月20日匿名上线,到8月26日期间的六天,Ox Alpha已经让全球开发者用掉了数十万亿Token(词元)。值得注意的是,这些请求流量全部由国产芯片提供算力支持。智谱表示,这是其首次在大规模流量中尝试用国产芯片集群提供服务,这些芯片均通过自研高带宽互联网络连接。(来源:福布斯中文网)北京日报的微博视频
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹