当前位置:
AIGC文章详情

智谱GLM-5.3-Flash开源发布,十分之一价格对标Claude Opus 4.8性能

源自287位全网作者

01:09

精选参考来源

1
智谱联合创始人唐杰老师关于 GLM 5.3 以及模型训练的一些分享:智谱 GLM-5.3 没有换基模底座,纯靠后训练让编码能力提升 50%。GLM-5.3 模型的底座是 GLM-5.2,约 743B 参数的混合专家(MoE)模型,每次推理只激活约 40B 参数。团队花了一个月,在长周期环境中做强化学习,编码能力比 GLM-5.2 提升了 50%。这里解释一下 MoE:传统模型每次推理要跑完所有参数,MoE 相当于把模型拆成一群“专家”,每次只调用其中几个,推理速度更快、成本更低。推文中特别区分了两个概念:1. 总参数量决定模型学习了多少知识2. 激活参数量和有效深度决定模型能想多深。比如说,让模型去找安全漏洞,主要是依赖的是推理能力,能把一条二十步的推理链完整走到底,相对来说各种安全数据库是次要的。至于为什么不换底座也能大幅提升呢?AI 模型的扩展(scaling)不止堆参数这一条途径。如果梳理下这些年模型训练的发展路线:- 2020 年 Kaplan 等人的研究建议参数增长要远快于数据,GPT-3、Gopher 都是这个思路的产物。- 2022 年 DeepMind 的 Chinchilla 论文则认为参数和数据应该同步增长,参数大的模型反而是最浪费算力的。- 再后来,大家发现模型上线后推理成本远超训练成本,最优解又变成了用更小的模型训更久,比如 Llama-2-7B 每个参数喂了约 290 个 token,Gemma-2-9B 更是喂了 889 个。模型能力由很多因素决定:底座大小、预训练数据量、每次前向传播的计算量、后训练。对于现阶段,模型后训练还有很大潜力可以挖掘。
2
聊聊唐杰老师对GLM-5.3和Scaling Law的思考
全部
来源
内容由AI生成

精选参考来源

1. 智谱联合创始人唐杰老师关于 GLM 5.3 以及模型训练的一些分享:智谱 GLM-5.3 没有换基模底座,纯靠后训练让编码能力提升 50%。GLM-5.3 模型的底座是 GLM-5.2,约 743B 参数的混合专家(MoE)模型,每次推理只激活约 40B 参数。团队花了一个月,在长周期环境中做强化学习,编码能力比 GLM-5.2 提升了 50%。这里解释一下 MoE:传统模型每次推理要跑完所有参数,MoE 相当于把模型拆成一群“专家”,每次只调用其中几个,推理速度更快、成本更低。推文中特别区分了两个概念:1. 总参数量决定模型学习了多少知识2. 激活参数量和有效深度决定模型能想多深。比如说,让模型去找安全漏洞,主要是依赖的是推理能力,能把一条二十步的推理链完整走到底,相对来说各种安全数据库是次要的。至于为什么不换底座也能大幅提升呢?AI 模型的扩展(scaling)不止堆参数这一条途径。如果梳理下这些年模型训练的发展路线:- 2020 年 Kaplan 等人的研究建议参数增长要远快于数据,GPT-3、Gopher 都是这个思路的产物。- 2022 年 DeepMind 的 Chinchilla 论文则认为参数和数据应该同步增长,参数大的模型反而是最浪费算力的。- 再后来,大家发现模型上线后推理成本远超训练成本,最优解又变成了用更小的模型训更久,比如 Llama-2-7B 每个参数喂了约 290 个 token,Gemma-2-9B 更是喂了 889 个。模型能力由很多因素决定:底座大小、预训练数据量、每次前向传播的计算量、后训练。对于现阶段,模型后训练还有很大潜力可以挖掘。

2. 聊聊唐杰老师对GLM-5.3和Scaling Law的思考

3. 刚刚,智谱创始人唐杰老师,在 X 上发了一篇超棒的帖子,专门说了下他对 Scaling Law 的理解(图1)。 正好今天 AA 的成绩也出来了,GLM-5.3 拿到了 60 分,上一代 GLM-5.2 是 53 分,基座是完全相同的,总参数 753B,激活 40B,而且大家 Coding 体感也都很棒,都觉得是国产 SOTA 了。 (图2) 但也有很多人也在说为啥智谱这次不训个新的基座模型。 唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。 他说,Scaling,从来不只有参数量这一个点。 我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。 现在它至少还得跟另外三个问题放在一起看: 模型有多少数据。 算力花在了哪。 谁在什么条件下运行它。 这背后,其实是 Scaling Law 过去几年一直在发生的变化。 2020 年,Kaplan 等人算出一个比例,认为参数增长应该比数据增长快得多,大概是 2.7 比 1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。 到了 2022 年,Hoffmann 等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数 20 个 Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。 这就是 Chinchilla Scaling Law。 其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。 但版本还在变化, 因为 Chinchilla 考虑的是一个模型训练一次,然后拿去评测。 但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。 所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。 到了 MoE 时代,那个简单的 20 比 1 也不够用了。 唐老师在帖子里区分了两个很重要的东西。 总参数量,大概决定模型能装下多少知识、事实和长尾信息。 激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。 需要记忆的任务,更吃参数量。 需要推理的任务,更吃数据。 后续研究甚至发现,在每个参数对应 Token 数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。 所以,大模型到底有多聪明,早就没法被一个总参数量概括了。 GLM-5.3 这次,唐老师说,它更像一次控制变量实验。 大模型 Scaling 依然在继续。 只是它已经从一个越来越大的数字。 变成了寻找最优解的游戏。#AI##科技先锋官##GLM-5.3##How I AI#

4. 牛来进军 AI 行业了。。。牛来 SOTA AI !!!Ox Alpha(OpenRouter 上的模型 ID 为 stealth/ox-alpha,也有 OpenCode 上的免费版)。上线时间:大约2026年8月20日深夜(北京时间21日凌晨)以“隐身模型”(stealth model)身份低调出现在 OpenRouter 等平台。主要规格:约100万 token 上下文窗口最大输出约13万 token支持文本 + 图片 + 视频多模态输入支持工具调用目前限时免费(约一周,到8月27日左右),调用额度很宽松(平台宣称日处理量可达100T token级别)性能表现(初步测试):Ox Alpha 通过率约 80%Claude Fable 5 Max 约 65%GPT-5.6 Sol Max 约 52%其他如 GLM-5.3、Grok 4.6 也在60%左右这让它在编程/Agent编码能力上引发大量关注,看起来逼近甚至局部超过当前头部模型。但注意:测试样本量较小(10道题左右),后续有人复测结果有波动。身份猜测:目前没有官方认领,完全匿名。社区通过“指纹分析”(比如视频token消耗模式、错误提示语言、审查口径等)做了大量对比:最主流猜测:智谱(Zhipu AI)尚未正式发布的 GLM-5.3 相关版本(可能是 Flash 版或带多模态的视觉版),证据匹配度较高。

5. 智谱的GLM-5.3终于也在AA竞技场开分,暑期档的这一轮国产模型上新基本上算是告一段落了,目前的成绩如下:Kimi K3和GLM-5.3并列60分,是中国唯二能过挤进T1阵营里的模型,咬住了GPT-5.6和Claude Opus 5,当然Kimi K3是已经发布超过1个月了,含金量更高。T2档位排下来依次是58分的Qwen3.8 Max、53分的DeepSeek-V4-Pro、52分的Qwen3.8 27B,也是兼顾性能与经济性的高竞争区间,凡尔登绞肉机的市场。T3则属于上桌吃饭的底线,有45分的MiniMax-M3、43分的小米MiMo-V2.5-Pro、42分的腾讯Hy3,主打一个量大管饱的供应,够用就行,要啥自行车呢。再往下数,T4就很深海了,蚂蚁Ling 3.0 Flash是38分,美团LongCat 2.0是34分,阶跃Step 3.7 Flash是31分,已经不太适用通用场景了,只能卖给垂直领域。什么,你问22分的百度文心模型是不是位于马里亚纳海沟?好吧,我稍微说句公道话,自从文心5.0拉了这坨大的之后,百度就没有再把新发布的文心5.1上传AA竞技场了,所以22分虽然不是百度的真实表现,但一个小版本的迭代估摸着也好不到哪里去。对了,字节也没有在AA竞技场上传Seed参展,就憋大的吧。

6. 这张图表来自国际AI评测机构 Artificial Analysis,展示的是其“AA智能指数”对全球主流大语言模型的综合能力排名。图中红框标注的两款模型——Kimi K3 (max) 与 GLM-5.3 (max),均获得60分,并列开源模型第一,同时跻身全球前沿模型能力区间,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰模型处于同一水平。

7. 我看智谱的创始人唐杰在 X 上发了一个关于尺度律的思考。我简单翻译一下。具体什么意思呢?很多人一听到大模型,第一反应就是问:它有多少参数?参数可以简单理解成模型的“脑容量”。参数越多,模型通常能装下更多知识,但这并不能单独决定模型有多聪明。还要看它读了多少训练资料,训练时用了多少算力,以及以后会被调用多少次。人工智能行业以前就因为只盯着参数量,走过一段弯路。2020年的一项研究认为,模型参数应该比训练数据增长得更快,比例大约是2.7比1。于是很多公司开始不断把模型做大,甚至冲向万亿参数。后来,研究人员重新比较了大约400个模型,发现更划算的做法,是让训练数据也跟上模型规模。大致来说,每个参数需要对应约20个词元,也就是训练文字中的小片段。参数和数据最好一起增长,不能只顾着扩大模型。后来大家又发现,训练成本只是问题的一部分。现在,一个模型每天可能被调用几十亿次,真正长期花钱的地方,常常是模型回答问题时产生的推理成本。这样一来,小一些的模型,如果接受更长时间、更充分的训练,可能比一个特别大的模型更实用。Llama 2 7B和Gemma 2 9B就体现了这种思路。采用MoE架构的模型,还要区分两类参数。总参数更像“知识仓库”,决定模型能装下多少事实和冷门信息。每次真正被调用的参数,以及模型能连续思考多少步,更影响它的推理能力。研究发现,记忆知识可能需要更多参数,复杂推理则更需要训练数据和更长的思考过程。比如,发现一个软件漏洞,不只是从资料库里找答案。模型需要把一连串推理完整走下去,中间不能忘记前面的线索,这种能力无法只靠增加总参数获得。GLM 5.3做了一个很有意思的实验。它和GLM 5.2的基础模型、架构、总参数量都差不多,主要用了一个月时间加强长流程训练和强化学习,也就是让模型在反复练习中获得反馈。结果能力提升很明显。这说明,大模型还有很多地方可以继续扩大。参数量只是其中一个旋钮,训练数据、推理算力、训练方式和强化学习都很重要。下一次进步,关键在于找到最值得继续投入的那个方向。#科技先锋官##How I AI#

8. GLM 5.3 更强却更难用了?我们让它和 5.2 做了同一个北京城市驾驶游戏

9. 实测对比神秘模型-Ox牛来 和 DeepSeek-V4-Flash-Vision,谁是真牛?

10. 【#新模型OxAlpha引大规模身份猜测#,#神秘牛来大模型OxAlpha火了#】近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就是「牛」的意思,国内网友很快给它起了一个更接地气的名字:「牛来」大模型。根据 OpenRouter 披露的信息,Ox Alpha 拥有 100 万 token 上下文,支持文本、图片和视频输入,可以调用工具,目前完全免费。上线后不久,开发者就把它接入编码 Agent,扔进真实代码仓库进行测试。初步测试结果显示,这款来历不明的「牛来」大模型,能力已逼近当前顶级代码模型。与此同时,有网友爆料,一款名为 korrine 的匿名模型正在 Code Arena 上进行测试。有人猜它是 Kimi K3.1,也有人将其指向 Qwen 和 MiMo,说啥的都有。8 月的大模型圈,突然变成了一场大型猜谜游戏。「牛来」大模型表现抢眼Ox Alpha 真正引发关注,靠的是代码能力。开发者 Ben Davis 从 DeepSWE 中抽取 10 项任务进行测试,Ox Alpha 完成了其中 8 项,通过率达到 80%。其公布的对比结果中,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。DeepSWE 考察真实软件工程能力。模型需要阅读代码仓库,定位问题,修改代码,运行测试,再根据报错继续修复。相比单轮编程题,它更接近编码 Agent 的实际工作。不过,10 项任务的样本很小。随后,其他开发者在另一组 DeepSWE 子集上测试,给出的结果约为 63%。两次测试的任务范围和运行配置并不完全相同,暂时无法据此确定 Ox Alpha 的准确排名。不过这些结果初步显示,这款匿名模型已经表现出很强的长程编码潜力,能力逼近当前头部模型。「牛来」大模型到底是谁家的?「牛来」大模型的身份,目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。有人还专门写了个博客进行分析:1. 最强证据来自视频编码器。四段不同帧率、时长和分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致。MiMo、Qwen 和 GLM-4.6V 都呈现出明显不同的结果。2. 文本 tokenizer 也高度吻合。研究者测试了 25 组提示词,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。3. 其他特征也指向智谱。Ox Alpha 拒绝处理音频,与 GLM-5V 的路由方式相同;回答风格、Agent 执行步数和推理接口也很接近 GLM。智谱此前还曾用 Pony Alpha 匿名测试 GLM-5,具备相同操作先例。还有网友从对话中寻到蛛丝马迹。Ben Davis 认为 99% 确定这就是 GLM-5.x。这些线索提高了 GLM 说的可信度,但还不足以完成身份确认。截至目前,OpenRouter、智谱都没有公开回应。korrine 身份更扑朔迷离「牛来」大模型的身份还扑朔迷离,Code Arena 又出现了一个名为 korrine 的匿名模型。最初,不少人猜测它是 Kimi K3.1,原因是 Kimi K3 发布前,曾被认为以 kivine 的代号接受测试。kivine 与 korrine 结构相近,因此引发了联想。不过,最早传播消息的爆料者随后补充称,此前获知的 Moonshot 新模型可能对应另一个代号 adamant-ananke。korrine 也可能来自 Qwen 等其他中国团队。评论区中,还有人将它指向 MiMo V3。大模型厂商为什么喜欢「挂马甲」?匿名测试正在成为大模型正式发布前的重要环节。在 Arena 中隐藏厂商和型号,可以尽量削弱品牌带来的先入为主。用户看不到模型身份,只能根据实际输出进行选择,最终积累的对战结果,也更接近真实用户体验。OpenRouter 提供的是另一类测试环境。开发者会把模型接入各种编码 Agent,让它进入真实仓库,连续调用工具,处理长达数小时的软件工程任务。上下文能否保持稳定,工具调用是否可靠,模型会不会在长程任务中循环或跑偏,都能在高强度使用中迅速暴露。对模型厂商来说,这相当于一次公开压力测试。团队可以提前观察失败案例,验证推理服务的承载能力,也能在正式发布前积累真实口碑。此外,「猜模型」现在也越来越成为一种营销手段了,身份悬念确实可以拉长讨论周期。最后回到模型本身。如果 Ox Alpha 真是一款 Flash 模型,其代码能力已经逼近头部水平,那么资源投入更高、能力更完整的完整版,又会把上限推到哪里呢?(新浪)

11. 彭博刚刚把美中人工智能差距做成了一张图表,嗯,是的,美国正在被碾压:> Kimi K3 接近 Fable 的水平> 每任务成本便宜约 70%> Anthropic 认为中国落后 6–12 个月> 中国现在拥有前沿实验室集群> GLM-5.3 甚至还没包括在内,这将有利于中国一方美国实验室仍然占据前沿位置,但中国正让它们无法收取前沿价格。

12. 参数一个没动,GLM-5.3 凭什么能力大涨?

13. 实测GLM 5.3,1/3参数量 + 后训练还能逼平GPT-5.6我也是服了

14. GLM-5.3 在 AA 14 模型对比中综合第 5,Agentic 第 2:双榜成绩出炉

15. 同一套 DeepSeek Harness 实测三款国产模型,GLM-5.3为何在两个项目中胜出

16. Arena榜单:GLM-5.3 排名第 8 今天,GLM-5.3在Arena上的排名刚刚出炉,目前在前端开发榜上排名第8,超过近期刚刚发布的Gemini 3.7 flash。 在Artificial Analysis模型智能评估中,GLM-5.3与Kimi K3分数相同。 不过两者参数量差异非常大: GLM-5.3:753B (7530 亿) Kimi K3:2.8T(2.8 万亿) 单就AA智能评估,GLM-5.3以小参数量追平Kimi K3,能效比表现相当亮眼! 价格方面根据官网,GLM5.3与上一代GLM5.2价格相同。 Arena 双盲评测大模型权威排行榜 arena.atease.dev

17. 智谱GLM-5.3 模型介绍

18. glm5.3用了一晚上,真被惊艳到了 本来一直用的5.6 sol,但是心血来潮用codex接了glm 5.3体验了一晚,把整个产品的后端都写完了,体感上并不比5.6差很多。找的TeamoRouter接的glm 5.3,价格上还能更di一些 #人工智能 #vibecoding #ai #智谱 #后悔没早点买 #大模型

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章