当前位置:
AIGC文章详情

智谱GLM-5.3-Flash开源,性能比肩旗舰,价格仅Claude的1/40

源自292位全网作者

00:32

精选参考来源

1
这张图表来自国际AI评测机构 Artificial Analysis,展示的是其“AA智能指数”对全球主流大语言模型的综合能力排名。图中红框标注的两款模型——Kimi K3 (max) 与 GLM-5.3 (max),均获得60分,并列开源模型第一,同时跻身全球前沿模型能力区间,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰模型处于同一水平。
2
刚刚,智谱创始人唐杰老师,在 X 上发了一篇超棒的帖子,专门说了下他对 Scaling Law 的理解(图1)。 正好今天 AA 的成绩也出来了,GLM-5.3 拿到了 60 分,上一代 GLM-5.2 是 53 分,基座是完全相同的,总参数 753B,激活 40B,而且大家 Coding 体感也都很棒,都觉得是国产 SOTA 了。 (图2) 但也有很多人也在说为啥智谱这次不训个新的基座模型。 唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。 他说,Scaling,从来不只有参数量这一个点。 我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。 现在它至少还得跟另外三个问题放在一起看: 模型有多少数据。 算力花在了哪。 谁在什么条件下运行它。 这背后,其实是 Scaling Law 过去几年一直在发生的变化。 2020 年,Kaplan 等人算出一个比例,认为参数增长应该比数据增长快得多,大概是 2.7 比 1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。 到了 2022 年,Hoffmann 等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数 20 个 Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。 这就是 Chinchilla Scaling Law。 其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。 但版本还在变化, 因为 Chinchilla 考虑的是一个模型训练一次,然后拿去评测。 但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。 所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。 到了 MoE 时代,那个简单的 20 比 1 也不够用了。 唐老师在帖子里区分了两个很重要的东西。 总参数量,大概决定模型能装下多少知识、事实和长尾信息。 激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。 需要记忆的任务,更吃参数量。 需要推理的任务,更吃数据。 后续研究甚至发现,在每个参数对应 Token 数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。 所以,大模型到底有多聪明,早就没法被一个总参数量概括了。 GLM-5.3 这次,唐老师说,它更像一次控制变量实验。 大模型 Scaling 依然在继续。 只是它已经从一个越来越大的数字。 变成了寻找最优解的游戏。#AI##科技先锋官##GLM-5.3##How I AI#
全部
来源
内容由AI生成

精选参考来源

1. 这张图表来自国际AI评测机构 Artificial Analysis,展示的是其“AA智能指数”对全球主流大语言模型的综合能力排名。图中红框标注的两款模型——Kimi K3 (max) 与 GLM-5.3 (max),均获得60分,并列开源模型第一,同时跻身全球前沿模型能力区间,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰模型处于同一水平。

2. 刚刚,智谱创始人唐杰老师,在 X 上发了一篇超棒的帖子,专门说了下他对 Scaling Law 的理解(图1)。 正好今天 AA 的成绩也出来了,GLM-5.3 拿到了 60 分,上一代 GLM-5.2 是 53 分,基座是完全相同的,总参数 753B,激活 40B,而且大家 Coding 体感也都很棒,都觉得是国产 SOTA 了。 (图2) 但也有很多人也在说为啥智谱这次不训个新的基座模型。 唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。 他说,Scaling,从来不只有参数量这一个点。 我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。 现在它至少还得跟另外三个问题放在一起看: 模型有多少数据。 算力花在了哪。 谁在什么条件下运行它。 这背后,其实是 Scaling Law 过去几年一直在发生的变化。 2020 年,Kaplan 等人算出一个比例,认为参数增长应该比数据增长快得多,大概是 2.7 比 1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。 到了 2022 年,Hoffmann 等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数 20 个 Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。 这就是 Chinchilla Scaling Law。 其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。 但版本还在变化, 因为 Chinchilla 考虑的是一个模型训练一次,然后拿去评测。 但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。 所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。 到了 MoE 时代,那个简单的 20 比 1 也不够用了。 唐老师在帖子里区分了两个很重要的东西。 总参数量,大概决定模型能装下多少知识、事实和长尾信息。 激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。 需要记忆的任务,更吃参数量。 需要推理的任务,更吃数据。 后续研究甚至发现,在每个参数对应 Token 数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。 所以,大模型到底有多聪明,早就没法被一个总参数量概括了。 GLM-5.3 这次,唐老师说,它更像一次控制变量实验。 大模型 Scaling 依然在继续。 只是它已经从一个越来越大的数字。 变成了寻找最优解的游戏。#AI##科技先锋官##GLM-5.3##How I AI#

3. 智谱联合创始人唐杰老师关于 GLM 5.3 以及模型训练的一些分享:智谱 GLM-5.3 没有换基模底座,纯靠后训练让编码能力提升 50%。GLM-5.3 模型的底座是 GLM-5.2,约 743B 参数的混合专家(MoE)模型,每次推理只激活约 40B 参数。团队花了一个月,在长周期环境中做强化学习,编码能力比 GLM-5.2 提升了 50%。这里解释一下 MoE:传统模型每次推理要跑完所有参数,MoE 相当于把模型拆成一群“专家”,每次只调用其中几个,推理速度更快、成本更低。推文中特别区分了两个概念:1. 总参数量决定模型学习了多少知识2. 激活参数量和有效深度决定模型能想多深。比如说,让模型去找安全漏洞,主要是依赖的是推理能力,能把一条二十步的推理链完整走到底,相对来说各种安全数据库是次要的。至于为什么不换底座也能大幅提升呢?AI 模型的扩展(scaling)不止堆参数这一条途径。如果梳理下这些年模型训练的发展路线:- 2020 年 Kaplan 等人的研究建议参数增长要远快于数据,GPT-3、Gopher 都是这个思路的产物。- 2022 年 DeepMind 的 Chinchilla 论文则认为参数和数据应该同步增长,参数大的模型反而是最浪费算力的。- 再后来,大家发现模型上线后推理成本远超训练成本,最优解又变成了用更小的模型训更久,比如 Llama-2-7B 每个参数喂了约 290 个 token,Gemma-2-9B 更是喂了 889 个。模型能力由很多因素决定:底座大小、预训练数据量、每次前向传播的计算量、后训练。对于现阶段,模型后训练还有很大潜力可以挖掘。

4. 聊聊唐杰老师对GLM-5.3和Scaling Law的思考

5. 彭博刚刚把美中人工智能差距做成了一张图表,嗯,是的,美国正在被碾压:> Kimi K3 接近 Fable 的水平> 每任务成本便宜约 70%> Anthropic 认为中国落后 6–12 个月> 中国现在拥有前沿实验室集群> GLM-5.3 甚至还没包括在内,这将有利于中国一方美国实验室仍然占据前沿位置,但中国正让它们无法收取前沿价格。

6. Vercel它是一个类似于网站部署的公司,会给很多小型网站提供免费的部署方案。我也有好几个网站部署在上面,非常好用。他们其实也很多地用到大模型。根据他们最近披露的一个数据,其大模型的使用从以前闭源模型占主导,到现在开源模型占主导,这个改变的进程其实非常短。因为随着技术进步的速度放缓,闭源模型的最强者已经不再是遥遥领先,而只是在某些部分领先。比如说 Anthropic 的 Claude Fable 5 这个模型,在前三四个月可能还是断崖式领先;但最近一两个月中国模型相继发布,比如智谱的 GLM 5.3、Kimi K3 模型,以及 DeepSeek 的 V4 Pro 等,都会或多或少挑战到 Fable 的绝对领先地位。同时,开源模型最大的优势就是便宜,意味着只要有自己的设备,就可以自己去部署运行。这也是为什么 Hugging Face 提到,公司使用的开源模型比例已经从之前的 28.4% 涨到现在的 62%,而闭源模型则从之前的 76% 相当于减半到现在的 38%。我觉得这可以说是攻守之势异也。

7. ZCode送1亿GLM-5.3token、DeepSeek上V4-Flash-Vision、GPT-5.6 Sol降价20% | 8月22日 AI日报

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章