智谱GLM-5.3-Flash开源,性能比肩旗舰,价格仅Claude的1/40
源自292位全网作者
00:32
精选参考来源
1
这张图表来自国际AI评测机构 Artificial Analysis,展示的是其“AA智能指数”对全球主流大语言模型的综合能力排名。图中红框标注的两款模型——Kimi K3 (max) 与 GLM-5.3 (max),均获得60分,并列开源模型第一,同时跻身全球前沿模型能力区间,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰模型处于同一水平。
2
刚刚,智谱创始人唐杰老师,在 X 上发了一篇超棒的帖子,专门说了下他对 Scaling Law 的理解(图1)。 正好今天 AA 的成绩也出来了,GLM-5.3 拿到了 60 分,上一代 GLM-5.2 是 53 分,基座是完全相同的,总参数 753B,激活 40B,而且大家 Coding 体感也都很棒,都觉得是国产 SOTA 了。 (图2) 但也有很多人也在说为啥智谱这次不训个新的基座模型。 唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。 他说,Scaling,从来不只有参数量这一个点。 我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。 现在它至少还得跟另外三个问题放在一起看: 模型有多少数据。 算力花在了哪。 谁在什么条件下运行它。 这背后,其实是 Scaling Law 过去几年一直在发生的变化。 2020 年,Kaplan 等人算出一个比例,认为参数增长应该比数据增长快得多,大概是 2.7 比 1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。 到了 2022 年,Hoffmann 等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数 20 个 Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。 这就是 Chinchilla Scaling Law。 其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。 但版本还在变化, 因为 Chinchilla 考虑的是一个模型训练一次,然后拿去评测。 但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。 所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。 到了 MoE 时代,那个简单的 20 比 1 也不够用了。 唐老师在帖子里区分了两个很重要的东西。 总参数量,大概决定模型能装下多少知识、事实和长尾信息。 激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。 需要记忆的任务,更吃参数量。 需要推理的任务,更吃数据。 后续研究甚至发现,在每个参数对应 Token 数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。 所以,大模型到底有多聪明,早就没法被一个总参数量概括了。 GLM-5.3 这次,唐老师说,它更像一次控制变量实验。 大模型 Scaling 依然在继续。 只是它已经从一个越来越大的数字。 变成了寻找最优解的游戏。#AI##科技先锋官##GLM-5.3##How I AI#
全部
来源
来源
内容由AI生成
1
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹