OpenAI内部10万亿参数模型预训练完成,算力军备竞赛进入下半场
源自220位全网作者
15:59
精选参考来源
1
刚刚,智谱创始人唐杰老师,在 X 上发了一篇超棒的帖子,专门说了下他对 Scaling Law 的理解(图1)。 正好今天 AA 的成绩也出来了,GLM-5.3 拿到了 60 分,上一代 GLM-5.2 是 53 分,基座是完全相同的,总参数 753B,激活 40B,而且大家 Coding 体感也都很棒,都觉得是国产 SOTA 了。 (图2) 但也有很多人也在说为啥智谱这次不训个新的基座模型。 唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。 他说,Scaling,从来不只有参数量这一个点。 我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。 现在它至少还得跟另外三个问题放在一起看: 模型有多少数据。 算力花在了哪。 谁在什么条件下运行它。 这背后,其实是 Scaling Law 过去几年一直在发生的变化。 2020 年,Kaplan 等人算出一个比例,认为参数增长应该比数据增长快得多,大概是 2.7 比 1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。 到了 2022 年,Hoffmann 等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数 20 个 Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。 这就是 Chinchilla Scaling Law。 其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。 但版本还在变化, 因为 Chinchilla 考虑的是一个模型训练一次,然后拿去评测。 但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。 所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。 到了 MoE 时代,那个简单的 20 比 1 也不够用了。 唐老师在帖子里区分了两个很重要的东西。 总参数量,大概决定模型能装下多少知识、事实和长尾信息。 激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。 需要记忆的任务,更吃参数量。 需要推理的任务,更吃数据。 后续研究甚至发现,在每个参数对应 Token 数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。 所以,大模型到底有多聪明,早就没法被一个总参数量概括了。 GLM-5.3 这次,唐老师说,它更像一次控制变量实验。 大模型 Scaling 依然在继续。 只是它已经从一个越来越大的数字。 变成了寻找最优解的游戏。#AI##科技先锋官##GLM-5.3##How I AI#
2
【参数即本能:为什么靠“外挂”救不了小模型】OpenAI研究员Jason Wei近期反思了一个行业共识:过去大家认为只要模型有个1B规模的“认知核心”,剩下的靠联网搜索或运行代码这些“外挂工具”就能搞定。但他现在认为这完全错了。他用练羽毛球打比方:新手能靠脑子记住教练的每一个动作要领(工具调用),但在实战中根本反应不过来;真正的顶级选手靠的是肌肉记忆(参数内化)。模型如果事事都要查工具,不仅速度慢、可靠性差,更重要的是它无法像大模型那样通过海量数据训练形成一种“合成直觉”。社区评论对此展开了激烈碰撞,有人认为大模型买到的是“被编译过的经验”,而工具调用每次都要在运行时重新构建路径,成本极高;也有开发者指出,虽然大模型判断力更强,但面对实时更新的信息,工具依然是不可或缺的“新鲜度”来源。这件事的核心在于,智能的质量往往取决于知识在多大程度上变成了“本能”。小模型加工具能完成杂活,但处理复杂、长程的任务时,频繁的工具调用会迅速填满上下文窗口,并让错误在链条中不断叠加。正如社区所言,你不能指望看着Excel表格去赛车,速度本身就是智能的一部分。虽然小模型在特定垂直领域能靠微调或持续学习追赶,但对于追求极致智能的场景,Bitter Lesson(苦涩的教训)依然适用:堆参数规模带来的内化能力,目前还没有替代品。
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
最新文章
热门文章
已收藏
去我的收藏夹