当前位置:
AIGC文章详情

OpenAI内部10万亿参数模型预训练完成,算力军备竞赛进入下半场

源自220位全网作者

15:59

精选参考来源

1
刚刚,智谱创始人唐杰老师,在 X 上发了一篇超棒的帖子,专门说了下他对 Scaling Law 的理解(图1)。 正好今天 AA 的成绩也出来了,GLM-5.3 拿到了 60 分,上一代 GLM-5.2 是 53 分,基座是完全相同的,总参数 753B,激活 40B,而且大家 Coding 体感也都很棒,都觉得是国产 SOTA 了。 (图2) 但也有很多人也在说为啥智谱这次不训个新的基座模型。 唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。 他说,Scaling,从来不只有参数量这一个点。 我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。 现在它至少还得跟另外三个问题放在一起看: 模型有多少数据。 算力花在了哪。 谁在什么条件下运行它。 这背后,其实是 Scaling Law 过去几年一直在发生的变化。 2020 年,Kaplan 等人算出一个比例,认为参数增长应该比数据增长快得多,大概是 2.7 比 1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。 到了 2022 年,Hoffmann 等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数 20 个 Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。 这就是 Chinchilla Scaling Law。 其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。 但版本还在变化, 因为 Chinchilla 考虑的是一个模型训练一次,然后拿去评测。 但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。 所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。 到了 MoE 时代,那个简单的 20 比 1 也不够用了。 唐老师在帖子里区分了两个很重要的东西。 总参数量,大概决定模型能装下多少知识、事实和长尾信息。 激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。 需要记忆的任务,更吃参数量。 需要推理的任务,更吃数据。 后续研究甚至发现,在每个参数对应 Token 数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。 所以,大模型到底有多聪明,早就没法被一个总参数量概括了。 GLM-5.3 这次,唐老师说,它更像一次控制变量实验。 大模型 Scaling 依然在继续。 只是它已经从一个越来越大的数字。 变成了寻找最优解的游戏。#AI##科技先锋官##GLM-5.3##How I AI#
2
【参数即本能:为什么靠“外挂”救不了小模型】OpenAI研究员Jason Wei近期反思了一个行业共识:过去大家认为只要模型有个1B规模的“认知核心”,剩下的靠联网搜索或运行代码这些“外挂工具”就能搞定。但他现在认为这完全错了。他用练羽毛球打比方:新手能靠脑子记住教练的每一个动作要领(工具调用),但在实战中根本反应不过来;真正的顶级选手靠的是肌肉记忆(参数内化)。模型如果事事都要查工具,不仅速度慢、可靠性差,更重要的是它无法像大模型那样通过海量数据训练形成一种“合成直觉”。社区评论对此展开了激烈碰撞,有人认为大模型买到的是“被编译过的经验”,而工具调用每次都要在运行时重新构建路径,成本极高;也有开发者指出,虽然大模型判断力更强,但面对实时更新的信息,工具依然是不可或缺的“新鲜度”来源。这件事的核心在于,智能的质量往往取决于知识在多大程度上变成了“本能”。小模型加工具能完成杂活,但处理复杂、长程的任务时,频繁的工具调用会迅速填满上下文窗口,并让错误在链条中不断叠加。正如社区所言,你不能指望看着Excel表格去赛车,速度本身就是智能的一部分。虽然小模型在特定垂直领域能靠微调或持续学习追赶,但对于追求极致智能的场景,Bitter Lesson(苦涩的教训)依然适用:堆参数规模带来的内化能力,目前还没有替代品。
全部
来源
内容由AI生成

精选参考来源

1. 刚刚,智谱创始人唐杰老师,在 X 上发了一篇超棒的帖子,专门说了下他对 Scaling Law 的理解(图1)。 正好今天 AA 的成绩也出来了,GLM-5.3 拿到了 60 分,上一代 GLM-5.2 是 53 分,基座是完全相同的,总参数 753B,激活 40B,而且大家 Coding 体感也都很棒,都觉得是国产 SOTA 了。 (图2) 但也有很多人也在说为啥智谱这次不训个新的基座模型。 唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。 他说,Scaling,从来不只有参数量这一个点。 我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。 现在它至少还得跟另外三个问题放在一起看: 模型有多少数据。 算力花在了哪。 谁在什么条件下运行它。 这背后,其实是 Scaling Law 过去几年一直在发生的变化。 2020 年,Kaplan 等人算出一个比例,认为参数增长应该比数据增长快得多,大概是 2.7 比 1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。 到了 2022 年,Hoffmann 等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数 20 个 Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。 这就是 Chinchilla Scaling Law。 其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。 但版本还在变化, 因为 Chinchilla 考虑的是一个模型训练一次,然后拿去评测。 但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。 所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。 到了 MoE 时代,那个简单的 20 比 1 也不够用了。 唐老师在帖子里区分了两个很重要的东西。 总参数量,大概决定模型能装下多少知识、事实和长尾信息。 激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。 需要记忆的任务,更吃参数量。 需要推理的任务,更吃数据。 后续研究甚至发现,在每个参数对应 Token 数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。 所以,大模型到底有多聪明,早就没法被一个总参数量概括了。 GLM-5.3 这次,唐老师说,它更像一次控制变量实验。 大模型 Scaling 依然在继续。 只是它已经从一个越来越大的数字。 变成了寻找最优解的游戏。#AI##科技先锋官##GLM-5.3##How I AI#

2. 【参数即本能:为什么靠“外挂”救不了小模型】OpenAI研究员Jason Wei近期反思了一个行业共识:过去大家认为只要模型有个1B规模的“认知核心”,剩下的靠联网搜索或运行代码这些“外挂工具”就能搞定。但他现在认为这完全错了。他用练羽毛球打比方:新手能靠脑子记住教练的每一个动作要领(工具调用),但在实战中根本反应不过来;真正的顶级选手靠的是肌肉记忆(参数内化)。模型如果事事都要查工具,不仅速度慢、可靠性差,更重要的是它无法像大模型那样通过海量数据训练形成一种“合成直觉”。社区评论对此展开了激烈碰撞,有人认为大模型买到的是“被编译过的经验”,而工具调用每次都要在运行时重新构建路径,成本极高;也有开发者指出,虽然大模型判断力更强,但面对实时更新的信息,工具依然是不可或缺的“新鲜度”来源。这件事的核心在于,智能的质量往往取决于知识在多大程度上变成了“本能”。小模型加工具能完成杂活,但处理复杂、长程的任务时,频繁的工具调用会迅速填满上下文窗口,并让错误在链条中不断叠加。正如社区所言,你不能指望看着Excel表格去赛车,速度本身就是智能的一部分。虽然小模型在特定垂直领域能靠微调或持续学习追赶,但对于追求极致智能的场景,Bitter Lesson(苦涩的教训)依然适用:堆参数规模带来的内化能力,目前还没有替代品。

3. 单卡跑满血大模型?伯克利+MIT 开源 FreeToken,端侧推理进入Token自由时代

4. 【美媒:#英伟达计划打造中国AI模型竞品#】据知情人士透露,英伟达已同意支付60亿美元,获得人工智能初创公司Poolside的AI模型授权,英伟达计划利用这项协议,开发人工智能模型,以挑战DeepSeek、Kimi K3等中国头部AI模型。 8月22日,据《华尔街日报》报道,超过100名Poolside员工将加入英伟达,参与这家科技巨头的开放权重模型研发项目,该项目被称为 Nemotron。Poolside的工程师将负责改进Nemotron项目目前正在开发中的最大规模模型。 此次交易凸显中美AI竞赛的激烈程度。西方媒体指出,尽管美国对华实施先进AI芯片出口管制,中国AI模型性能正迅速追赶美国产品,研发成本却显著更低。中国初创公司月之暗面推出的Kimi K3,其性能已逼近美国Anthropic旗舰模型,开发投入远低于后者。 英伟达此次巨额投资被视为对美国AI技术护城河的加固,以及对崛起中中国AI力量的直接回应。目前双方尚未就交易细节发布正式公告。 RT今日俄罗斯的微博视频

5. #CodexHarness开源#继英伟达黄仁勋公开支持来源模型之后,OpenAI也有了动作。正式宣布将Codex底层核心框架,作为平台全面开源。人工智能发展到现在这个阶段,客观来说开源大模型已经取得了阶段性的胜利。拿到到了行业应该有的尊重。这对于众多的开发者来说无疑是一个利好。开源大模型的价值已经被社会认可。回到OpenAI的来说,这个是巩固自己估值的一个无奈的选择。在B端市场一直没有起色。C端也是因为闭源获得的市场份额有限。自己仅有的先发优势已经损失殆尽。变通也是唯一可以拯救自己的一条道了!

6. 【大模型全家桶的“套娃”革命】康奈尔大学等机构的研究者提出 Matryoshka 语言模型套件,核心是将不同规模的子模型嵌套在同一个架构中进行端到端训练。以 500M、1.5B 和 3B 的组合为例,这种方法比独立训练节省了 36% 的算力,且性能基本持平。由于小模型本身就是大模型的一部分,推理时的投机采样无需额外加载草稿模型,内存和激活值完全共享,使吞吐量提升了 14-26%。过去厂商发布模型全家桶往往是重复造轮子,每种尺寸都要吃一遍数据和算力。这项研究的精妙在于把知识蒸馏变成了训练的副产品,让小模型在成长过程中直接共享大模型的参数权重,解决了模型家族之间的一致性问题。这为算力捉襟见肘的团队提供了一条捷径,即用一份算力换取一套模型。社区评论虽然对其在超大规模参数下的表现以及架构灵活性持保留意见,但这种通过结构设计榨取效率的思路,显然比单纯堆算力更具启发性。

7. DeepSeek Harness上线24小时破7万星!附程序员做Agent三大核心技术和可写简历的项目资源

8. 【MTPLX:让苹果芯片本地大模型速度翻倍的“榨汁机”】MTPLX是一个专为Apple Silicon设计的本地大模型运行工具(youssofal/MTPLX),核心卖点是利用多标记预测(Multi-Token Prediction)技术实现推理加速。与传统需要额外小模型引导的投机采样不同,它直接调用Qwen 3.8等模型内置的MTP头进行自我草拟,并在单次前向传递中完成验证。这意味着在不额外占用内存的前提下,M4或M5芯片的Mac能获得1.6倍到2.2倍的生成速度提升。该工具提供原生Mac应用和命令行界面,支持自动硬件调优,并兼容OpenAI与Anthropic的API接口,甚至集成了嵌入和重排序模型服务。长期以来,本地大模型的痛点在于推理速度与显存占用的博弈,而MTPLX的出现标志着投机采样进入了“原生化”阶段。它最值得关注的地方在于保持了输出分布的精确性,通过拒绝采样算法确保加速后的结果与标准解码完全一致,而非牺牲质量的“贪婪搜索”。对于开发者而言,其内置的Forge工具允许用户自行训练MTP适配器,这打破了模型架构对加速技术的限制。虽然目前这套方案高度绑定苹果硬件生态,但它为个人计算终端如何高效消化参数量级越来越大的开源模型提供了一个极具参考价值的样本:不再盲目堆砌硬件,而是从算法实现层面压榨既有算力的上限。

9. 现在AI的竞争,早就不是单纯比参数大小了。OpenAI直接把Codex Harness对外开源。同样一个大模型,配不一样的执行框架,实际跑出来效果差别真的很大。有了它,AI可以嵌入各类软件,自动完成一连串工作。当然只是提供基础框架,想要真正能用,还有一大堆现实问题要解决。你们觉得往后,框架的权重会不会超过大模型本身?#CodexHarness开源##openai#

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章