当“大力出奇迹”的Scaling法则遭遇瓶颈,AGI的下一步将走向何方?一场汇聚了中国AI界核心人物的闭门会议,探讨了超越算力堆叠的新范式。从Scaling的效率拷问,到Token效率的关键地位,再到中美AI发展的路径分化,这些讨论不仅揭示了行业共识,也为理解下一代通用人工智能的演进方向提供了极具价值的洞见。
智能速览
Scaling法则遭遇瓶颈,单纯堆叠算力的“偷懒方式”效率堪忧。
Token效率正成为决定模型智能上限的关键竞争因素。
中美大模型走上不同路径,美国重生产力工具,中国重成本与落地。
toB与toC市场逻辑分化,企业端对模型能力的价值感知更强烈。
自主学习被视为下一代范式的可能方向,但其实现路径仍不清晰。
精华内容
当“大力出奇迹”的Scaling法则遭遇瓶颈,AGI的演进并未停滞,而是转向更深层的结构性问题。效率、成本与路径选择,正成为决定未来的关键变量。
范式反思
智谱AI首席科学家唐杰直言,继续投入算力、数据和参数虽然仍能提升模型能力,但当智能增量持续变小,效率已成为瓶颈,将单纯依赖Scaling形容为“一种相对偷懒的方式”。
这一反思与国际前沿声音遥相呼应。OpenAI联合创始人Ilya Sutskever也指出,高质量数据逐渐耗尽,仅靠堆叠规模获得的智能增量正迅速收窄。
那么下一代范式是什么?腾讯首席AI科学家姚顺雨观察发现,硅谷正在热议“自主学习”,但其实现路径远未清晰。真正的挑战在于数据从何而来,任务如何定义。他预测,2026年可能会在类似Cursor的工具中看到一些迹象。
阿里Qwen技术负责人林俊旸则从另一个角度补充,让AI训练AI在技术上可行,但真正的困难在于让模型在长期交互中形成对用户的稳定认知,而非简单的参数自举。
效率革命
月之暗面创始人杨植麟强调,Token效率已从训练问题上升为决定模型智能上限的核心变量。预训练阶段的Token是有限的,一旦被“吃完”,模型的天花板就被锁死。
在技术层面,当上下文长度拉长至数万甚至数十万Token时,不同架构的位置损耗会显著拉开差距。这直接决定了模型在复杂推理与Agent任务中的潜力。
为此,月之暗面在K2模型中投入了大量精力,通过引入muon优化器和线性注意力等新架构,致力于提升Token效率。杨植麟将其效果类比为“用更少的参数,就能得到更好的Scaling效果”,实现了在Scaling尺度下的等效收益。
这种效率的提升,对Agent能力至关重要。更高的Token效率意味着模型拥有更强的先验知识,可以在有限的搜索空间内完成更复杂的任务,而非枚举大量无意义组合。
路径分化
中美大模型的差距,正从能力高低演变为路径分化。腾讯姚顺雨指出,美国大模型正集中于生产力与企业级场景,模型能力直接重塑工作方式,市场也愿意为更强的模型支付溢价,将其视为“生产资料”。
相比之下,中国市场环境截然不同。企业级市场对成本高度敏感,需求碎片化,更看重模型的稳定性与交付效率。模型更多是嵌入现有系统的能力,而非独立定价的生产力主体。
这种差异根植于更深层次的实验室文化。美国的研究机构倾向于围绕前沿问题进行长期、高风险的投入,而中国的研发环境更强调效率与短期反馈,研究方向更容易被落地场景牵引。
姚顺雨补充道,中国更看重“刷榜或数字”,而美国更在意“什么是正确的事情”以及“能亲身体验的好坏”。这种文化与市场的叠加效应,最终放大了两国在模型演进路线上的选择差异。
这场闭门讨论没有给出标准答案,却清晰地勾勒出AGI发展进入深水区的现实图景。当旧的范式效率递减,新的竞争焦点已然浮现。无论是追求极致的Token效率,还是在不同的市场土壤中寻找最佳路径,都预示着通往AGI的道路将不再是单一的扩张。未来的突破,会来自哪个角落?