大模型发展不再只追求参数规模,一场转向效率的革命正在悄然发生。这不仅解释了为何小模型能力突飞猛进,更预示着 AI 应用落地成本将大幅下降,为端侧智能的普及铺平了道路。
智能速览
大模型发展焦点正从“规模”转向“密度”,追求单位参数效率。
模型“能力密度”约每3.5个月翻一倍,推理性能显著提升。
模型推理成本约每2.6个月减半,已下降超过260倍。
硬件与模型密度双重提升,端侧智能普及速度将远超预期。
高质量数据、高效架构和优化算法是推动密度增长的三大核心。
精华内容
这种转变并非突然的技术革命,而是模型进化方向的关键调整,它正重新定义 AI 技术的竞争格局与应用边界。
密度的崛起
过去评判模型强弱主要看参数规模,但现在“能力密度”成为更关键的指标。能力密度定义为模型有效能力与实际参数量的比值,直观反映了单位参数的效率。研究发现,大模型的能力密度正以指数级增长,大约每3.5个月就能翻一倍。这意味着达到同等性能所需的参数量在急剧减少,一个3B模型如果能实现6B模型的能力,其密度就是2,说明训练非常“紧实”和高效。
成本指数级下降
效率的提升直接带来了成本的骤降。数据显示,主流模型的推理价格大约每2.6个月就会减半。例如,2022年GPT-3.5的API价格约为每百万token 20美元,而到了2024年,性能更强的Gemini Flash价格已降至0.075美元,降幅超过260倍。这种成本下降不仅源于模型本身更“密”,也得益于FlashAttention、量化推理等底层技术的优化,让高性能AI服务的普及成为可能。
端侧智能来临
当模型密度的指数级增长与硬件性能的提升相结合,端侧智能的时代将加速到来。硬件晶体管密度约每两年翻一倍,而模型能力密度每3.5个月翻一倍,两者的叠加效应使得在同等价格的硬件上,可运行的“有效模型规模”大约每88天就能翻一倍。这预示着过去必须在云端实现的能力,未来将能高效地在手机、PC等本地设备上运行,离线大模型应用将迎来爆发。
增长的驱动力
模型密度的持续提升,主要归功于三个方面的进步。首先是训练数据的质量和规模,例如Llama-3使用了15万亿token的高质量数据,远超前代。其次是模型架构的革新,如稀疏专家模型通过在推理时仅激活部分“专家”,大幅提升了参数利用率。最后,训练算法的演进,如将强化学习融入预训练阶段,也让模型在固定参数量下挖掘出更高的能力上限。
AI 应用正从技术展示步入实用积累期,效率成为新的核心。未来竞争的关键,不再是谁的模型更大,而是谁能将高效的智能部署到最恰当的场景中。下一个突破点会在哪里?