传统信息论在面对算力有限的现代AI时显得力不从心。卡耐基梅隆与纽约大学的研究团队提出一个名为“Epiplexity”的新概念,旨在量化数据中真正可被学习的结构化信息,为解释合成数据价值、语言模型学习顺序等现象提供了全新框架。
智能速览
提出Epiplexity概念,量化数据中可习得的结构信息。
将信息拆解为“可习得结构”与“算力约束下的随机部分”。
揭示经典信息论在解释合成数据、学习顺序、涌现结构等现象时的“三个悖论”。
基于带时间约束的最小描述长度原则(MDL)来定义Epiplexity。
提出一种实用近似方法:通过神经网络的损失曲线面积来估算Epiplexity。
精华内容
为何经典信息论无法解释现代机器学习的诸多现象?关键在于忽略了“算力”这一核心约束。下面深入探讨这一新范式如何重塑我们对信息的理解。
传统理论的局限
经典的香农信息论和算法信息论,虽然奠定了信息科学的基础,但其背后隐藏了一个核心假设:观察者拥有无限的计算能力。这使得它们更像是“上帝视角”的度量标准,无法准确描述现实中算力受限的AI系统究竟能从数据中学习到什么。例如,这些理论认为确定性变换(如数据增强、模拟)无法创造新信息,但这与AlphaZero通过自我对弈(一种确定性过程)变得更强的现实相悖。
Epiplexity的诞生
为解决上述问题,研究提出了一个全新的核心概念:Epiplexity,可译为认知复杂性或可习得结构复杂性。它专门用来衡量在算力受限前提下,学习者能从数据中提炼并写进模型参数的结构性信息。信息因此被一分为二:一是Time-bounded Entropy,代表本质随机、无法预测的噪声部分;二是Epiplexity,代表可以被学习、压缩并复用的结构部分。例如,随机哈希值只有熵没有结构,而动物图像则富含可供学习的结构。
三大悖论的挑战
新理论的提出,源于对现代机器学习实践中“三大悖论”的观察。悖论一:确定性变换不能创造信息,但合成数据、模拟(如AlphaZero)确实让模型学到了新技能。悖论二:信息与分解顺序无关,但大语言模型(LLM)从左到右学习的效果明显优于反向,出现了“时间箭头”。悖论三:最大似然训练只是拟合分布,但模型似乎学到了比数据生成过程本身更多的“涌现结构”。这三个悖论的根源,都在于经典理论忽略了“算力限制”这一现实约束。
定义与测量方法
在理论层面,研究者借助带有“算力/时间上限”约束的最小描述长度原则(MDL)来精确定义Epiplexity。通俗讲,就是在规定时间内,为了用最短的模型描述数据,必须在模型里存下多少“可复用的结构”,这个模型的“长度”就是Epiplexity。在工程实践中,他们给出了一个极具启发性的近似测量方法:通过观察神经网络的损失曲线来估算。模型训练时,损失曲线下降越显著、曲线下的面积越大,就代表从数据中吸收的结构信息越多,即Epiplexity越高。
Epiplexity理论的提出,为算力受限时代的AI发展提供了全新的信息范式。它不仅统一了对现有现象的解释,更可能为未来的数据选择、模型优化和OOD泛化等关键难题指明方向。这一理论是否真的会改写科技史?