一篇足以改写人类科技史的文章:来自卡耐基梅隆与纽约大学机器学习团队的最新研究!

源自公众号:典故学研究 Allusion studies

01-23 19:14

传统信息论在面对算力有限的现代AI时显得力不从心。卡耐基梅隆与纽约大学的研究团队提出一个名为“Epiplexity”的新概念,旨在量化数据中真正可被学习的结构化信息,为解释合成数据价值、语言模型学习顺序等现象提供了全新框架。

一篇足以改写人类科技史的文章:来自卡耐基梅隆与纽约大学机器学习团队的最新研究!智能速览

  • 提出Epiplexity概念,量化数据中可习得的结构信息。

  • 将信息拆解为“可习得结构”与“算力约束下的随机部分”。

  • 揭示经典信息论在解释合成数据、学习顺序、涌现结构等现象时的“三个悖论”。

  • 基于带时间约束的最小描述长度原则(MDL)来定义Epiplexity。

  • 提出一种实用近似方法:通过神经网络的损失曲线面积来估算Epiplexity。

一篇足以改写人类科技史的文章:来自卡耐基梅隆与纽约大学机器学习团队的最新研究!精华内容

为何经典信息论无法解释现代机器学习的诸多现象?关键在于忽略了“算力”这一核心约束。下面深入探讨这一新范式如何重塑我们对信息的理解。

传统理论的局限

经典的香农信息论和算法信息论,虽然奠定了信息科学的基础,但其背后隐藏了一个核心假设:观察者拥有无限的计算能力。这使得它们更像是“上帝视角”的度量标准,无法准确描述现实中算力受限的AI系统究竟能从数据中学习到什么。例如,这些理论认为确定性变换(如数据增强、模拟)无法创造新信息,但这与AlphaZero通过自我对弈(一种确定性过程)变得更强的现实相悖。

Epiplexity的诞生

为解决上述问题,研究提出了一个全新的核心概念:Epiplexity,可译为认知复杂性或可习得结构复杂性。它专门用来衡量在算力受限前提下,学习者能从数据中提炼并写进模型参数的结构性信息。信息因此被一分为二:一是Time-bounded Entropy,代表本质随机、无法预测的噪声部分;二是Epiplexity,代表可以被学习、压缩并复用的结构部分。例如,随机哈希值只有熵没有结构,而动物图像则富含可供学习的结构。

三大悖论的挑战

新理论的提出,源于对现代机器学习实践中“三大悖论”的观察。悖论一:确定性变换不能创造信息,但合成数据、模拟(如AlphaZero)确实让模型学到了新技能。悖论二:信息与分解顺序无关,但大语言模型(LLM)从左到右学习的效果明显优于反向,出现了“时间箭头”。悖论三:最大似然训练只是拟合分布,但模型似乎学到了比数据生成过程本身更多的“涌现结构”。这三个悖论的根源,都在于经典理论忽略了“算力限制”这一现实约束。

定义与测量方法

在理论层面,研究者借助带有“算力/时间上限”约束的最小描述长度原则(MDL)来精确定义Epiplexity。通俗讲,就是在规定时间内,为了用最短的模型描述数据,必须在模型里存下多少“可复用的结构”,这个模型的“长度”就是Epiplexity。在工程实践中,他们给出了一个极具启发性的近似测量方法:通过观察神经网络的损失曲线来估算。模型训练时,损失曲线下降越显著、曲线下的面积越大,就代表从数据中吸收的结构信息越多,即Epiplexity越高。

Epiplexity理论的提出,为算力受限时代的AI发展提供了全新的信息范式。它不仅统一了对现有现象的解释,更可能为未来的数据选择、模型优化和OOD泛化等关键难题指明方向。这一理论是否真的会改写科技史?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章