何恺明团队近期发表的论文对扩散模型的传统范式提出了根本性挑战。这项研究指出,当前主流扩散模型虽名为“去噪”,实际却在训练中让神经网络预测噪声或混合量,而非真正还原干净图像。团队通过理论分析和实验证明,直接预测原始图像不仅更符合去噪本质,还能在高维场景下避免传统方法的崩溃性失效。
核心突破:流形假设的实践意义
论文的立论基础是流形假设:自然图像虽存在于高维像素空间,却实际分布于一个低维流形上(类似三维空间中蜷曲的二维纸片),而噪声则散布于整个高维空间(如充满房间的灰尘)。这一假设揭示了关键矛盾:

- 预测噪声的困境:要求模型记忆无结构的高维随机分布,需极大模型容量
- 预测图像的优势:模型只需学习将数据投影回低维流形,任务本质更简单
团队设计了一个直观实验:将二维螺旋数据嵌入512维高维空间后,用隐藏层仅256维的MLP学习生成。结果显示:
- 预测噪声(ε-prediction)完全失效
- 预测图像(x-prediction)精准还原原始结构
这验证了模型容量有限时,预测低维结构目标的显著优势。
JiT:极简架构的革命性实践
基于此,团队提出JiT(Just image Transformers)架构:
- 去除冗余组件:无需VAE压缩、tokenizer、预训练模型或附加损失函数
- 直接像素操作:将图像切分为16×16或32×32的大尺寸图块(patch),原始像素输入标准Vision Transformer
- 目标纯粹:输出端直接预测去噪后的干净图块
在高维场景下(如256×256图像采用16×16分块时,图块维度达768),传统预测噪声方法彻底崩溃(FID指标飙升),而JiT表现稳定。更关键的是,当人为在输入层加入降维瓶颈(如768维→256维→768维)时,生成质量反而提升——因为降维过程天然过滤了无结构噪声,强化了流形学习。
颠覆性实验结果
在ImageNet标准测试中:
1. 高维优势凸显
256×256分辨率下,JiT-B/16模型(patch维度768)预测噪声的组合FID达300+(失效),而预测图像组合稳定在2.0左右。
2. 跨分辨率竞争力
- 256×256分辨率:JiT-G/16达到FID 1.82
- 512×512分辨率:JiT-G/32达FID 1.78
媲美需复杂VAE和预训练的DiT、SiT等模型。
3. 计算高效性
因省略潜空间编码等步骤,JiT的Gflops显著低于同类像素空间模型。
为何过去未被察觉?
论文指出,传统方法在低维场景(如CIFAR-10的32×32图像)或使用VAE降维时,因目标维度与模型容量匹配而未暴露问题。但当处理高维原始像素(如大尺寸patch)时,预测噪声的固有缺陷被急剧放大。
学科影响与技术启示
- 返璞归真:揭示"预测噪声"是历史性路径依赖,回归去噪本质可能重塑生成模型基础框架
- 跨领域潜力:对蛋白质结构预测、气候模拟等难以设计tokenizer的领域提供新思路
- 设计哲学:证明"拟合结构"(图像流形)比"拟合混乱"(高维噪声)更符合数据本质
何恺明团队此次工作再次展现其标志性的"减法创新"思维——通过解构复杂系统找到被忽视的本源问题,用极简方案实现性能突破。这提示研究者:当模型陷入性能瓶颈时,不妨重新审视最基础的假设是否依然成立。