何恺明团队颠覆扩散模型:预测图像而非噪声更优

源自18位全网作者

25-11-23

何恺明团队近期发表的论文对扩散模型的传统范式提出了根本性挑战。这项研究指出,当前主流扩散模型虽名为“去噪”,实际却在训练中让神经网络预测噪声或混合量,而非真正还原干净图像。团队通过理论分析和实验证明,直接预测原始图像不仅更符合去噪本质,还能在高维场景下避免传统方法的崩溃性失效。

核心突破:流形假设的实践意义

论文的立论基础是流形假设:自然图像虽存在于高维像素空间,却实际分布于一个低维流形上(类似三维空间中蜷曲的二维纸片),而噪声则散布于整个高维空间(如充满房间的灰尘)。这一假设揭示了关键矛盾:

何恺明团队颠覆扩散模型:预测图像而非噪声更优

- 预测噪声的困境:要求模型记忆无结构的高维随机分布,需极大模型容量

- 预测图像的优势:模型只需学习将数据投影回低维流形,任务本质更简单

团队设计了一个直观实验:将二维螺旋数据嵌入512维高维空间后,用隐藏层仅256维的MLP学习生成。结果显示:

- 预测噪声(ε-prediction)完全失效

- 预测图像(x-prediction)精准还原原始结构

这验证了模型容量有限时,预测低维结构目标的显著优势。

JiT:极简架构的革命性实践

基于此,团队提出JiT(Just image Transformers)架构:

- 去除冗余组件:无需VAE压缩、tokenizer、预训练模型或附加损失函数

- 直接像素操作:将图像切分为16×16或32×32的大尺寸图块(patch),原始像素输入标准Vision Transformer

- 目标纯粹:输出端直接预测去噪后的干净图块

在高维场景下(如256×256图像采用16×16分块时,图块维度达768),传统预测噪声方法彻底崩溃(FID指标飙升),而JiT表现稳定。更关键的是,当人为在输入层加入降维瓶颈(如768维→256维→768维)时,生成质量反而提升——因为降维过程天然过滤了无结构噪声,强化了流形学习。

颠覆性实验结果

在ImageNet标准测试中:

1. 高维优势凸显

256×256分辨率下,JiT-B/16模型(patch维度768)预测噪声的组合FID达300+(失效),而预测图像组合稳定在2.0左右。

2. 跨分辨率竞争力

- 256×256分辨率:JiT-G/16达到FID 1.82

- 512×512分辨率:JiT-G/32达FID 1.78

媲美需复杂VAE和预训练的DiT、SiT等模型。

3. 计算高效性

因省略潜空间编码等步骤,JiT的Gflops显著低于同类像素空间模型。

为何过去未被察觉?

论文指出,传统方法在低维场景(如CIFAR-10的32×32图像)或使用VAE降维时,因目标维度与模型容量匹配而未暴露问题。但当处理高维原始像素(如大尺寸patch)时,预测噪声的固有缺陷被急剧放大。

学科影响与技术启示

- 返璞归真:揭示"预测噪声"是历史性路径依赖,回归去噪本质可能重塑生成模型基础框架

- 跨领域潜力:对蛋白质结构预测、气候模拟等难以设计tokenizer的领域提供新思路

- 设计哲学:证明"拟合结构"(图像流形)比"拟合混乱"(高维噪声)更符合数据本质

何恺明团队此次工作再次展现其标志性的"减法创新"思维——通过解构复杂系统找到被忽视的本源问题,用极简方案实现性能突破。这提示研究者:当模型陷入性能瓶颈时,不妨重新审视最基础的假设是否依然成立。

内容由AI生成

精选参考来源

1. 何恺明团队指出,扩散模型应该直接预测「图像」而不是「噪声」,如何评价这个工作?

何恺明团队指出,扩散模型应该直接预测「图像」而不是「噪声」,如何评价这个工作?过去大家几乎都默认:扩散模型应该预测「噪声」。但何恺明团队最近的一篇论文指出:很多情况下,你让模型直接预测「清晰图像」本身

2. 何恺明新作:Just image Transformers

何恺明新作:Just image Transformers 当今的去噪扩散模型并非以经典意义上的方式“去噪”,即它们不直接预测干净图像。相反,神经网络预测的是噪声或一个含噪量。 在这项工作中,Re

3. MIT何恺明团队新作:让扩散模型回归“去噪”本质,简单Transformer即可实现SOTA性能

MIT何恺明团队新作:让扩散模型回归“去噪”本质,简单Transformer即可实现SOTA性能 最近,来自麻省理工学院(MIT)的何恺明团队发表了一篇引人深思的技术报告,对当前主流的扩散生成模型提出

4. 何恺明团队发现,过去几年扩散模型(Diffusion Models)其实一直在“避重就轻”,没有老老实实做“还原干净图像...

何恺明团队发现,过去几年扩散模型(Diffusion Models)其实一直在“避重就轻”,没有老老实实做“还原干净图像... 何恺明团队发现,过去几年扩散模型(Diffusion Models)其实

5. 恺明最新工作:扩散模型的新范式 JiT

恺明最新工作:扩散模型的新范式 JiT 刚刚看到恺明最新工作,分享一下: 当前的去噪扩散模型并不以传统意义上的方式“去噪”,即它们并不会直接预测干净图像;相反,它们预测的是噪声或带噪的量。作者指出

6. 何恺明团队新作:扩散模型可能被用错了

何恺明团队新作:扩散模型可能被用错了 何恺明又一次返璞归真。 最新论文直接推翻扩散模型的主流玩法——不让模型预测噪声,而是直接画干净图。 如果你熟悉何恺明的作品,会发现这正是他创新的典型路径,

7. 何恺明团队新作:扩散模型可能被用错了

何恺明团队新作:扩散模型可能被用错了 闻乐 发自 凹非寺 量子位 | 公众号 QbitAI何恺明又一次返璞归真。最新论文直接推翻扩散模型的主流玩法——不让模型预测噪声,而是直接画干净图。如果你熟悉何恺

8. 恺明新作大道至简:放弃VAE,ViT直出原图!

恺明新作大道至简:放弃VAE,ViT直出原图! 那个男人带着他的极简主义又回来了!🔥 💎在AI圈,何恺明这三个字就代表着风向标。回顾历史,从ResNet的残差连接,到MoCo的动量队列,再到MAE

9. Rectified Flow是不是扩散模型的终极形态?

Rectified Flow是不是扩散模型的终极形态? 1️⃣ 从随机扩散到可控概率路径 🔸传统的扩散模型使用SDE来加噪和去噪,采样时通常用带噪声的反向随机过程,或者是概率流方程。 🔸 CNF不再使

10. AI绘画或许迎来了"文艺复兴"

AI绘画或许迎来了"文艺复兴" 11月19日晚消息,据新智元报道,何恺明团队发布最新研究成果《Back to Basics: Let Denoising Generative Models Denoi

11. 从 JiT 说起,聊聊生成模型的灵魂逻辑

从 JiT 说起,聊聊生成模型的灵魂逻辑 为什么我最近在研究流形假设(Manifold Hypothesis)?其实,如果你了解最近何恺明团队的最新论文 JIT:Just image Transfor

12. JiT:kaiming新作 扩散模型回归去噪本质!

JiT:kaiming新作 扩散模型回归去噪本质! 你有没有发现,现在超火的生成模型总说在“去噪”,但其实它们偷偷预测的全是噪声?MIT最新论文直接戳破真相:传统扩散模型(像DDPM、EDM这些)根本

13. 扩散模型为何选择预测噪音而非直接数据?

扩散模型为何选择预测噪音而非直接数据? 扩散模型(Diffusion Model)是一类生成模型,其核心通过逐步去噪的方式生成高质量数据。与直接预测数据相比,扩散模型更倾向于预测噪声,这种设计具有显著

14. 每天拆解一个AI知识点:扩散模型-diffusion

每天拆解一个AI知识点:扩散模型-diffusion [一R] 什么是扩散模型 ✨ 扩散模型是一种基于概率的生成模型。 它和我们直觉中理解的直接生成图像不一样,它的做法是: 👉 从一张随机噪声

15. 📚 每天学一个AI知识:扩散模型

📚 每天学一个AI知识:扩散模型 📊 扩散模型(Diffusion Model): 扩散模型是一种用噪声生成图像的AI模型。它的思路很特别: 先把一张清晰的图片逐步加噪声,直到完全变成“雪花点”一

16. 何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升

何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升 鱼羊 发自 凹非寺 量子位 | 公众号 QbitAI扩散模型风头正盛,何恺明最新论文也与此相关。研究的是如何把扩散模型和表征

17. #何恺明新作给扩散模型加正则化##将扩散模型与表征学习结合#扩散模型风头正盛,何恺明最新论文也与此相关。研究的是如何把扩...

#何恺明新作给扩散模型加正则化##将扩散模型与表征学习结合#扩散模型风头正盛,何恺明最新论文也与此相关。研究的是如何把扩... 扩散模型风头正盛,何恺明最新论文也与此相关。研究的是如何把扩散模型和表征

18. 何恺明携 Dispersive Loss 重塑扩散模型

何恺明携 Dispersive Loss 重塑扩散模型 何恺明携 Dispersive Loss 重塑扩散模型,该研究提出了分散损失(Dispersive Loss),这是一种简单且即插即用的正则化方
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章