图像生成领域迎来突破,何恺明团队提出的pMF模型,实现了在像素空间进行单步图像生成。该方法摒弃了传统扩散模型的多步迭代和潜空间依赖,在保证高质量输出的同时,极大地提升了生成效率,为端到端图像生成开辟了新路径。
智能速览
实现了无需潜空间且仅需单步即可生成高质量图像的端到端方案。
直接在原始像素空间建模,避免了VAE解码器带来的计算开销。
通过预测更易学习的“去噪图像”目标,解决了像素空间高维建模难题。
在ImageNet 512x512分辨率下达到2.48 FID,计算成本远低于同类模型。
精华内容
pMF模型究竟如何实现单步像素级生成?其核心在于对生成目标和建模空间的革新,通过流形假设直接预测图像本身,绕开了传统模型的复杂路径。
单步直出
传统扩散模型生成图像需要经历一个漫长的迭代去噪过程,通常需要几十甚至上千步,这限制了其在实时应用中的可能性。pMF模型颠覆性地将这一过程压缩至单步完成,输入噪声后,网络一次性输出最终图像,推理速度得到质的飞跃,为实时图像生成应用铺平了道路。
这种效率的突破并非牺牲质量换来的,其生成效果依然保持了顶尖水准,真正解决了速度与质量难以兼顾的痛点。
像素级建模
当前主流的生成模型大多在VAE构建的低维潜空间中进行计算,再通过解码器还原为像素图像。这个过程不仅引入了额外的计算开销,还可能因解码器能力不足而导致细节丢失。
pMF选择直接在原始的像素空间中建模,实现了真正的端到端生成。这种“所见即所得”的方式,使得模型输出即是最终图像,避免了信息在编解码过程中的损耗,为生成更精细的视觉效果奠定了基础。
流形学习
直接在高维像素空间中预测是极具挑战性的。pMF的创新之处在于引入了流形假设,它认为自然图像数据实际上分布在一个低维流形上。
因此,模型不再预测复杂的噪声速度,而是转向预测一个更简单、更直接的目标——“去噪图像”的均值流。这一转变极大地降低了网络的学习难度,使其能够在单步内就精准地定位到干净图像在流形上的位置。
性能优势
凭借独特的架构,pMF在性能上展现出强大优势。在ImageNet 512×512这一权威基准测试中,pMF取得了2.48的FID分数,与多步迭代的顶级模型不相上下。
更关键的是,由于其单步和无潜空间的特性,其总计算成本远低于同级别的GAN或潜空间扩散模型。此外,由于直接操作像素,模型可以原生融入感知损失(LPIPS),进一步提升图像的细节和视觉真实感。
pMF的成功为图像生成领域带来了新思路,其高效、端到端的特性预示着实时高质量图像生成的未来。这是否会彻底改变AIGC的应用版图,让更复杂的创意任务在普通设备上即时实现?