主流文本生成模型受限于从左到右的生成顺序,而扩散模型提出了一种全新的非顺序生成范式。它借鉴图像领域的成功经验,通过在离散文本空间中迭代去噪,有望生成更连贯、更富多样性的内容,为AI文本生成技术带来变革。
智能速览
扩散模型可应用于离散的文本生成任务。
前向过程逐步将文本替换为噪声标记[MASK]。
反向过程通过迭代预测还原出完整文本。
该模型与自回归模型的核心区别在于非顺序生成。
潜在扩散模型通过压缩嵌入来增强生成连贯性。
精华内容
当前主流的文本生成模型遵循严格的从左到右顺序,而一种新的范式——扩散模型,正试图打破这一常规,通过迭代去噪的方式为文本生成带来更多可能。
离散空间扩散
传统的扩散模型在处理图像等连续数据时表现出色,但如何将其应用于离散的文本是一个挑战。核心思路是引入一个特殊的噪声标记[MASK],用它来替代文本中的词元。
在前向扩散过程中,干净的文本序列会根据预设的步数,以一定概率逐步将部分词元替换为[MASK]。这个过程就像给清晰的图像逐步添加噪声,最终整个文本序列会完全被[MASK]覆盖,成为纯噪声状态。
掩码与去噪
生成过程的核心是反向扩散,即从纯噪声(全部是[MASK])开始,逐步还原文本。模型以当前部分遮蔽的序列为输入,预测每个[MASK]位置上所有可能词元的概率分布。
根据这个概率分布采样一个词元来替换[MASK]。一旦某个词元被“揭示”,它在后续步骤中就会保持不变。模型只需要持续对剩余的[MASK]进行预测和替换,直到整个序列被完全重建。这个[MASK]标记在扩散过程中扮演了“吸收态”的角色,确保了过程的稳定性。
对比自回归模型
与扩散模型形成鲜明对比的是自回归模型。自回归模型,如GPT系列,严格遵循从左到右的顺序,每次只预测一个词元,且依赖于前面所有已生成的词元。这种顺序性限制了生成的并行度和灵活性。
而掩码扩散模型则突破了这一限制。由于它不需要严格的顺序,理论上可以并行预测多个[MASK]位置,或者采用更灵活的生成策略,这为提升生成效率和多样性提供了新的可能。
生成过程示例
一个直观的例子是从一串[MASK]逐步还原出一段话。初始状态是完全遮蔽的序列:“[MASK][MASK][MASK]……”。
第一步,模型可能会预测出几个关键词,如“No matter [MASK] you feel”。第二步,基于已有信息,进一步填充,得到“No matter how weak [MASK] you feel”。通过这样迭代式的填充和修正,模型最终能够生成一段连贯的完整文本,如:“No matter how weak or unworthy you feel, keep your heart burning, grit your teeth and move forward.”
文本扩散模型为生成式AI开辟了一条充满想象力的新路径,其非顺序的生成方式有望克服传统自回归模型的固有局限。尽管仍处于早期探索阶段,但其在提升文本连贯性和生成多样性上的潜力,预示着它可能成为下一代语言模型的重要发展方向。