当前大语言模型的逐字生成方式限制了其推理速度。字节跳动与清华大学联合发布的Seed Diffusion模型,通过离散状态扩散技术实现了并行生成,在H20 GPU上达到了惊人的2146 tokens/s。此内容不仅展示了该模型的技术突破,也探讨了其在代码生成等领域的应用前景,为解决LLM的延迟问题提供了全新思路。
智能速览
Seed Diffusion是一种基于离散状态扩散的并行生成语言模型。
该模型在H20 GPU上实现了2146 tokens/s的推理速度。
采用TSC两阶段课程训练提升模型鲁棒性与校准能力。
通过受约束顺序训练优化了生成路径,提高了模型性能。
在多项代码生成基准测试中,性能与先进自回归模型相当。
块级并行采样方案有效平衡了计算成本与生成延迟。
精华内容
Seed Diffusion之所以能实现如此惊人的速度,关键在于其核心技术。它并非简单套用现有方案,而是针对性地解决了离散扩散语言模型面临的几大挑战,下面将深入剖析其技术创新点。
突破传统瓶颈
传统自回归模型“一个字一个字”的生成方式是其推理速度的天然瓶颈。非自回归模型虽然理论上可以实现并行生成,但应用于离散文本数据时面临两大挑战:一是词元顺序建模的归纳偏见,模型需学习大量冗余甚至有害的生成顺序;二是迭代式去噪过程带来的严重延迟,削弱了其并行优势。
鲁棒性训练策略
为解决模型过分自信无法自我修正的问题,Seed Diffusion采用了名为TSC的两阶段课程训练策略。在前80%的训练步骤中,使用基于掩码的破坏过程;在后20%步骤中,引入基于编辑距离的破坏过程作为数据增强,迫使模型重新评估所有词元,显著提升了模型的校准能力和鲁棒性。
优化生成路径
为缓解任意顺序建模带来的效率问题,模型在训练后增加了一个受约束顺序的扩散训练阶段。具体做法是:先大规模生成候选轨迹池,然后通过最大化证据下界(ELBO)标准筛选出高质量轨迹,最后用这些高质量轨迹微调模型,从而学习到更优的生成顺序,缩小了与自回归模型的性能差距。
并行推理加速
为释放并行潜力,研究团队提出了在策略学习范式和块级并行扩散采样方案。前者通过优化代理损失,直接缩短生成轨迹的长度,类似于模式过滤技术;后者则将生成分成多个块,块内并行生成,块间保持因果顺序,并结合KV-caching,高效地平衡了计算开销与延迟。
性能实测对标
在HumanEval、MBPP、BigCodeBench、LiveCodeBench等一系列全面的代码评测基准上,Seed Diffusion预览版展现了卓越潜力。其性能与同等规模的先进自回归模型不相上下,同时在代码编辑等任务上实现了明显提升。更重要的是,其2146 tokens/s的速度远超Mercury Coder和Gemini Diffusion等同类模型,在“速度-质量”帕累托前沿上树立了新标杆。
Seed Diffusion模型的成功,证明了离散扩散技术在加速大规模语言模型推理方面的巨大潜力,不仅带来了速度的飞跃,更挑战了传统的从左到右建模范式。未来,如何探索其扩展规律并在更复杂的推理任务中应用,将是整个领域需要共同面对的课题。这是否预示着一个全新的高速LLM时代的到来?