张大妈

Seed Diffusion:推理速度飙升2000+ tokens/s,下一代高速语言模型来了?

源自知乎:知新科技侠

02-28 10:30

当前大语言模型的逐字生成方式限制了其推理速度。字节跳动与清华大学联合发布的Seed Diffusion模型,通过离散状态扩散技术实现了并行生成,在H20 GPU上达到了惊人的2146 tokens/s。此内容不仅展示了该模型的技术突破,也探讨了其在代码生成等领域的应用前景,为解决LLM的延迟问题提供了全新思路。

Seed Diffusion:推理速度飙升2000+ tokens/s,下一代高速语言模型来了?智能速览

  • Seed Diffusion是一种基于离散状态扩散的并行生成语言模型。

  • 该模型在H20 GPU上实现了2146 tokens/s的推理速度。

  • 采用TSC两阶段课程训练提升模型鲁棒性与校准能力。

  • 通过受约束顺序训练优化了生成路径,提高了模型性能。

  • 在多项代码生成基准测试中,性能与先进自回归模型相当。

  • 块级并行采样方案有效平衡了计算成本与生成延迟。

Seed Diffusion:推理速度飙升2000+ tokens/s,下一代高速语言模型来了?精华内容

Seed Diffusion之所以能实现如此惊人的速度,关键在于其核心技术。它并非简单套用现有方案,而是针对性地解决了离散扩散语言模型面临的几大挑战,下面将深入剖析其技术创新点。

突破传统瓶颈

传统自回归模型“一个字一个字”的生成方式是其推理速度的天然瓶颈。非自回归模型虽然理论上可以实现并行生成,但应用于离散文本数据时面临两大挑战:一是词元顺序建模的归纳偏见,模型需学习大量冗余甚至有害的生成顺序;二是迭代式去噪过程带来的严重延迟,削弱了其并行优势。

鲁棒性训练策略

为解决模型过分自信无法自我修正的问题,Seed Diffusion采用了名为TSC的两阶段课程训练策略。在前80%的训练步骤中,使用基于掩码的破坏过程;在后20%步骤中,引入基于编辑距离的破坏过程作为数据增强,迫使模型重新评估所有词元,显著提升了模型的校准能力和鲁棒性。

优化生成路径

为缓解任意顺序建模带来的效率问题,模型在训练后增加了一个受约束顺序的扩散训练阶段。具体做法是:先大规模生成候选轨迹池,然后通过最大化证据下界(ELBO)标准筛选出高质量轨迹,最后用这些高质量轨迹微调模型,从而学习到更优的生成顺序,缩小了与自回归模型的性能差距。

并行推理加速

为释放并行潜力,研究团队提出了在策略学习范式和块级并行扩散采样方案。前者通过优化代理损失,直接缩短生成轨迹的长度,类似于模式过滤技术;后者则将生成分成多个块,块内并行生成,块间保持因果顺序,并结合KV-caching,高效地平衡了计算开销与延迟。

性能实测对标

在HumanEval、MBPP、BigCodeBench、LiveCodeBench等一系列全面的代码评测基准上,Seed Diffusion预览版展现了卓越潜力。其性能与同等规模的先进自回归模型不相上下,同时在代码编辑等任务上实现了明显提升。更重要的是,其2146 tokens/s的速度远超Mercury Coder和Gemini Diffusion等同类模型,在“速度-质量”帕累托前沿上树立了新标杆。

Seed Diffusion模型的成功,证明了离散扩散技术在加速大规模语言模型推理方面的巨大潜力,不仅带来了速度的飞跃,更挑战了传统的从左到右建模范式。未来,如何探索其扩展规律并在更复杂的推理任务中应用,将是整个领域需要共同面对的课题。这是否预示着一个全新的高速LLM时代的到来?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章