张大妈

高通AI研究院让视频生成提速5倍:金字塔结构如何重塑AI视频制作

源自今日头条:至顶AI实验室

01-17 18:05

当前AI视频生成因高昂计算成本而难以普及。高通AI研究院推出的PyramidalWan技术,通过引入金字塔式生成结构,在保持视频质量不变的前提下,将计算成本压缩至原来的2%,为AI视频制作效率带来了革命性突破。

高通AI研究院让视频生成提速5倍:金字塔结构如何重塑AI视频制作智能速览

  • 高通研究院提出PyramidalWan技术,重塑AI视频生成流程。

  • 金字塔结构采用“先粗后细”策略,大幅降低计算成本。

  • 通过微调和知识蒸馏,现有模型可低成本获得性能提升。

  • 计算量压缩至原先的2%,生成速度提升约5倍。

  • 新模型在语义一致性上超越原模型,综合质量相当。

高通AI研究院让视频生成提速5倍:金字塔结构如何重塑AI视频制作精华内容

AI视频生成一直受困于高昂的计算成本与漫长的等待时间。高通研究院的金字塔结构,通过模仿人眼“先粗后细”的观察习惯,为这一瓶颈问题提供了全新的解决思路。

效率革命的原理

传统AI视频生成模型如同“重装坦克”,威力强大但行动缓慢,每一帧高清内容的生成都需消耗全部算力。高通团队的创新在于将这辆“重装坦克”改造成一组协调工作的“轻便跑车”,构建了三层金字塔处理结构:底层处理21×112×208像素的粗糙内容,中层处理41×224×416像素的中等精度内容,顶层才处理最终的81×448×832像素高清内容。

这种设计利用了“频谱自回归”原理,即在生成早期,AI只需确定大致的运动方向和整体结构,无需纠结于细微纹理。实测数据显示,底层处理单帧仅需7.62毫秒,中层需要33.76毫秒,只有顶层需要631.77毫秒,实现了高效的分工协作。

旧模型的新生

将现有的大型视频生成模型(如Wan2.1-1.3B)改造为金字塔结构,并非易事。研究团队采用了“微调”技术,让预训练好的模型学会在不同分辨率层级间协调工作。这一过程的核心是“金字塔流匹配损失函数”,它为每个层级设定了质量标准,并确保不同层级生成的内容保持一致性。

为保证改造后的模型质量不下降,团队引入了“知识蒸馏”技术,让新模型(学徒)向原始高性能模型(师傅)学习,以维持生成水准。有趣的是,在某些情况下,金字塔模型生成的视频在语义一致性方面甚至超过了原始模型。整个微调过程仅需两块H100 GPU训练数小时,成本极低,意味着现有模型有望通过此方式获得显著性能提升。

从50步到5步的精进

仅仅实现金字塔结构还不够,研究团队进一步追求极致的生成速度。传统方法需要经过数十步反复优化,而“步数蒸馏”技术则致力于用最少的步骤达到同等效果。团队探索了“分布匹配蒸馏”和“对抗性蒸馏”两种策略,让模型学会快速模仿高质量输出。

最终,结合金字塔结构与步数蒸馏的优化模型,能够在2-2-1的调度方案下工作,即底层执行2步、中层执行2步、顶层执行1步,总共仅需5步即可完成原先50步的任务。这一极度精简的流程将总计算成本压缩至原来的2%左右,同时保持了相当的视频质量。

数据验证的成果

理论需要实践检验。在业界标准的VBench评测中,PyramidalWan模型在20-20-10调度下获得了82.83的综合质量分,略超原始模型50步生成的82.49分。更关键的是,其语义一致性得分达80.70,显著高于原模型的78.57分。

即使压缩到极致的2-2-1调度,优化模型的综合得分仍能保持在82.72,与原始模型相当。人工评估也显示,观众并未认为PyramidalWan的质量显著低于原始模型。在延迟测试中,该模型在2-2-1调度下的单次推理延迟为282毫秒,实现了速度与质量的出色平衡。

这项研究不仅是技术上的突破,更展示了通过架构创新来平衡效率与质量的新范式。它让庞大的现有AI模型资产得以焕发新生,为实时、普惠的AI视频生成应用铺平了道路,未来值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章