实测京东实时流式视频编辑模型,AI终于可以边播边改视频了吗?
图片来自AI生成
图片来自AI生成
AI视频发展到今天,生成视频已经不是最难的问题。
对于视频生成用户来说,“抽卡”是一个很考验成本和耐心的过程,用户输入指令,模型生成结果,查看效果后再决定是否调整。一段视频往往需要经过多轮生成,创作过程被拆成了多个等待环节。
最近,京东开源自研的实时流式视频编辑模型JoyAI-Video-Edit,尝试改变这一创作流程。
在测试中,我们让模型直接处理正在播放的视频:直播画面中的商品可以被替换,室内空间可以实时调整,户外场景也可以根据指令改变,整个过程不需要等待完整视频生成完成,模型会随着视频输入持续完成编辑。
与传统视频生成模型不同,JoyAI-Video-Edit处理的不是一段已经结束的视频文件,而是一条持续输入的视频流。
根据官方公布的技术报告,JoyAI-Video-Edit采用基于自回归扩散的视频编辑架构,由多模态语言模型编码器、因果视频VAE以及多模态扩散Transformer组成。在单张NVIDIA B200 GPU环境下,完整流水线吞吐约30 FPS,请求到响应周期约266毫秒。
不过,实时速度只是这类模型需要解决的问题之一。
视频编辑相比单张图片处理更复杂,模型既要理解用户希望修改什么,也要保持人物身份、动作轨迹和未修改区域稳定。如果视频持续播放,前面生成的结果还会成为后续处理的参考,一旦误差积累,就可能出现画面漂移。
为了验证JoyAI-Video-Edit的实际表现,我们选择了几个更接近真实使用的场景进行测试,包括直播商品替换、家装效果调整、户外环境变化,以及具身智能相关的人手替换机械手。
实时编辑多场景实测首先测试的是JoyAI-Video-Edit最核心的流式编辑能力,直播商品替换是实时视频编辑较容易落地的场景之一。
在测试中,我们选择了一段模特走秀的视频,让模型根据指令替换画面中的商品,同时保持人物动作和原始环境。测试结果显示,模型能够完成商品替换,替换后的商品可以跟随人物动作继续出现在画面中,整体视频保持连续播放。
这类任务的难点,在于商品与人物之间的空间关系是否能够保持稳定。如果只是针对单帧画面进行修改,容易出现商品漂移、位置异常等问题。在测试视频中,模型能够保留人物动作,商品位置和人物交互关系基本保持稳定。
不过,当商品包含复杂纹理、文字或者细小结构时,视频编辑难度会明显增加,这类场景对模型细节还原能力提出更高要求。
除了直播场景,我们还测试了家装效果实时调整。测试视频是一段室内空间画面,要求模型根据指令改变空间中的视觉效果,例如调整家具风格和整体环境。
从测试结果看,模型能够根据要求改变房间视觉效果,同时保持原有镜头运动和空间结构。相比单独生成一张装修效果图,这种方式直接基于真实视频进行调整,用户可以基于实际空间快速查看不同设计效果,为方案沟通提供参考。
为了测试模型在复杂场景中的连续编辑能力,我们进一步进行了户外环境变化测试。在测试视频中,去除所有人物只显示环境,此外,模型也根据指令改变环境效果,例如调整天气和整体场景氛围。
测试结果显示,模型可以完成环境转换,修改后的环境也能够与原视频融合。
最后测试的是人手变机械手,根据一段人手操作视频,要求模型将其中的人手替换为机械手,同时保持原有动作。
这一测试相比普通换装和环境修改更加复杂,模型需要处理的不只是外观变化,还需要保持手与物体的位置关系、抓取动作连续性、前后视频帧的一致性。
测试结果显示,模型能够完成从人手到机械手的替换,机械结构可以跟随原有动作变化,物体位置关系基本保持。
我们进一步测试了机器人动作变化场景,让模型调整视频中的机器人动作表现,结果显示,模型可以根据指令完成相应调整。
不过,这类能力距离真正用于机器人训练仍有距离。机器人任务除了视觉数据,还涉及力度、碰撞、环境反馈等物理因素,当前更多体现的是视觉数据生成和扩充能力。
从几个场景测试来看,JoyAI-Video-Edit已经能够完成实时视频编辑中的多类任务。
在直播商品替换、环境调整等场景中,模型表现出较好的连续编辑能力;在人手替换机械手等任务中,也展示了对动作和空间关系处理的能力。
但测试也显示,实时视频编辑仍面临一些挑战,复杂运动、细节纹理、多人交互等场景,对模型稳定性提出更高要求。
JoyAI-Video-Edit的价值不只体现在生成一段新视频,也在于视频播放过程中根据用户需求持续修改画面。这类能力距离大规模应用还有优化空间,但已经具备进入部分真实场景验证的基础。
流式视频编辑难在哪里?目前多数视频编辑模型采用离线处理方式,模型需要先拿到完整视频,再分析前后帧关系,最后生成修改结果。这种方式可以获得较好的画面质量,但很难满足直播、视频通话、摄像头等实时场景的需求。
流式视频编辑的难点在于,模型只能根据当前和历史信息完成判断。
比如直播过程中,主播下一秒的动作、镜头变化都还没有出现,模型无法提前读取完整视频,只能根据已经输入的内容持续处理。同时,视频越长,模型需要保存的信息越多,如果简单累积历史状态,计算量和显存占用都会不断增加。
技术报告提到,JoyAI-Video-Edit模型由多模态语言模型编码器、因果视频VAE以及多模态扩散Transformer组成。其中,模型通过因果视频VAE将视频压缩到潜空间,并以Chunk作为连续处理单元,跨Chunk采用因果注意力机制,让模型只能看到当前和历史信息,符合实时输入的要求。
同时,JoyAI-Video-Edit通过固定窗口机制控制历史信息规模,只保留近期视频状态和关键参考信息,避免视频越长,计算成本持续增加。在生成速度方面,扩散模型通常需要多轮迭代才能生成高质量结果,实时视频编辑则要求模型在极短时间内完成处理。
JoyAI-Video-Edit通过Source-Anchored DMD等蒸馏方法减少推理步骤,让16B参数模型也能够达到实时处理速度。官方测试显示,在单张NVIDIA B200 GPU环境下,模型端到端吞吐约30FPS,能够匹配常见视频播放速度。
JoyAI-Video-Edit在多个视频编辑评测中取得较好成绩。
在OpenVE-Bench短视频编辑评测中,JoyAI-Video-Edit总分达到3.60,在全局风格变化、局部替换、局部删除、字幕编辑等任务中表现突出。在LongV2VBench长视频评测中,JoyAI-Video-Edit排名第一,主要考察长时间视频编辑中的稳定性。
以往实时视频编辑模型通常需要在速度和质量之间做取舍,JoyAI-Video-Edit的测试结果显示,实时视频编辑模型与离线视频编辑模型之间的差距正在缩小。
不过,需要注意的是,流式编辑模型和传统视频生成模型解决的问题并不完全相同。
例如,当前主流视频生成模型更关注生成时长、画面质量和运动表现,Seedance、可灵、Vidu、MiniMax H3等模型都在持续提升视频生成能力,而Runway等公司推出的视频编辑模型,则重点解决已有视频内容修改的问题。
从行业动作来看,实时视频能力也正在成为各家探索的方向。
视频生成模型已经解决了从无到有的问题,但无论是广告制作、直播运营还是影视制作,大量时间都消耗在修改和调整环节,实时编辑提供了一种新的工作方式。例如,直播团队可以根据观众反馈即时调整商品展示效果,设计师可以在沟通过程中快速修改空间方案。
当然,目前实时视频编辑距离全面商用仍有一些距离,实时推理对于算力成本也存在压力,京东开源JoyAI-Video-Edit展示了一条开源模型探索实时视频编辑的技术路线,这类能力初步具备进入部分真实场景验证的基础。(本文作者 | 张帅,编辑 | 杨林)
作者:TechPulse
