AI视频创作工具碎片化,流程繁琐且一致性差。UniVA作为首个开源视频通用Agent,通过Plan-Act双智体架构,整合理解、生成与剪辑,旨在打通创作全链路,实现可控、高质量的长视频生成,为行业带来革命性思路。
智能速览
UniVA是首个开源的视频通用Agent框架,整合理解、生成与剪辑能力。
采用Plan-Act双智体架构,模仿人类导演的规划与执行流程。
基于MCP协议构建,可“即插即用”集成最新的AI工具。
引入分层记忆机制,有效解决长视频生成中的一致性难题。
在多步视频任务评测基准上表现显著优于现有端到端模型。
精华内容
UniVA的核心突破在于其精巧的架构设计,它如何将规划与执行分离,并解决业界老大难的一致性问题?
架构创新
与传统“一锤子买卖”的端到端模型不同,UniVA采用了Plan-Act双智体架构。规划智体负责解析用户指令,将其拆解为可执行的子任务序列,如分镜设计、情节推进。执行智体则调用具体工具完成每个子任务。这种解耦设计,如同人类导演先写剧本再拍摄,极大提升了复杂任务的成功率和可控性,改变了过去依赖运气的“抽卡”式生成模式。
一致性的秘密
长视频生成中,人物形象、场景等元素的一致性是核心痛点。UniVA通过引入分层记忆机制解决了这一难题。该机制在多步骤生成过程中,持续记忆并追踪关键实体(如人物ID、物体特征),确保在不同镜头和时间段内,核心元素的稳定呈现。例如,让一个穿西装的男人展示工作一天,UniVA能完美保持其身份不变,这是普通视频模型难以企及的。
开放生态
UniVA的能力边界并非固定,其强大之处在于基于Model Context Protocol (MCP)构建的开放生态。这意味着UniVA可以像“插件商店”一样,无缝集成社区最新、最强的AI工具,无论是文生图、视频生成还是编辑模型。这种“即插即用”的特性保证了UniVA的能力会随着技术发展而持续进化,避免了单一模型能力受限的问题,使其成为一个真正可扩展的视频创作平台。
性能验证
为客观评估其效果,团队发布了首个针对多步视频任务的评测基准UniVA-Bench。实验数据显示,在复杂的LongText2Video任务中,UniVA在MLLM Judge评分上取得了3.333分,显著优于Wan(3.183分)和LTX-Video(1.125分)等主流端到端模型。数据证明,在面对复杂任务时,UniVA的“精心规划”策略远比“暴力生成”更为高效和可靠。
UniVA不仅是一个强大的视频创作工具,更代表了AI视频从单一模型向智能体协同演进的未来方向。它为开发者和创作者提供了全新的可能。开源的生态将如何推动其快速发展?