面对视频模型功能割裂、交互单一的瓶颈,快手提出通用框架Kling-Omni。它首次将生成、编辑与推理统一于端到端系统,通过多模态交互范式,向“多模态世界模拟器”迈进,为高自由度视频创作提供了革命性解决方案。
智能速览
Kling-Omni是首个统一视频生成、编辑与推理的端到端框架。
创新性多模态视觉语言(MVL)交互,融合文本、图像与视频指令。
Prompt Enhancer显著提升生成视频的身份一致性与物理合理性。
通过蒸馏技术将推理步数从150步压缩至10步,大幅提升效率。
完备的工业级训练与推理基础设施,保障长序列多参考输入的稳定性。
精华内容
Kling-Omni的突破不仅在于技术整合,更在于其构建了一个更接近人类智能的创作范式,让视频创作从执行指令进化到理解与推理。
统一架构设计
传统视频模型依赖多阶段流水线,功能相互割裂。Kling-Omni摒弃了这种模式,采用端到端扩散Transformer架构,在共享的嵌入空间中统一处理文本、图像与视频数据。这种原生统一的设计,使得模型能够无缝衔接生成、编辑与理解任务,避免了多模型切换带来的信息损耗和效率瓶颈,是实现通用视频智能的基石。
多模态交互范式
Kling-Omni的核心创新在于引入了多模态视觉语言(MVL)交互。用户不再局限于文本提示,可以将参考图像、视频片段等视觉元素作为输入的一部分。模型将这些异构信息融合成统一的“视觉语言”,从而更精准地理解复杂的空间关系、时序变化和风格要求,极大提升了指令的表达能力和生成结果的准确性。
训练体系与对齐
为确保生成质量,Kling-Omni构建了“预训练→监督微调→偏好对齐强化学习”的三阶段训练体系。其中,Prompt Enhancer模块利用多模态大模型对用户输入进行语义补全和重写,使其更符合高质量数据的分布,有效解决了身份不一致和物理逻辑错误等问题。随后通过DPO技术,让模型的输出更贴近人类的审美和意图。
效率与工业化部署
为满足工业化应用需求,Kling-Omni在效率上实现重大突破。通过轨迹匹配与分布匹配蒸馏技术,模型推理步数从150步锐减至10步,生成速度提升超过10倍,且画质几乎无损。同时,配套的工业级基础设施,包括动态负载均衡和多级并行策略,确保了在超长序列和多参考输入等复杂场景下的高吞吐和稳定运行。
Kling-Omni的出现,标志着视频生成模型正从“工具”向具备感知、推理能力的“智能体”演进。它不仅解决了当前技术的割裂问题,更描绘了“多模态世界模拟器”的蓝图。未来,这样的技术将如何改变内容创作与人机交互的方式?