近日,米哈游公开了其自主研发的视频角色表演生成大模型LPM1.0,引发了业界的广泛关注和讨论。该模型专注于生成具有丰富表演能力的角色视频,其展示的效果和背后的技术思路,揭示了米哈游在AI领域深耕的战略方向。
综合各方观点来看,LPM1.0的核心亮点并非单纯的视频生成,而是其在“角色表演”这一特定场景下的系统性解决方案。与通用视频生成模型不同,LPM1.0专为打造可实时交互、具备长时间一致性的数字角色而设计。其输入包括文本、参考图像和音频,能够根据音频内容,实时生成角色的相应口型、表情和动作。
LPM1.0最令人印象深刻的特性主要体现在三个方面:实时交互、长时间稳定性以及专注于对话场景的表演能力。许多评价指出,模型的亚秒级响应和可无限时长的视频生成能力,是其区别于其他模型的关键优势。这意味着它不再是“离线渲染”的工具,而是能够支撑“实时对话”的引擎,这对于游戏、虚拟伴侣等交互式娱乐产品而言是质的飞跃。为了实现这一点,LPM1.0在技术架构上进行了大量工程创新。
根据其公布的技术细节,LPM1.0并非一个单一模型,而是一套复杂的工程系统。它首先解决了行业内普遍存在的“表演三难困境”,即在生成视频时难以同时兼顾高画质、低延迟和长时一致性。其解决方案是将一个高质量的“离线教师模型”通过蒸馏技术,训练成一个更轻量、适合在线推理的“在线学生模型”。
在具体生成过程中,LPM1.0采用了一系列精巧的设计来保证实时性和稳定性。它将视频生成任务拆解为以秒为单位的“块”,并采用流水线并行处理的方式,即在精修前一秒画面的同时,开始生成后一秒的轮廓,极大地压缩了延迟。为了保证角色在长时间生成中形象不“漂移”,模型采用了两步走策略:先生成一个稳定但相对粗糙的“潜变量轨迹”来稳住角色的整体动态和一致性,再通过精修模型来补充细节。此外,通过滑动窗口、KV缓存等技术,模型实现了高效的“短时记忆”,既能保持上下文连续性,又避免了因处理全部历史数据而导致的性能瓶颈。
在应用层面,该模型将角色的状态细分为“倾听”、“说话”和“待机”等不同模式,并进行针对性训练,使得角色在与用户互动时,能够展现出符合情境的自然反应。例如,在用户说话时,角色会呈现倾听的姿态;当轮到角色发言时,又能精准匹配口型和情绪。
从战略角度看,LPM1.0的公布标志着米哈游在AI领域跑通了从研发到生产应用的闭环。这不仅意味着米哈游拥有了为自身核心业务(如游戏)量身定制AI工具的能力,摆脱了对第三方通用模型的依赖,还能根据自身需求进行深度优化,从而在成本控制和技术迭代上获得更大的自主权。这类似于米哈游深度定制游戏引擎的策略,旨在将最前沿的技术与自身的内容创作流程深度融合。
当然,目前LPM1.0也存在一些可观察到的局限,例如部分细节(如手指关节)的精细度仍有提升空间,角色表演在某些时候也可能略显生硬。同时,米哈游明确表示该模型目前为内部使用,暂无开源或开放接口的计划。
米哈游LPM1.0的发布,展示了一种将AI技术工程化、产品化的清晰思路。它不仅仅是一次技术成果的展示,更是对其未来产品形态和交互体验的一次预演,预示着AI驱动的、更具沉浸感的数字角色和互动娱乐体验,或许正加速到来。