MiniMax Design用Agent串联多模型,争夺专业内容生产入口
图片由AI生成图片由AI生成
8月20日,MiniMax发布多模态创作Agent工作台MiniMax Design,其核心目标在于推动模型能力进入商业内容生产流程。
MiniMax Design是一款多模态创作Harness。用户提出创作需求后,Agent能够理解目标、拆解任务,并调用相应的模型与Skills,完成素材处理、内容生成、编辑和最终交付。
上个月,7月31日,MiniMax发布了通用全模态生成模型H3,也是该公司首个开源的视频生成模型。H3核心的特点是打破任务边界,不再将文生图、图生视频、视频编辑等视为独立任务,而是在一个模型内统一处理。
不过,也有部分开发者表示H3提示词复杂,上手难度高,对硬件和配置的要求,让很多个人用户望而却步。
面对一项具体任务,MiniMax Design试图判断需要提供哪些文字、图片、视频和音频,并识别其中需要参考或保留的内容,将创作需求转化为适合H3执行的素材和指令,补充了音视频生成前的分镜规划,以及生成后的剪辑和成片装配能力。
例如,其主推的“3D导演台”功能,可以根据场景、人物动作和镜头要求,在3D空间中摆放角色、调整姿态与机位,并从不同视角检查画面。
围绕H3开源后形成的创作者生态,MiniMax Design已将部分社区工作流集合到产品中。已经使用ComfyUI的专业创作者也可以接入原有的本地部署方式和成熟工作流,选择云端或本地运行,并让Agent根据对话协助编辑工作流节点、调整生成参数。
MiniMax Design 已将部分社区工作流集合到产品中
MiniMax Design 已将部分社区工作流集合到产品中
此外,MiniMax分享了对多模态生产力的两个判断:首先,未来的内容创作与修改将逐步从像素、图层、时间点和参数操作,转向语义层面的交互。用户只需说明想要什么、改变什么和保留什么,系统负责理解意图,并完成相应的生成、修改、重组和编辑。
其次,多模态模型需要理解的Context将从一次输入扩展到整个Project。一项完整的内容任务通常包含多轮对话,以及剧本、图片、视频、音频、人物、场景、道具和品牌资产。不同版本及其修改记录也会成为后续创作的上下文。Context长度之外,模型能否理解并有效使用这些内容,将影响其处理复杂任务的能力。
从行业层面来看,当前主流的AI视频生成工具,Runway、Pika、即梦、可灵等,团队迭代的重心在视频模型能力的进阶。其在AI视频实际工作流上,可以在输出独立视频片段,以及个人创作者创意实现上表现优异,但缺少完整项目管理、分镜编排、批量版本导出、企业资产规范,在大规模商业化上会存在一定的短板。
而一些垂直行业SaaS,比如,电商剪辑工具、短剧制片平台,主要是针对单一场景封装,模型能力受限,跨品类复用差。为此,MiniMax Design通过Skill生态,横向覆盖电商、短剧、品牌广告、教育科普、动画漫剧多个内容赛道。
这些是MiniMax推出MiniMax Design以寻求差异化优势的原因。不过,对于MiniMax来说,其视频模型能力在高端影视级生成能力仍有上限,模型画质和口碑均弱于头部竞品,这将直接限制其切入高溢价顶级广告制片市场。
MiniMax Design的Skill生态起步较晚,优质行业模板数量不足,第三方开发者参与度低。而当前主流的创作工具平台,比如,ComfyUI、Runway已经搭建起了庞大创作者生态,用户可以自定义插件、预设、教程、第三方服务商。
未来的行业竞争不会再只是聚焦于单一的视频生成效果,工作流复用能力、企业资产管控、多模型调度、行业垂直 Skill 生态,也就是 Harness 层的产品能力,也将成为视频模型厂商发展的核心要义。(本文首发于钛媒体APP,作者|李程程,编辑|杨林)
作者:LCC_Beta版
