可灵AI 2.0正式发布:快手加码多模态创意生产,技术升级引领全球内容生成创新
4月15日,快手推出可灵AI 2.0版本,这是其人工智能创意生产力平台的又一次重大升级,涵盖视频生成模型和图像生成模型。自去年6月初上线以来,可灵AI快速成长,发布超过20个迭代版本,全球用户规模从最初的百万级迈入千万级别,目前已经突破2200万。在过去10个月,月活用户量增长了25倍,累计生成视频超过1.68亿,图片达3.44亿张。这些数据揭示了可灵AI在AI驱动的内容创作领域的强大影响力,其快速迭代能力和技术深度也得到行业认可。

此次发布的可灵2.0模型在动态质量、语义响应、画面美学等多个维度表现出色,显著领先国际同行。相比之前的1.6版本,新模型优化了文生视频和图生视频的生成效果,在视频动态处理上表现尤为突出。例如,解决了传统视频模型生成的“慢动作”问题,实现更自然流畅的动态画面,人物动作的复杂程度和幅度也得到合理还原。可灵的多模态交互功能成为本次升级的亮点,其推出的多模态视觉语言(MVL)让创作者可以利用文本、图片、视频片段等多模态输入方式,将复杂创意更精准地表达给AI。与文字交互相比,这种方式能更好地处理跨媒介的信息组合,使用户生成的内容更加贴近预期。

图像生成方面的可图2.0模型也获得大幅提升,其指令遵循能力精准性增强,同时在风格化呈现上的多样性进一步扩大,新增了60余种艺术风格效果。在指令生成的细节处理上,可图2.0引入新的去噪策略,图像质量呈现得到优化,更加符合创作者在画面美学上的挑剔需求。例如,系统可在提示词中精确描绘电影级光影细腻度以及情绪表达,与传统模型相比显然提供了更丰富的创意可能性。对于行业内有高标准内容生产需求的用户,例如广告营销公司、影视创作团队,可图2.0的表现将为其提供更大的创作自由度。

可灵AI的下一步发展同样展现出战略深度。其不仅积极引入全球开发者及企业客户,已有超过1.5万名开发者使用其API在不同场景中应用,包括电商营销、内容生成、教育平台等领域,还开始探索更具互动性的概念,如可控视频编辑能力。用户不仅能够生成视频,还可以对视频进行增删改操作,甚至在内容中引入如声音、运动轨迹等复杂信息。可灵提出的多模态描述子(MMW)拓展了生成视频的可能性,打破了传统选项限制。这种创新性交互语言为创作者的表达提供了更高的操作自由度,其商业化潜力值得关注。
另一方面,可灵AI也在全球范围内参与行业竞赛。据数据测试,2.0版本在文生视频领域的表现远超谷歌和OpenAI相关模型,例如在相关性、动态处理、语义细节能力上胜负比显著领先。通过技术升级和市场拓展,可灵AI不仅在国内树立了领先优势,也逐渐成为全球范围内的顶级AI视频应用平台。快手在相关领域的持续投入已经让可灵AI成为技术创新与商业潜力兼具的重要代表。

快手可灵AI 2.0的发布标志着国产大模型在视频和图像生成技术领域的进一步成熟。其技术细节的改进和用户体验的优化有望推动多个行业的数字创作生态。这不仅促进了AI时代内容生成的效率提升,也彰显了中国企业在全球技术创新竞赛中的优势地位。接下来,可灵AI的跨模态探索和工具矩阵扩展将成为其发展的重要看点。面对技术的快速迭代和市场需求的多样化,可灵AI能否保持当前优势仍值得长期关注。
