张大妈

生数科技Vidu系列文生视频大模型4月9日上线阿里云百炼平台,支持16秒音视频一体生成

源自26位全网作者

04-15 02:46

精选参考来源

1
聊聊昨天上线的多图参考生视频Vidu Q2。测了几个小时以后,先说结论,确实是多图参考生视频的王。也是一种,做AI视频工作流的,新范式。说实话,自从Veo3、可灵2.5、Sora2以后,我自己,越来越不喜欢用图生视频了。最开始的时候,23年,我挂置顶的那个预告片总共肝了693张图片,185个镜头,最终选出来60个镜头。这其实是没办法的办法,先生图,再用图生视频的方式,对于流程还是挺蛋疼的,需要你强行来回跳转不同的产品。而且图片本身,很多时候是个静帧,会影响很多动态的发挥,如果不是为了一致性,很多时候,我真的喜欢用文生视频去做。去年11月,Vidu第一次上线了多图参考生视频,可以用几张图,就能保持人物、物品、场景一致性,开启了多参党的时代。那个时候,我也写过Vidu。不过效果,其实已经是Vidu去年基模还是1.5的时候的效果了,对甚至连Q这个开头前缀都没有。而现在,在经历了Vidu 1.5、Vidu 2.0、Vidu Q1之后,新的Vidu Q2,确实给多图参考,带来了一些以前达到不了的效果。而图生视频这个工作流,就好像曾经的SD一样,可能确实会越来越被我,封印在历史的尘埃里了。今天,我是一个光荣的多参党。我觉得这次的Q2和多参升级,可以体现在3个方面:大幅进化的一致性,更强的表演能力,以及更棒的多风格表现力。一、一致性参考生视频的,我们很多时候最看重的,就是一致性。三个月前,Vidu Q1的多参生图其实已经很强了,但是遇到超多主体的情况还是会歇菜。而这次,Q2更新以后,就牛逼了很多。比如,让文艺复兴的新三杰和旧三杰同框出现(图1、2)。Q2的效果,镜头依次出现六个画家,每个人的特征都基本保留,实现了这个挑战。而Q1的话,还是会失败的。比如会出现人物不全,或者人物突然从地里钻出来的情况。用多图参考生视频也特别简单,就是把你的图片都传上去之后,直接可以艾特所有人和物品 ,超级简单,比Sora2的那个还丝滑,因为Sora2只能@ 人物,物品和场景就不行了。再来看一下主体+物品的case。比如让范德彪穿着草裙在沙滩上晒太阳。然后就得到了一个晒到七成熟的德彪。(图3、4)再让川普先从冰箱里拿出来一罐百事可乐,再拿出来一瓶可口可乐。生成出来的结果,川普、百事可乐和可口可乐,都保持了原状。特别是百事上的字,也保持的非常好。(图5)还有一个,我觉得很有趣的case,也是一个之前没玩过的玩法,就是你可以通过多主体,让主人公实现变身。最惊喜的是,镜子里和镜子外的变化非常同步,这个是真的是有点东西的。(图6)还有一个玩法,就是人物不变,场景变化。提示词我放评论区了。在一致性上,表现的非常完美。(图7)二、情绪表演表演这一块,也是Q2的重头戏。拿我喜欢的演员基里安墨菲来举例,我从他演过的英剧《浴血黑帮》里找了几张图,做了一个叫Tommy的主体。(图8)这个主体其实也是多图的的升级功能。(图9)就是比如一个角色,我们为了它更稳定,就可能要传三张不同角度的图上去,而传统的做法,就是写男人靠在XX地方,让AI视频自己去脑补,这三张图片是这个男人啊。后续的复用上,也不好管理。现在,你可以用主体的方式,命名,然后,直接@ 它就完事了,还能保存成主体库,后续随便用,很方便。这些小细节,Vidu做的确实是蛮好的。瞬间,得到了这个非常细腻的表演。(图10)基里安的眼睛是真的有戏啊,把脆弱感展现的淋漓尽致。相比之下Q1的演技就完全没开窍。而如果说,Vidu Q2的真人表演已经很不错了,那么二次元领域的表演更是Vidu的拿手好戏。毕竟,动漫,很多时候,都是Vidu的代名词之一。-一个经典的日剧跑段落。出来的效果真的很有那味儿,可以直接配一首《你的名字》了。让我想起那年夕阳下的奔跑,那是我逝去的青春。。。(图11)在测试情绪的过程中,我还发现,Vidu非常懂动漫中常见的情绪表现手法。比如下面这个case,它会通过眉眼边上的线条抽动、瞳孔骤然缩小、眼白布满红血丝,来展现一个人极致恐惧的情绪。(图12)但说实话,大部分情况下我都不会给这么细的提示词。我在这一段,只规定了三个点,男人极度惊恐的表情,半明半暗的光影,和推镜头的运动。而Q2能凭借自身的技法积累,在我的提示词框架里面完善细节,最后得到一个,有表现力的效果。图我只能说,他们动漫的效果,是真的强啊。三、多风格表现力上面的case大家也看到了,Vidu Q2做出来的动漫视频效果很出挑。所以这一趴,我做了更多不同动画风格的case,让大家感受一下,Vidu的动画风格表现力。真的,Vidu无愧于AI视频动漫之王的称号。后面这些,我就不放截图了,但是和生成方法和前面还是一样的。都是贴上参考图,或者贴上主体,然后写提示词,生成视频。先从最日常的泡面番风格开始。(图13)热血战斗番,亦正亦邪的反派既视感,一时间幻视了不少角色。(图14)追求音乐梦想的美少女,在空荡的礼堂里独自练习。超典型360度环绕运镜。(图15)同时,它不仅有超棒的角色一致性,还有特别棒的风格一致性。(图16)还有一个更酷的,就是我测下来发现,Q2真的很适合生成一些中二动漫场面,因为它的运镜和特效,给的真的太足了。比如下面这个男人舞剑的case。镜头拉近拉远再拉近,还有挥剑形成的狂风,效果直接拉满了。(图17)再比如这个打斗。刀光剑影,飞檐走壁,人物和镜头的运动都很丰富,也只抽了两次卡。(图18)-最后Vidu Q2这次的参考生视频,确实要比之前的质量好太多了。超多主体同框一致性的稳定,以及Q2基模所带来的效果提升。再加上参考生视频能带来更牛逼的运镜和自然的表演。确实,是多参党的胜利,也是新的工作流范式,进化的前夜。最后,再来说说大家最关心的价格问题。以标准版月度会员为例,59元800积分,20积分就能生成一条8s视频,折合下来1.475元/条,约0.184元/s。几乎就是现在最便宜的AI视频模型之一了。整体来说,这次Vidu Q2的多参还是让我很惊喜的。而且他们也上了APP,跟Sora2那样的交互,也能玩合拍,不过是用多参做的,也挺有意思的,感兴趣的可以去玩玩。我也还是很相信,多图参考生视频,是未来的共识。Vidu,未来可期。#ai创造营##ai#
2
Vidu Q2的参考生视频,是AI视频多参党的胜利。
全部
来源
内容由AI生成

精选参考来源

1. 聊聊昨天上线的多图参考生视频Vidu Q2。测了几个小时以后,先说结论,确实是多图参考生视频的王。也是一种,做AI视频工作流的,新范式。说实话,自从Veo3、可灵2.5、Sora2以后,我自己,越来越不喜欢用图生视频了。最开始的时候,23年,我挂置顶的那个预告片总共肝了693张图片,185个镜头,最终选出来60个镜头。这其实是没办法的办法,先生图,再用图生视频的方式,对于流程还是挺蛋疼的,需要你强行来回跳转不同的产品。而且图片本身,很多时候是个静帧,会影响很多动态的发挥,如果不是为了一致性,很多时候,我真的喜欢用文生视频去做。去年11月,Vidu第一次上线了多图参考生视频,可以用几张图,就能保持人物、物品、场景一致性,开启了多参党的时代。那个时候,我也写过Vidu。不过效果,其实已经是Vidu去年基模还是1.5的时候的效果了,对甚至连Q这个开头前缀都没有。而现在,在经历了Vidu 1.5、Vidu 2.0、Vidu Q1之后,新的Vidu Q2,确实给多图参考,带来了一些以前达到不了的效果。而图生视频这个工作流,就好像曾经的SD一样,可能确实会越来越被我,封印在历史的尘埃里了。今天,我是一个光荣的多参党。我觉得这次的Q2和多参升级,可以体现在3个方面:大幅进化的一致性,更强的表演能力,以及更棒的多风格表现力。一、一致性参考生视频的,我们很多时候最看重的,就是一致性。三个月前,Vidu Q1的多参生图其实已经很强了,但是遇到超多主体的情况还是会歇菜。而这次,Q2更新以后,就牛逼了很多。比如,让文艺复兴的新三杰和旧三杰同框出现(图1、2)。Q2的效果,镜头依次出现六个画家,每个人的特征都基本保留,实现了这个挑战。而Q1的话,还是会失败的。比如会出现人物不全,或者人物突然从地里钻出来的情况。用多图参考生视频也特别简单,就是把你的图片都传上去之后,直接可以艾特所有人和物品 ,超级简单,比Sora2的那个还丝滑,因为Sora2只能@ 人物,物品和场景就不行了。再来看一下主体+物品的case。比如让范德彪穿着草裙在沙滩上晒太阳。然后就得到了一个晒到七成熟的德彪。(图3、4)再让川普先从冰箱里拿出来一罐百事可乐,再拿出来一瓶可口可乐。生成出来的结果,川普、百事可乐和可口可乐,都保持了原状。特别是百事上的字,也保持的非常好。(图5)还有一个,我觉得很有趣的case,也是一个之前没玩过的玩法,就是你可以通过多主体,让主人公实现变身。最惊喜的是,镜子里和镜子外的变化非常同步,这个是真的是有点东西的。(图6)还有一个玩法,就是人物不变,场景变化。提示词我放评论区了。在一致性上,表现的非常完美。(图7)二、情绪表演表演这一块,也是Q2的重头戏。拿我喜欢的演员基里安墨菲来举例,我从他演过的英剧《浴血黑帮》里找了几张图,做了一个叫Tommy的主体。(图8)这个主体其实也是多图的的升级功能。(图9)就是比如一个角色,我们为了它更稳定,就可能要传三张不同角度的图上去,而传统的做法,就是写男人靠在XX地方,让AI视频自己去脑补,这三张图片是这个男人啊。后续的复用上,也不好管理。现在,你可以用主体的方式,命名,然后,直接@ 它就完事了,还能保存成主体库,后续随便用,很方便。这些小细节,Vidu做的确实是蛮好的。瞬间,得到了这个非常细腻的表演。(图10)基里安的眼睛是真的有戏啊,把脆弱感展现的淋漓尽致。相比之下Q1的演技就完全没开窍。而如果说,Vidu Q2的真人表演已经很不错了,那么二次元领域的表演更是Vidu的拿手好戏。毕竟,动漫,很多时候,都是Vidu的代名词之一。-一个经典的日剧跑段落。出来的效果真的很有那味儿,可以直接配一首《你的名字》了。让我想起那年夕阳下的奔跑,那是我逝去的青春。。。(图11)在测试情绪的过程中,我还发现,Vidu非常懂动漫中常见的情绪表现手法。比如下面这个case,它会通过眉眼边上的线条抽动、瞳孔骤然缩小、眼白布满红血丝,来展现一个人极致恐惧的情绪。(图12)但说实话,大部分情况下我都不会给这么细的提示词。我在这一段,只规定了三个点,男人极度惊恐的表情,半明半暗的光影,和推镜头的运动。而Q2能凭借自身的技法积累,在我的提示词框架里面完善细节,最后得到一个,有表现力的效果。图我只能说,他们动漫的效果,是真的强啊。三、多风格表现力上面的case大家也看到了,Vidu Q2做出来的动漫视频效果很出挑。所以这一趴,我做了更多不同动画风格的case,让大家感受一下,Vidu的动画风格表现力。真的,Vidu无愧于AI视频动漫之王的称号。后面这些,我就不放截图了,但是和生成方法和前面还是一样的。都是贴上参考图,或者贴上主体,然后写提示词,生成视频。先从最日常的泡面番风格开始。(图13)热血战斗番,亦正亦邪的反派既视感,一时间幻视了不少角色。(图14)追求音乐梦想的美少女,在空荡的礼堂里独自练习。超典型360度环绕运镜。(图15)同时,它不仅有超棒的角色一致性,还有特别棒的风格一致性。(图16)还有一个更酷的,就是我测下来发现,Q2真的很适合生成一些中二动漫场面,因为它的运镜和特效,给的真的太足了。比如下面这个男人舞剑的case。镜头拉近拉远再拉近,还有挥剑形成的狂风,效果直接拉满了。(图17)再比如这个打斗。刀光剑影,飞檐走壁,人物和镜头的运动都很丰富,也只抽了两次卡。(图18)-最后Vidu Q2这次的参考生视频,确实要比之前的质量好太多了。超多主体同框一致性的稳定,以及Q2基模所带来的效果提升。再加上参考生视频能带来更牛逼的运镜和自然的表演。确实,是多参党的胜利,也是新的工作流范式,进化的前夜。最后,再来说说大家最关心的价格问题。以标准版月度会员为例,59元800积分,20积分就能生成一条8s视频,折合下来1.475元/条,约0.184元/s。几乎就是现在最便宜的AI视频模型之一了。整体来说,这次Vidu Q2的多参还是让我很惊喜的。而且他们也上了APP,跟Sora2那样的交互,也能玩合拍,不过是用多参做的,也挺有意思的,感兴趣的可以去玩玩。我也还是很相信,多图参考生视频,是未来的共识。Vidu,未来可期。#ai创造营##ai#

2. Vidu Q2的参考生视频,是AI视频多参党的胜利。

3. 开源是战略,生态是王炸,阿里千问入局AItoC #千问 #大模型

4. 拓宽百年奥运「赛场边界」,阿里云AI让人人皆可上场

5. 千问APP国内正式上线,“千问恐慌”愈演愈烈,OpenAI恐怕要被反杀了 #千问APP #AI #AI助手 #开源大模型#阿里巴巴

6. 【阿里千问发布全模态大模型 Qwen3.5-Omni】阿里云正式发布新一代全模态大模型 Qwen3.5-Omni,在音视频理解、识别、交互等 215 项第三方测试任务中取得 SOTA,成为目前全球最强的全模态大模型之一。关键数据 1:支持 113 种语言及方言的语音识别,36 种语言及方言的语音生成;关键数据 2:可处理超 10 小时音频输入,自然涌现“音视频编程”能力(口述需求直接生成代码);时间 / 价格:用户可于 Qwen Chat 免费体验,企业可通过阿里云百炼平台调用 API。从“多模态理解”到“音视频编程”,Qwen3.5-Omni 将 Vibe Coding 推向新阶段,大模型正从“对话工具”进化为“跨模态生产力平台”,加速渗透影视制作、内容审核等高价值场景。#阿里千问 #Qwen3.5 #全模态大模型 #AIGC#

7. 锁死一致性!Vidu Q2「参考生」可算来了,新功能强到离谱,APP全面进化

8. 小白也会用,Vidu 把好莱坞的运镜、氛围、构图全装进了一个“@”里

9. Vidu Q3 登顶中国AI视频新王者,一句话生成16秒音视频,音效惊艳

10. 阿里AI,5年要再造一个阿里

11. 生数科技Vidu正式上线阿里云百炼

12. 速递|阿里领投、国家队进场!生数科技完成 20 亿元 B 轮融资,押注通用世界模型

13. 阿里云领投!生数科技完成近20 亿元 B 轮融资

14. 生数科技完成近20亿元B轮融资, 阿里云领投,发力通用世界模型

15. 生数科技完成近20亿元融资,加码通用世界模型!

16. AI世界——Vidu Q3 全球震撼来袭,为「剧」而生!

17. ƼƴȫսԺViduεģϼܰƽ̨

18. 生数科技:Vidu B端客户数量及调用量环比增300%

19. 快讯 | 阿里巴巴领投Vidu新一轮3亿美元融资

20. Vidu重磅上线 Vidu Q2视频模型 !首创支持多图多主体融合生成视频!

21. 阿里云代理商:百炼大模型 企业级 AI 应用的终极指南

22. 阿里云百炼:AI大模型有哪些?超详细介绍

23. 阿里云百炼上线三方视频生成模型,PixVerse首发登陆

24. 阿里云代理商:百炼用AI重新定义图像的诞生

25. 刚发布,限时免费体验丨Vidu Q2 x 海艺AI 正式上线!

26. 2025.10.21 AI动态资讯

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章