9月8日,智象未来把vivago R1推到全球上线,国内版"够搭"同步升级,打的旗号很扎眼:全球首个无限时长内容创作智能体。 AI视频群里第一反应不是欢呼,而是一句灵魂拷问——“无限时长?又是什么新词包装的拼接?”知乎
这个质疑不算冤枉。"无限时长"这个词,本地工作流圈已经玩了大半年,而各家路线其实完全不是一回事。我把官方上线口径、开源社区的实测、以及做AI漫剧/短剧的人真实卡壳的地方对了一遍,这篇就给正在做1-3分钟连载、靠"抽卡+缝片"日更的人捋清楚:这次到底变了什么,哪条路现在值得动,哪条路还得再等等。
先把9月8日这条新闻说透
翻了几家报道和实测,R1目前能对上的事实是这些:
今年7月的WAIC 2026上首次亮相,内测近两个月后于9月8日正式面向全球开放;
主打"一次对话生成5分钟":输入一个"华强买瓜"的提示词,Agent自动完成规划、分镜、生成视觉资产、合成成片,一段60秒鬼畜视频一次成型;
同步推出了vivago-agent-cli,通用Agent可以通过命令行调用R1,接进自己的自动化流水线;
官方叙事针对的就是行业老毛病:时长受限、画面跳变、人设错乱。
但注意,连转发它的"单反时刻"式测评文章,自己在实测段落里也留了一句:“不过多段拼接处仍略不自然。” 这句才是关键——宣传口径里的"无限时长",和观众眼里的"看不出是缝的",目前还差一步。知乎

"无限时长"其实同时存在三种东西
听到这四个字,先问一句"哪种无限"。现在市场上有三种,各自卡壳的地方完全不同。
路线A:Agent编排型(vivago R1/够搭)。 时长和分镜交给模型,你用自然语言提要求。好处是把原来最吃手艺的"分镜规划+资产一致性管理"接了过去,还给了agent-cli这种可集成的入口;智象未来7月刚完成15亿元C轮融资、被媒体统计"3个月融了21亿",钱是冲着把拼接做成产品内耗去的。 卡壳点:接缝观感、以及控制粒度——你只能通过对话去挪它的分镜,改一个镜头可能要挪整段上下文。36氪
路线B:本地链式流(MiniMax H3/Wan2.2/LTX + ComfyUI工作流)。 这才是"无限时长"一词的源头,但说穿了一点不 magic:模型单段还是只有8-15秒。B站"程序员萝卜"的H3无限时长V2工作流评论区,作者自己把底交代的很干净:“每一次只跑8秒,最后拼接的”“每段一个提示词,自己写”“参考音频需要自己分割”“衔接帧已经切割了”;还翻过车——313版流程有取潜空间错误的BUG,后来出V2A修正,有人生成第二段后画面没问题、声音全是电流声。 Wan2.2、LTX的无限时长流同理:首尾帧/潜空间续写,8G显存就能跑。卡壳点:它不是时长问题,是人工问题——一段一换提示词、音频手动切、错了重抽,做2分钟视频=十几次手工活。换来的是完全可控和几乎为零的边际成本。哔哩哔哩

路线C:平台工作流(H3"无限时长导演台"、RunningHub链式方案)。 介于两者之间:官方或平台把上面那套拼接流程封装成一键模板。MiniMax官方号8月25日发过"无限时长导演台"视频,号称一键批量生成、音画同步,1.2万播放、888条评论(点开前排全是"666求流程",咨询热度可见一斑)。 9月11日智东西报道,RunningHub基于上个月刚开源的H3(ArtificialAnalysis有声视频编辑榜一度登顶,Elo 1130)做了开源方案,15秒视频54秒生成。 卡壳点:积分计费+模板黑盒,效果不好你也不知道该骂哪一环。哔哩哔哩知乎
小红书们为什么会为这个词停下来
因为"15秒魔咒"是这个圈子的日常创伤。小红书上5640赞、9331收藏的帖子原话:“AI视频最怕生成到一半角色变脸、画风崩坏,以前超15秒就翻车的魔咒”。 3367赞的那条更具体:“15秒之后,人物形象突变、位置乱跑、配音乱换”。 还有人专门警告"千万别再用首尾帧拼AI视频了,画面必卡顿、必断层"。 就连9月8日当天还有人在发"AI生成视频拼接老觉得画面卡卡的"的避坑帖。小红书小红书小红书
这条时间线连起来看:创作者社区半年前就在手搓"无限时长",今天厂商把它商品化——所以这波对老手是"终于有人替我干脏活",对新手是"门槛真的塌了"。知乎上那句提问"每天用AI做一个3-5分钟小视频,每天发有没有搞头?",就是门槛塌了之后最直接的反应。知乎
按你在做什么内容,决定动不动手
做漫剧/动画向的:可以冲。 动画风对脸跳、光变容忍度高,"略不自然"甚至能被风格消化。R1这类agent产品5分钟级的连载产能是实打实的红利,先拿它跑样片。
做真人质感短剧、靠脸吃饭的:先别整体换线。 长时序人物一致性没有被真正解决,官方demo是"华强买瓜"这种短梗,不是两分钟带角色回头的剧情。验收标准就一条:拿你自己的剧本跑一条2分钟真人风,看第三段脸还在不在。在这之前,本地链式流+角色参考仍是可控下限。
做解说/知识/数据向的:另一条路已经跑通。 上了GitHub Trending的HyperFrames走的是第四条路线——让AI写HTML、把每帧稳定渲染成MP4,代码化、可复现、不抽卡,代价是没有"拍出来"的质感。这类内容其实早就配得上"无限时长"这个词。知乎

观望日更矩阵的:算一笔时间账。 以前2分钟≈十几段抽卡+手工缝,现在agent方案把缝的环节收进产品,但"改一处重跑一片"的返工成本还在,值不值得换,取决于你的日更量能不能摊平学习成本。
接下来盯什么信号
R1的真人风格长剧情样片和角色转身回头的稳定性——官方案例从鬼畜梗换成剧情片那天才算落地;
导演台/无限时长流的版本迭代速度——社区教程两天前还在更新(minimax无限时长流搭建、Singularity工作流大更新),说明这套东西远没定型;
计费口径的变化:智象未来CEO梅涛今年5月说过,多模态模型token毛利率远高于语言模型。 谁先按"成片时长"而不是"抽卡次数"定价,谁就真把拼接吃进去了。36氪
H3这条开源线的第三方长内容实测(比如RunningHub之外,有没有人放出一集10分钟漫剧的完整成本账)。
"无限时长"这四个字,目前最诚实的理解是:拼接这个工种正在从你的手艺人劳动,转移到产品的工程劳动。 时长数字赢了,观感还没全赢。真正值得换管线的那一刻,是你能一眼分不清它是不是缝的——按现在三家放出的料,那个点大概率在今年内,但未必是你换卡换积分包的这个月。