这轮大模型刷屏里最反直觉的一幕,是刷屏的那个模型根本不干生成视频的活。
9月3日,OpenAI发布新一代旗舰GPT-6 Astra和Astra Pro,官方定位是"第一个为做事而生的模型"。知乎发布会尾声,总裁Greg Brockman留下一句"欢迎来到AGI时代"。微博但真正在AI漫剧、AI短片创作者群里疯传的,不是它的评测分数,而是别人用它干出来的活:国外博主Matt Shumer只给一个想法,Astra就在虚幻引擎里搭出一座AI角色能生活、工作、互相交流的虚拟小镇,这条测试拿到百万级浏览。微博
更贴近内容生产的实测也同一周铺开:有人发现Astra能根据房源照片直接创建逼真的3D房屋模型。知乎往前数两天,李飞飞的World Labs刚发布全球首个多模态世界模型Atlas,宣传语同样扎心:几张照片,省掉几百个机位。36氪小红书上,还有创作者花大约两个小时,和Astra一起搭出一座可以翻开的3D数字书架。小红书

微博话题#GPT6改变AI视频生产流程#下的高赞总结只有一句话:不生视频,却改了整个生产流程。微博这条微博776赞、89评,评论区问得最多的是:我明天就要交的片子,要不要换流程?
先给结论:这一轮变化是真的,但它改的是"前处理",不是"成片";值不值得跟,取决于你踩不踩得到下面说的三个条件。
一、为什么是"空间":模型脑子里确实有一张3D地图,但它自己转不稳
过去两年,多模态模型在空间问题上一直是"看得懂东西、认不清方位":图里有什么它如数家珍,你把镜头左移两步、问沙发背后是什么,它就瞎编。这轮不一样了。
9月9日前后,一份MirroS团队的解读文章把机制层的东西讲清楚了:论文《S-Space: Exploring Spatial Workspace in Multimodal Models》发现,多模态模型的中间层隐藏状态里存在一个沿水平、垂直、距离三个方向连续编码的三维坐标工作区。研究者不仅能从模型内部"读出"物体的坐标,还能直接改写坐标——把左推向右、近推向远,模型的空间判断会跟着变,而问它颜色这类非空间问题基本不受影响。更有意思的是,这张地图会自动脑补画面外的东西:守门员扑出画框时,没出现的球会被放在扑救方向。知乎
真正决定工作流价值的,是下面这组实验数字。在视角转换测试SpinBench上(以Qwen3.6-27B为例):模型直接回答,准确率60.96%;加思维链"多想几步",83.56%;先从内部S-Space读出坐标,交给外部程序做确定性的视角旋转,再回答,95.21%。知乎

翻译成人话:模型"脑中有地图,但还不会可靠地转动这张地图"。靠prompt让它硬想几何,永远有一段失败率尾巴——这就是为什么"一句话直接出电影"到现在还是做不到,而"Astra负责看懂空间、搭好场景,Blender/3D工具负责精确结构,视频模型负责渲染"这种分工流程突然变得可行。
需要泼一盆冷水的是:S-Space是可解释性研究,实验对象是Qwen等开源模型;把Astra的惊艳表现直接归因为"引入了S-space",是发布后一周里社区逐渐形成的叙事,并非官方逐条确认的技术路线。方向一致,但引用时别把它当官方文档。
二、它到底改了什么:把你从"抽卡工"挪回"导演位"
拿漫剧创作者最熟的纯抽卡流程和现在被刷爆的流程做个对照:
环节 | 抽卡流程 | Astra式流程 |
|---|---|---|
场景 | 提示词描述,每次生成每次飘 | 先生成/调用3D场景,空间一次定死 |
镜头 | 反复重roll碰运气 | 在3D场景里直接规划机位、运动路径 |
角色一致性 | 换镜头换脸,靠参考图硬拽 | 角色作为独立资产在场景中复用 |
出片 | 生成模型直出+大量废片 | 3D白模/预演确定后,再交视频模型渲染 |
返工成本 | 整段重抽 | 改机位/资产,不动其他镜头 |
Higgsfield给专业影视工作室演示的商用管线就是这个结构:Astra映射空间场景,建模人物关系,最后用Seedance 2.5生成连续视频,反馈的关键词是稳定性提升、抽卡率下降。微博国内这边,极顶数创9月9日展示的V2Fun工作流更进一步:给Astra一张挖掘机参考图,它先理解这台机器由哪些部分组成——驾驶舱、履带、底盘、动臂、斗杆、铲斗,复杂曲面件交给3D基础模型生成,规则件用Three.js程序化补齐,最后Astra统一装配成可继续编辑的混合资产。知乎这套分工背后的判断和S-Space研究完全一致:语言模型别去硬啃几何细节,让它做它擅长的理解、规划和调度。
小红书那条2231赞、2485收藏的流程视频评论区,恰好是这轮信息差最真实的样子:“blender搭建后,就直接交给seedance 吗?怎么给它”“我怎么没看明白?是让它操作blender直接生成视频?”“太复杂,做视频还有建3D 模型,直接输出电影不行吗?”小红书三个高赞困惑分别对应流程整合方式、工具衔接、以及"为什么不一步到位"。前两个已经有工程答案(用中间格式导出预演/深度图约束生成,各家平台适配进度不一),第三个的答案就在上面那组60.96%对95.21%里。有博主晒出的实测正好回答了"AI产出的到底是什么":一张产品参考图丢给Astra,回来的是三十多个可编辑实体、能直接在建模软件视口里继续调结构的真3D资产,而不是一张png。


三、先算三笔账,再决定跟不跟
第一笔:时间账。 这套流程省的是"抽卡时间",吃的是"搭景时间"。一个三机位同场景的对话戏,抽卡要roll十几次的功夫,换成先搭白模再定机位,第一次做可能更慢,第二次开始回本。判断标准很简单:你的内容里"同一个空间被反复使用"的比例——连载漫剧、固定场景短剧高,一次性氛围混剪低。
第二笔:钱账。 多个实测帖的共同反馈是"额度耗得快了"——有用户拿它和上一代对比后的原话就是:区别不是很大,就额度耗得快了。知乎Astra这类强调多步骤执行的模型,单任务上下文和工具调用量都比问答式用法大,官方评测口径里长上下文和电脑操作提升明显,代价就是API账单和订阅额度都不是上一代的水位。对已经按秒买视频生成算力的团队,新流程相当于在"生成费"之外加了"设计费",抽卡费下降多少,得自己拿样本跑一周才知道——这恰恰是该先小流量测试、而不是全组切换的原因。
第三笔:风险账。 这轮热度里混着两类要过滤的噪音。一类是"AGI教"式吹捧:“官方说这就是AGI”"杀死比赛"这类帖子互动极高,但它们描述的是发布会话术和个别Demo,不等于你手上项目的成功率。另一类明显更多了:知乎搜"GPT-6"按最新排序,前排大量以"不一定要先折腾海外卡和整套新SDK,换一个国内可用的endpoint就能先跑起来"开头、末尾引导到某个中转API站点的软文。知乎这类渠道的风险不是贵,而是模型名不副实——你在第三方接口里调到的"api-6-astra"到底是什么权重,没人能验证,项目数据去了哪里也没人替你签字。想尝鲜的普通创作者,优先走ChatGPT官方订阅内可用的入口,比任何中转都省事。
四、对不同人来说,这周该干什么
做连载漫剧/多镜头短剧的:值得现在就把Astra或同类具备3D规划能力的模型塞进"预演"环节试跑,拿一个旧本子做AB对照:同一段戏,抽卡流程vs先建场景流程,各记废片率、工时、费用。一周后数字会替你做决定。
做单条爆款/氛围混剪的:暂时不用动。你的成本大头在画面质感不在空间一致性,等渲染侧(Seedance这类)把3D约束变成一键选项再跟进,不至于掉队。
纯观望的轻度用户:可以把这轮当科普看——它回答了一个更大的问题:多模态大模型正从"看图说话"进入"理解物理空间",商汤首席科学家林达华那句"多模态的涌现时刻会在一两年内到来"的判断,和Astra、Atlas这两条线指向同一件事:空间智能是当前最确定的主战场。36氪
给家里换车的:顺手看一眼9月9日特斯拉HW4.0车型推送的座舱更新——接入本土大模型后,多模态对话已支持连续任务规划,语音助手从"听指令"进化为"懂意图",这些端侧应用正在把"多模态"变成购车清单上的隐性参数。知乎
接下来盯三个信号:一是Astra官方是否开放标准3D资产导出(决定"搭景"成果能不能复用进游戏/影视管线);二是各家跟进"不生视频、只改流程"的模型节奏——这轮发布潮里Gemini、Claude的新版本都在往电脑操作和空间理解上叠能力;三是第三方评测的废片率数据出来没有,那才是这笔账的最终答案。
一句话收尾:这一轮刷屏告诉你,AI视频的竞争从"谁抽得起卡"进入"谁先看懂空间"。工具会一直出新,但导演位只有一个——现在的问题不是Astra强不强,而是你愿不愿意从生成器前面,坐回到监视器后面。