GPT-6 Astra"一张图盖房子"刷屏:建筑党挑完户型再算账单,3D设计师的三本账都变了
这两天你刷到的三维设计内容,大概率是同样几条视频:一张室内照片丢给 GPT-6 Astra,它在 Blender 里原样重建了一整间房,地上的玩具、电器和家具都是可手动调整的独立几何,最后打包成本地应用,60 帧随便走;一张手绘蒸汽火车草图,重建出 3295 个可编辑对象,车轮连杆锅炉全有独立几何,还能拆开继续改。微博两张苹果总部的图,直接吐出一支企业宣传片。微博
这些演示来自 OpenAI 北京时间 9 月 4 日凌晨发布的新一代旗舰模型 GPT-6 Astra。微博总裁 Greg Brockman 那句"欢迎来到 AGI 时代"让全网吵了一个周末,知乎一天里冒出十几篇高热回答和专栏。但对靠 Blender、3ds Max、CAD 吃饭的人来说,AGI 来没来不是重点——重点是这次官方演示里,第一次把我们的生产软件当主角:官方宣传片展示了它独立操作 KiCad 画 PCB、在 Unity 搭 3D 城市、用 Blender 和 FreeCAD 制作机械结构。微博能不能用、要多少钱、哪段工时保不住,这三本账得当场算清楚。我把官方发布材料、第三方评测、B 站视频评论区和微博搬运实测翻了一遍,账目如下。
第一本账:跑分里,真正跟 3D 有关的是两项
Astra 这次的成绩单很长,但跟三维设计直接相关的其实就两项。
第一项是 BenchCAD——在 BenchCAD 中,模型需要根据多个视角的渲染图,用代码重建 3D 物体。知乎这个测试集 8 月中旬就在工业软件圈用过,当时 GPT5.6 优于 Fable/Opus5、KimiK3,考的正是识别零件图并创建对应 CAD 代码。知乎这次 Astra 拿了 95.9%,上一代 Sol 是 83.3%,直接跳到了第一。知乎注意它的口径:“看懂图纸、生成参数化建模代码”,不是艺术雕刻,更不是 sculpt 手办。
第二项是电脑操作本身。OSWorld 2.0(把模型扔进真电脑里干活)完成率 72.6%,平均 40 分钟一个任务;上一代 Sol 是 65.7%、要 75 分钟。微博看屏幕并精准点到该点位置的 ScreenSpot-Pro,从 76.9% 干到 92.7%。知乎翻译成人话:AI 替你操作建模软件这件事,这次是真的换代了,而不是演示技巧。
至于刷屏用的其它数字,得学会打折。被引最多的 ARC-AGI-3"接近满分",ARC Prize 官方直接质疑:定制适配器允许保留推理状态,等于开卷考试。微博独立评测机构 Artificial Analysis 当天的报告更冷静:综合智能指数 Astra 61 分,和上一代 Sol 打平,比两天前刚发布的 Claude Fable 5.1 还低 5 分。知乎编程侧 DeepSWE 74.1% 对 Claude Opus 5 的 73.7%,几乎持平,算不上碾压。微博
所以对三维用户的判断是:"看懂图、操作软件、写建模代码"这三项提升是真信号,"世界第一智能"是发布会话术,两件事别混着信。
第二本账:演示跑通了全流程,翻车在"住人"和"素材哪来的"
先说跑通的部分。按流传最广的那条搬运视频(B 站 2.7 万播放)的展示,从概念描述 → 写 Python 代码 → Blender 搭场景 → 调黄金时段光影 → 导入 UE5 打包成可交互漫游 App,全程模型独立完成,无界面渲染之后还会自己检查画面、自己纠错。B站这在以前是一支可视化团队的活:你将以这种方式在房子存在之前就能看到它,如今这样的可视化服务需要一家工作室与建筑师和 3D 艺术家合作才能完成。微博
再说翻车的部分,就在同一条视频的评论区。做室内效果图的设计师逐条挑户型——沙发面朝正门,背对后门,你要看什么?B站油烟机在哪、为什么摆两张餐桌、书柜为什么挡在桌子后面,一条条都有人指。随后是那句高赞:"艺术性确实不错,但是实用性……"再随后又有人纠正说那不是第二张餐桌,是岛台——这个争论本身恰恰说明问题:AI 产出的是"拍照好看的空间",不是"住人的空间",而平面逻辑、动线、设备位这些恰恰是初中级从业者现在赖以接单的部分。
另一处至今没人解释清楚的是素材来源。评论区那句"資產是AI生成的,還是抓取來的"的追问,官方到现在没有回应。B站连专门拆解 Astra 如何驱动 Blender 的技术向视频下面,也有判断认为"你确定那张桌子的花纹是模型自己做的"、它可能更擅长调用素材库。B站官方演示没有展示每个家具的生成过程,所以"重建一间房"到底是逐件建模,还是识别语义后拼装模型库——这个区别对游戏行业意味着版权和可编辑性的天壤之别,目前存疑。
第三本账:牌价翻倍,跑分任务变便宜,但你的 3D 任务两头不占
API 牌价:输入 10 美元/百万 token、输出 50 美元/百万 token,和 Fable 5.1 完全同价,是上一代 Sol 促销价的 2.5 倍。微博长上下文更狠:输入和输出价格涨到了原来的 2.5 倍之后,一旦达到或超过 272K,输入变成 20 美元/百万 Token、输出 75 美元,按长上下文价格看它已经是目前最贵的主流大模型;缓存读取也只有 Fable 5.1 的四分之一。另有 Fast 模式,速度最高 2.5 倍、价格翻倍。企业版默认关闭,要管理员手动打开。知乎
但第三方和官方给出的"每任务成本"又是另一个故事。Artificial Analysis 的口径:Astra 平均输出 token 约 17K,Fable 5.1 要 45K,所以单任务成本 1.67 美元——不到 Fable 5.1 的一半。知乎对比上一代,同样的任务 Astra 要花 1.67 美元,Sol 是 0.94 美元——智能一分没涨,成本快翻倍。知乎OpenAI 自己的说法则更激进:单任务 API 成本比 Fable 5.1 低约 63%。微博牌价、效率、缓存命中率三张表,谁都在挑对自己有利的口径。
真正该警惕的是:这些"单任务成本"都是通用任务的平均值,不是你的场景重建账单。B 站有人拿 Blender 分别用 Fable 5.1 和 Astra 跑同一个别墅场景做横评,配文直接挂出"#GPT6消耗的Token量惊人#"的话题。微博演示视频评论区里,"这得要不少token先生"几乎是最常见的追问。Agent 式建模几十步"读图—写代码—渲染—自检—改错"的循环,token 消耗跟着任务长度涨,官方在 ARC-AGI-3 被质疑"开卷"的同时,也没公布过 3D 长任务的成本口径。
同一个作业还有便宜解法:有 UP 主横评后称 Kimi K3 做场景建模"效果不错",账单 2.3 美元,而 Fable 5.1 的表现被评价为"有点降智/偷懒"。B站小红书那边 Fable 5.1 的拥趸则晒出案例:用了三轮对话,构建出一整个长城3D。小红书一句话:这轮之后,按"次"报价的建模外包,先要重算的不是工时,是不同模型的 token 效率差。
谁该动一动了
建筑表现 / 室内设计师:短期掉价的是漫游动画、UE5 演示打包这类"展示层"交付——这是演示直接跑通的链路;短期掉不了的是户型合理性、动线、设备位、施工可行性——这是被评论区逐条挑错的部分。可以今天就试的:拿低附加值的任务(多版草案、视角补渲)喂给它,但提示词结尾学官方开发者馆的套路,补上一句让 AI 在浏览器里自己跑几局、碰撞计分失败重开全验一遍、控制台不许报错——同一个模型,有没有这句验收条款,出活差一个档次。知乎
游戏场景 / TA:值得盯的是"场景代码 → Blender → 渲染"这条视频生产管线,一句话描述场景,Astra 生成 3D 场景代码、规划空间与镜头,Blender 搭建,Seedance 渲染,AI 视频正在从"反复抽卡"走向"先设计,再生成"。微博但别为渲染图买单,为几何可编辑性和素材来源买单——这两样官方至今没证明。
工业 / CAD 方向:BenchCAD 95.9% 打的就是"图纸 → 参数化模型"这条线,知乎上已经有文章标题直接写"GPT 6 Astra CAD建模能力达新高,国产工业软件差距又拉大"。知乎接下来盯它能不能稳定输出带特征树的 STEP 文件,而不是渲染好看的重建。
学生党:普通用户现在还排队呢——首批只开放给 OpenAI 网络安全项目 Daybreak 的少数机构,未来几天陆续推送到 ChatGPT Plus、Pro、Business、Enterprise 用户以及 API。微博这时候出来卖"Astra 建模变现课"的,是第一波该捂紧钱包的对象。
继续观察四个信号:演示素材来源有没有官方回应;BenchCAD 有没有第三方裸模型复测(参照 ARC 的教训);Kimi K3、GLM 这批国产模型什么时候把"操作 Blender"跑进价格战;Fable 5.1 会不会跟进降价——它已经先手把缓存读取砍了 75%。知乎
跑分是厂商的考场,工作流才是你的考场。上一波"大模型在 Blender 里造东西"的热闹,翻车的是 9876 端口和第一版账单;这一波官方亲自下场,翻车点换成了户型和素材来源。能确定的是:当建模这件事以后被叫作"古法手工"的时候——评论区已经有人开始快进这个称呼了,“快進到建模 被稱呼爲古法手工建模”——第一批涨价的恰恰是那些能挑出沙发该朝哪边的人。B站