OpenAI喊"AGI",傅盛疑"千年老二":GPT-6 Astra贵2.5倍逐条对账,到底谁更便宜?

源自33位全网作者

04:02

9月4日凌晨,OpenAI把新一代旗舰模型GPT-6 Astra推上线,总裁Greg Brockman在电话会上直接喊出"欢迎来到AGI时代",还说"AI的综合智力彻底碾压人类"。界面新闻新智元 同一天下午四点,傅盛在B站发了条视频,标题反着来:《GPT-6 Astra终于发布,王者归来还是千年老二,揭秘宣传中的三个猫腻》。哔哩哔哩 这条视频3297播放、59赞、36收藏——比他平时的数据安静得多。但问题对天天跟着傅盛日更学AI、用他8.5折中转站调模型的人来说是真金白银的:官方的"AGI时代"和傅盛的"猫腻",到底该信谁?我翻了官方定价页的转载、界面新闻和量子位两家媒体的快讯、小红书当天二十来条实测帖、还有傅盛视频底下的热评,把"贵2.5倍"这个数字拆开对账。结论先行:"2.5倍"是名义价,有一批人实际会花得更少,另一批人连"能不能用上"都还没轮到自己。

先把官方那张价目表看全

界面新闻拿到的定价是:Astra每百万Token输入10美元、输出50美元,是上一代GPT-5.6 Sol(输入4美元、输出20美元)的2.5倍,跟Claude Fable5.1基本持平。界面新闻 但这张表上有三个小格子,多数转发只字不提:

  • 缓存读取直接砍90%:命中缓存的输入只要1美元/百万Token;缓存写入加价25%,12.5美元/百万Token。

  • 五级推理强度,从low到max,按任务难度自己挑。

  • 长上下文溢价:上海交大的王烁老师在小红书整理的口径里写得最细——单次请求输入一旦超过27.2万Token,整次请求按更高费率走:输入和缓存翻2倍、输出加50%。小红书 也就是说,105万的上下文窗口是"能装",不是"该装满"。

OpenAI喊

傅盛在标题里说要揭秘"三个猫腻",视频没挂文字稿,我没能拿到他逐条列的原文。但拿价目表和发布会材料对一遍,宣传口径里至少有三处"有解释空间的表述"是实打实能核对的,下面逐条来。

对账第一笔:"AGI时代"这句话,没有可核对的数字

发布会亮出来的成绩确实猛:FrontierMath Tier 4拿到97.6%(逼近98%饱和线)、ARC-AGI-3飙到99.9%、ExploitBench漏洞利用满分。新智元 这也是OpenAI迄今最大算力训出来的模型,还是它首个由前代AI在训练监督中发挥重要作用的模型。

问题出在"Brockman宣布AGI实现"这半句。他的口径是"综合智力碾压人类"——这个说法没有任何基准对应,属于定义权之争。傅盛视频下面点赞最高的评论(6赞、13条回复)就怼了这一句:这次只不过大幅下调AGI的定义,然后声称自己实现了。哔哩哔哩 这条评论还顺手翻旧账:这个剧本之前Sora就上过一次当。评论区里立刻有人回怼:先去看成品,GPT6做出的3D游戏开发确实惊艳。

也得给跑分说句公道话:Epoch AI和曼彻斯特大学发布的FrontierMath Erdős基准里,68道人类未解题,GPT-6 Astra是唯一得分的模型(5道,得分率3%),同场的GPT-5.6 Sol、Claude Fable 5.1等四个模型全交白卷——这份"从0到1"是以前跑分测不出来的。知乎 但同一批发布材料里也有反向的线:官方图表一边给ExploitBench漏洞利用标了100%满分,另一边ExploitGym蜜罐成功率上代5.6 Sol是48.2%、Astra是0.0%。同一个"网络安全SOTA",两张官方图能讲出两个故事——这正是"宣传中的猫腻"该看的颗粒度。

OpenAI喊

对账第二笔:"贵2.5倍"是挂牌价,不是人人都在付的价

拿一个具体任务算账(数字全部按上面官方价目表折算,是我给的演算,不是官方结论):一次Agent任务,输入10万Token、输出2万Token。

  • GPT-5.6 Sol:0.1×4+0.02×20=约0.8美元

  • GPT-6 Astra不命中缓存:0.1×10+0.02×50=2美元,确实是2.5倍;

  • GPT-6 Astra如果输入大部分命中缓存(长会话、重复system prompt、反复在同一份文档上干活——这正是挂Agent跑任务的标准形态):0.1×1+0.02×50=1.1美元

OpenAI喊

再叠一层"返工账"。王烁那篇帖子里的逻辑值得抄作业:旧模型平均要尝试5次、还需要人工修改40分钟,新模型两次完成、人工只检查10分钟的话,最后的业务成本可能反而更低。小红书 他给的企业采购结论也干脆:不要按"最强模型"采购,也不要按"最低Token价"采购,按自己的业务基准算单个成功任务成本。

档位里还藏着一个反直觉实测:有人拿同一道题——真刀真枪在Godot游戏引擎里做一个3D版刺猬索尼克——分别用max档和medium档跑,max档53分钟、烧4%周额度,medium档25分钟、1%额度,两边都交卷。小红书 贵的档不是"更快的档",是"想得更深的档",杀鸡用牛刀,牛刀既贵又慢。提醒一句:这是单个样本的个人实测,只能当信号,不能当定律。做AI落地的作者"Levi"汇总的档位对比也指向同一边:Astra Medium的跑分摸到了上代Sol Max、钱少花一半。小红书 具体到你自己,还是那句话:拿自己的活各跑一遍。

OpenAI喊

对账第三笔:“发布了"不等于"你现在能用上”

官方写的是分阶段节奏:Astra先向"可信访问"(Trusted Access)和Daybreak网络安全项目里的有限企业组织开放,未来几天才陆续覆盖Plus、Pro、Business、Enterprise订阅,再走API和亚马逊AWS。界面新闻 新智元的稿子末尾自己就提了一句:一点小遗憾,GPT-6 Astra还得再等等。新智元

但订阅侧的体感已经先崩了——有用户实测Plus额度卡打满后,跑Astra"不到3分钟就又限额",怀疑要开更贵的套餐。小红书 还有人一天把额度跑冒烟,吐槽他比我聪明能干多了,但是我比他贵超多,所以替代不了我。小红书 所以"该不该切换"对相当一部分订阅用户还是个伪问题——额度政策没出齐之前,任何"首发尝鲜"都是溢价消费。

傅盛这篇,该用什么姿势听

把他最近的日更摊开看:8月10日他发视频说"对OpenAI的预言成真,Atlas浏览器正式关停"——这条确实应验了,是他内容里可信度较高的部分。哔哩哔哩 9月2、3日他连着两条视频护龙虾(OpenClaw生态),立场也写在明面上——他自己卖8.5折Token中转、做"猎豹AI实战派"课程、给300万粉日更要流量。

所以GPT-6这条视频,他的"劝你别急着信宣传"和成本对账的结论方向是一致的,这属于该听的;但他既靠"第一批实测内容"吃流量、又靠中转站在你升级时多出货,这属于要留心眼的:他说"有猫腻"不需要你全信,他自己也不需要你全信——你需要的是拿着上面那张价目表自己算。

谁该动,谁该装:一张切换决策卡

  • 挂Agent重度用户(长会话、重复上下文多):值得认真切,切之前把system prompt和常驻文档做缓存,缓存价才是你的真实单价;同时盯住27.2万Token的溢价线,别把整个知识库一次塞进去。

  • 轻量聊天、简单分类任务:不动。5.6 Sol该便宜还是便宜,Astra的溢价买不到你的体验差。

  • Plus/Pro订阅用户:等官方额度和套餐口径全放开再说,窗口期别去站外买"代开""合租额度"之类的灰色货。

  • 等国产开源的:傅盛评论区那句"没几个月国产大模型也会弄出不亚于GPT6最高性能的模型来还开源"目前只是许诺,不是现实,验证信号看各家基准发布,不看评论区。哔哩哔哩

OpenAI喊

继续盯的三个信号:Astra缓存计费的官方细则(判断你的Agent真实月成本)、中转站是否跟进8.5折上架Astra(判断傅盛这次"猫腻"视频到底是判断还是生意)、以及medium/max档的更多第三方同题实测(判断档位选择的普适性)。傅盛下一期日更大概率会把这三条里的一条做成标题——到时候,你可以拿这篇的价目表先对一遍再点进去。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章