9月3日,OpenAI发布GPT-6 Astra,发布会尾声,总裁Brockman甩出一句"欢迎来到AGI时代"。9月8日,它向Plus、Pro、Business、Enterprise全面开放。微博知乎
接下来的9天,热闹和争议一起涨:知乎"GPT-6电脑操作自动化"话题浏览冲到57万。 B站两天内冒出"让GPT-6操作AE"的实操教程。 小红书那条发布资讯帖拿了4371赞、1227收藏。知乎哔哩哔哩小红书
但真正说明"大家不缺瓜、缺清单"的是另一条帖:一条"对科研人最正确的打开方式"的用法帖,3216赞、4700收藏——收藏量比发布资讯帖还高出一大截。小红书
围观完这9天,我的结论先放这:让AI碰你的鼠标之前,先把三本账对完——哪些活值得交、从哪儿交给它、额度这笔账怎么算。下面每一条都来自这9天的实测帖、权限清单和费率表,不是发布会PPT。
先把"操作电脑"拆成三层:你刷到的演示,一半根本没碰你的机器
折腾了大半年"AI操作电脑"的知乎账号"数智罗盘",把这个词拆成了三层:一是它告诉你怎么操作,键还是你按;二是它在云端沙箱里替你跑,你交文件、拿结果;三是直接读写你的硬盘、驱动你装的软件、在你的浏览器上点按钮。他说试了一圈才发现,市面上多数产品给的是前两种。三层的风险量级完全不同——只有第三层,你的备份习惯、账号权限、审计日志才会变成真问题。知乎
再看数字,口径必须分开。官方自报的:ARC-AGI-3从上一代20%以下的水平跳到99.9%,GPQA Diamond 96%,Terminal-Bench 4.0(真实多步编码任务)57.9%,幻觉率从9.4%降到2%——但注意,这些全是厂商自报的口径。央视财经给这次升级的定性倒是一句话就说清了:从"提供答案"转向"完成任务"。知乎央视财经
自报数字里最该被记住的反而是Terminal-Bench那个:57.9%,意味着约四成复杂任务仍然完不成。第三方这边也有两条:CMU和斯坦福做的智能体基准OSWorld 2.0上,Astra拿了72.6分。另一个,Agent Arena出炉,Astra仅次于Fable 5.1——别忘了,Anthropic正是在Astra发布前两天推出的Claude Fable 5.1和Mythos 5.1。"操作电脑"是全行业一起踩油门,不是某一家解锁了技能,也还没到分输赢的时候。知乎知乎小红书
第一本账:哪些活敢交、哪些别交
"数智罗盘"踩坑半年换回来的风险分级,提效党值得直接抄下来。知乎
绿档,直接交:多表汇总、格式统一、批量重命名、PDF字段提取、定时周期任务。
黄档,先在副本上跑:覆盖式修改原文件、跨目录移动、自动发送消息邮件、业务表单录入。
红档,要审批、分批、留痕:批量删除、财务人事客户数据写入、生产系统操作——一切不可逆动作。
他的三个坑都带具体代价:让AI直接对原文件批量改格式,跑完发现一批页眉被改坏——“最危险的不是报错,是它不报错但结果错了”;让它"把文件夹整理得有条理",它按自己的习惯分了类,返工更久——它能执行规则,不能替你定义规则。最隐蔽的一条是概念错位:程序在你本机跑≠数据不出本机,只要接的是公有云API,完成任务必需的文件内容照样发给服务商——执行位置和数据流向,是两个维度。知乎
反方声音也得并排放。知乎一位做落地的人提醒:"演示视频看着吓人,是把路面全扫干净了才跑得通。"真干活的环境里,到处是好几年没人管的破烂接口、格式乱七八糟的报文、压根没写进文档的历史特例——扔进泥潭,它容易自作聪明把异常当数据洗了,搞出事故。所以验证流程建议原样照抄:先副本跑通→小批量验证→全量执行→抽样复核。再加两条边界:验证码、短信验证这类强人机环节,就是"它死你上"的位置;页面改版、结构异常时它会断,需要你修。知乎知乎
第二本账:从哪儿交给它——“不是给AI更多钥匙,而是给它一间独立办公室”
知乎"数据与AI爱好者"Kevin现在每天带两台电脑上班:主力机给人用,另一台专门放AI Agent——让它自己开网页、操作软件、连续跑几十步。被问"敢不敢让AI在你的主力电脑上自由行动",他的回答是"不太愿意"。知乎
市面上的独立算力配件,逻辑和他完全一致:不给AI更多系统权限,而是直接给它一台自带处理器、内存和系统的小设备,模型还能自带Key随便换。知乎
没有备用机,最低配是把这五步权限检查做一遍,做完才谈放权。知乎
系统权限三件套逐条问:“完全磁盘访问”“辅助功能”“自动化控制”,用不上就关;
执行环境要隔离:高危动作前有二次确认、删除先进回收站,这两项没有就别放权;
审计日志要有、能查、不能改——出事时你最感谢的就是它;
账号物理隔离:主力邮箱、主支付、密码管理器,不要出现在AI操作的机器和浏览器里;
关键目录先备份,出问题能回滚。
知乎"林杰"总结过一句我认为是这一层的核心:把控制写进流程,而不是写在提醒里。AI是否尊重授权、证据不足时会不会停下来、操作有没有留痕可复查——这三点才是"数字员工"和"事故发生器"的分界线。知乎
第三本账:额度——单价×2.5,不等于任务成本×2.5
如果一项电脑任务从75分钟缩到40分钟,你敢不敢把鼠标交出去?省下的时间很诱人,做错以后收拾要花多久,同样得算。这笔账分三层。第一层,API单价确实涨了:输入10美元、输出50美元一百万token,是上一代的2.5倍,还得有境外支付方式。但官方同时给的口径是"编程Agent成本降50%"。 两个数不打架:你支付的是单价×轮次,一次过的事总账未必贵,便宜模型反复重做才叫真贵。知乎微博知乎
第二层,别把模型当一堵墙用。知乎"迷路"把Astra、5.6 Sol、5.5比作三位资历不同、收费不同的助手:日常杂活交给单位费率更低的Sol,跨软件、错一步就返工的复杂活再上Astra,跑顺手的5.5留着做对照。还有个容易忽略的开关:快速模式按标准费率的2.5倍扣额度,它不是免费加速。知乎
第三层,额度窗口和大盘。5小时滚动窗口已经成了小行业,“如何一天蹬Astra三次"的核心就一句:你第一次什么时候触发,会直接决定后面一整天的刷新节奏——额度按窗口用,不是按自然日用。另一边,有人"12天,Astra就是我的神”,一个星期的token量一口气跑完。 "干活快,额度也掉得快"则是这9天最一致的实测。36氪周观察的原话更直接:Astra拓展Agent边界,Google意外受益于tokenmaxxing——OpenAI把自己的额度烧紧了。你时间线里刷屏的3D建模演示,都是用token堆出来的;真上手,请盯紧扣额面板。知乎小红书36氪
隐藏的一本账:你囤的AGENTS.md,可能正在倒贴
小红书用户森森转述了Astra官方指南里最容易漏的提醒:升级模型后,最好重新检查一遍Skills和AGENTS.md。Astra对长期指令更敏感——规则写太多、互相冲突,会让它频繁找确认、扩大测试范围,甚至执行到一半停下来。他自己让Astra审计了一遍:AGENTS.md被压缩到原来的约1/6,还找出了22个建议暂停的开发类Skills。微博上正在测试GPT-6的开发者也有同感:这玩意已经不能用传统提示词、甚至Skill的方式来测试,而是只能扔给它一个真正的工程看结果。这是"越用越顺"最容易被忽略的迁移成本:你为弱模型调教的指令库,强模型可能当噪音。换主力模型前,给指令库做一次大扫除的时间,算进升级成本里。小红书微博
提效党的决策线:现在动,还是再等等
轻度(只用AI写方案、总结):暂时什么都不用动。"操作电脑"的第一层你早就在用;等第三方复现落地、国产方案跟进,再升级不迟。
中度(日常在用Agent/编程工具):本周值得做的不是换模型,而是把上面两张清单走一遍——权限五步检查+Skills/AGENTS.md清理。这两件事不依赖任何新模型,做完长期受用。
深度(愿意折腾海外订阅的):从绿档任务开始交,第一次别超过10个步骤、别碰不可逆操作,把你自己踩出来的"别交清单"记下来。57万浏览的演示不是你的工作环境,那约四成会失败的任务里,恰好有你工作最重要那部分的可能性,目前没人能排除。
Brockman说AGI来了,落地的人说路面是扫干净才跑的——两句话都对:它确实快了,判断也确实没法外包。接下来盯三个信号。第一个是OSWorld、ARC这些跑分的第三方完整复现。第二个是订阅窗口会不会重新放开——9月9日OpenAI产品负责人Tibo已经预警,Astra需求"前所未有",再这么下去可能不得不暂停新的Pro订阅。 第三个是国产办公Agent什么时候把同等能力做到国内付得起的价位——WPS表格Agent已经三个月内第三次登顶国际权威评测了。知乎36氪
你交过什么活给AI、被反噬过什么?评论区报个到,把"别交清单"一起凑齐。