3D贴图10分钟出活,转载新闻30分钟5连败:把鼠标交给GPT-6之前,先核对你的任务站在哪一边

源自166位全网作者

04:47

9月4日凌晨,OpenAI正式发布GPT-6 Astra,官方主打的卖点就一句话:这是全世界最强的"操作电脑"模型——像人一样看屏幕、点鼠标,哪怕软件没提供API,它也能替你操作。知乎知乎专栏

接下来的第一个周末,社区裂成了两半。

一位7小时烧掉Pro周额度70%的知乎用户盛赞。知乎Computer Use是"爆炸性的提升",“我肉眼都看不到他点了啥,刷的一下闪出一个界面,然后继续下一步”;6个多小时的长程任务,中途基本没偏离目标,“所有软件都可以通过它来控制”。

另一位自称"没收广、没恰饭"的重度用户,把自己每天最不需要动脑子的机械活交给它——从已购授权的新闻网站复制当天文章,粘到自己管理的网站后台发布,人工三分钟搞定。结果30分钟里连败5次:没正确识别网页、把后台"已发布"三个字当成"任务已完成"、漏掉整个栏目、连自动登录都搞不定,最后他手动登录都救不回来。知乎他的评价只有一句:与官方宣传视频严重失实。

都是真实订阅用户,同一周的实测记录,为什么评价能劈叉成这样?

我把知乎、B站、小红书近一周的实测记录和官方数据翻了一遍,结论先放这:分歧不在"模型强不强",而在三个变量——你交给它什么任务、你用什么设置用它、你在哪一天测它。在把鼠标交出去、烧自己的额度试错之前,这三个变量值得先核对一遍。

官方跑分里,其实已经写好了劈叉

先看两组数字。

在测"单个电脑操作任务"的OSWorld 2.0上,GPT-6 Astra得分72.6%,比上一代GPT-5.6 Sol的65.7%高出一截;完成任务的速度还快了约47%(约40分钟对约75分钟)。知乎专栏屏幕理解准确率ScreenSpot-Pro更是从76.9%直接拉到92.7%。知乎专栏这些数字不掺水——"点得准、点得快"确实大幅进步了。

但在模拟"复杂职业流程"的AutomationBench上,Astra得分41.4%。知乎相比Sol的18.1%是翻倍有余,可反过来读:像真实业务流程那样的任务,它有一多半做不完。知乎专栏

同一个模型,简单操作任务70%+,复杂流程不到50%。官方数字自己就承认了:这是个"会操作、但不一定办得成事"的模型。用户评价的两极,不过是这两条跑分在现实里的投影。

变量一:任务结构,决定它是"神"还是"废物"

把成功案例和失败案例逐个对齐,规律非常清楚。

被盛赞的任务,形态高度一致:

  • 小红书有用户让它做3D视差贴图,初次生成只花10分钟,“给我手搓估计得两天”(代价是烧掉两个Plus的5小时额度)。小红书

  • 技术博主鱼皮让它写3D城市生成器,18分钟交付,7项自动化测试全过。知乎专栏再做一段72秒的特洛伊战争3D动画,前后端全栈,19分钟交卷;

  • 连他那个失败的KiCad电路软件测试,前13分钟也是"打开项目、进PCB编辑器、导入网表、跑DRC规则检查",每一步界面流程全对。

3D贴图10分钟出活,转载新闻30分钟5连败:把鼠标交给GPT-6之前,先核对你的任务站在哪一边

被痛骂的任务,形态也高度一致:DBinary的新闻转载,卡在自动登录、跨页面记忆(记住哪些文章还没转)、和"什么算完成"的判断(把"已发布"三个字当成任务成功)这三道坎上。知乎另一位用户让它打开一个桌面软件,它反复说找不到,任务直接阻塞。知乎

归纳一下,成功率高有三个共性:目标一句话说得清;屏幕上的东西看得见、点得着;完成信号明确——测试通过、文件生成、图出来了,机器自己能验证。

失败率高也有三个共性:需要你的登录态和账号权限;需要跨页面、跨系统的记忆(“哪些做过了”);"做完"是个模糊状态,得靠它自己猜。

KiCad这个案例尤其值得多看一眼:官方演示里,Astra把元器件摆放、铜线布线全部自己完成,直接产出可生产的PCB图。知乎专栏而实机测试里,界面流程全对,最后"正确的布局和布线"没完成。知乎专栏

3D贴图10分钟出活,转载新闻30分钟5连败:把鼠标交给GPT-6之前,先核对你的任务站在哪一边

操作界面和专业判断是两回事——前者是它被跑分证明了的强项,后者还远没到。

变量二:设置不对,你可能根本没见到它的真实水平

两条被实测验证过的用法,比任何"要不要升级套餐"的讨论都更省钱:

第一,别用低推理档位指望它操作电脑。那位被桌面软件阻塞的用户后来发现原因:用astra low时,控制电脑彻底失败;新开会话换astra high,computer use立刻能用了。知乎而烧掉70%周额度的那位重度用户,分工更细:xhigh制定方案,high执行,长程任务6小时不跑偏。知乎

3D贴图10分钟出活,转载新闻30分钟5连败:把鼠标交给GPT-6之前,先核对你的任务站在哪一边

第二,你的老"防御性prompt"可能在拖后腿。B站连续48小时实测的Topbook给了个反直觉结论:正因为旧模型不够聪明,大家习惯了在提示词里加大量限制和说明;到了GPT-6这一代,这些约束反而限制它的发挥——减少限制、给足空间,它反而能做得更好。哔哩哔哩这和DBinary在记录末尾主动贴出自己"开骂前的前缀prompt"的失败案例形成了互证:翻车的原因,可能不在模型,而在你还用给上一代模型写的说明书在指挥它。

变量三:在哪一天测,决定你得到哪个结论

这是发布周最容易踩的坑。

9月5日盛赞"爆炸性提升"的那位20x用户,在9月6日、7日连写两条更新:“我宣布AGI持续了一天”——任务一长又开始过度思考、不推进项目;7日更糟,“Astra high和之前的降智版sol差不多了”,连Computer Use都"又开始慢慢点,半天找不到位置"。他的原话是"发布才几天啊"。知乎

这不是个例。同期知乎上就有多人讨论"大规模路由降智":高并发时Astra经常被路由到GPT-4o——问它知识库截止日期,它答2024年6月。知乎发布周末流量挤爆,模型被悄悄换成小的,体验自然断崖。

所以这几天所有的实测帖,都该先问一句:你哪天测的?被路由了吗?Day 1的结论和Day 3的结论,可能说的是两个完全不同的模型。你现在上手遇到的,也未必是下周稳定后的那个Astra。

就算它成功了,你也别当那个不验收就签字的人

最后一个变量,其实在用户自己身上。

知乎一篇高赞长文说得透:Astra在OSWorld拿72.6%、在AutomationBench只有41.4%,说明它已经能干很多活了,同时又远没到可以不验收的程度。知乎作者打了个比方——用它干活像当塔台:你不必亲自驾驶每一架飞机,但得知道哪架缺油、哪架偏航、哪两架正在抢同一条跑道。

最危险的不是它明显报错,而是"看起来八十分、能交差"的产出。它40分钟交回来,后面还有九个任务排队,你很容易扫一眼就点"继续"——坑就是这么埋下的。KiCad那份"流程全对、布线没完成"的答卷,就是标准的八十分产出。知乎

3D贴图10分钟出活,转载新闻30分钟5连败:把鼠标交给GPT-6之前,先核对你的任务站在哪一边

还有一种清醒的声音值得听:点赞最高的批判性回答(851赞)认为,GPT-6这一代"只有图形界面操作电脑的能力提高了",而这个方向本身存疑——在AI能直接写代码的时代,未来越来越多的软件会主动提供API,模拟人手点击更像一个过渡性的商业方向,“和AGI没有关系”。知乎这话未必全对,但至少提醒:别把整套工作流押注在"GUI操作"这一条腿上。

核对清单:到底能不能把活交给它

综合这一周跨平台的实测记录,给想现在就上手的人一份可执行的核对单:

现在就能交的活:目标明确、完成信号清晰、不需要你登录态的单次生成任务——贴图、网页、动画、数据可视化,以及软件内部的界面流程操作。

先别交的活:任何涉及账号登录、支付、发布权限的流程;需要跨系统记忆"哪些做过了"的任务;以及你没时间逐项验收的东西。

用法四条

  1. 电脑操作类任务,推理档位从high起步,方案规划用xhigh;

  2. 删掉那些为旧模型写的限制型prompt,给目标、少给步骤;

  3. 避开高并发时段,遇到疑似降智(反应变慢、答非所问、自称旧模型),换个时段重测再下结论;

  4. 长任务设人工检查点,对"看起来八十分"的产出默认存疑,验收标准在开工前写清楚。

接下来值得盯的信号:路由降智是否随推送扩大而收敛;Google那边同样在做Computer Use的Gemini 3.5 Flash预览版何时开放对比;以及软件厂商会不会像批判者预言的那样,加速给AI开API——那才是"操作电脑"这条路线的真正考题。

GPT-6 Astra此刻最公允的评价大概是:它把"AI操作电脑"从宣传片推进到了"能用、但必须验收"的阶段。跑分里那个72.6%,是它被盛赞"点击快得看不见"的部分;那个41.4%,是它30分钟办砸一件3分钟小事的部分。把鼠标交出去之前,先看看你的任务站在哪一边。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章