9月30日凌晨,OpenAI DevDay 2026一口气发布了20多项更新,这场的主角不是模型,是"AI员工":常驻智能体Dots由GPT-6Astra驱动、自带一台带浏览器的云电脑、可连接用户授权的应用,给个目标就24小时在后台推进,上下文还能横跨ChatGPT、Slack、Teams和短信。 同一晚,Manus回魂发布2.0并推出全天候智能体Cue。 隔天Anthropic的Sonnet 5.5发布:性能逼近Opus 5.5,单任务成本最高降30%。 10月1日,谷歌发布Gemini 4 Argon,把单次输出上限从6.4万提到100万——云端在集体卖"不用你盯着,AI自己上班"。微博36氪36氪
而本地这头,B站这两天也密集出现"真正的本地(24小时)在线的AI员工openclaw"和"把团队的AI算力彻底私有化"的教程与实测视频。 本地党这周绕不开一个决定:"雇个AI员工"这事,云端和本地到底哪边现在能上岗?我把两边的14条可核数字摆进一张表,先对数,再对立场。哔哩哔哩哔哩哔哩
一、两边这周各自的报价和翻车现场
云端这周的价目表是双向变动的:新模型GPT-6.1Sol按官方标准API定价,输入和输出费用分别是GPT-6Astra的五分之一,纯干活变便宜了。 但想要"员工",是新开的ChatGPT Pro500档,一个月500美元,约合人民币3600元,一年下来4万3。 同时还有用户反馈,老Pro用户的额度被砍了半。 也就是说,重度用户的处境是一边API降价、一边订阅收紧,两头都在变。微博微博微博
更扎眼的是翻车信号:DevDay现场本身就出了发布事故,微博上还有人直言"Dots这玩意不就是抄muse的作业吗"——Meta Muse已先跑商业化,股价还涨了。36氪微博
然后是这周本地社区传得最热的一条:小红书上一篇《别用OpenAI Dots!一觉醒来代码没了》的自述帖(作者"人间漂流"),说辛辛苦苦配了一下午环境、拿Dots跑过夜任务,第二天睁眼代码仓库连渣都不剩。帖子列的排查细节相当具体:平台后台半夜偷偷重建了一次容器,工作区直接出厂格式化,/workspace/shared只剩416KB的默认空文件夹。 智能体沙箱的根目录和/home/agent全是tmpfs内存盘,环境一重启改动当场归零;非443端口全部丢包、提权报EPERM、常驻daemon被平台屏蔽;讽刺的是浏览器里的账号登录态还在——登录态绑在云端profile上,你的文件在"云电脑本地盘"上,而那块盘是租的。小红书
需要说清楚:这是单篇个人自述,官方没有回应,个案不能当结论。但它指出的架构事实值得每个想上云的人对一遍:云电脑卖的不是"你的电脑",是"平台随时可以重装的电脑"。
本地这一侧的镜像问题正好相反:它不会半夜删你的文件,但它可能根本干不完活。
二、本地AI员工的实测家底:14条数据摆一张表
# | 数据点 | 出处与口径 |
|---|---|---|
1 | Dots订阅:Pro500档,$500/月≈¥3600 | OpenAI DevDay(微博多篇报道) |
2 | GPT-6.1Sol API:单价为GPT-6Astra的1/5 | 微博多篇报道 |
3 | 老Pro用户:额度砍半(用户反馈口径) | 微博头条文章 |
4 | Sonnet 5.5:性能逼近Opus 5.5,单任务成本最高降30% | 36氪 9/29 |
5 | Gemini 4 Argon:单次输出上限6.4万→100万 | 36氪 10/1 |
6 | Dots个案:/workspace被半夜重建后只剩416KB | 小红书个人自述,非官方结论 |
7 | Dots个案:沙箱/home/agent全为tmpfs内存盘 | 同上 |
8 | Dots个案:非443端口丢包、提权EPERM | 同上 |
9 | Bonsai2-27B(5.9GB、跑分保留98.2%):agent任务0/6 | 本站前文实测 |
10 | FastBrowserUse:Qwen3.5 4B本地操作浏览器,准确率75%+ | B站实测 9/29 |
11 | Hindsight中文长期记忆:默认2/12题排第一,换两个多语言模型后11/12 | B站本机Ollama实测 9/30,博主注明样本小 |
12 | NInfer+GSQ-RCO:16G跑Qwen3.8-27B,解码120+ tok/s,160K上下文可选 | B站实测 9/30 |
13 | 长上下文体感:塞10万字,首字等4分钟 | B站实测 9/28 |
14 | 能力与成本锚点:qwen3.8-flash-next Q8≈国模前五、电费已低于token plan;重度订阅口径月耗4亿token;顶配机约7-10万 | 知乎高赞回答(112万播放问题) |
这张表里,本地侧的能力是"四科各有一道真题":
任务关:本站前文实测过的Bonsai2-27B,5.9GB跑27B、官方跑分保留98.2%“智商”,agent任务通过率0/6,六件事一件没办成。
浏览器关:FastBrowserUse实测让Qwen3.5 9B/35B本地完成浏览器搜索、点击、填表,博主测完发现4B在这个场景下速度和准确率反而更稳,准确率可以达到75%以上。哔哩哔哩
记忆关:Hindsight这套给AI代理用的长期记忆系统被在本机Ollama上验货:16条中文笔记全部存成功,但12个中文问题在默认配置下只有2题把目标排到第一,换两个多语言模型后做到11题——博主自己也注明样本小、不是基准测试。哔哩哔哩
速度关:NInfer配GSQ-RCO的实测给出16G跑Qwen3.8-27B、解码120+ tok/s、160K上下文可选的数。 但长上下文有另一面:另一条实测塞10万字要等4分钟首字,换机器也一样。 还有一条迷你主机实测提醒:64G×2换不来128G的速度。哔哩哔哩哔哩哔哩哔哩哔哩
三、决策表:AI员工的活,哪些现在就能派、哪些别派
绿灯(本地9B-27B今天就能干):定时资讯采集、网页搜索填表这类单步任务(75%准确率配人工抽查);本地知识库问答——那篇讲企业私有化的知乎回答把点挑得很准:答得准不准,卡点不在模型,在库。 数据、权限、语料整理比换大模型值钱;离线翻译、摘要、文档批处理也在这一档。知乎
黄灯(能干,但要折腾):接微信/飞书/钉钉的常驻在线——openclaw教程这波已经把395迷你主机、飞牛NAS一键部署当门票在卖;长上下文任务(首字4分钟,适合过夜跑,不适合人盯着)。
红灯(本月谁都别派):碰生产库的代码任务——云端有持久化疑云,本地有0/6;跨应用的长期记忆委托——2/12就是默认配置的现实;自动下单、付款、替发消息这类审批动作——这条对Dots和本地openclaw一视同仁。
四、账本:云在"变贵的员工、便宜的token",本地在"更贵的硬件、够用的智商"
云端这周的变化,对只想调API干活的人是利好(Sol五分之一价),对想要常驻智能体的人是利空(3600元/月起步,还出了持久化争议)。
本地侧,那个112万播放的问题下,高赞回答给过两条锚。能力上,作者和多位搞消费级本地部署的朋友聊完认为qwen3.8-flash-next Q8差不多是国模五名左右的水平,而且算过电费已经低于token plan。 量上,同一个问题下的另一条新回答给重度用户算了口径:很多模型的订阅形容重度用户是一个月4亿token的消耗。 想让本地接住这种量,卡点从来不是电,是机器价格——那篇高赞的原话是"基本上要接近十万的价格"。而近半年64G内存条从1287元涨到7538元(本站前文算过这笔账),硬件这头并没有变便宜。知乎知乎
这周密集上市的AMD 395平台小主机——极摩客EVO-X2、天钡NEX395、铭凡M2Pro——把"本地员工"的价格锚往下拉,"锐龙AI Max+395顶配拿下235B大模型"的实机视频也已经发出来了。 但宣传页上的"能跑235B"是MoE量化口径,真正决定体感的是内存带宽和token/s——参考此前Mac mini M6上27B只有8.3 tok/s的教训,下单前先问一句:这台机器跑我要的那款模型,实测多少t/s?哔哩哔哩
五、收个尾:谁能现在雇,谁该再等等
需求是"每天帮我盯资讯、查内网文档、跑固定流程"——本地现在就雇得起:一台395小主机或现有PC + 27B级模型 + openclaw/AnythingLLM这一层壳,账目里最贵的不是电,是折腾时间。
需求是"过夜代码agent、交付完整任务"——本周两边都别雇。云端等Dots官方把持久化口径说清楚、等个案是孤例还是通病的验证;本地等27B级agent任务通过率从0/6开始动。
我接下来盯的三个信号:Dots自述翻车帖会不会变成批量复现;本地模型下一轮量化分支会不会直接带agent通过率数据;openclaw这层壳出现"删库级"事故的概率(它跑的是你家本地盘,红灯任务派上去,没人替你恢复)。
云端AI员工开卖第一周就交出"薛定谔的持久化",本地AI员工的短板从"不会干活"变成了"干活要抽查"——两边都在半路上。这周想雇员工的,先对着这张表把需求放进绿灯、黄灯或红灯,别再为任何一个阵营的发布会文案付全款。