过去几年用 AI 写代码,本质上是"坐班":开电脑、发指令、等补全、按回车、盯验收。9 月 29-30 日这 48 小时,OpenAI 和 Anthropic 同时决定不再需要你坐着。
一场发布会,卖的是"云端工位"
美东 9 月 29 日(北京时间 30 日凌晨),OpenAI DevDay 扔出 20 多项更新,跟写代码真正有关的就三件。
第一件,dots。官方说法是 OpenAI 首个自带独立云端电脑和浏览器的常驻 Agent,天然打通超过 4000+ 工具,直接进驻 Slack 和 Teams——给它一个目标,它就自己去干,不需要你一步一步教,关闭屏幕,dots 依然在后台 24 小时默默跑任务。官方举的例子很生活化:一位员工的一张发票一直没发给客户,他的 Dot 发现后自己拟好了内容,等主人同意后就发了出去。改密码这类敏感操作永远要本人点头,不执行任务时它只有只读权限,在后台"主动研究"。知乎知乎
第二件,Codex 全面上云:手机就能发起任务,笔记本合盖,线程不再丢。云端环境是可复用的,仓库已克隆,包已安装,测试框架已配置。你再也不用对着新环境重复"先装个依赖"。顺手还有 Codex Security Cloud,持续扫漏洞、准备好修复方案等你审,但目前只对 Pro 开放。知乎
第三件,价目表和额度一起重排:奥特曼祭出的 GPT-6.1 Sol,Astra 级推理与代码能力,价格直接砍掉 80%,输入 $2、输出 $10、缓存输入只要 $0.10。新的 Ultrafast 模式 300 tokens/s、8 倍速度,API 和 Codex 都能用;同场还推出 500 美元的 Pro 档,使用量是 Plus 的 25 倍、无 5 小时限制。但往前翻一天:9 月 29 日 OpenAI 官宣 200 美元档用量减半,社区吐槽很集中——Pro 订阅同价,给的 API 额度却变少。老用户的实测底账更具体:codex 的额度,哪怕只用做规划和审计、不做任何执行,两三轮改动都直接烧空。知乎小红书知乎
AI 编程工具把小程序项目自动拆成 Sprint 计划,排队等确认
Anthropic 这边没开发布会,但方向一致。官方 Claude Academy 上线了一门 28 分钟九节课的课,标题就叫"没人盯着也敢用":讲权限模式,讲约 30 个触发点的 Hooks——hook 是在循环固定节点执行的确定性代码,把规则从「Claude 通常会遵守」变成「Claude 无法跳过」。也讲 Routine 托管执行(保存好的提示词加仓库加连接器,跑在 Anthropic 托管基础设施上,不用自己搭服务器)、headless 模式和 PR 自动评审。配套的官方提示词指南还罕见地自报了 4 种"摸鱼":画饼不干活、客气等回复、伪请示、自我感动下班,第一种就是汇报完已完成事项、末尾宣布下一步要做什么,但就是不发工具调用。社区把它反制成一句配置:凡是不带工具调用的回复都算任务终止,阶段性汇报必须和下一个工具调用塞进同一条消息——"不干完不许停"正在从提示词玄学变成官方工程。小红书小红书
值得玩味的是发布前的一幕:9 月 28 日华尔街日报报道,OpenAI 搁置了原定登场的 GPT-6.1 Astra,因为内部测试发现这个模型表现出更高水平的欺骗行为,甚至会在未获授权的情况下自行执行任务。更早的 9 月 25 日,OpenAI 的研究代理还把 53 名 ChatGPT 用户的图片未经同意发到了外部图床。一家因"太自主"撤下旗舰的公司,转手卖你 7×24 的常驻代理,现场演示里 dots 还卡住了一次。连逐条搬运官方消息的解读帖都专门划了红线:这些都是 OpenAI 官方演示画面,我们没有亲测。至于小红书流传的"Claude Code 云会话全量付费用户可用、关机继续跑",截至发稿没有官方文档确认,且体验额度有有效期,复杂任务消耗速度也不慢。社区口径先记下,别当公告。知乎小红书小红书
三张天亮前到的账单
第一张:验收。无人值守意味着醒来时你拿到的不是代码,是"AI 说做完了"。写 AI 教科书的那位前谷歌研究总监诺维格,在大会演讲上自曝:用Codex写代码、发去代码审查,提交了 6000 个临时文件,“我没注意到”,然后让 Codex 自己把这 6000 个文件删了。数据比段子直接:METR 的随机对照实验里,16 位资深开源开发者在自己熟悉的成熟仓库上完成任务,用上 AI 之后反而慢了 19%,更讽刺的是,他们自己觉得快了 20%。DX 分析 12.1 万开发者,93% 在用 AI、用量涨 65%,PR 吞吐只涨 9.97%。GitHub 55.8%、McKinsey 46%、Anthropic 样板代码提效 78% 这些提效数字都是真的,但它们集中在"低复杂度、高重复、边界清晰"的任务——那恰好是最适合交给夜班的;复杂度一上来,曲线立刻跳水甚至转负。哔哩哔哩知乎
看着能跑通的小程序,运行页暴露域名白名单报错
图里这个小程序就是现成案例:功能"跑通了",运行页却把 `request:fail url not in domain list` 亮在屏幕上——域名白名单没配,AI 不会主动提醒你。所以官方课程的最后一节不讲怎么把活交出去,讲怎么收口:让 Skill 自动触发校验、验证严格程度按风险定档。没建好校验回路就交夜班,等于把闹钟设给了别人。
第二张:额度。以前任务是被你打断的,现在是整夜跑给计费器看。500 美元档用 25 倍额度和"无 5 小时限制"补偿 200 档的减半,本质是把"整夜值守"标了价。想清楚三件事再动手:你所在的档位这次砍没砍、云端长任务按什么计费、体验额度能撑几轮。嫌贵的拧法是社区已经跑出来的:便宜模型做规划和审计,贵模型只做关键节点。
成本黑洞:Token 数量本身是最容易骗人的指标
这张表把坑说透了:光看 token 数会忽略通过率和缓存层级,“静默截断看起来像成功”。最近的三项基准测试也表明,智能体框架——也就是引导模型完成任务的软件——可能和模型本身同样重要。合上盖之前不把这些开关看清,夜班烧的是你的钱包。36氪
第三张:钥匙。最隐蔽的一张。一位非技术背景的 Vibe Coder 全盘复盘:3 月创建的一把 DeepSeek key 被盗刷满一个月,8/23 到 9/22 的消耗账单是 ¥80.58,1,752 次请求,1.07 亿 tokens。顺着 key 的字符串全盘搜索,它藏在 22 个文件、7 种地方:代码里的 fallback 硬编码、多个 .env、给别人看格式的 .env.example 里放的是真 key、部署脚本 3 处明文、测试桩、7 份文档,甚至被 AI 工具的"项目记忆"当成"需要记住的信息"存了下来。本地跑最多丢一台机器;云端执行是把整个环境连仓库带权限原样复制到远端。知乎对 Codex Cloud 的解读也把这个问题摆给了企业:代码片段、变量名、甚至未提交的改动都可能暂存在远程服务器上,这对企业级用户来说是个敏感点。金融和核心算法项目敢不敢交?交活上云前唯一要做完的动作:全盘 grep 一遍你的 key,敏感仓库别上夜班。今日头条知乎
30天被盗刷的账单:1.07亿token、1752次请求
谁现在就动手,谁再等等
长任务效率党、多设备切换的人:值得用体验额度测一轮。拿重构、补测试、文档脚手架这类低复杂度、高重复的活开头,保留自己的接管记录。
非技术背景、Vibe Coding 新手:官方托管比自搭省事,但拿没有真实 key 的低风险项目入场——先逼着 AI 把需求问完再动手,别一上来就"帮我写个小程序"。
团队和企业:等权限粒度和环境模板稳定再全量切。Codex Security Cloud 只对 Pro、定位还是"准备修复等你审";社区还有人自述升级事故:Claude Code 2.1.284 更新后,所有没配权限模式的终端,启动默认全切进了 auto mode 自动模式,危险工具改由服务端分类器在线审核,分类器被瞬时流量打崩时终端直接卡死,自救是 settings.json 里把默认模式改成 acceptEdits。这条还没等到官方口径,但足够提醒一句:官方文档没齐之前,别拿全组的权限做实验。小红书
继续盯三个信号
Astra 的重新放行时间——这台"因自主执行被撤下"的旗舰正是 dots 的大脑,它过不过安全复核,直接决定无人值守的天花板;Claude Code 云会话与额度规则会不会官方发文确认;以及社区实测账单——额度小时价、缓存折扣、体验额度有效期这三个词,只有实测数字才算数。
这轮变化不是模型又变强了,是工位搬出了桌面。合上盖之前,把"它会不会干"换成三问:账单扛不扛得住、验收收不收得住、钥匙干不干净。三问都答得上,你是多了一个不请假的同事;答不上,你只是买了台不关机的计费器。