26%研发由Claude主导,离全自动只差一级
9月18日,Anthropic 公开了一组自家内部数字:截至今年 8 月,公司 AI 研发工作里已经有 26% 到了"AI 主导"这一级。而今年 2 月,这个数字还不到 1%。
同一份报告里还有另一个数:8 月,内部监控分析了超过 10 亿次 Agent 决策,其中 0.002% 被实时拦下。
一个涨得飞快,一个小得不像话。把它们放在一起读,才是这份报告真正值得看的地方。

542 个节点的任务表,怎么算出 26%
一句话说清:这套 Anthropic R&D Automation Index,把公司所有 AI 研发工作列成任务清单,给每项打一个自动化等级,再按投入的人力加权,最后汇总成一个百分比。
拆开看它借用的刻度,来自 Epoch AI 提出的六级自动化标准,从 AL0 到 AL5。AL0 是人做完全部;AL3 是"AI 协作",人类盯着的时候 AI 能完成大块工作;AL4 是"AI 主导",人给一句高层指令,AI 自己把大部分活跑完;AL5 是完全自主,从发现问题到上线都不需要人。
落地方法官方写得很细:7 月按部门随机抽 20% 的员工,从内部文档和沟通记录里还原每人每周干了什么,得到约 1.5 万条细粒度任务;再聚成一棵 542 个节点的任务树,其中 378 个是叶子。
每个节点交给 Claude 调研"这类活现在谁在做、AI 占多少",另一个独立的 Claude 判官从六级里选一档;最后按人时占比加权。这棵树被冻结,之后每月都对着同一篮子工作打分。
放到场景里更好懂。官方举了夜里数据管道挂掉的例子:AL3 状态下,工程师带着日志找 Claude,来回确认细节,改完逐行 review,再自己重新部署。
AL4 状态下,工程师只丢一句"管道坏了,修一下",Claude 自己翻日志、定位失败的环节、写补丁、跑测试、拿上一版正常输出做对比、写复盘说明,但不部署,只把工程师叫来看结论、决定今晚发不发。
从 AL3 到 AL4,差的就是人要不要一直盯着。
比 26% 更该记住的几个数
26% 是上标题的数字,另外几个更接近风险剖面。
约 3 万个 Agent 同时在线,在那个最常用的内部平台上做研究和工程。报告口径说得很清楚:这些监控指标只覆盖这一个平台。
线上监控覆盖 100% 的动作,在执行前判定,8 月一共分析超过 10 亿次决策,其中 0.002%(约四万七千分之一)被拦下,换算过来是每月约两万次被挡住的危险动作。
线下监控同样覆盖 100% 的动作,看的是事后。它每周标记约 10 万条会话记录,绝大多数由分类器消解,最高优先级的约 50 条才进入人工复核。
算力那头,7 月 13 日到 20 日这一周:AI 研发的总算力里约 6% 投给安全相关研究;只看"AI 做 AI 研发"的那部分,这个比例约 12%。
三个最容易看错的地方
误区一:26% 意味着 AI 已经在自己写代码,人可以撤了。这话有一半对,AL4 的定义就是人只给方向、AI 自己跑完大部分流程。
但它解释不了 AL5 是零——没有任何一项被测工作能做到从发现到部署全自主;也解释不了 26% 是按人时加权的任务份额,不是产出份额,更不是岗位替代率。更准确的理解是,它是一张分工地图,告诉你在哪些活上人已经从操作者退成了验收者。
误区二:0.002% 的拦截率说明 Agent 很乖、很安全。听上去合理,单次动作出问题的概率低到万分之一都不到。
但它解释不了基数——10 亿次决策的 0.002% 意味着这个月仍有约两万次动作被拦下;而且拦截率低既可能是"行为确实安全",也可能是"监控只认得它认得的那类问题"。更准确的理解是,Agent 安全得三个数一起看:覆盖率、复核延迟、升级率,只看拦截率容易偏乐观。
误区三:这份指数要么是失控前兆,要么是自卖自夸。两句都有点道理:半年从不到 1% 涨到 26% 确实陡;判定又是自家模型做的,研究 Agent 取证、判官模型打分。
但这两句也解释不了报告里最实的部分:判官和人类业主的完全一致率是 59%,而人类之间的完全一致率只有 35%,两者相差一个等级以内占 97%。更准确的理解是,它是一份能被第三方复算的方法草案,不是一份结论。Anthropic 自己也说,接下来会引入多家外部机构,给到与内部风险评估团队同级的系统和数据权限。
和你有关的部分
AL4 里人类干的活其实很具体:给方向、读复盘、决定发不发。这三件事在未来几年,比"熟练执行"更值钱。
以后再看到任何"AI 替代了 X%"的数字,先问三句:口径是什么、基数多大、谁在评。这套问法对各家都一样管用。
安全算力的两个比例本身就是一次边界演示:同一天的数据,换个统计口径就差一倍。指标能被核查,比指标好看重要。
半年 26%,下一步要看的不是它涨到多少,而是谁有能力复算它。
如果觉得今天这篇有启发,点个在看,顺手转发给需要的朋友;想第一时间收到推送,可以星标我⭐。
关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。
作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
