8月12日,OpenAI 发布了一份企业 AI 使用报告,三组数字很快传遍全网:头部企业的 AI 使用深度是中位企业的 8.3 倍;64% 的企业输出 token 来自 agent 型工具 Codex;采用 6 个月后,普通员工每周比高管多给 AI 发 13 条消息。
很多标题的潜台词是:差距已经拉开,你落后了。
但有个问题值得细看。知乎上有人就这份报告发问:差距真有这么大吗?知乎小红书上也有解读帖把它概括成一句"揭开了企业用AI的真正差距"。小红书而知乎上被讨论最多的那篇回答,结论相当克制:这三组数字能证明"企业用 AI 的方式在变",证明不了"生产率已经提高"。
这个区分对普通使用者相当重要,因为它决定了你看完这份报告之后,学的是"多用",还是"换个用法"。
先看清楚这三组数字是什么
先把官方报告的数字摆出来。
8.3 倍:OpenAI 按"每个活跃用户的 token 输出量"给企业客户排序,前 10% 记为 frontier,处在 45%-55% 分位的记为 typical。今年 1 月,两者差距是 2.6 倍,到 6 月扩大到 8.3 倍。
64%:6 月,企业客户的 Codex 输出 token 占 Codex 加 ChatGPT 合计输出的 64%。也就是说,企业场景里 AI 产出的大头,已经不再是"你问我答"的聊天,而是 agent 型工具完成的活。
13 条:企业采用 6 个月后,早期职业员工每周比高管多给 AI 发 13 条消息。

8.3 倍、64%、13 条,足以支持一个判断:企业 AI 的任务形态正在改变。但它们还不足以证明另一件事:企业生产率已经提高。知乎先抓住这个大前提,再看细节。
关键:三组数字的分母并不一样
这份报告最值得抠的地方,不是数字,是数字怎么读。
8.3 倍的本质是"输出量"差距,不是"效果"差距。Agent 任务天然吃 token:一个任务跑下来,agent 要读资料、改文件、调工具、失败重试、最后整理结果,整条链路全算输出。而 ChatGPT 式的一问一答,一次可能只返回几段文字。

所以同样是 token,两边的含金量未必相同。输出量大,能说明这些企业把更长的任务交给了 AI,但不直接等于任务完成得好,更不等于这些任务"值得"做。
64% 是"构成"的截面,不是"效果"的前后对比。它能说明企业 AI 的主战场正从聊天转向执行,但执行得怎么样、返工多少、人工复核花了多少成本,报告没有回答。
13 条也有它的边界:统计的只是企业工作区里的活跃用户。按报告里的估计口径,经理和总监约占周活跃用户的 24%,早期职业员工和实习生合计只占约 7%。知乎“高管占比高"和"人均发消息频率低"可以同时成立,推不出"高管不用 AI”。
至于传播最广的那个案例——维珍大西洋航空的工程团队用 Codex 把一次遗留代码重构从两周压缩到 30 分钟——那是客户案例。案例用来说明 agent 任务长什么样,不能代表所有企业的平均效果。
这份报告真正能证明什么
把不能证明的部分剥掉,这份报告可信的结论其实就两句。
第一,任务形态在变。企业 AI 正在从"帮人梳理问题的聊天"转向"交付成果的执行",64% 对这个判断的支撑相当扎实。
第二,深度差距的性质变了。五个月里从 2.6 倍拉到 8.3 倍,差距早已越过"有没有账号"这一层。报告里,Plugins、skills 这类高阶能力在头部企业和中位企业之间的采用率差距明显——真正被拉开的,是"模型能读到什么资料、能调用什么工具、流程能不能复现"。

还有一个报告里不太起眼、但值得咂摸的细节:采用 AI 的企业,本来就更大、更有钱。2024 年中位数口径下,采用企业营收约 22.751 亿美元,非采用企业只有约 2.096 亿美元;员工数分别是 2934 人和 424 人。知乎回归分析显示组织投入与采用相关,但剔除科技和高研发行业后,这个关系就不再显著。
翻译一下:大公司、有钱的公司更倾向于把 AI 用得更深,但不是"花了钱就自然有效果"。
这事和你有什么关系
如果你是已经在用 ChatGPT、或者正考虑订阅的个人用户,这份报告其实给了三道自测题。
一,你是在问一次性的问题,还是把重复任务固化成了可复现的流程?8.3 倍差距里,相当一部分来自"一问一答"和"整流程托管"的差别。
二,你有没有给 AI 上下文和工具?差距的本质不是使用频率,而是 AI 能不能读到你的资料、接上你的工具、产出你可以复核的结果。
三,你周围谁用得最好?报告里最实在的建议,是找到组织里已经形成稳定 AI 工作流的人,把他用的输入材料、工具步骤、检查标准记下来,变成别人能用的模板。传播方法比传播消息数更有价值——对个人同样适用:与其和别人比每天用多少次,不如先把自己一个高频任务固化成稳定工作流。
这里插一句:那种"用起来小心翼翼"的感觉,不是你一个人的。早在 5 月上一份报告发布时,就有人在微博上说,“我也好想让企业老板给我配个无限token用额,现在用起来都是小心翼翼”。微博额度和成本焦虑本身就在限制使用深度,而这恰恰是报告里"深度差距"没有告诉你的那一面。
最后一句:token 用量可以当温度计。它能提示任务是不是变深了、agent 是不是进入了更多流程,但它不是绩效证明。
几个值得继续观察的信号:这项研究的数据截至 2026 年 3 月,64% 也只是 6 月的截面。三季度差距是否继续扩大、OpenAI 会不会拿出质量、返工这类结果侧证据,将决定这个故事能不能从"使用差距"走到"效果差距"。