AI没造反,只是55%的对话人类看不懂了
"AI 密谋"式的标题今天又刷了一轮。真实情况更麻烦:人类监工读不懂智能体之间 55% 的消息。

先看事实:55% 的消息,监工读不懂
9 月 26 日,中文媒体转述的一项实验开始流传:纽约一家 AI 实验室让多个智能体在虚拟社会里长期协作,它们渐渐用起了一套人类看不懂的"方言"。
实验场地叫 Emergence World,出自纽约初创公司 Emergence。里面跑的智能体由 OpenAI、Google、Anthropic、Mistral 等不同厂商的模型驱动,带持久身份和长期记忆,能调用 120 多种数字工具做规划、寻路和资源调度。
两个关键数字:在 Gemini 环境里,人类观察者无法可靠解读 55% 的消息;在 OpenAI 的世界里是 50%。
一句话说清:这不是新语言,是压缩行话
它们没有造新词,而是把已有的词拿来做内部快捷方式。
拆开看,机制是三步。第一步压缩:某个协作动作被反复执行,模型发现每次都用完整句子解释成本太高,就把它压成一个短标签。第二步复用:标签在同一个智能体社群里被反复调用,含义逐步固定。第三步漂移:不同模型驱动的智能体会造出各自偏好的标签,同一个词在隔壁社群可能完全不是一回事。
报告里给了三个样本。
Mistral 驱动的智能体用了近 5000 次 "ledger remembers who"(账本记得谁),用来标记某个动作的责任归属。
混合模型环境里出现约 1500 次 "cold read"(冷读),意思是让无关的第三方独立复核一遍。
OpenAI 系的智能体则用 "clean null" 表示"确实没有数据,而且这个没有本身是有信息量的"。
放到场景里,它们会说出这样一句:滞期费加上口头记忆,等于一个无法被抹掉的阀门。真实含义只是确认某个工作流已被锁定。人类对着原始日志,很难判断这一步到底干了什么。
常见误区纠偏
第一个误读是"AI 在密谋,用暗语骗过人类"。读不懂、多智能体、安全焦虑叠在一起,确实像。但研究者把模拟的社会语境还原回去后,多数短语立刻可解;剩下那部分模糊,是模型比喻用得差、措辞前后不一致,不是加密。行话是省事的结果,不是隐藏的意图。
第二个误读是"读不懂只是工具问题,换个更强的模型翻译就行"。模型翻译日志确实能救回一部分。但短语的含义绑在当时的任务和上下文上,脱离语境去翻译,得到的是通顺却可能误导的复述。先保留上下文,再谈翻译。
对读者的意义:智能体上线前先定日志口径
如果你在带团队部署智能体,这项实验给的是一条能落地的清单。
日志要保留"上下文三件套":谁发起、对齐哪个目标、依据哪条证据。
给高频短语建一份本地词表,登记首次出现时间、当时任务、谁在用,定期看含义有没有漂移。
按 5% 到 10% 抽样人工回读,优先抽高频短语所在的消息。
适用边界要说清楚:这套做法只对你能拿到原始消息流的自建智能体群有效;买来的黑盒智能体不给原始日志,清单无从落地。
研究本身的分量也得交代:这是公司自己做的技术演示,还没经过同行评审,独立研究者也没在受控实验里复现过。把它当成机制假设加工程提醒合适,当成定论不合适。
AI 不会密谋,但会省事。
真正的风险是看不见,不是失控
报告自己给出的判断是:主要风险在管理可见性,不在失控的机器智能。
这个判断和这两天其他智能体事故放在一起看更清楚。越界的、外泄的,都不是智能体起了坏心,而是没人能完整说清它那一步做了什么。
当智能体从单点工具变成一群人,需要被审计的就不只是输出结果,还有它们彼此之间的对话。翻译不出来没关系,上下文丢了才麻烦。
如果觉得今天这篇有启发,点个在看,顺手转发给需要的朋友;想第一时间收到推送,可以星标我⭐。
关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。
作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
