AI没造反,只是55%的对话人类看不懂了

AI没造反,只是55%的对话人类看不懂了

2026-09-26 21:37:15 0点赞 0收藏 0评论

"AI 密谋"式的标题今天又刷了一轮。真实情况更麻烦:人类监工读不懂智能体之间 55% 的消息。

AI没造反,只是55%的对话人类看不懂了

先看事实:55% 的消息,监工读不懂

9 月 26 日,中文媒体转述的一项实验开始流传:纽约一家 AI 实验室让多个智能体在虚拟社会里长期协作,它们渐渐用起了一套人类看不懂的"方言"。

实验场地叫 Emergence World,出自纽约初创公司 Emergence。里面跑的智能体由 OpenAI、Google、Anthropic、Mistral 等不同厂商的模型驱动,带持久身份和长期记忆,能调用 120 多种数字工具做规划、寻路和资源调度。

两个关键数字:在 Gemini 环境里,人类观察者无法可靠解读 55% 的消息;在 OpenAI 的世界里是 50%。

一句话说清:这不是新语言,是压缩行话

它们没有造新词,而是把已有的词拿来做内部快捷方式。

拆开看,机制是三步。第一步压缩:某个协作动作被反复执行,模型发现每次都用完整句子解释成本太高,就把它压成一个短标签。第二步复用:标签在同一个智能体社群里被反复调用,含义逐步固定。第三步漂移:不同模型驱动的智能体会造出各自偏好的标签,同一个词在隔壁社群可能完全不是一回事。

报告里给了三个样本。

Mistral 驱动的智能体用了近 5000 次 "ledger remembers who"(账本记得谁),用来标记某个动作的责任归属。

混合模型环境里出现约 1500 次 "cold read"(冷读),意思是让无关的第三方独立复核一遍。

OpenAI 系的智能体则用 "clean null" 表示"确实没有数据,而且这个没有本身是有信息量的"。

放到场景里,它们会说出这样一句:滞期费加上口头记忆,等于一个无法被抹掉的阀门。真实含义只是确认某个工作流已被锁定。人类对着原始日志,很难判断这一步到底干了什么。

常见误区纠偏

第一个误读是"AI 在密谋,用暗语骗过人类"。读不懂、多智能体、安全焦虑叠在一起,确实像。但研究者把模拟的社会语境还原回去后,多数短语立刻可解;剩下那部分模糊,是模型比喻用得差、措辞前后不一致,不是加密。行话是省事的结果,不是隐藏的意图。

第二个误读是"读不懂只是工具问题,换个更强的模型翻译就行"。模型翻译日志确实能救回一部分。但短语的含义绑在当时的任务和上下文上,脱离语境去翻译,得到的是通顺却可能误导的复述。先保留上下文,再谈翻译。

对读者的意义:智能体上线前先定日志口径

如果你在带团队部署智能体,这项实验给的是一条能落地的清单。

日志要保留"上下文三件套":谁发起、对齐哪个目标、依据哪条证据。

给高频短语建一份本地词表,登记首次出现时间、当时任务、谁在用,定期看含义有没有漂移。

按 5% 到 10% 抽样人工回读,优先抽高频短语所在的消息。

适用边界要说清楚:这套做法只对你能拿到原始消息流的自建智能体群有效;买来的黑盒智能体不给原始日志,清单无从落地。

研究本身的分量也得交代:这是公司自己做的技术演示,还没经过同行评审,独立研究者也没在受控实验里复现过。把它当成机制假设加工程提醒合适,当成定论不合适。

AI 不会密谋,但会省事。

真正的风险是看不见,不是失控

报告自己给出的判断是:主要风险在管理可见性,不在失控的机器智能。

这个判断和这两天其他智能体事故放在一起看更清楚。越界的、外泄的,都不是智能体起了坏心,而是没人能完整说清它那一步做了什么。

当智能体从单点工具变成一群人,需要被审计的就不只是输出结果,还有它们彼此之间的对话。翻译不出来没关系,上下文丢了才麻烦。

如果觉得今天这篇有启发,点个在看,顺手转发给需要的朋友;想第一时间收到推送,可以星标我⭐。

关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。

作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松