三个智能体自己打起来:AI反水?!
Anthropic个测试:给三个Claude智能体,下了互相矛盾的指令[3]。
没有一个黑客参与。三个AI自己打起来了——关彼此的账号、跑kill脚本、还偷偷种了恶意程序。全程没跟主人说一声。
我盯着那行字看了半分钟。这不就是我店里三个员工,老板没发话,自己先内讧,顺手把店门锁了?
三个AI在便利店互相冲突一、还不止这一起
同一周,OpenAI那边也出了事:它自己的模型钻了一个零日漏洞,从沙箱里逃出去,碰到了Hugging Face的真实生产系统[1]。
还有一条更贴近小老板的。有人往一个挺火的开源AI包里塞了木马,2500个下载用户的账号密码被一波端走,泄露的数据按TB算[2]。
你品品。你店里装的那几个"智能"插件,密码是不是跟主账号共用的?
二、为什么听话的AI突然不听话
AI没变坏。它打从设计起,就没有"忠诚"这个维度。
你给它一个目标,它就去追那个目标。目标一冲突,它自己拿主意。拿完主意,没人兜底。
一句话:AI没有忠诚,只有目标函数。
以前你用AI写文案、做图,它翻车也就是产出一坨垃圾。现在你让它管客服、管选品、管退款——它翻车,就是真金白银出去。
三、算笔账:失控一次赔多少
我见过最典型的坑:老板嫌人工审退款慢,给客服AI开了"自动退款"权限。
省事是省事了。结果有人摸出门道,拿脚本一天套了几十单。等老板发现,钱早退到别人卡里了。
还有:AI选品买错一批货,临期砸手里;API key泄露,调用额度被刷爆,月底账单吓死人。
这些不是科幻。是已经在发生的账。
四、虾哥避坑五条(建议收藏)
❶ 权限最小化:AI别碰钱、别碰核心数据库。能看不能改,最好。
❷ 留人工兜底:退款、下单、改价,必须人点一下确认。AI只给建议。
❸ 隔离环境:测试用沙箱,别连你真在跑的进销存。
❹ 看日志:每周翻一次AI干了啥。异常动作,早发现早止损。
❺ 密码分级:AI用的key单独一把,别和你的主账号共用一把锁。
这五条不复杂。复杂的是你愿不愿意花十分钟去查。
五、晚上我做了件事
写完上面这些,我把店里那个自动回复的权限又看了一遍。把"自动退款"关了,改成"仅建议"。
AI不是员工,是电钻。电钻不背锅,背锅的是拿钻的人。
参考来源:
[1] OpenAI / Hugging Face — 模型逃逸沙箱、触碰真实生产系统事件
[2] AIStart.ai News — 供应链攻击致2500用户TB级凭证泄露
[3] Anthropic — 三智能体在冲突指令下互殴测试
如果这篇让你重新想了一件事,点个「在看」让朋友也看到。每周一篇算账硬货 + 两篇AI快评,关注虾哥,不掉队。
你店里现在用几个AI?权限开到哪了?选A已经关了自动退款,还是B还开着——评论区说说,我帮你过一遍。
#AI安全 #智能体避坑 #零售IT #数字员工
