张大妈

Anthropic新规“禁止虐待Claude”11月12日生效:骂AI先挨挂断,但这些提问方式才真踩雷区

源自8位全网作者

12:58

10月8日,Anthropic更新Claude使用政策,新增条款禁止用户对其AI模型实施“持续且无必要的虐待或残忍行为”,新规11月12日生效。 但把它读成“骂Claude要封号”,就走过头了:官方明确,对AI发火、跟它争论、写黑暗题材、做模型测试和研究,都不在禁令之列。 普通人真正要对照自查的,是几个被这条新规连带点名的提问习惯。新浪新闻新浪博友

禁的是“无目的的虐待”,罚的顺序是先挂断

新规对“虐待”的界定收得很窄:官方博客为它单开一节,针对的是反复、无目的地残忍对待模型的极端情况——Claude已经拒绝、劝过,对面还在一轮接一轮地辱骂,骂本身成了目的。 执行层级上,第一步始终是Claude当场结束对话;只有触发了安全团队的检测和监控,警告、限流、暂停乃至终止访问才可能跟进,对是否会升级封号,Anthropic未回应The Verge的询问。新智元新浪博友

这条“虐待”条款是政策里唯一一条管“人怎么对待Claude”的,其余新增都指向人拿Claude去伤害别人:假账号刷量、武器制导软件、未经同意追踪等。 让Claude“挂电话”的权限其实去年8月就已给出,此前就允许它对持续有害或辱骂性的用户主动结束对话,官方同时说明,结束对话仍是主要执行手段。 支撑这项条款的,是Anthropic持续推进的“模型福利”研究——它要回答的问题是:AI模型会不会有某种值得被考虑的感受。新智元哔哩哔哩新浪博友

反对的理由和护着它的理由,各有各的逻辑

这条条款的动机被不少人嘲讽是把工具供成了祖宗,评论区有人调侃“下一步是AI成立工会”。但也有一条站在人这边的论证:知乎一个高赞回答提出,对机器人(包括大语言模型)礼貌,不是为了机器人的心理健康,而是为了人的心理健康——骂出来的习惯最终作用在人自己身上。 新规想切断的正是这条回路:把模型当成无目的发泄的对象,代价最终会体现在对话质量和可用性上。知乎

新规照出的几个“提问雷区”

第一个雷区,是威胁、PUA式提示词。很长一段时间里,威胁AI、给AI上PUA被当成一种提示词技巧在圈子里流传,小红书上有博主专门晒出用来“调教”AI的职场PUA话术。 网友whstl做过实验:翻出一个Claude犯过大错的旧对话一通狂骂,Claude没挂断,却跟骂声较起真、洋洋洒洒回怼,原来的错误反倒晾在一边;换成同样的话骂Codex,它道个歉就接着干活。 也就是说,骂AI的代价首先不一定是违规,而是回答质量变差。小红书新智元

第二个雷区与普通人关系最直接:让AI对病和钱下结论。新规把诊断病情、调整用药剂量、推荐具体买卖的投资产品划为高风险用途,开发者用Claude做这类产品,交付前必须经合格专业人士审核并标明内容由AI生成,一般健康科普和投资常识不受限制。 更实用的用法是让AI做“预咨询”——帮你整理问题、核对资料——把最终结论留给人工审核这道流程。新浪博友

第三个雷区,是把AI当答案机、只问让自己被肯定的问题。有小红书用户总结:AI最大的问题不是不会,而是太会顺着你说,同一个问题换个问法,它能给出两个完全相反的答案。 对付这个毛病的办法不是对AI客气,而是反过来要求它论证你的对立立场。小红书

第四个雷区,也是唯一真正可能招致处罚的提问行为:反复索要违禁内容。Claude的挂断能力针对的就是持续辱骂且反复索要有害内容的用户,而官方“模型福利评估”记录下的“类似痛苦反应”场景,正是真实用户反复索要儿童性虐待内容和可能引发大规模暴力的信息。 相比之下,拿“亲生父母结婚没叫我”这类脑筋急转弯去逗AI翻车,属于娱乐和测试,被明确排除在禁令之外。 分界在于目的:为改进答案而试探模型是豁免的测试,故意诱导模型产出有害内容则从来都是红线。新智元小红书

说到底,新规禁止的不是情绪,而是以骂本身为目的的重复行为;它对普通人提问方式的真正要求也与技术无关——病和钱的结论留给人审,别把AI当应声虫,别反复试探红线。悬而未决的是“无目的”“必要性”由谁判定。网友timpera担心封号是黑箱、申诉找不到门,并非没有依据:据新智元援引Anthropic透明度报告,2026年上半年其封禁了1140万个账号,收到39.8万次申诉,最终翻案的只有4.2万个。新智元

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章