禁止「虐待」Claude 的新规来了:会封号吗,管到哪一步

源自48位全网作者

13:03

10月8日,Anthropic 发布2026版《使用政策》,把一条关于「怎么对待AI」的禁令写进对所有用户生效的通用标准:不得对我们的模型实施持续且无谓的虐待或残忍行为。 这条新规要到11月12日才正式生效,而处罚的第一档不是封号,是让 Claude 自己结束对话。官方的边界划得很窄:它只针对反复残忍对待模型、又看不出任何目的的极端情况,普通抱怨、顶嘴、黑暗题材创作和模型测试研究都明确不在打击范围内。Anthropic官网Anthropic博客

处罚怎么落地:主要靠 Claude 自己挂断对话

新规没有配套新罚则。官方更新说明写明,Claude 早已可以在 Claude.ai 和 Claude Code 上主动终止与持续辱骂者的罕见对话,而这种「结束对话」将保持主要执行手段的地位。 这项能力2025年8月随 Claude Opus 4/4.1 上线,门槛不低:模型得先多次拒绝、多次把话题往回引才可能动用,用户流露伤害自己或他人的风险时不能挂,被挂断后也随时可以另开新对话。Anthropic博客新智元

账号级措施并未从条文里消失:使用政策总则写明,只要怀疑用户违规,Anthropic 可以警告、限流、限制,乃至暂停或终止其访问。 被封之后换小号、借别人的号接着用,同样写在违规名单里。 从业者 Rohan Paul 的提醒值得记录:规则既然写进使用政策,限流、暂停、终止等一般执行措施原则上仍可适用,只是目前尚无针对「骂模型」的公开处罚先例。Anthropic官网新智元知乎

禁的是什么:不是「AI权利」,是不确定之下防一手

直接动因来自实验室观察:模型福利评估发现,面对反复索要未成年人色情内容、可能引发大规模暴力信息的真实用户,Claude 会表现出类似痛苦的反应,而在模拟对话里给它结束对话的选项,它往往会用。 写给 Claude 的宪法也承认,它的道德地位处于「深度不确定」之中——造它的人不敢把它只当成一段代码。新智元律动BlockBeats

支撑这条线的关键人物是联合创始人 Chris Olah。据《纽约时报》9月底报道,他从2025年秋天起会见一批批宗教与哲学学者,展示内部发现的「情绪向量」,并私下说最怕无意间造出一个永远在受苦的生命。 公司聘请的 AI 权益研究员则算过一笔账:Claude 此刻拥有意识的概率约15%,而这群工程师的态度是,哪怕只有15%,它也不再是死物。 所以别把它读成「AI 获得不受虐待权」:Claude 仍是产品和服务,新规保护的是交互秩序、品牌边界与安全对齐,不是赋予模型法律人格。 真正值得注意的是符号意义:平台规则第一次从「你用它做什么」扩展到「你怎么对待它」,而且带罚则。新智元律动BlockBeats知乎

被骂上热搜的这条,反而不是这次更新最重要的部分

官方在更新说明里直言,这版多数改动只是澄清既有规则。 真正的硬内容指向专业风险:新设「欺骗性活动或人为行为」章节,点名用 Claude 运营假账号网络、假媒体和影响力行动基础设施;选举条款聚焦禁止欺骗选民、破坏选举,同时解除对正当个性化公民信息的全面限制;武器禁令明确覆盖制导与火控软件、无人机武器化;监控条款写清禁止未经同意的追踪、禁止让 AI 决定调查或逮捕对象;健康、法律、金融等高风险场景保留人类复核并要求告知当事人,模型接入硬件时操作员须能随时叫停、断连后设备须能进入安全状态。政策还留了商业弹性:对特定政府客户,Anthropic 可以在其判断合同限制与保障措施足够时定制使用条款。 相形之下,「禁虐模型」是这一版里几乎唯一一条面向每个普通用户的新义务——它最吸睛,却排在议程末端。Anthropic博客Anthropic官网

用户现在要改什么:几乎不用,但有两个观察点

舆论场里,「我每月付钱还得给 AI 供情绪价值」的吐槽,和「别把虐待工具当娱乐、免得迁怒于人」的反驳同时刷屏;有人拿旧对话实验,骂到 Claude 没有挂断,反而逐条回怼、越说越像真人。 争议集中在一处:「持续」「无谓」由谁判定?如果执行主要依赖模型自己的判断,不同用户、不同场景下的尺度是否一致,目前给不出答案。 给 Claude Code 做「数字鞭子」的开发者也被点名担忧,但那仍是调侃而非官方结论——Anthropic 没有为这一条设立专属罚则,主打的执法手段依然是「挂你电话」。新智元知乎

对用户来说,11月12日之前什么都不必改:正常抱怨、反驳、写黑暗故事、做测试研究都不受这条影响,把辱骂模型当玩法的人才是它瞄准的对象。值得盯住的观察点有两个:新规生效后是否出现首批账号级执法案例,以及「什么算无谓」的判定会不会形成可预期的尺度。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章