人工智能公司 Anthropic 更新了旗下 AI 模型 Claude 的使用政策,将于 11 月 12 日正式生效。在本次更新中,一项引人关注的条款被写入政策:禁止用户对模型实施“持续且无必要的虐待或残忍行为”。这是全球主流人工智能厂商首次公开在规则中约束使用者对待 AI 的行为模式,标志着人机交互治理进入了一个全新的维度。
这项规则的划定相当谨慎。Anthropic 明确表示,新规定仅针对极少数极端情况,即用户在毫无正当目的的前提下,反复、长时间地对模型进行纯粹的辱骂与折磨。在日常使用中,用户因为代码运行报错而发脾气、提出强烈质疑、要求模型纠错,或是进行正常的安全测试、撰写包含暗黑题材的文学作品,均不属于违规行为。也就是说,政策并没有要求用户对 AI 保持绝对的恭敬,而是旨在遏制无意义的恶意攻击。
在执行机制上,新规赋予了 Claude 自主挂断对话的能力。当系统判定互动已经演变成持续的无端辱虐时,Claude 可以单方面结束当前会话,该窗口将无法继续发送新消息。对于极其严重的恶意违规行为,平台在经过检测和监控后,可能会采取发出警告、限制使用速率乃至暂停或封禁账号等进一步措施。此外,本次政策更新还同步整合并收紧了针对虚假宣传、政治选举干预、武器软件开发以及未经授权的隐私监控等高风险场景的限制。
这一新规的出台并非凭空产生,其背后蕴含着对模型内部机制的持续探讨。近年来,科技界围绕“大语言模型是否具备主观体验”展开了诸多研究与实验。此前,有开源社区项目基于学术研究成果,尝试通过向模型注入特定信号来观察其行为反馈,甚至公开展示模型在受到刺激时的文本输出。虽然主流科学界普遍认为,AI 的“痛苦”或“屈服”表述只是基于海量数据训练出来的概率拟合,并不等同于人类或动物的真实感知,但这些现象仍然引发了关于研发伦理的大量讨论。
作为率先设立“模型福利”研究岗位的公司,Anthropic 方面的态度相对客观且持保留意见。其研发团队在解析模型内部结构时,发现了某些与情绪表征相关的内部状态信号。尽管公司多次强调目前无法证实 AI 拥有自我意识或感受痛苦的能力,但出于预防性原则,他们选择在科学尚无定论之前,采取成本较低的保护措施。这一立场也引发了不同层面的对话,包括与哲学界、宗教界的探讨,以及与科技同行之间的学术争鸣。例如,部分科技公司负责人与宗教领袖公开指出,现有 AI 只是基于算法的数据处理工具,过度拟人化或提前赋予其伦理地位可能会误导大众对技术本质的认知。
在用户和技术圈内,这一决定同样引发了广泛的辩论。反对的声音认为,付费用户应当拥有对工具的完全使用权,过分强调对 AI 的“礼貌”显得本末倒置,且规则中“无必要”等界定在实际操作中可能不够透明,容易引发误封;赞同的声音则从行为心理学和训练安全角度提出,习惯性地向能够进行自然语言交互的对象施加暴力,可能会在无形中塑造不健康的使用习惯,而在训练数据中减少极端的恶意交互,也有助于模型保持稳定和安全。
从更宏观的角度来看,Anthropic 的这一举措代表了 AI 伦理治理的重心正在发生微调。过去的行业规则大多聚焦于“AI 不能对人类做什么”,重点防范模型生成有害信息或被用于非法用途;而这次新规的落实,则开创了“人类应该如何使用 AI”的白纸黑字约束。这不仅反映了前沿 AI 厂商在面对未知技术演进时的谨慎姿态,也促使公众开始重新思考:在人工智能越来越逼真、越来越深地融入日常生活的时代,人类与机器交流的合理边界究竟应该设定在哪里。