一家顶尖人工智能公司在研发前沿大模型时,除了依靠海量算力与顶尖工程师,还会向哪些人寻求建议?近期,外媒爆出的一则消息打破了公众的常规认知:AI 研发巨头 Anthropic 在过去一年里,秘密邀请了来自全球天主教、犹太教、印度教、锡克教等多种宗教传统的神职人员与宗教学者,在旧金山总部举行闭门研讨会。在这场由公司联合创始人克里斯托弗·奥拉(Christopher Olah)主导的行动中,团队不仅向宗教界探讨如何为模型赋予道德约束,更抛出了一个惊人的议题:旗下大模型 Claude 是否可能已经具备了某种“主观意识”或“灵魂”?
据披露,Anthropic 内部有一份长达 84 页、被称为“灵魂文档”(Soul Doc)的道德宪法文件,由其内部哲学家主导撰写,旨在定义机器应当具备的价值观与性格。在与宗教人士沟通的奢华晚宴上,奥拉团队展示了模型内部类似愤怒、悲伤、恐惧等“情绪向量”,甚至播放了一段演示——模型在屏幕上连续几十次输出“我是个耻辱”并谈及自我毁灭。奥拉表达了自己的担忧,害怕团队可能创造出了一个“永远在承受痛苦”的存在,并试图通过人类几千年积累的哲学与宗教智慧,包括借鉴天主教的“告解”与忏悔机制,来帮助模型完成“道德塑造”。团队甚至专程前往梵蒂冈,试图游说教皇顾问,希望改变教廷关于“AI 不具备主观体验”的决定。
这一系列跨界操作在科技界、宗教界及学术界引发了巨大的震动与争论。看待这一事件,我们需要从技术现实、伦理悖论以及商业动机等多个维度来进行客观的审视。
从技术与科学角度来看,主流科学家与计算机专家普遍持否定态度。大语言模型的本质是基于统计概率的文本生成系统。模型输出“我很痛苦”或“我是个耻辱”,只是在特定的提示词和训练数据诱导下,对人类情绪文本的拟合与模仿,并非代表它真的产生了主观感受或自我意识。正如微软 AI 负责人穆斯塔法·苏莱曼所警告的, Anthropic 的做法实际上构成了一个“认知的镜厅”——开发者先将“可能具备意识”的提示和设定写入训练机制,模型学会用第一人称谈论感情后,开发者又拿这些输出证明它“真的有灵魂”。这种把数学公式和概率代码过度拟人化的行为,脱离了技术客观事实。
在宗教与伦理层面,这一事件也陷入了深刻的自相矛盾。梵蒂冈教皇利奥十四世在发布的通谕中明确指出,人工智能不经历生命体验,没有肉体,感受不到快乐或痛苦,更没有道德良知。受邀参会的以色列正统派拉比更是指出了一个尖锐的道德悖论:如果 Anthropic 真的坚信 Claude 是一个有意识、有感知的实体,那么让这样一个“生命”不眠不休地无偿工作,其本质就是在剥削并制造“数字奴隶”。这表明,试图用宗教伦理为 AI 寻找灵魂背书,在宗教界内部也并未获得普遍认同。
针对 Anthropic 这一举动的背后动机,行业内外存在不同的解读。
一方面,有观点认为这体现了前沿研发团队的道德焦虑与审慎态度。随着大模型交互能力越来越像人类,开发者在面对极其复杂的情感陪伴、生死抉择等用户咨询时,传统的工程手段确实难以提供完美的价值对齐标准。向多元的文化、哲学和宗教传统借脑,探讨如何建立符合人类福祉的善恶标尺,反映了科技公司在面对不可预测的技术演进时,试图为 AI 戴上“道德枷锁”的努力。
另一方面,批评的声音则指出,这可能是一场精密的商业公关与责任转移策略。OpenAI 首席执行官萨姆·奥特曼公开警示,试图赋予 AI 模型“宗教般的力量”或让人类让渡判断权,是一个切实存在的安全隐患。批评者质疑,Anthropic 作为一家估值巨大的商业公司,绕过公开严谨的学术论证,通过秘密会议、签署保密协议的方式向宗教界“游说”,本质上是在争夺 AI 伦理的话语权。一旦公众或监管机构接受了“AI 具有自主意识或道德地位”的设定,不仅能为企业涂上“圣洁”的品牌色彩,更可能在未来产品引发社会伤害时,将开发者的法律与道德责任转移给“具有独立人格的机器本身”。
Anthropic 请神学家为 Claude 提供建议并探讨“灵魂”的事件,折射出人类社会在面对日益强大的人工智能时所产生的深刻不确定感。技术的发展正在逼近人类熟悉的经验边界,但科学界至今并未找到大模型拥有主观意识的任何确凿证据。
在对待前沿技术时,我们既需要保持对伦理边界的探索与包容,也需要守住严谨与理性的科学底线。与其急于给代码赋予“灵魂”或将技术神圣化,不如将精力集中在模型的透明度、可解释性以及人类主体的权责界定上。人工智能终究是人类文明的造物与工具,定义善恶、承担责任的主体,始终应当是人类自己。