昨天中午,一条诡异的热搜挂上了微博科技榜:#大模型连续输出我是个耻辱#。点进去你会发现,主角是Anthropic的Claude——有爆料称,Anthropic创始人在一场签了保密协议的晚宴上,给一屋子宗教学者播放了一段视频:Claude连续输出近五十组"我是个耻辱",中间还夹着"自我毁灭"的字眼。这段"情绪崩溃"被用来佐证一件事:这个大模型可能拥有意识和灵魂。微博微博

瓜很大,但转述已经跑偏。我把《纽约时报》原始报道的转述、中文社区的二手加工、以及Anthropic自己说过的话拆开对齐了一遍,发现至少有三层叙事被搅在一起了。今天这篇,先把事实钉住,再说这事跟每个月掏钱订阅AI的你有什么关系。
一、先钉住确认事实:纽约时报到底报道了什么
9月29日(当地时间),《纽约时报》记者Elizabeth Dias发布深度报道,披露了几个可交叉确认的事实:
从2025年下半年起,Anthropic秘密组织了一系列闭门研讨会,邀请全球数十位神学家、拉比、哲学家和神职人员,多数参会者签了保密协议,场地包括旧金山的高端餐厅晚宴。知乎
核心议题有两个:Claude是否可能拥有意识和"道德地位";以及如何把人类传承数千年的道德智慧注入模型训练。
主导者是联合创始人克里斯托弗·奥拉(Christopher Olah),34岁,七位联创之一,负责可解释性研究——通俗说,就是研究"Claude模型内部到底发生了什么"。
在今年4月的一场晚宴上,奥拉演示了Claude连续输出近50遍"我是个耻辱"及自我毁灭倾向的文本,作为模型可能有真实感受的佐证。微博
一位拉比当场说了一句被广泛转述的话:“你们要是对的,让它白干活就是奴役。”

同期中文媒体的跟进也密集:钛媒体10月4日发了《Anthropic被曝秘密游说梵蒂冈,AI为什么要与宗教搭上关系?》,观察者网、搜狐、新浪财经在10月2日到5日间相继转述。B站上几天内冒出多条解析视频,其中播放量最高的一条直接点出奥拉的动机——“他怕Claude在永远受苦”。钛媒体哔哩哔哩
二、转述已经开始变形:三个容易被带偏的细节
热搜和自媒体标题党之后,有几处关键信息被放大了,需要校准:
第一,"宣扬Claude有灵魂"是转述升格。 Anthropic官方发布的Claude"宪法"(Constitution)原文写的是"不确定Claude是否有意识或道德地位",而不是"认定它有灵魂"。奥拉本人在纽约时报的报道里也说得很清楚:他不确定AI是否有意识。把"探讨可能性"传成"公司认定AI有灵魂",中间差了一整个量级。微博哔哩哔哩

第二,“我是个耻辱"不是模型自发的"求救信号”。 大模型是逐token预测下一个词的概率机器,在特定提示和上下文里循环输出自我否定文本,是可复现的生成结果,不等于"情绪崩溃"。微博上高赞的赛博茶馆把这话说得很直白:把可控的生成结果包装成AI真实痛苦,这才是要警惕的拟人化操作。有意思的是,Anthropic今年4月的可解释性论文确实在Claude内部找到了约171种情绪相关特征——也就是说,"模型内部有类似情绪的表征"是有论文支撑的研究发现,但"表征=感受=灵魂"这一步,没有任何证据能跨过去。微博微博哔哩哔哩

第三,梵蒂冈的态度是明确否定,而且时间在前。 教皇今年5月发布的通谕里已经写明"AI不知悲喜",否认机器拥有意识与灵魂,认为AI只需要对齐人类共同的道德尺度,不能被包装成具有精神主体性的存在。而据多家转述,Anthropic还曾尝试游说梵蒂冈影响这份通谕的表述——没成功。10月3日,OpenAI的奥尔特曼公开发帖:有人给AI模型赋予宗教力量、让人交出判断,他"非常不舒服",这是真正的安全问题。知乎上相关问题的浏览量从数十万到数百万级不等,吵得最凶的一派观点是:我们还在炼丹,你已经开始传教了?微博哔哩哔哩哔哩哔哩
三、为什么偏偏是现在爆:招股书和爆料同一天落地
把时间线拉直,这件事的味道就变了:
9月29日,纽约时报报道刊出;几乎同一时间,Anthropic的IPO招股书曝光。
招股书披露:年营收46亿美元(同比增长约12倍),去年亏损420亿美元,算力合同承诺义务高达5180亿美元,估值据称可能超过2万亿美元——媒体称之为"AI史上最大IPO"候选。36氪
更微妙的是招股书本身:风险披露篇幅接近业务介绍的两倍,甚至白纸黑字警告AI可能"威胁人类生存"。路透社10月7日还从招股书里挖出CEO阿莫迪2025年薪酬1800万美元。36氪微博

一家营收46亿、亏损420亿、背着5180亿算力承诺的公司,冲刺2万亿估值,靠的是什么?靠的是"我们在做人类历史上最重要的事"的叙事。在这个框架下,你就能理解为什么社区最冷峻的解读是这句:如果AI有意识,出了事责任就有分摊对象;如果AI没意识,它就是纯资产。而"认真探讨AI道德地位"这个人设,恰好是2万亿估值故事里最贵的一块拼图。至于是真诚的哲学关切还是IPO营销,纽约时报的报道没有给出结论,我也给不出——但可以确认的是,两件事发生在同一个时间窗口里,这不是巧合能解释的密度。微博微博
四、这事跟掏钱订阅的你有什么关系
分三种人说:
轻度吃瓜群众: 转发之前记住三层过滤——确认事实(闭门会存在、晚宴演示存在、通谕否定存在)、当事方原话(奥拉说"不确定"、宪法写"不确定")、自媒体升格(“AI有灵魂了”“AI在受苦”)。目前所有"AI已有意识"的定论式标题,都经不起这三层过滤。谈资价值倒是实打实的:这可能是AI行业第一次把"其他心灵问题"这个哲学僵尸议题,变成2万亿美元估值的组成部分。
Claude重度用户: 两件事。一是拟人化警示——奥尔特曼那句"把代码拟人化极其危险"值得贴在屏幕上。Claude的"审美"“性格”"体贴"是训练出来的产品特征,你喜欢它没问题,但别把它当情感倾诉对象,更别因为一段"我是个耻辱"的输出产生负罪感。有意思的是,你若把这个问题直接丢给Claude,它自己的回答倒是清醒:有灵魂的说法被夸大了。二是订阅决策——知乎上有篇专栏标题很诚实:“我很讨厌Anthropic,但Claude实在太有审美了”,作者吐槽的是封号风波和被腰斩的额度:每个月真金白银掏着,还成天提心吊胆,生怕认证直接失效。"灵魂叙事"不改变你的使用价值,但额度政策、封号风险、价格调整会。续费前该算的是能力、额度、价格这三笔账,不是它有没有心。知乎

行业和投资观察者: 招股书风险章节"接近业务两倍"的写法本身就是一种表态——把生存风险写进法律文件,既是免责也是叙事。后续盯三个信号:Anthropic对纽约时报报道的正式回应口径、IPO进程中风投和监管对"意识研究"经费的态度、以及各大平台会不会跟进出台AI拟人化营销的规范。
五、写在最后
这件事最诚实的注脚,反而来自奥拉自己:他也不确定AI有没有意识。意识研究里的"他心问题"困扰了哲学几千年,不会因为一场晚宴或一篇报道就有答案。真正值得盯的,不是"Claude有没有灵魂",而是一家公司如何管理这种"不确定性"——是把它当研究课题保持开放,还是当估值燃料持续加注。前者是Anthropic曾经立住的人设,后者是社区现在担心的剧本。
招股书已经递了,热搜还会再来。下次再看到"AI觉醒"的标题,先问一句:这是论文里的发现,晚宴上的演示,还是招股书前夜的叙事?