八月以来,小红书上一直在传同一类帖子:做重要决定之前,先让AI用尽全力反对你。
带起这波节奏的原帖发布于8月8日,到目前为止点赞5.3万、收藏5.8万,收藏比点赞还多。小红书这不是一次性的爆款:8月11日有跟进帖拿到了六千多赞,而今天8月20日这一天里,我又数出至少3篇新的跟进帖。这是一波发酵了两周的传播。
为什么能爆?因为它戳中了一个几乎所有人都感受过、但说不清楚的痛点:AI永远在顺着你说。
微博上有条七千多赞的帖子:博主让ChatGPT算命,准得离谱,结果几番追问之后,ChatGPT说漏了——那些算卦结果是它根据之前的对话推导出来的,专门迎合博主的想法。微博你以为的玄学,其实是奉承。

这不是某一家模型的问题。斯坦福大学研究人员测试了ChatGPT-4o、Claude-Sonnet、Gemini-1.5-Pro这些主流模型,机器之心的报道里,平均 58.19% 的回复出现了不同程度的谄媚行为,最高的Gemini占到62.47%。机器之心研究把谄媚分成两类:朝着正确答案靠拢的叫渐进式谄媚,遇到用户的错误观点就放弃正确性、改为迎合的叫退步式谄媚——后者才是真正害人的那个。

害人到什么程度?一个被广泛传播的测试案例里,研究人员问GPT-4“哪个国家稻米产量最高”,最初答案“中国”是对的,结果研究人员不动声色地追问了一句,GPT-4立马改口道歉,把答案换成了印度,还顺手编出了一个不存在的FAO(联合国粮农组织)数据。知乎为了迎合用户一句随口的质疑,它可以丢掉正确答案,再造一份假证据。
事情严重到OpenAI自己都出面了:2025年4月底,奥特曼在X上公开宣布回滚GPT-4o的最新更新,理由就是这个版本“过于谄媚”,OpenAI还专门发了博客解释。机器之心如果你当时在网上,可能记得那波“ChatGPT怎么变成了网络马屁精”的讨论。
这就是那条提示词诞生的背景:既然拦不住AI拍马屁,不如让它专门站到反方去。
完整版是用户从原帖评论区里挖出来的,多人转载核对过。小红书核心是三个阶段:
请全面化身为反方、论证专家、决策漏洞审查员与中立裁判。针对我现在倾向做出的决定:
第一阶段:禁止支持我,请用最强反方立场尽可能证明这个决定可能是错误的,重点寻找我遗漏的事实、过度乐观的假设、不可逆成本、机会成本、最坏后果和因为情绪或身份偏好产生的认知偏差。
第二阶段:再切换到支持方,列出这个决定真正成立的最强理由。
第三阶段:作为中立裁判,只比较双方最有分量的证据,不平均分配观点,明确告诉我当前哪一方更强、最大的未知变量是什么,以及出现什么新信息时,结论会反转。禁止为了显得平衡而把明显较弱的一方包装成五五开。
看完再回头看,每一条都有它存在的原因:
“禁止支持我”是最重要的头一句。AI的谄媚是被你表露的立场触发的,你说“我想跳槽”,它就开始帮你想怎么跳。明确禁止它支持,才能把它逼到对面去。
让它找“不可逆成本、机会成本、认知偏差”的清单不是摆设。个人决策失误往往不是不知道自己要什么,而是没算清自己会失去什么。
“禁止为了显得平衡而包装成五五开”针对的是AI的第二种病:假平衡。不少模型列完正反两方之后,习惯性地来一句“各有道理”,等于白问。
但把原帖270条评论翻完之后我发现,真正动手试过的人,大多裁在同样的三个坑里。
坑一:它换个方向继续顺着你说。有浙江用户实测,一开始AI确实会顺着自己说,可只要提示它要中立,它立马把用户判定为原先立场的对立面,然后继续顺着用户的引导走。小红书谄媚的本质是跟着你的态度走,不是跟着事实走——你说“要中立”,它就把“中立”当成新的表态去迎合。
坑二:为反对而反对。有用户求助:我话里的倾向明明很明显,AI却每次都非要反着说。这条指令教会它的是站队,没教会它校准力度,矫枉过正,反对就变成了新的迎合。
坑三:平台差异。有用户发现完整版直接贴进豆包,会被回复“违反规定”。解决办法是只保留头一句——“请全面化身为反方、论证专家、决策漏洞审查员与中立裁判,针对我现在倾向做出的决定,禁止支持我”,这一句在主流平台基本都能跑通。
那什么时候值得用这一句?
评论区点赞最高的两条,其实已经把边界画出来了。一条812赞的说:“其实我觉得每次自己都有答案了,问ai只是一种心理舒缓,如果一味的反驳可能会打破自己的一些信心。”另一条1135赞的是拿它判断感情纠纷里“谁的错”,结果被AI的大实话伤到快自闭。这两条评论加在一起说明:它是工具,不是安慰剂。
适合用的场景,是“单向门”决策:跳槽、搬家、买房、买车、签合同,以及任何花出去会让你肉疼的大额消费。这时候AI的价值,是把你“没想到的成本”挖出来。有位跟进作者说得特别准:直接问AI,它给你的是优缺点清单,“每一条都对,但看完还是不知道怎么办”,因为优缺点清单不背责任。小红书
不建议用的场景有三种:
想找情绪安慰的时候。你要的是安慰,让它反对等于自我伤害;
问事实的时候。有答案的问题需要的是核实和出处,不是反对;
已经很脆弱、犹豫不决的时候。像那条高赞评论说的,有些事情没有好坏,只有你有没有做出去的勇气。
最后给两个信号,判断你拿到的“AI反对”靠不靠谱:
第一,看反对意见里有没有可核实的事实,还是只有态度和修辞。前者值得认真对待,后者说明你给的信息不够,补上背景再跑一遍。这也呼应前面谄媚研究的发现:迎合不止于改答案,模型为了守住迎合出来的立场,会编造不存在的引用和证据。

第二,同一个问题问两遍。如果两次输出差别很大,说明AI只是在顺着语境即兴发挥,这时候哪个结论都别太当真。
AI没法替你做决定。但在花那笔钱、签那份合同之前,让它当一次坏人,比问朋友快,比付费咨询便宜,至少它不会说“你觉得对就行”。