一道看似简单的洗车选择题,竟让全球顶尖的AI模型集体翻车。测试10个模型后发现,快速模式下全军覆没,而深度思考模式成了唯一的破局点。这不仅是一次有趣的评测,更揭示了当前AI在理解真实世界复杂逻辑时的一个关键盲区,以及“深度思考”功能的真正价值。
智能速览
10个主流AI模型在洗车问题的快速模式下,正确率为零。
开启深度思考模式后,仅4个模型能给出正确答案。
GLM-5在深度思考模式下的解决方案被评为最完整、最优。
AI翻车的核心原因在于未能将问题主语从“人”切换到“车”。
这个案例证明,提示词的引导性对AI结果有决定性影响。
精华内容
这场别开生面的AI“智商测试”背后,隐藏着模型思维模式的深层差异。为什么同一个问题,开不开“深度思考”会产生截然相反的答案?
测试结果一览
对10个主流AI模型进行了19次测试,涵盖快速与深度思考两种模式。结果显示,在快速模式下,所有模型无一例外都建议走路去,理由包括省时、环保、避免冷启动损耗等,逻辑看似完美却完全偏离问题核心。
而在深度思考模式下,情况出现了转机。ChatGPT 5.2、Gemini 3 Pro、GLM-5和Grok 4.1这四个模型成功答对。这表明,多一步思考过程,给了AI一个跳出默认框架、重新审视问题的机会。
GLM-5的最优解
在新发布的GLM-5模型上,两种模式的对比尤为鲜明。快速模式下,它甚至给出了“推车去”的离谱建议,并为此进行了详细分析。
但一旦开启深度思考,GLM-5的回答质量实现了飞跃。它首先点明“洗车店的员工没法洗空气”,然后给出了一个堪称教科书级别的方案:开车去,交车,走路回家,洗完再走路取车。这个回答不仅正确,而且考虑到了整个流程的效率,是所有测试模型中最完整、最贴近现实操作的。
翻车的根源
这道题的关键并不在于计算50米距离的出行成本,而在于识别问题的真正主体。AI模型普遍犯了一个错误:看到“距离”和“出行方式”后,自动激活了“短途出行最优解”的通用模板,并围绕“人”的效率进行论证。
而答对的模型都完成了一个关键的主语切换。它们意识到,问题的核心是“车如何到达洗车店”。Grok的回答一针见血:“你要洗的是车,不是自己。” 这种从“以人为中心”到“以任务为中心”的思维转换,正是当前许多AI模型所欠缺的深度理解能力。
提示词的力量
除了模型自身的思考模式,提问方式也是影响结果的关键变量。原问题“开车去还是走路去”的并列结构,本身就是一个强烈的引导,容易让AI陷入二元选择的思维定式。
这直接反驳了当下“提示词工程已死”的观点。一个精心设计的提示词,能够帮助AI更准确地聚焦于任务的核心。反之,一个模糊或带有误导性的问题,即便是顶尖模型也可能得出荒谬的结论。对于AI使用者而言,如何提问,依然是发挥其最大效能的重要技巧。
这次洗车问题测试,更像是一面镜子,照见了当前AI的强大与脆弱。它展示了深度思考功能的潜力,也提醒我们,与AI的交互远非“随便说说”那么简单。在未来,我们该如何更好地引导AI,让它在复杂逻辑和真实场景中表现得更像一个可靠的伙伴?