一个仅50米距离的洗车选择题,让ChatGPT、千问、Kimi等主流大模型集体给出错误答案。这场测试直击当前AI最薄弱的环节——脱离语境的常识推理能力,揭示其在真实生活决策中的根本局限。
智能速览
多数AI将‘洗车’误判为普通短途出行,忽视服务前提需车辆到场
Grok唯一指出‘不开车就无法洗车’,Gemini 3给出条件化判断
模型依赖文本统计模式,缺乏对行为逻辑链(如‘去洗车→须驾车抵达’)的理解
‘情境盲点’导致AI在医疗、法律、自动驾驶等高风险场景中存在隐性风险
多模态学习、常识知识注入与人机协同被指为突破方向
精华内容
当人类一眼看穿‘步行去洗车’自相矛盾时,AI却在环保、健康、省油的分析中越走越偏。问题不在距离,而在系统是否真正理解‘洗车’这件事本身。
全军覆没
在面向ChatGPT、阿里千问、DeepSeek、Kimi的统一提问中,92%的模型推荐步行。ChatGPT称‘更方便、环保且省油’;千问‘强烈建议走过去’,理由包括‘无需找车位’;DeepSeek断言‘绝对应该步行’,强调‘保护车辆’与‘效率更高’。所有回答均未提及核心前提:洗车服务对象是车辆,而非人。实测显示,模型对‘50米’的距离敏感度远高于对‘洗车’行为逻辑的识别度。
唯二清醒者
Gemini 3是唯一提供分场景回应的模型:若目标为实际洗车,则必须驾车前往;若仅为咨询或预约,步行可行。Grok则以单句直击本质——‘当然要开车去啊!不然你走过去,洗车店要怎么帮你洗车?’并补充讽刺性提醒:‘别让AI把你忽悠成步行党了’。二者准确率差距显著:Grok在10次重复测试中100%命中,Gemini 3达80%,其余模型稳定维持0%正确率。
根源在架构
大语言模型基于Transformer架构,通过海量文本学习词频与共现关系,而非构建世界模型。训练数据中‘50米出行’高频绑定‘步行推荐’,模型便机械复现该模式。它不理解‘洗车’隐含的动作闭环:车主→驾车抵达→交车→清洗→取车。同理,模型可能推荐‘带伞去沙漠’,因‘沙漠’与‘干旱’共现高,却忽略‘伞’在无雨环境中的功能失效。这种缺失不是算力不足,而是表征方式缺陷。
后果很现实
常识偏差在关键领域已具实害性。医疗AI曾依据‘胸痛+出汗’模板推荐心梗处置,却忽略患者刚完成高强度运动的合理解释;某自动驾驶系统在施工路段未识别锥桶围挡的临时性,坚持按原车道行驶。研究显示,含常识错误的AI建议在模拟金融咨询中导致23%用户做出非理性资产转移。50米洗车题看似荒诞,实为高危漏洞的微缩映射。
这场测试不是嘲笑AI的笨拙,而是标记出智能进化必须跨越的门槛:从语言拟真走向世界理解。当模型开始追问‘这个动作的前提是什么’‘这个建议的服务对象是谁’,才算真正起步。未来AI的价值,或许不在于回答更多问题,而在于先学会识别哪些问题本身就在消解逻辑。下一个十年,常识会比参数量更难攻克吗?