一个简单的洗车问题——“50米距离,开车还是步行”,竟能让一众顶尖大模型集体“翻车”。这些能解答奥赛难题的AI,为何在常识性问题上犯低级错误?这背后揭示了当前大语言模型与人类思维的根本差异,帮助更清醒地认知AI的能力边界。
智能速览
多个主流大模型在洗车问题上建议步行,犯了低级错误。
AI错误的根源在于其基于统计预测的工作模式,而非人类逻辑。
专家举例说明AI难以理解文字的“话外音”和深层意图。
明确提示词中的“场景”和“目标”是有效引导AI的关键。
尽管无法100%避免错误,但工程调优正持续改进AI表现。
精华内容
面对AI在简单问题上的失误,与其感到惊奇,不如深入探究其背后的技术原理。这并非偶然的bug,而是现阶段大模型工作模式的必然产物。
“翻车”现场
一个距离50米的洗车店,却让包括豆包、DeepSeek、元宝、千问、ChatGPT等在内的国内外主流大模型都建议用户步行前往。它们一本正经地分析着开车的麻烦,如掉头、找车位耗时,却完全忽略了“洗车”这一核心任务必须将车开到店里的基本常识。这一集体失误,生动展现了AI在特定情境下的“不聪明”。
失误根源
西湖大学教授张岳博士指出,深层原因在于大语言模型的工作模式。它们通过在海量数据上预测下一个词来生成回答,本质上是一种统计学习。这种模式让AI随着模型和数据规模的增大而变聪明,但它并非按照人类的严密逻辑来思考,导致了在看似简单的问题上可能表现得非常脆弱。
“话外音”难题
AI与人类在理解上的差异,体现在对“话外音”的处理上。张岳博士以《诛仙》中的桥段举例:当男女主角对话时,一袭绿色裙摆飘过,人类读者能立刻联想到有第三人在场。但AI可能会机械地将裙摆的主人理解成女主角,因为它无法进行这种基于常识和联想的深层推理。洗车问题的失误也源于此,AI未能理解“开车”是“洗车”这一意图的必要行动。
如何引导AI
那么,如何避免AI犯此类错误?关键在于提供更明确的指令。如果在提问时,将场景和目标补充完整,例如“我要洗车,但车停在家里”,AI就能给出正确的答案。有模型(蚂蚁灵光)成功回答了此问题,也有模型(元宝)进行了自我反思,指出AI有时会卡在字面意思,忽略指令背后的意图。
未来的路
从技术原理上看,大模型的研发模式决定了现阶段无法100%根除这类问题。但随着工程调优技术的不断进步,AI理解人类意图的能力正在逐步增强,未来表现有望越来越好。正确认知并学会与当前的AI协作,是发挥其最大价值的关键。
从洗车问题出发,这番探讨让我们得以窥见AI强大能力背后的运作机制与潜在盲点。它提醒我们,在拥抱技术便利的同时,理解其边界并掌握有效的沟通技巧至关重要。在与AI共存的未来,人类将如何更好地引导和利用这些强大的工具?