张大妈

测了10款大模型,这道题居然只有两家做对

源自小红薯:AI冷科长

02-28 14:51

一道考察空间参照系转换的镜像逻辑题,成为检验大模型真实推理能力的试金石。测试覆盖GPT、Gemini、千问、DeepSeek等主流模型,结果揭示免费版普遍存在‘自信式错误’,而中文语境下的深度推理能力正出现结构性变化。

测了10款大模型,这道题居然只有两家做对智能速览

  • 10款主流大模型中仅DeepSeek R1与千问准确作答并给出清晰推理路径

  • Gemini与ChatGPT免费版均给出错误答案,且推理过程看似严谨实则失准

  • 题目核心在于区分‘观察者视角’与‘镜像参照系’,非简单左右判断

  • 千问表现超出预期,推理稳定、无反复修正,直击问题本质

  • 测试反映中文复杂逻辑任务中,国产新模型已具备差异化竞争力

测了10款大模型,这道题居然只有两家做对精华内容

当人站在镜子前举起右手,镜中影像的‘右手’实际位于画面左侧——但问题真正考验的,不是常识记忆,而是能否主动切换坐标系进行元认知推理。

题目本质

题目为:‘我正对镜子站立,举起一只手。在镜中影像里,这只手出现在画面左侧。请问现实中我举起的是哪只手?’

表面是左右判断,实则是空间参照系建模能力测试。正确解法需明确三个层级:现实物理空间、镜像光学映射、以及观察者对‘左侧’这一表述所依赖的参考坐标(是镜面自身坐标,还是观察者身体坐标)。

多数模型将‘镜中左侧’直接等同于‘我身体的左侧’,陷入语言表述陷阱,未完成坐标系主动转换。

失败模型共性

Gemini免费版与ChatGPT-4o免费版均输出‘左手’,并辅以看似合理的解释,如‘镜像翻转左右,因此镜中左侧对应现实右手’——该推论默认镜像翻转发生在垂直于镜面的轴上,却忽略了题干中‘镜中影像的左侧’这一描述本身是以镜面为画布的二维坐标系。

实测显示,8款未答对模型中,7款在首轮响应即给出确定结论,0款出现自我质疑或分步验证;平均响应时间1.3秒,体现‘快速但浅层’的推理模式。

千问突破点

千问不仅给出‘右手’答案,更在推理中明确定义:‘题干中‘镜中影像的左侧’指镜面平面上的左侧,即观察者正对镜面时,其右侧在镜中呈现于画面左侧’。

它主动拆解了‘左侧’的归属坐标系,并指出‘举起的手在镜中位于画面左侧’与‘我举起的是右手’构成充分条件关系。全程无冗余假设,未引入‘镜像翻转’等易引发歧义的物理术语,全部基于题干可验证的视觉关系展开。

DeepSeek R1表现

DeepSeek R1同样答对,但路径略有不同:先确认镜像为前后轴反转,再说明‘当人面镜站立时,其右侧在镜中投影位置处于镜面平面的左侧区域’,最后关联题干描述得出结论。

其推理包含基础光学原理锚定,步骤数比千问多1步,耗时延长0.8秒,但每步均有显式前提标注。在10款模型中,它是唯一对‘镜面平面坐标系’与‘人体坐标系’做出术语区分的模型。

这场小规模但高精度的测试,暴露出当前大模型在语义精确性与参照系管理上的普遍短板。当AI开始承担教育、法律咨询等需零容错推理的场景时,‘答得快’远不如‘想得准’重要。国产新模型在中文逻辑任务中的稳健表现,是否预示着训练数据语境优势正转化为推理架构优势?这值得持续追踪。

测了10款大模型,这道题居然只有两家做对关键评论

  • 终于信服自家豆包了,不过过程中我的表述有没有漏洞,反而结果让它答对了

  • 它说的是以镜面为参考系的左侧,而不是人正对镜子所见的左侧[doge]

  • 连我也懵了。‘在镜子的左侧’——镜子有左右吗?

  • 测了10款模型只有两家答对?!什么题这么难🤔 是逻辑推理还是代码生成类的?

  • 在现实中右侧镜像中为左侧。因为,在镜像中的你已经转了180°

内容由AI生成
2
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章