北大174名化学大二学生与GPT-5等顶尖AI的化学推理对决结果令人震惊。这场硬核测试不仅暴露了AI在多模态理解和逻辑推理上的致命短板,更展现了中国基础学科教育的硬核实力,为AI发展指明了新方向。
智能速览
174名北大学生平均准确率40.3%,顶尖AI最高仅37%
测试覆盖分子结构、化学反应等四大核心领域
引入推理路径一致性指标杜绝AI蒙对答案
图形题导致AI准确率暴跌5%,暴露跨模态短板
AI缺乏科学直觉,推理链条容易断裂
精华内容
这场对决的意义远超输赢本身,它让我们看清了AI的边界与潜力,也让我们看到了人类智慧的不可替代性,更指明了未来人机协同的发展方向。
测试设计
北大化学学院联手计算中心开发的SOGOR CAM系统,设计了500道前沿化学题,覆盖分子结构与性质、化学反应与合成、化学原理与计算、实验设计与分析四大核心。每道题都经过多轮打磨,最多迭代15个版本,彻底杜绝AI靠记忆刷题的可能。更关键的是引入推理路径一致性指标(RPF),即使答案正确但逻辑不符专家思路也算错,确保测试的严谨性。
比赛结果
经过数小时激烈对决,174名北大本科生平均准确率达到40.3%,而表现最好的GPT-5也仅有37%左右。这个结果让所有人震惊,AI在化学推理领域输给了刚学完基础课程的大二学生。值得注意的是,这些题目连北大化学研究生平均准确率也只有50%,40.3%的成绩足以证明本科生的扎实功底和题目难度。
图形题暴露短板
测试加入大量图形题后,AI准确率不升反降。GPT-5在图形题的准确率比文字题低了5%。AI无法将图形中的空间结构、键角、键长等关键信息转化为化学语义。一道环状分子构型题,AI把环状看成链状,搞错键角大小;还有AI看不懂电子转移箭头,把取代反应判成加成反应。而人类学生能凭借空间想象力快速关联图形与化学原理。
AI根本缺陷
AI的核心缺陷在于记住知识而非理解知识。首先是推理链条容易断裂,无法搭建跨维度逻辑链。一道实验设计题需要整合有机、分析、物理化学知识,AI只能按训练路径答题。其次是缺乏科学直觉,会出现违背常识的幻觉,如说氯化氢在水溶液中不电离。最后是无法应对实际变量,只会单一思维。
人机协同未来
这次对决明确了AI的发展方向和人类价值。AI需要突破多模态语义转化和高阶逻辑推理两大短板,从数据记忆者升级为科学思考者。人类优势在于科学直觉、创新思维和临场应变能力,能突破框架提出新想法。两者互补才能发挥最大价值,正如武汉光谷AI制药平台,AI负责快速筛选,人类负责最终决策。
这场对决不是终点而是起点,它让我们认清了AI的边界与潜力,也看到了人类智慧的不可替代。未来不是AI取代人类,而是人机协同探索未知。扎根基础、提升思维、拥抱变化,才能在AI时代站稳脚跟,让科技真正为人服务。
关键评论
普通人在AI时代该如何超越机器,这是关键问题
目前AI只是根据搜索信息猜测结果,距离人类创造性思维还很遥远
AI无法替代人类,只能在人类手下干活,这是现实
视频内容针对性强,解释了AI只是工具,但现阶段已足够恐怖
测试对象是智商精英,普通人如何竞争更值得关注