随着人工智能技术向科学研究领域渗透,AI for Science(AI4S,或称科学智能)正成为全球科技巨头和顶尖实验室竞相布局的下一个前沿。然而,前DeepMind资深研究科学家曹原指出,AI4S当前最难的环节是“验证”。这一观点揭示了AI赋能自动科研所面临的核心瓶颈:AI生成假设的速度与人类及物理世界验证这些假设的能力之间,存在着巨大的鸿沟。
科学研究的传统流程通常包括提出假设、设计实验、执行与观测、分析数据并得出结论。AI,尤其是大模型,凭借其强大的推理、编程和模式识别能力,正在显著加速前端的“提出假设”和“模拟设计”环节。例如,在材料科学和药物研发中,AI可以在短时间内生成数以万计的潜在新分子结构或新材料候选。然而,这些在数字世界中诞生的“答案”,距离成为真正的科学发现还有很长的路要走,而这条路正是由“验证”铺就的。
“验证”之所以成为瓶颈,其根本原因在于科学与纯粹的数学或编程问题存在本质差异。曹原在访谈中提到,AI在编程和数学领域进展迅速,得益于其快速、低成本的验证闭环。代码写完可以立即运行测试,数学证明可以通过形式化工具(如Lean)进行严格的逻辑校验。反馈是即时且确定的,这使得AI能够通过“生成-验证-修正”的循环快速迭代和自我改进。
但在材料、生物、物理等大多数科学领域,验证必须进入物理世界。一个AI设计的全新药物分子,其有效性和安全性必须通过复杂的“湿实验”(wet lab)来检验,包括化学合成、细胞实验、动物实验,最终是漫长且昂贵的临床试验。一个新材料的性能,也需要真实合成并进行物理、化学性质的表征。这些物理验证过程周期长、成本高、复杂度高,无法像运行一段代码那样即时完成。当AI以指数级速度生成候选方案时,实验室的验证能力仍是线性增长,甚至更慢。这就形成了“假说爆炸”与“验证瓶颈”的剪刀差:实验室门口排起了长队,等待验证的AI假设越积越多,科研的整体效率瓶颈从“设计端”被推向了“实验验证端”。
这一瓶颈带来了多重挑战。首先是信任危机与“AI幻觉”。AI生成的结论可能看似合理,但缺乏严格的验证,就无法排除其是基于错误关联或模型幻觉的“伪发现”。已有研究指出,许多自动化科研系统在缺乏严格审计和外部验证的情况下,容易出现隐藏负面结果、挑选数据(cherry-picking)等问题,其产出的“论文”或“结论”可信度存疑。
这给科研生态带来了巨大的负担。在数学领域,AI已能生成大量复杂猜想的候选证明,但人类数学家没有足够的时间和精力去逐一审查,导致“证明过剩”的现象。这种由AI生成的海量内容,正在加剧学术界的审稿压力,甚至可能出现“劣币驱逐良币”的风险,让真正有价值的创新成果被淹没。
面对这一核心瓶颈,学界和业界正在探索多种解决方案。一种思路是加速物理世界的验证过程,即通过自动化实验室(AutoLab)和机器人技术,让实验流程本身也实现自动化,从而打造从“AI提出假设”到“机器人执行实验”再到“数据反馈给AI”的完整闭环。目前,如Ginkgo Bioworks的自动化生物实验平台,以及一些在材料科学领域实现AI计算与自动化实验联动的“智能研发工厂”,都在尝试打通这个闭环。

另一种更为务实的路径是构建“人机协同”的科研范式。这种模式不追求完全的自动化,而是将AI定位为强大的研究助手,让人类科学家保留最终的判断权和决策权。AI负责执行重复性高、计算量大的任务,如数据处理、文献检索、代码编写和初步模拟,而人类则专注于提出有品位的问题、设计关键实验、解读异常结果,并在关键节点进行方向性的判断和纠偏。
此外,强化AI自身的可验证性也至关重要。研究人员正致力于开发新的AI架构和训练方法,使其不仅能生成结论,更能提供可追溯、可审查的证据链。例如,通过过程监督(process supervision)奖励“走对研究过程”而非仅仅“说对结论”,或设计交叉验证机制,让不同的AI模型相互评审,以提高结果的可靠性。
归根结底,曹原所指出的“验证”瓶颈,不仅是一个技术问题,更是一个关乎科研范式和学术伦理的结构性问题。它提醒我们,AI在科学发现中的角色,并非简单地替代人类,而是重构了整个科研流程。未来,真正的突破将不仅取决于AI生成假设的能力有多强,更取决于我们能否建立起高效、可信的验证体系,来驾驭和确认这些由AI带来的海量可能性。只有当“验证”这一环被有效打通,AI自动科研才能真正从概念上的加速器,转变为推动知识边界拓展的强大引擎。