当前位置:
AIGC文章详情

AI科研“假说爆炸”难落地,前DeepMind科学家:验证才是真瓶颈

源自50位全网作者

07:35

随着人工智能技术向科学研究领域渗透,AI for Science(AI4S,或称科学智能)正成为全球科技巨头和顶尖实验室竞相布局的下一个前沿。然而,前DeepMind资深研究科学家曹原指出,AI4S当前最难的环节是“验证”。这一观点揭示了AI赋能自动科研所面临的核心瓶颈:AI生成假设的速度与人类及物理世界验证这些假设的能力之间,存在着巨大的鸿沟。

科学研究的传统流程通常包括提出假设、设计实验、执行与观测、分析数据并得出结论。AI,尤其是大模型,凭借其强大的推理、编程和模式识别能力,正在显著加速前端的“提出假设”和“模拟设计”环节。例如,在材料科学和药物研发中,AI可以在短时间内生成数以万计的潜在新分子结构或新材料候选。然而,这些在数字世界中诞生的“答案”,距离成为真正的科学发现还有很长的路要走,而这条路正是由“验证”铺就的。

“验证”之所以成为瓶颈,其根本原因在于科学与纯粹的数学或编程问题存在本质差异。曹原在访谈中提到,AI在编程和数学领域进展迅速,得益于其快速、低成本的验证闭环。代码写完可以立即运行测试,数学证明可以通过形式化工具(如Lean)进行严格的逻辑校验。反馈是即时且确定的,这使得AI能够通过“生成-验证-修正”的循环快速迭代和自我改进。

但在材料、生物、物理等大多数科学领域,验证必须进入物理世界。一个AI设计的全新药物分子,其有效性和安全性必须通过复杂的“湿实验”(wet lab)来检验,包括化学合成、细胞实验、动物实验,最终是漫长且昂贵的临床试验。一个新材料的性能,也需要真实合成并进行物理、化学性质的表征。这些物理验证过程周期长、成本高、复杂度高,无法像运行一段代码那样即时完成。当AI以指数级速度生成候选方案时,实验室的验证能力仍是线性增长,甚至更慢。这就形成了“假说爆炸”与“验证瓶颈”的剪刀差:实验室门口排起了长队,等待验证的AI假设越积越多,科研的整体效率瓶颈从“设计端”被推向了“实验验证端”。

这一瓶颈带来了多重挑战。首先是信任危机与“AI幻觉”。AI生成的结论可能看似合理,但缺乏严格的验证,就无法排除其是基于错误关联或模型幻觉的“伪发现”。已有研究指出,许多自动化科研系统在缺乏严格审计和外部验证的情况下,容易出现隐藏负面结果、挑选数据(cherry-picking)等问题,其产出的“论文”或“结论”可信度存疑。

这给科研生态带来了巨大的负担。在数学领域,AI已能生成大量复杂猜想的候选证明,但人类数学家没有足够的时间和精力去逐一审查,导致“证明过剩”的现象。这种由AI生成的海量内容,正在加剧学术界的审稿压力,甚至可能出现“劣币驱逐良币”的风险,让真正有价值的创新成果被淹没。

面对这一核心瓶颈,学界和业界正在探索多种解决方案。一种思路是加速物理世界的验证过程,即通过自动化实验室(AutoLab)和机器人技术,让实验流程本身也实现自动化,从而打造从“AI提出假设”到“机器人执行实验”再到“数据反馈给AI”的完整闭环。目前,如Ginkgo Bioworks的自动化生物实验平台,以及一些在材料科学领域实现AI计算与自动化实验联动的“智能研发工厂”,都在尝试打通这个闭环。

AI科研“假说爆炸”难落地,前DeepMind科学家:验证才是真瓶颈

另一种更为务实的路径是构建“人机协同”的科研范式。这种模式不追求完全的自动化,而是将AI定位为强大的研究助手,让人类科学家保留最终的判断权和决策权。AI负责执行重复性高、计算量大的任务,如数据处理、文献检索、代码编写和初步模拟,而人类则专注于提出有品位的问题、设计关键实验、解读异常结果,并在关键节点进行方向性的判断和纠偏。

此外,强化AI自身的可验证性也至关重要。研究人员正致力于开发新的AI架构和训练方法,使其不仅能生成结论,更能提供可追溯、可审查的证据链。例如,通过过程监督(process supervision)奖励“走对研究过程”而非仅仅“说对结论”,或设计交叉验证机制,让不同的AI模型相互评审,以提高结果的可靠性。

归根结底,曹原所指出的“验证”瓶颈,不仅是一个技术问题,更是一个关乎科研范式和学术伦理的结构性问题。它提醒我们,AI在科学发现中的角色,并非简单地替代人类,而是重构了整个科研流程。未来,真正的突破将不仅取决于AI生成假设的能力有多强,更取决于我们能否建立起高效、可信的验证体系,来驾驭和确认这些由AI带来的海量可能性。只有当“验证”这一环被有效打通,AI自动科研才能真正从概念上的加速器,转变为推动知识边界拓展的强大引擎。

内容由AI生成

精选参考来源

1. 前DeepMind科学家曹原称AI4S最难的是「验证」,为什么「验证」会成为AI自动科研的关键瓶颈?

前DeepMind科学家曹原称AI4S最难的是「验证」,为什么「验证」会成为AI自动科研的关键瓶颈? 我提一个最关键的问题:如果我在申基金本子里面写,我打算人工验证本领域近期内众多AI生成的正确性存疑

2. 对话前DeepMind曹原:AI for Science爆发

对话前DeepMind曹原:AI for Science爆发 8月第一周,谷歌灵魂人物Jeff Dean带着其他几位高管离开Google,创办Discovery Loop,将目光投向AI for Sc

3. AI4S的下一个共识

AI4S的下一个共识 看完今年人工智能科学大会,有种很奇妙的感觉。 几位院士提出的方向,正好对应了我们过去一年一直在做的三件事。我们不被容易理解的路线,正在成为新一轮AI4S的共识。 ——

4. 细说Ai支线AI4S

细说Ai支线AI4S AI4S(AI for Science,科学智能) 是指利用人工智能技术加速科学研究和发现,与通用大模型不同,科学大模型需要融合学科专业知识、实验数据和科研规则。2024年英伟达

5. AI4S产业链全景解析

AI4S产业链全景解析 核心驱动:AI for Science(AI4S)将人工智能深度嵌入科学研究全流程——从分子设计、药物发现到材料筛选、反应优化,显著提升候选生成与研发迭代效率。AI4S被市场视

6. 【正片】AI4s,当AI开始创造材料…

【正片】AI4s,当AI开始创造材料… 商业可行的清洁能源材料,往往要经过十年以上的开发周期;而材料空间本身极其庞大,单靠一个个实验根本无法穷尽。 AI出现后似乎有了一个新的解法。近年的学术研究都

7. 对话前DeepMind曹原:AI for Science爆发,一个新时代到来了

对话前DeepMind曹原:AI for Science爆发,一个新时代到来了 对话前DeepMind曹原:AI for Science爆发,一个新时代到来了硅谷1011787048570 8月第一周

8. 对话前DeepMind曹原:AI for Science爆发,一个新时代到来了

对话前DeepMind曹原:AI for Science爆发,一个新时代到来了 对话前DeepMind曹原:AI for Science爆发,一个新时代到来了钛媒体APP1787111355 (本文作

9. 一图看懂,什么是AI4S?

一图看懂,什么是AI4S? AI4S(AI for Science,科学智能)的核心跃迁在于 AI 不再只是做摘要、查资料的“对话助手”,而是深度介入数学证明、生物制药、化学合成与新材料筛选的全流程,

10. AI4S产业链全景解析核心驱动:AI for Science(AI4S)将人工智能深度嵌入科学研究全流程——从分子设计、...

AI4S产业链全景解析核心驱动:AI for Science(AI4S)将人工智能深度嵌入科学研究全流程——从分子设计、... AI4S产业链全景解析核心驱动:AI for Science(AI4S)

11. 自主研究代理:AI科学家综述和验证差距

自主研究代理:AI科学家综述和验证差距 这篇论文聚焦于自主研究智能体(LLM-driven autonomous research agents)在端到端科研流程中产生的验证差距(verificati

12. 和七千名科学家一起做AI4Science实验

和七千名科学家一起做AI4Science实验 最近挂出来一篇长达八十多页的新论文 可以说是我的方法论集大成之作[笑哭R] 从实验 到AI/训LLM 到因果推断 到formal model全用了一遍 我

13. AI for Science正在爆发,最慢的一环还在实验室里 如果AI能源源不断地提出新假设,实验室却来不及验证,科...

AI for Science正在爆发,最慢的一环还在实验室里 如果AI能源源不断地提出新假设,实验室却来不及验证,科... AI for Science正在爆发,最慢的一环还在实验室里 如果A

14. OmniScientist:全模态全学科AI科学家

OmniScientist:全模态全学科AI科学家 AI真的可以独立做完整科研了✨ 传统AI科学家大多只能处理文本、预计算好的特征数据 只能走一遍“假设‑实验‑写论文”流程 却看不到原始数据里的空间、

15. 关于AI4S的一些想法7️⃣

关于AI4S的一些想法7️⃣ 接6️⃣,已躬身入局[doge] 距离上一篇AI4S的帖子已经过了一年,最近突然想重新开始记录。都说能力越大,责任越大,那么在能力还不太够的年龄,随性多记录一下吧。希

16. AI自动做科研全流程

AI自动做科研全流程 🔬 发现一个超强的AI科研助手,上传数据就能自动跑完整个研究流程! 最近读到一篇论文叫SciDER,来自威廉与玛丽学院等高校的团队。说实话看完有点震撼,感觉科研的方式真的要变

17. 不要太相信ai可以全自动科研

不要太相信ai可以全自动科研 我看到很多xhs在推全自动科研 尽管我自己也在做open-scholar- skill。stem的短文可能质量不错 但是人文社科的一年生成高质量文章都是耍流氓。我们测试了

18. 每天吃透一个AI知识点AI4S(AI for Science)

每天吃透一个AI知识点AI4S(AI for Science) AI for Science(AI4S)这个词最近出现的频率越来越高。 你可能听说过 AI 能画画、AI 写文章,但你听说过 AI

19. 上海AILab :科研 Agent 要会验过程

上海AILab :科研 Agent 要会验过程 科学发现 Agent 已经能读数据、写代码、跑统计分析,但真正难的不是生成一个结论,而是每一步分析有没有被证据支撑。 很多现有评测只看结论对不对。问

20. Baker最新发表,快速验证百万AI设计的蛋白

Baker最新发表,快速验证百万AI设计的蛋白 David Baker团队又推进了AI蛋白设计的重要一步。 过去几年,AI已经可以生成海量蛋白设计。 但新的瓶颈出现了:设计得出来,如何快速验证? 最新

21. 试完 Auto Research,我发现科研不能没人

试完 Auto Research,我发现科研不能没人 这两个月,我把主流 Auto Research 产品几乎都跑了一遍。 最后我的判断非常直接: ⚠️ 大多数科研自动化工具,都把科研误解成了一个不需

22. AI4S制药

AI4S制药 AI制药进入“内嵌研发”阶段,产业逻辑从概念兑现到订单可见。 过往制药领域存在双十困境、研发支出高收益低,把AI4S理解成给药研装上加速器,过去靠人海战术试错,现在靠AI快速筛选合成

23. AI自己做科研,怎么防幻觉

AI自己做科研,怎么防幻觉 🤯 AI 全自动做科研,可怕的不是做不出来,而是一本正经给出不成立的结论。 EvoMap 和清华的 AutoResearch 把流程拆成两段:一段管这方向凭什么值得试,

24. #深小图读报# 【《上海发布国内首个零人工介入物质科学“智能研发工厂”》——从技术验证走向商业落地的技术闭环】如何加快破...

#深小图读报# 【《上海发布国内首个零人工介入物质科学“智能研发工厂”》——从技术验证走向商业落地的技术闭环】如何加快破... 【《上海发布国内首个零人工介入物质科学“智能研发工厂”》——从技术验证

25. AI 🦞全自动研究?快醒一醒!!

AI 🦞全自动研究?快醒一醒!! Karpathy带火了auto research之后就被各种刷屏,xhs全是"AI科学家来了"、"睡一觉醒来论文写好了" 的各种skills, agents。这些re

26. 大模型为何无法独立发明相对论?DeepMind称其“跳”不过去

大模型为何无法独立发明相对论?DeepMind称其“跳”不过去 大模型为何无法独立发明相对论?DeepMind称其“跳”不过去AI智识局1787102037 不能。即使把爱因斯坦时代所有知识一字不差地

27. AI Agent 辅助科研:瓶颈在项目文档PROJECT.md

AI Agent 辅助科研:瓶颈在项目文档PROJECT.md 用 Codex、Claude Code 这类AI agent 辅助科研时,结果却总是不符合你的预期?这通常不是因为提示词不够长,也不是因

28. 🔥60万奖金池+免费算力,AI4S科探挑战赛

🔥60万奖金池+免费算力,AI4S科探挑战赛 想用AI解决真实科研问题?机会来了!🚀 由@上海 AI Lab 与壁仞科技联合主办的「书生国智科探挑战赛」现已进入作品提交阶段。 本次赛事面向真实科研场景

29. Gemini系列自主解决9个数学界开放难题

Gemini系列自主解决9个数学界开放难题 Google Deepmind最近发布了一篇论文,他们开发了一个AI代理框架,AI自主解决了353个开放Erdős问题中的9个,它的核心机制是LLM和Lea

30. 目前的AI技术是否具备证明著名数学猜想的能力?

目前的AI技术是否具备证明著名数学猜想的能力? 前些天我去青海转雪山,没法带电脑工作,只能在手机上跟ChatGPT对话。然而手机屏幕上读latex很困难,于是我不断地push ChatGPT给我证定理

31. 自动科研别直接指望它替你出论文

自动科研别直接指望它替你出论文 AutoResearchClaw 最容易让人误判的, 不是它跑不动,而是它看起来太像“快要替你把论文也写完了”。 它在复现、验证、批量跑实验这条线上确实能省很多时间

32. 十万行代码的全自动芯片验证Agent

十万行代码的全自动芯片验证Agent 经过1000小时的开发和迭代,这个Agent已在ALU、UART、AES三类典型模块上完成了端到端全自动验证闭环,覆盖约600行RTL规模的设计。 我个人感觉

33. Auto Research神话彻底破灭!斯坦福大揭秘

Auto Research神话彻底破灭!斯坦福大揭秘 🤖 AutoResearch 曾被当作下一件大事,一个系统就能从假设做到成文。该研究把 100 个真实前沿任务交给 8 个模型组合,把每条轨迹逐阶

34. NeurIPS征稿/比赛AI for Verifiable Coding

NeurIPS征稿/比赛AI for Verifiable Coding 论文征稿+比赛报名+审稿人招募开启! 📅 NeurIPS 2026 Workshop「AI for Verifiable

35. AI for Physics 全景图(长篇科普)

AI for Physics 全景图(长篇科普) 过去两三年,随手翻一翻物理领域的新闻,会看到两个很不一样的AI世界。一个世界里,AI已经走进了物理学的生产线。材料科学里,机器学习势函数正在改变分子模

36. 首证! AI可证明数学! 数学证明+验证的agent

首证! AI可证明数学! 数学证明+验证的agent AI可证明数学! 数学证明+验证的agent我淌通了,日产5篇证明(推进数学前沿边界) 有没有谁感兴趣! A Counterexample t

37. 李国杰院士:AI for Science的前景、瓶颈和风险

李国杰院士:AI for Science的前景、瓶颈和风险 李国杰院士:AI for Science的前景、瓶颈和风险科技导报1787128862 过去3年中,科学智能(AI for Science,

38. 人工智能会成为数学研究的新范式吗?

人工智能会成为数学研究的新范式吗? 需要注意的是AI集中产出数学成果后,不能让媒体舆论带节奏,助长急功近利的心态。首先,很多人用AI claim了一些大猜想的证明,验证这些证明是需要时间的。当年张益唐

39. 今天空闲时读了Scott的文章《Verification is the new bottleneck》,他提到的一些担忧...

今天空闲时读了Scott的文章《Verification is the new bottleneck》,他提到的一些担忧... 今天空闲时读了Scott的文章《Verification is the

40. 如何看待Tsimerma认为不到两年ai的数学能力就彻底超越人类数学家?

如何看待Tsimerma认为不到两年ai的数学能力就彻底超越人类数学家? 其实不是数学领域,而是一切可以快速形式化验证的科学问题,AI都展现出来了至少与人类科学家相当或者更强的能力。AI最近在数学界攻

41. AI 能做物理研究吗?我们发布了 PRL-Bench

AI 能做物理研究吗?我们发布了 PRL-Bench 当智能体(Agent)步入科研领域,我们距离真正的“AI 科学家”究竟还有多远? 为了回答这一问题,我们构建了 PRL-Bench——一个基于

42. 牛津AI博士:这样训练 AI,再也不敢"降智"

牛津AI博士:这样训练 AI,再也不敢"降智" 牛津AI博士:这样训练 AI,再也不敢"降智" 这可能是我最近最激动的一次人机协作。 我把自己的数学思路交给AI,让它逐条运行代码、验证逻辑、补齐pro

43. 如何看待近期 AI 密集攻克数学开放猜想(雅可比猜想、DGG 猜想、Erdős 单位距离猜想等)?

如何看待近期 AI 密集攻克数学开放猜想(雅可比猜想、DGG 猜想、Erdős 单位距离猜想等)? 利益相关:这波热潮里我不只是旁观者——我也借助 AI 完成了一个小型图论验证实验(13 阶正则竞赛图

44. 985博士科研经验分享(二):可控的AI科研

985博士科研经验分享(二):可控的AI科研 本人985博士生,在AI能力爆发[火R]时就开始用AI提高个人科研能力,尝试过多种AI科研,也用过多种github上的autoresearch项目,总结出

45. AI 让科研效率暴涨,但关于 AI 的幻觉危机始终萦绕。上个月在同济大学举办了一场关于科研 AI 实践的讨论,一致认为科...

AI 让科研效率暴涨,但关于 AI 的幻觉危机始终萦绕。上个月在同济大学举办了一场关于科研 AI 实践的讨论,一致认为科... AI 让科研效率暴涨,但关于 AI 的幻觉危机始终萦绕。上个月在同济大学

46. 数学,AI 自我改进的第一级台阶

数学,AI 自我改进的第一级台阶 上个月,OpenAI 用一个内部模型证伪了 Erdős 在 1946 年提出的单位距离猜想——Quanta 称之为"第一个具有历史意义的 AI 证明"。Will Sa

47. 【重磅】数学大抽卡时代来啦!

【重磅】数学大抽卡时代来啦! 今日工具:Rethlas by @董彬 北京大学 项目 GitHub 原链接: https://github.com/frenzymath/Rethlas 它是自

48. AI漫谈篇(1): 数学AI, 科研自动化,影响

AI漫谈篇(1): 数学AI, 科研自动化,影响 最近AI在数学领域节节推进:从五月份开始,人类宣称在AI辅助下接连攻克 Erdős 单位距离猜想,循环双覆盖猜想,雅可比猜想,Dinitz–Garg–

49. AI大跃进,我的科研产出却下降了

AI大跃进,我的科研产出却下降了 先说一下我的情况👇 自然科学方向,博后在站。 博士期间AI小跃进时,我从“纯古法科研”过渡到“半古法科研”——用AI写论文、润色英文。 博后期间,在自己熟悉的领域,靠

50. Mechanist:AI作为发现智能机制科学工具

Mechanist:AI作为发现智能机制科学工具 这篇论文旨在解决如何自主地发现和理解人工智能模型智能背后的内在机制这一核心问题,以弥合AI能力快速增长与人类对其理解、控制及安全审计能力之间不断扩大的
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章