3. SciResearcher.腾讯这篇《SciResearcher》,真正想解决的,并不是“AI 知识不够多”,而是一个更底层、也更容易被忽视的问题:
今天的大模型,其实还不会真正做科研。
过去两年,整个行业都在围绕更大的参数、更长的上下文、更复杂的多模态能力展开竞争。模型看起来越来越聪明,能写代码、能解数学、能读论文,甚至已经能在很多考试里超过普通人类。但如果把这些能力真正放进科研场景里,你会发现一个很明显的问题:
它们很会“回答问题”,却并不真正擅长“研究问题”。
这两件事,看上去很像,但其实完全不同。
因为真正的科研,从来不是把已有知识重新组织一遍。真正困难的部分,恰恰发生在没有现成答案的时候。研究者需要在大量互相矛盾的信息里寻找规律,在不完整的数据里提出假设,再通过不断验证、修正、推翻,慢慢逼近一个暂时可信的解释。
这里最核心的能力,不是记忆,而是长时间、多步骤、持续修正的 reasoning。
而这,恰好是今天大模型最薄弱的地方。
你可以把现在的大模型理解成一个“读过无数书的人”。它拥有极其庞大的知识储备,也能快速组织语言,所以当你提问时,它总能给出一个结构完整、逻辑流畅、甚至看起来非常专业的回答。但很多时候,这种能力本质上仍然是一种“高维知识压缩”。
它擅长从过去见过的文本里提炼统计规律,却并不真正具备持续推进一个开放性问题的能力。
这也是为什么,很多 AI 一旦进入复杂科研场景,能力会突然塌掉。
因为科研不是搜索,也不是总结,而是一个需要不断推进的问题空间。比如一个真正的科学问题,从来不会只有一个标准答案。研究者可能需要查几十篇论文,对比不同实验结果,分析数据之间的冲突,再一步一步排除错误解释。很多时候,真正重要的不是最后那个结论,而是中间那条漫长的推导路径。
为什么提出这个假设?
为什么排除了另一个方向?
为什么这组实验可信?
为什么这个变量可能有问题?
这些东西,才构成了科研真正的主体。
而今天的大模型,其实严重缺少这种“思考过程”的训练。
这也是为什么,《SciResearcher》最重要的部分,并不在于它又做了一个更强的聊天 Agent,而在于它开始尝试把“科研过程”本身,变成 AI 的训练对象。
论文里的核心思路,其实可以翻译成一句很简单的话:
AI 不应该只学习答案,它还应该学习科学家是怎么一步一步走到答案的。
所以他们开始让 Agent 自己生成科研训练数据。它会自己阅读论文、提出问题、搜集证据、构建推理链、调用工具,再把这些完整的 reasoning trajectory 重新用于训练模型。
这件事的意义,其实比很多 benchmark 提升都更大。
因为过去的大模型,大多数时候学习的是“结果”。互联网有海量现成答案,但真正稀缺的,其实是人类完整的思考过程。尤其科研领域,真正值钱的从来不是最后一句结论,而是中间那条不断修正、不断推导的路径。
而一旦 AI 开始能够稳定地产生这种高质量 reasoning path,它就不再只是一个被动回答问题的系统,而会慢慢进入一种新的循环:
学习、推理、提问、再学习。
也就是说,它开始具备某种“自主研究”的雏形。
这也是为什么,最近整个行业都在从 Chatbot 转向 Agent。因为大家已经慢慢意识到,聊天能力本身正在快速商品化。真正决定下一阶段上限的,不是谁更会说话,而是谁更能长时间自主完成复杂任务。
而科研,恰好是所有复杂任务里最难的一类。
它没有标准答案,没有固定路径,信息极度碎片化,还需要持续修正认知。所以如果 AI 真能在这个方向上取得突破,它改变的就不只是“聊天体验”,而是 AI 是否开始真正进入“知识生产”阶段。
这也是论文里那句“comparable to OpenAI Deep Research”真正值得注意的原因。
因为它背后隐含的,其实是一种行业共识:
下一代 AI,可能不再只是一个聊天工具。
它会慢慢变成一种能够主动探索、组织、验证、推进知识的研究 Agent。
所以如果你不是技术背景,其实只需要记住一句话:
过去的大模型,更像一个读过无数书的人;而现在这类 Scientific Agent,开始试图变成一个能够自己做研究的人。
很多技术进步,看起来像是在不断增加能力。但真正重要的变化,往往发生在另一种时刻:
你突然发现,AI 不再只是会回答问题了。
它开始尝试,自己寻找问题。
#ai #知识分享 #科技 #腾讯 #agent