100篇论文有74篇变成了智能体:Nature新发的Paper2Agent这周刷屏科研圈——装之前先看懂两个准确率口径、审稿人的三点不服和四类人的花法

源自187位全网作者

07:26

100篇论文有74篇变成了智能体:Nature新发的Paper2Agent这周刷屏科研圈——装之前先看懂两个准确率口径、审稿人的三点不服和四类人的花法

这周知乎上"华人学者Nature发文推出AI工具,可将论文快速转化为AI智能体"的问题吵翻了。一边说这是"复现论文时代的终结",另一边甩出同行评审记录,说这"在科学上是来搞笑的"。同一篇论文,两种口碑——作为常年把GitHub里的论文代码折腾两周还跑不起来的人,我觉得看这篇论文的正确姿势,是把它的数字拆开看。

先说一个大多数转发稿没讲清的事实:Paper2Agent不是这周才冒出来的新东西。它去年9月就挂上了预印本、开源在GitHub(jmiao24/Paper2Agent),第一作者是斯坦福大学博士后Jiacheng Miao,2025年10月投稿,今年9月16日正式发表于《自然》(Nature)。这一轮热度的真正触发点,是这个工具打磨了一年终入Nature,又恰好赶上Claude Code、Codex这类智能体客户端进入科研人的日常——它终于变成"可用"的了。哔哩哔哩微博

它解决的是最后一公里,不是"读论文"

方法复现的痛点从来不是"读懂"论文,而是代码散在GitHub、数据在补充材料、环境卡在依赖版本。Paper2Agent做的事是把这段脏活自动化:六步流水线——找到代码仓库、配好环境、扫教程、跑通教程、把方法提取成工具、逐一验证工具——然后把整篇论文封装成一个MCP服务器。你用paper2agent技能连上Claude Code或Codex,用自然语言问"把这个方法用在我的数据上",智能体自己调工具、跑分析、出结果。

100篇论文有74篇变成了智能体:Nature新发的Paper2Agent这周刷屏科研圈——装之前先看懂两个准确率口径、审稿人的三点不服和四类人的花法

一个流传很广的误解是把它和NotebookLM、Gemini Notebook归成一类。那类工具是"问答式读论文",本质是检索增强生成,上限是回答"作者怎么做的";Paper2Agent交付的是一组可执行接口——"读懂论文"和"用上论文"之间,差的正是这一段。

主菜是数字,但数字有两种读法

论文语料实验的数字:100篇计算生物学论文,成功智能体化74篇;生成的599个工具里593个通过验证;在300个教程衍生基准问题上,准确率约91.2%±1.6%。案例细节:AlphaGenome那篇论文,生成22个工具、约45分钟、花了14美元、在一台个人笔记本上跑完;一组基准里智能体化版本准确率98.7%,明显高于让Claude直接读仓库的82.7%。Scanpy生成7个工具,45分钟、13美元,四个公开数据集跑出来的结果和人类研究者一致。知乎知乎

还有一个被反复转发的展示案例:AlphaGenome、MPRA-coupled scCRISPRi、Perturb-seq三个论文智能体协作找银屑病相关变异的因果基因,指向GPR137,而且分析策略是智能体自己提出来的、不是源论文里的。知乎

第一层读法是"复现成本从几周变成45分钟加十几美元"。第二层读法更有信息量:

  1. 74/100不是工具缺陷率,是论文代码的审计报告。失败的那26篇,多数败在代码不完整、文档缺失、环境配不通——这暴露的是论文自带的代码别人跑不起来。Paper2Agent一边在测试AI,一边在反测全网计算生物学论文的可复现性,这大概是它最被低估的副产品。

  2. 两个准确率的口径不一样。91.2%考的是"教程衍生问题",即复现作者自己写的教程;98.7%是另一组基准上的对比值。官方验证标准也更直白:生成预期文件、数值落在3%容差以内、图像用感知哈希匹配。这些都界定了它的能力边界——它保证的是"复现作者做过的事",不是"替你做新科学"。知乎

100篇论文有74篇变成了智能体:Nature新发的Paper2Agent这周刷屏科研圈——装之前先看懂两个准确率口径、审稿人的三点不服和四类人的花法

审稿人的三点不服,和另一种口碑的来源

知乎答主赵泠扒出的评审记录显示:审稿人1认为论文没证明MCP封装比直接把Markdown喂给大模型强,“用教程训练、再用教程测试"是循环验证,GPR137案例是二次分析,并且断言更强的基座模型会把这套壳的效果削弱到归零;审稿人2指出没测试模型能不能承担训练环节(作者的回应是"能跑训练脚本、调几个参数”);审稿人3直接说这是系统工程,不是算法创新。三点都没拦住论文发表。知乎

100篇论文有74篇变成了智能体:Nature新发的Paper2Agent这周刷屏科研圈——装之前先看懂两个准确率口径、审稿人的三点不服和四类人的花法

我的看法:这三条批评都成立,但都不构成"不值得用"的理由。"复现作者教程"这件事对复现党的价值,不是基座模型变聪明就自动到手的——模型能看懂代码,但不能替你配环境、跑通仓库、拿到一套验证过的工具清单。真正值得记下的是论文结尾那个建议:期刊应该增加"agent availability"环节,作者连论文带智能体一起交。如果哪天这条落地,"论文代码跑不通"的成本会从复现的人头上,转到写论文的人头上。

四类人,谁该装、谁该等

  • 计算生物/生物信息方向的复现党:第一优先试用。挑有GitHub仓库+教程脚本的论文,走一遍技能,开源项目,成本主要是API账单。

  • 非生物领域的科研人:再等等。测试语料清一色计算生物学论文,对计算机、物理、材料这类"算法描述为主"的论文泛化能力还没被验证过。

  • 只读不跑的人:不用装。问答类工具够用,MCP服务器帮不了你。

  • 课题组/导师:先做两件事再推广——抽查输出数值对不对(3%容差是官方口径,工具通不过≠结论没错);确认未发表数据走不走得了模型API(工具在本地跑,但提示词和中间结果要发给大模型)。

怎么试:4个动作+1个自检

仓库在GitHub的jmiao24/Paper2Agent,装skills/paper2agent下的技能,在Claude Code或Codex里直接发起转换。转完后建议的自检:拿论文图里的1-2个数值人工抽查一遍;核对工具清单是否覆盖方法的核心步骤;先在官方教程数据上跑一遍,再喂自己的数据。如果转换失败,先手动检查那个仓库本身能不能装起来——那26篇失败的,一半死在代码自己手里。知乎

值得继续盯的三个信号

  1. 有没有非生物领域的团队把它跑通——决定它是"科研圈专用工具"还是"论文这种载体的通用接口";

  2. 期刊界对"agent availability"的回应;

  3. OpenAI、Anthropic的官方客户端会不会原生接入论文智能体——那决定这东西是基础设施还是极客玩具。

论文炼出器灵、“论文自己当通讯作者”,梗归梗。复现党真正该记住的是:今年对你最有用的,未必是模型又聪明了多少,而是这种脏活自动化被打包进Nature、开了源、标好了价。45分钟、十几美元值不值,取决于你收藏夹里躺着多少个没跑起来的论文仓库。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章