一篇论文能否被他人独立复现,是科学可信度的基石。这套开源AI Agent工具链首次实现从PDF阅读、变量识别、R代码生成到结果验证与质量分析的端到端自动化,大幅降低科研复现门槛。
智能速览
支持自动解析论文PDF并提取核心变量定义
能比对用户本地数据与论文所需变量,精准标出缺失项
生成带注释、分模块的可运行R代码,含完整数据加载与回归流程
自动执行代码验证,输出点估计值对比(如EDU years:原文0.157 vs 复现0.111)
具备实时纠错能力——报错后可自然语言交互,Agent跨文件定位并修正代码
已开源为paper-replicate-agent-demo,适配UK Biobank等大型队列数据场景
精华内容
科研复现长期受限于人工读论文、查变量、写代码、调参数的重复劳动。这个Agent不是简单调用大模型,而是构建了可验证、可追溯、可迭代的自动化复现工作流。
变量识别准
Agent在解析PNAS Nexus论文时,自动比对用户提供的CSV数据与原文变量清单,明确列出available变量(如EDU_years、height)与not available变量(如childhood_sugar_intake)。实测中识别出3个可用变量中的2个通过质量控制,另1个因符号方向差异但均不显著而判定为可接受偏差。
这种结构化变量映射能力,解决了UK Biobank等超大规模数据库中动辄数千变量难以手动匹配的痛点。
尤其适用于初版复现——用户依据缺失清单定向提取补充字段,再交由Agent进行第二轮精细化复现。
代码生成稳
生成的R代码严格遵循模块化设计:face1加载数据与包,face2清洗变量,face3-6执行多组回归,face7汇总结果,face8导出CSV。每段代码附有中文注释说明功能。
实测运行全程无报错,三个table1回归模块依次输出点估计值(EDU_years: 0.111;height: -0.024),与原文(0.157;0.019)误差在合理范围内。
代码权限配置清晰,Agent在请求R运行权限时主动提示,用户只需确认即可推进,无需干预底层逻辑。
验证反馈快
Agent自动生成质量分析报告,直接对比原文Table 1 Panel A结果:EDU_years点估计偏差29%,但方向一致且统计显著性保留;height虽符号相反,但p值均>0.05,判定为非实质性偏离。
报告明确标注‘2/3变量通过质量控制’,避免模糊表述,为用户判断复现可信度提供量化依据。
整个验证过程嵌入工作流,非事后补做——代码生成后立即执行,并将输出结果反哺至报告撰写环节。
纠错机制实
当人工运行发现某模块报错时,可将完整错误日志粘贴回对话框,Agent即刻定位问题根源(如某行缺失na.omit()处理),并在原代码对应位置完成修复。
区别于通用聊天模型,该Agent拥有文件系统级操作权限,能在.R、.csv、.txt多类型文件间交叉检索上下文。
实测中一次报错经自然语言描述后,Agent在12秒内返回修正版代码,重跑后顺利通过全部7个face模块。
这套工具将论文复现从数天的人工劳动压缩至小时级闭环,其价值不仅在于效率提升,更在于建立可审计、可复用、可协作的科研基础设施。当变量缺失提示、代码版本追踪、结果偏差归因成为标准输出,复现就真正从‘能做’走向‘可信’。未来是否会出现由Agent驱动的开放复现社区?