一个名为FARS的自动化研究系统,在10天内生成了100篇学术论文,成本高达10.4万美元。这次实验通过详实的数据,量化展示了AI在科研领域的当前能力,包括其惊人的效率、高昂的成本以及产出的质量水平,为AI驱动科研的可行性提供了宝贵的参考。
智能速览
FARS系统在约228小时内生成100篇研究论文。
总成本达10.4万美元,平均每篇论文成本1040美元。
AI评审显示其论文平均分为5.05,质量处于中等偏上水平。
AI审稿质量已接近人类评审员,相关系数达0.42。
所有研究提案、代码、论文及评审结果均已公开。
精华内容
一个AI系统在10天内完成百篇论文,这不仅是速度的展现,更是对科研模式的一次大胆探索。其产出的质量与成本,为AI参与科研的可行性提供了关键数据。
速度与成本
FARS项目在启动228.5小时后,完成了100篇研究论文的生产。总成本高达10.4万美元,期间共消耗了114亿Token。折算下来,平均每篇论文的生产时间约为2小时17分钟,成本为1040美元。这些数据直观地揭示了当前自动化科研系统在量化指标下的真实开销与效率,展示了其高速运转下的经济账。
质量评估
为评估论文质量,项目方采用了斯坦福大学开发的Agentic Reviewer进行AI评审。结果显示,FARS产出的论文得分区间为3.0至6.3分,平均分为5.05分。其中,大部分论文得分集中在5.2分附近,少数论文获得了6.0分以上的高分,同时也有部分论文得分低于4.5分。这一分布表明,AI系统能稳定产出中等偏上的研究成果,但质量存在波动。
AI vs 人类
评审过程的另一个关键发现是,AI审稿人的表现已非常接近人类水平。数据显示,AI审稿人与人类审稿人的Spearman相关性系数为0.42,而人类审稿人之间的相关性为0.41。这意味着在标准化评审任务上,AI已具备替代部分人类重复性劳动的潜力。不过,项目方也指出,本次产出的“短论文”不完全适用ICLR等顶级会议标准,评估结果仅供参考。
成果与展望
目前,FARS生成的所有研究提案、实验代码、最终论文及AI评审结果,均已在其官网公开。这种完全透明的方式,为社区提供了宝贵的观察样本。尽管人工评估仍在进行中,但FARS的这次实验已经为自动化研究的未来提供了一个具体、可量化的起点,引发了关于AI在科学发现中角色的广泛讨论。