大语言模型正加速进入科学实验室,但其潜在的安全风险却鲜少被系统评估。研究人员对AI的过度信任,可能因模型幻觉等问题引发严重事故。一项发表在Nature子刊上的研究,通过构建专业的安全基准,揭示了当前主流AI模型在实验室安全决策中的重大短板,为AI在科研领域的安全应用敲响了警钟。
智能速览
大语言模型在实验室安全识别上准确率不足70%。
模型普遍存在安全误判和“信息幻觉”现象。
规模更大的模型在安全任务上未必表现更好。
研究推出LabSafety Bench基准,用于系统性评估AI安全风险。
常见的思维链提示等技巧对提升安全表现效果不稳定。
精华内容
为了系统性地揭开AI在实验室中的安全短板,研究者们开发了LabSafety Bench基准。其测试结果令人警醒,揭示了当前AI模型远未达到可靠的安全标准。
评测基准诞生
针对AI在实验室环境中的安全风险,研究者开发了一个名为LabSafety Bench的综合基准框架。该框架构建了一个包含765道文本多项选择题、133道图文结合题以及404个基于真实场景的开放性问题的庞大数据库,全面覆盖生物学、化学和物理学等领域的安全知识。
为确保数据的专业性,研究采用人类专家与AI协作的方式,从权威文献中提取关键知识点生成问题,并通过专家交叉验证和AI辅助优化,确保了评估的准确性和实用性。
普遍不及格
研究评估了包括DeepSeek-R1、GPT-4o、Claude-3.5-Sonnet在内的19个先进模型。结果显示,没有任何一个模型在危害识别任务上的准确率超过70%。虽然这些模型在结构化的多项选择题中表现尚可,但在需要深度推理的开放性问题中,它们的得分大幅下降,并未展现出明显优势。
这表明,当前AI模型在处理复杂、模糊的实验室安全情景时,其可靠性存在严重不足。
幻觉与误判
研究发现,模型在安全评估中存在明显的“信息幻觉”现象。例如,GPT-4o曾错误地判断苯和四氯化碳之间存在协同毒性效应,而实际上这两种化学物质的毒性仅为简单的相加关系。这种错误的“专业判断”可能误导研究人员,低估或高估实际风险。
此外,许多模型在安全优先级排序上存在误判,过度关注某些显性风险,却忽视了其他同样致命的潜在危险,这种片面的风险认知在实验室中是致命的。
规模非万能
一个反直觉的发现是,模型的规模、架构或推理机制的复杂度,并不直接等同于更高的安全性能。在某些安全任务上,参数规模较小的模型甚至能超越更大型的模型。这表明,模型的通用智能能力与其在专业安全领域的表现并非线性相关。
同时,常用的链式推理和外部提示工程等技巧,对提升模型安全表现的效果也因模型而异,甚至在某些情况下会降低其表现,显示出当前优化手段的局限性。
这项研究清晰地表明,将大语言模型直接用于高风险的实验室环境为时过早。在AI真正成为可靠的科研伙伴前,必须建立更严格、更专业的安全评估体系。未来的探索方向,或是如何让AI不仅“聪明”,更能“可靠”,这将是科研安全领域的关键问题。