现有医疗大模型在处理真实电子病历(EHR)时,常因信息丢失导致推理中断,难以胜任临床决策。上海交大与上海AI Lab的研究通过构建AGENTEHR评测基准和提出RETROSUM框架,系统性解决了这一痛点。该方案让AI能在冗长复杂的病历中实现连续思考,为医疗智能体从信息检索迈向临床决策提供了关键路径。
智能速览
提出更贴近真实临床环境的AGENTEHR评测基准,要求AI完成多轮交互决策任务。
研究指出传统摘要方法会破坏病历中的长时序推理链,是导致误诊的关键。
RETROSUM通过回溯式摘要,动态重估历史信息的重要性,避免关键信号丢失。
框架保留原始交互轨迹与摘要共存,摘要用于引导,不破坏底层推理逻辑。
进化式策略让AI能从过往成功或失败的经验中学习,提升在复杂环境下的稳定性。
实验显示,新框架将模型F1值最高提升29.16%,交互错误率下降92.3%。
精华内容
RETROSUM框架如何具体实现“连续思考”,其背后的机制设计带来了哪些颠覆性改变?以下将从评测基准构建、核心摘要创新及推理策略优化三个维度展开剖析。
真实评测基准
为了精准衡量医疗AI的真实能力,研究团队构建了AGENTEHR评测基准。该基准彻底改变了单步问答的模式,要求智能体在包含高噪声的原始EHR数据库中,通过多轮工具调用,完成诊断、用药建议、检查安排、手术规划、转科决策等6类完整的临床任务。
它覆盖了MIMIC-IV的常见与罕见病场景以及MIMIC-III数据集,确保了评测结果的广泛适用性和挑战性,为医疗智能体的能力进化提供了真实且严苛的试炼场。
回溯式摘要
研究首先指出现有方法的致命缺陷:传统的逐步摘要(ReSum)会不可逆地破坏临床推理所需的上下文。例如,早期的一个轻微异常指标,可能在后续交互中才显现其重要性,而单向摘要早已将其舍弃。
RETROSUM框架的核心创新在于“回溯式摘要”机制。它不再是简单地压缩最近窗口,而是在固定步长触发时,联合远期历史与近期交互进行全局“回看”,动态重估旧信息的重要性。这种机制确保了潜在的跨时间、跨表关键信号得以保留。
双轨与进化
为了进一步增强推理的鲁棒性,RETROSUM采用了“摘要+全轨迹”双轨并行的策略。生成的摘要作为高层认知地图,用于引导模型的注意力,但它不会替换或破坏底层的完整交互轨迹,保证了推理链的完整性。
此外,进化式经验策略将AI智能体在决策过程中的成功或失败经验提炼并存储到外部记忆库。在处理新病例时,系统会根据病人语义相似度检索相关经验,显著提升了模型在复杂临床环境下的决策稳定性。
效果验证
全面的实验验证了RETROSUM框架的有效性。在涵盖Qwen、GPT-5-mini、Grok-4.1在内的5种主流大模型上测试,结果显示,新框架在关键指标F1上最高带来了29.16%的提升。更重要的是,模型的总交互错误率下降了92.3%,即使在8k的上下文限制下,其性能依然保持稳定,证明了其在真实应用场景中的巨大潜力。
AGENTEHR与RETROSUM的组合,为解决医疗AI在复杂病历中的连续推理难题提供了系统性方案,标志着医疗智能体正从“信息检索员”向“临床决策辅助者”的关键转变。这种回溯式、双轨并行的推理范式,其价值或将超越医疗领域,为所有需要长上下文理解的AI应用带来启发。未来,当AI能真正“读懂”病历,我们离更精准、更普惠的智能医疗还有多远?