昨天,「阿里肝癌AI两个月发现15例漏诊」的话题冲上微博热搜:阿里巴巴达摩院联合中国医科大学附属盛京医院等机构研发的肝脏肿瘤AI模型DAMOLiON,被报道「登上国际顶刊」,评论区立刻分成「AI要抢放射科饭碗」和「又一波宣传」两派。微博我直接去取了原文:论文于8月19日在线发表于《Nature Medicine》,题为《Large-scale AI-guided liver malignancy diagnosis: multicenter study and a single-arm trial》,由盛京医院放射科团队牵头,联合达摩院、法国EURECOM等机构完成,前瞻性试验注册号NCT07153783。Nature Medicine读完它,再把它和《自然·医学》今年发的一系列同类试验横向对照,我的结论是:数据比热搜克制得多,而正是这份克制,让它值得认真对待。
热搜放大了两处表述
「15例漏诊」不是全貌。论文的前瞻性试验里,LiON作为「额外AI阅片者」嵌入正常临床流程,两个月内读了10,333例增强CT;人机协同发现了51处初轮人工阅片遗漏的病灶,其中15例确诊恶性,并由此触发了37份影像报告修正和22次多学科会诊(MDT)升级。Nature Medicine「15例漏诊」是更容易传播的数字,但「51处病灶→37份报告修正」才是更完整的证据链。
「准确率优于放射科医生」不是试验的主要终点。单臂试验的主要终点是「恶性肿瘤诊断AUC的95%置信区间下限超过0.900」,实测0.952(95% CI:0.942–0.961),达标;而「阅片时间减少27%、敏感性提高11.5%、初级达到资深水平」来自达摩院方面的对外发布与媒体报道。微博引用时应分清「论文数据」和「官宣口径」。
论文本身长什么样
LiON(Liver DiagnOsis Network)基于增强CT,完成的是三层验证:训练层6,443例患者;回顾性验证层横跨多中心与真实世界队列共22,251例,整体AUC 0.975,而且在脂肪肝(0.971)和肝硬化(0.924)这两类最难读的肝脏背景下也没有掉链子;前瞻性试验层就是上面那项10,333例的单臂试验,直接在医院真实工作流里跑。Nature Medicine在医疗AI领域,第三层和第二层之间的差距,远大于第二层和第一层:回顾性数据集上刷分是行业常态,真实临床流程里的前瞻性验证才是稀缺品。

而LiON这次揪出的病灶普遍「小、淡、偏」——平均直径1厘米左右,与周围肝组织对比度低,或位于少见解剖位置,正是高负荷阅片里人眼最容易漏的类型。微博论文给出了两个典型病例:一位肝硬化患者初判「不定性病变、6个月随访」,LiON提示肝细胞癌,MDT决定立即活检,病理确诊;一位乳腺癌术后患者初判「无肝病变」,LiON提示转移,MDT随后更改了辅助治疗方案。

横向看:今年的《自然·医学》是医疗AI的「试验场」
比单篇论文更值得看的,是整体图景。最近半年,《自然·医学》密集发表了一批AI进入真实临床的前瞻性试验,结果阳性和阴性交替出现:
研究 | 发表 | 设计 | 核心结果 |
|---|---|---|---|
LiON肝脏肿瘤AI | 2026.08 | 单臂前瞻性,10,333例 | 阳性:AUC 0.952,揪出15例人眼漏诊恶性病灶 |
Retina4IRD眼底遗传病诊断 | 2026.07 | RCT,295例 | 阳性:Top-5基因诊断准确率提升21.2个百分点 |
谷歌AMIE辅助心内科 | 2026.02 | RCT,107例 | 阳性:临床显著错误近半减少、遗漏率减半以上 |
LungIMPACT肺癌路径 | 2026.03 | RCT,93,326张胸片 | 阴性:AI优先排序未缩短诊断时间线 |
AI Consult肯尼亚基层医疗 | 2026.06 | 整群RCT,9,691例 | 阴性:14天治疗失败率无差异 |
为什么有的成了、有的没成?把几篇全文放在一起读,分水岭不在算法强不强,而在AI有没有坐在诊断链条的真正瓶颈上。LungIMPACT的AI只做「优先排序」——可疑胸片被排到工作列表前面,但下游的CT设备和专科医生就那么多,整条路径依然卡住;肯尼亚的GPT-4o改善了病历书写的过程质量,可离14天内的患者结局之间隔着太多变量,主要终点无统计学显著差异。知乎知乎
LiON不一样:它直接坐在「阅片」这个环节本身,测量的终点——「人眼漏掉的我有没有找到」——就是它的直接产出,天然可测量。同样的逻辑也解释了另外两项阳性试验:Retina4IRD直接给专科医生输出基因短名单,把Top-5基因诊断准确率提升了21.2个百分点;AMIE直接参与生成完整评估方案,RCT中亚专科专家对AI辅助评估的偏好率显著高于医生单独评估,遗漏重要内容的病例仅占6.5%。知乎知乎所以下次再看到「AI又颠覆某某医生」的标题,可以先问三个问题:是前瞻性还是回顾性?终点是算法分数、医生行为还是患者结局?AI坐在瓶颈上还是装饰环节?这三个问题能滤掉大部分噪音。

接下来看什么,以及冷静什么
值得关注的信号有两条线:监管层面,据公开报道,LiON已进入国家药监局创新医疗器械特别审查通道,并获得美国FDA「突破性设备」认定。微博证据层面,论文自己在结尾坦白,还需要更多医疗体系的前瞻性对照研究来证明其对临床结局的影响。Nature Medicine与之对应,有两件事可以冷静:其一,这是一项没有对照组的单臂试验,「揪出漏诊病灶」不等于「降低患者死亡率」;其二,它的定位是帮医生兜底的「安全网」,AI与医生判断不一致时流程是提交资深医生复核——它不取代谁,普通患者也不必急着去医院点名要「AI读片」。
一句话总结:这是中国医疗AI从「数据集比拼」走进真实临床前瞻性验证的一个里程碑;值得信的是三层验证设计和51处病灶→37份报告修正的完整链条,值得等的是对照证据和审批落地。