张大妈

百川开源全球最强医疗大模型M3,「严肃问诊」定义AI医疗新能力

源自公众号:百川智能

01-20 20:50

百川智能开源新一代医疗大模型 Baichuan-M3,其在全球权威医疗评测 HealthBench 中登顶,实现了对 GPT-5.2 的全面超越。此举不仅刷新了行业技术高度,更重要的是,M3 首次具备原生“严肃问诊”能力,通过主动追问和深度推理,有效解决了 AI 在严肃医疗场景中的核心痛点,为AI医疗的落地提供了全新范式。

百川开源全球最强医疗大模型M3,「严肃问诊」定义AI医疗新能力智能速览

  • Baichuan-M3 在 HealthBench 总分与 Hard 子集上均排名全球第一。

  • 模型幻觉率低至 3.5%,为全球最低水平。

  • 首创“严肃问诊”能力,问诊水平超越真人医生平均水平。

  • 通过全动态 Verifier System 升级强化学习,突破能力上限。

  • 提出SCAN原则,将临床思维过程系统化、白盒化。

百川开源全球最强医疗大模型M3,「严肃问诊」定义AI医疗新能力精华内容

技术的突破并非偶然,而是源于对医疗核心难题的深刻洞察与重构。Baichuan-M3 的领先,建立在三大基石之上。

登顶评测

在全球最权威的医疗 AI 评测 HealthBench 中,Baichuan-M3 以 65.1 分的综合成绩位列全球第一,并在考验复杂决策能力的 HealthBench Hard 上以 44.4 分夺冠。

这一成绩标志着其全面超越了 OpenAI 的 GPT-5.2 模型。作为对比,其前代模型 M2 在 HealthBench Hard 上的成绩为 34.7 分。M3 的跃迁,得益于全面升级的强化学习系统,即全动态 Verifier System,它通过持续演进、变难的监督信号,推动模型在复杂医学问题上实现了质的突破。

幻觉重构

幻觉问题是 AI 进入严肃医疗场景的最大障碍。不同于业界普遍依赖外部工具或提示工程的后处理方式,M3 将医学事实一致性作为核心训练目标,直接内化为模型的基础能力。

这种重构的训练范式,让模型在纯模型设置下也能稳定、可信地作答。实测数据显示,M3 的医疗幻觉率低至 3.5%,超越了此前以低幻觉著称的 GPT-5.2,刷新了全球最低纪录,为 AI 诊疗的安全性提供了坚实保障。

严肃问诊

医疗问诊的核心是完整收集关键信息,而非简单回答问题。M3 突破了“角色扮演”的局限,首次具备原生的“严肃问诊”能力。

为此,百川提出了“严肃问诊范式”与SCAN原则,将临床思维系统化。基于150多位一线医生参与构建的 SCAN-bench 评测体系,M3 在病史采集、辅助检查、精准诊断全流程的表现,均显著高于真人医生的平均水平,成功构建了从精准问询到安全决策的闭环。

Baichuan-M3 的开源不仅是技术实力的展示,更定义了 AI 医疗的新范式。从跟随到引领,中国 AI 正以硬核实力重塑全球医疗技术格局。随着“百小应”等应用落地,AI 深入临床实践的最后一公里正在被打通,未来的医疗生态将因此发生怎样的深刻变革?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章